产品

TTS

Text-to-Speech

TTS(Text-to-Speech,文本转语音)是生成式 AI 中进展最快的赛道之一,中国创业公司在开源和闭源两条线上都在追赶甚至局部领先。

据砺思资本 2025 年 6 月的报道,沐言智语发布的开源模型 Muyan-TTS 将推理效率推到了每 1 秒语音仅需 0.33 秒生成,词错率和语音质量均处于开源模型一线水平,同时提供了零样本 TTS 合成和单说话人微调两个版本。几乎同期,云启资本天使轮项目 MiniMax 发布的 MiniMax Speech 02 在 Artificial Analysis Speech Arena 与 Hugging Face TTS Arena 两个权威榜单中双双位列第一,超越了 OpenAI、ElevenLabs 等主流模型,支持 32 语种、不同口音和情绪的语音合成。

应用层面,TTS 能力正在被嵌入到更复杂的产品形态中。真格基金投资的 Vozo AI 从手机提词器起步,逐步延伸到声音美化、语言转换、内容改写等功能,最终沉淀为 SaaS 产品,目前全球用户超过 600 万。五源资本在 2023 年的一篇文章中也提到,其被投项目 ACE Studio 探索过"text-to-音色"的交互方式,让用户用语言描述生成虚拟歌手的混合音色。

由 AI 生成,可能出现错误,请仔细核对内容。

TTS产品
Text-to-Speech
渲染中…
在 5 篇文章中被提及

相关报道