AI语音进入“表演时代”:阿里Qwen-Audio-3.0-TTS登顶全球权威榜单
阿里云发布语音合成大模型 Qwen-Audio-3.0-TTS:从“能说话”到“会表达”
2025年7月20日,阿里云正式发布语音合成大模型 Qwen-Audio-3.0-TTS,它标志着语音合成技术从“能说话”向“会表达”的跨越。该模型在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性等方面实现了系统性提升,并提供了面向实时交互的
Flash版本
Plus版本
Artificial Analysis
细粒度标签控制:精确到“字”的情感表达
Qwen-Audio-3.0-TTS 的上一代版本已支持
freestyle(自由风格模式)
通过
结构化标签
- :[gasp](抽一口气)、[giggles](轻笑)、[angry](愤怒)
示例标签
- :叙事、游戏、配音等需要极致情感控制的领域
应用场景
小提示
多语种与方言覆盖:16种语言 + 20种方言
面向全球多语种场景,Qwen-Audio-3.0-TTS 进行了专项优化,覆盖 中、英、日、韩、德等16种语言,并新增了阿拉伯语、越南语、马来语以及菲律宾语。根据
CV3-Eval
- :在16种语言中,Qwen-Audio-3.0-TTS 家族在 10种语言 中获得了 SOTA(当前最优),其中
词/字错误率评测
和韩语
的领先幅度最大。马来语
- :Qwen-Audio-3.0-TTS-Plus 在16种语言中全部获得最优,而 Flash版本 则包揽了 15项第二,其中
说话人相似度评测
、马来语
和西班牙语
的领先幅度最为明显。阿拉伯语
此外,针对方言发音容易滑向普通话腔的痛点,研究团队专门设计了
方言强化训练
语音克隆与鲁棒性:高噪声环境下的精准克隆
语音克隆产品通常要求原始参考音频在安静环境下录制,而 Qwen-Audio-3.0-TTS 通过
真实声学仿真训练
语音增强能力
- :真实声学仿真训练 + 语音增强能力
技术亮点
- :嘈杂环境下的语音克隆、移动设备录音提取
适用场景
精品音色库与音频质量:录音棚级别的输出
面向严肃创作场景,Qwen-Audio-3.0-TTS 拥有
开箱即用的精品音色库
3分钟
版本与可用性:即刻调用
Qwen-Audio-3.0-TTS 提供两个版本:
- :面向实时交互,首包延时 300ms级别
Flash版本
- :面向高质量生成,具备顶级音质和表现力
Plus版本
即日起,两款模型已在
阿里云百炼
常见问题
-
问:Qwen-Audio-3.0-TTS-Plus 版本在哪些语言上表现最佳?
答:根据 CV3-Eval 说话人相似度评测,Plus 版本在16种语言中全部获得最优。在特定语言上,Flash版本也表现出色,例如马来语、西班牙语和阿拉伯语,领先幅度最为明显。
-
问:如何在实际项目中使用细粒度标签?
答:在文本中直接嵌入如 [gasp]、[giggles] 等标签即可。例如,输入“他惊讶地[gasp]倒吸一口气”,模型会在对应位置产生抽气效果。建议结合 freestyle 模式设定角色,以获得更自然的表达。
-
问:Flash 版本和 Plus 版本的主要区别是什么?
答:Flash 版本优化了低延迟,首包延时仅 300ms,适合实时交互场景(如语音助手、游戏对话)。Plus 版本则注重音质和表现力,输出采样率高达 48kHz,适用于影视配音、有声书等高质量内容创作。
总结
Qwen-Audio-3.0-TTS 的发布,标志着语音合成技术从“能说话”到“会表达”的跨越。通过细粒度标签控制、多语种与方言覆盖、高噪声环境下的语音克隆以及录音棚级别的音频输出,它为用户提供了更自然、细腻和富有表现力的语音合成体验,无论你是开发者、内容创作者还是普通用户,都能轻松上手。