首页 > 教程攻略 > ai资讯 >Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”

Qwen-Audio-3.0-TTS 正式发布!AI 语音从 “能说话” 升级到 “会带情绪表达”

来源:互联网 时间:2026-07-21 12:21:36

阿里云最近放了个大招,正式发布了语音合成大模型Qwen-Audio-3.0-TTS。这次升级,在细粒度标签控制、freestyle指令遵循、多语种与方言覆盖以及复杂声学鲁棒性这几个关键维度上,都做了显著提升。模型包含了两个版本:一个是面向实时交互的Flash版本,首包延时能做到300毫秒级别,适合对速度要求极高的场景;另一个是面向高质量生成的Plus版本,追求更极致的音质和表现力。从全球第三方权威机构Artificial Analysis的榜单来看,Qwen-Audio-3.0-TTS-Plus版本已经拿下了冠军,而它的预览版Fun-Realtime-TTS,其实在一个月前就已经登顶过这个榜单了。

先说说freestyle模式,这个功能很实用。你可以通过角色设定,自由控制合成语音的情绪、场景和语速。更关键的是,新版本支持结构化标签,允许你在文本中嵌入像[gasp](抽气)、[giggles](轻笑)、[angry](愤怒)这样的标记。这意味着什么?意味着控制精度能从整段情绪,直接细化到单字级别。对叙事、游戏配音这类对细节要求很高的场景来说,这简直是质的飞跃。

在多语种和方言方面,Qwen-Audio-3.0-TTS覆盖了中、英、日、韩、德等16种语言,还新增了阿拉伯语、越南语、马来语和菲律宾语。从CV3-Eval多语种基准测试的结果来看,在16种语言的词/字错误率评测中,模型在10种语言里取得了最优成绩,尤其在韩语和马来语上,领先幅度相当明显。而在说话人相似度评测中,Plus版本更是直接拿下了全部16种语言的SOTA(最优性能)。

方言方面,研究团队也下了不少功夫。他们专门设计了方言强化训练,让模型在韵律、声调和口语表达上,听起来能接近母语者的水平。目前覆盖的方言包括广东、重庆、东北、陕西、上海、四川、云南等20种,范围相当广。

在噪声处理上,模型通过真实声学仿真训练,在克隆流程中直接嵌入了语音增强能力。这意味着,即便是在高噪声、高混响的复杂环境下,也能有效地过滤掉干扰,保证输出质量。音频输出也从之前的24kHz提升到了48kHz,单次语音合成最长可达3分钟。此外,还提供了开箱即用的精品音色库,省去了很多调参的麻烦。

即日起,这两款模型已经在阿里云百炼正式开放调用了。