位列 Artificial Analysis 榜首,阿里千问发布语音合成大模型 Qwen-Audio-3.0-TTS
来源:互联网
时间:2026-07-20 20:54:28
阿里千问于 7 月 20 日正式发布语音合成大模型
Qwen-Audio-3.0-TTS
核心特性一览
- :支持在文本中嵌入结构化标签,直接调控语气、情绪和呼吸细节。
细粒度标签控制
- :无需严格格式,自然语言指令即可驱动语音风格变化。
Freestyle 指令遵循
- :支持 16 种语言和 20 种方言,满足全球化需求。
多语种与方言覆盖
- :在嘈杂环境、变声场景下仍保持稳定表现。
复杂声学鲁棒性
全球权威榜单夺冠
在全球第三方权威榜单
Artificial Analysis
结构化标签控制:精准表达情绪与语气
用户可直接在文本中嵌入以下标签,实现对语音的精细调控:
[gasp](抽气)[giggles](轻笑)[angry](愤怒)- 更多情绪类标记(如
[sigh]、[whisper]等)
这些标签让语音合成不再只是“读文字”,而是能根据场景传递真实情感。
精品音色库:开箱即用的高品质资源
模型配套 精品音色库,将多语种、多方言、指令控制和细粒度表达的能力沉淀为可直接调用的音色资源。后续将陆续上架:
- :根据指令动态调整风格
指令风格音色
- :覆盖广东、重庆、东北、陕西、上海、四川、云南等
20 种方言音色
- :支持更细腻的情感表达
细粒度控制音色
14+ 小语种音色
音频输出规格从 24KHz 提升至 48KHz,相当于从电话和普通语音助手的品质提升到录音棚、影视配音的规格。单次语音合成最长可达 3 分钟。
多语种与方言覆盖详情
面向全球多语种场景,Qwen-Audio-3.0-TTS-Plus 进行了专项优化,覆盖以下语言:
- :中文、英文、日文、韩文、德文等,并新增阿拉伯、越南、马来、菲律宾语。
16 种语言
- :广东、重庆、东北、陕西、上海、四川、云南等。
20 种方言
用户可根据实际场景选择原声或特定方言,无需额外训练。
开放链接与使用入口
Qwen-Audio-3.0-TTS 现已全面开放,可通过以下链接体验:
- :https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-plus
Plus 版本(高质量)
- :https://bailian.console.aliyun.com/cn-beijing?tab=model#/model-market/detail/qwen-audio-3.0-tts-flash
Flash 版本(低延迟)
小提示
- 如果对实时性要求高(如语音助手、直播交互),建议优先选择 ,首包延时仅 300ms 级别。
Flash 版本
- 如果追求最高音质与情感表现力(如有声书、影视配音),建议使用 ,支持 48KHz 采样率和 3 分钟长文本。
Plus 版本
- 使用结构化标签时,请确保标签拼写正确(如
[giggles]而非[giggle]),否则可能被忽略。
常见问题
Q:Flash 和 Plus 版本的主要区别是什么?
A:Flash 版本优先保证低延迟(首包延时 300ms),适合实时交互场景;Plus 版本优先保证高音质(48KHz 采样率)和长文本合成(最长 3 分钟),适合内容创作场景。
Q:如何调用结构化标签?
A:在输入文本中直接嵌入标签即可,例如:“你今天怎么样?[giggles] 我很好。”模型会自动识别并应用对应语气。
Q:支持哪些方言?
A:目前支持 20 种方言,包括广东、重庆、东北、陕西、上海、四川、云南等,后续会持续扩充。