首页 > 教程攻略 > ai资讯 >支持耳语与情绪控制!Fish Audio 周年重磅发布 S2.1Pro 实时对话语音模型

支持耳语与情绪控制!Fish Audio 周年重磅发布 S2.1Pro 实时对话语音模型

来源:互联网 时间:2026-07-29 15:55:09

先说几个关键点:Fish Audio 在成立周年之际,正式推出了 S2.1Pro——这是他们目前最顶级的语音大模型,专为实时对话场景设计,而不是传统的脚本旁白工具。目前该模型已通过 Fish Audio API 上线,同时提供合理限额的免费版本,方便开发者和测试人员上手体验。

QQ20260729-143606.jpg

技术层面,S2.1Pro 的首帧音频延迟只有大约 90 毫秒,这意味着对话轮替可以做到几乎无感衔接,自然流畅。它覆盖了 83 种语言,并且采用统一的语音识别架构,跨语言一致性表现不错。更值得关注的是语音控制的灵活性——不再局限于预设的情绪菜单,而是允许直接在文本中嵌入自由格式的括号标签,比如“(耳语)”“(紧张笑声)”这类行内细粒度指令,精准度相当高。

另一个亮点是原生支持多说话人对话生成,只需要 10 到 30 秒的短参考样本,就能完成高质量语音克隆,而且无需额外微调,就能精准复刻目标语调与说话风格。这在实际部署中能省下不少功夫。

从行业视角来看,S2.1Pro 的发布标志着语音 AI 正在从传统的脚本式合成,加速向极低延迟、高拟真度的实时对话模式演进。对于全球化智能语音交互落地来说,这无疑降低了算力门槛,提供了更可用的基础设施。