字节跳动Seed团队发布音频创作模型Seed Audio 1.0
来源:互联网
时间:2026-07-23 13:04:27
就在7月22日,字节跳动Seed团队正式推出了他们的音频生成模型——Seed Audio 1.0。这个模型基于统一架构,能端到端合成为人声、音效以及环境声在内的完整三维音频场景,目标很明确:打造“听即所见”的沉浸式听觉体验。

这套模型的技术亮点可以说相当丰富。先说精度:它支持毫秒级(100ms)的时间精度控制,这意味着声音元素的起始时刻可以被精细编排。再来说延展性:支持零样本语音生成,还能实现长时音频的连续延展,单次输出时长可达2分钟,而且角色音色全程保持一致——这在影视配音里可是个硬需求。语言方面,它兼容中、英、日、韩等20余种语言,同一音色还能在不同语言之间自然跨语言迁移,打通了多语种制作的壁垒。
从实测数据来看,Seed Audio 1.0在文本到音色生成任务中表现突出。在影视配音、播客制作、短剧音频等主流应用场景里,音频可用率都突破了90%,基本可以实用了。目前,这个模型已经正式上线火山方舟体验中心,面向开发者和创作者开放体验。