字节跳动发布Seed Audio 1.0:音频生成从“会说”迈向“会创作”
来源:互联网
时间:2026-07-21 14:45:54
近日,字节跳动正式推出音频创作模型
Seed Audio1.0
核心突破:从“拼接”到“端到端创作”
长期以来,影视级音频内容生产依赖多模型分别生成 人声、音效与环境声,再通过人工繁琐拼接与混音,流程冗长且难以保证整体叙事一致性。Seed Audio1.0的核心突破在于,它并非简单拼接素材,而是在统一框架下联合建模多种音频要素,端到端生成可服务于叙事的“完整声音作品”。

功能亮点:从“会说”到“会创作”
- :将人声、音效、环境声等要素融合在一个模型内,无需分步拼接。
统一框架建模
- :输入描述或参考,即可直接输出完整的音频作品,保持叙事一致性。
端到端生成
- :创作者无需专业音频编辑技能,即可生成高质量影视级声音内容。
降低制作门槛
未来规划
团队计划进一步融合视频参考等多模态输入,并探索可控翻译技术,持续优化长音频与分轨生成能力,助力创作者将脑海中的声音构想高效转化为可听见的作品。
体验与使用
Seed Audio1.0已上线火山方舟体验中心,面向创作者开放测试。具体体验路径如下:
- :https://seed.bytedance.com/seedaudio1_0
项目主页
- :火山方舟体验中心 - 登录 - 选择语音模型 - 语音合成 - Doubao - 音频生成 - 1.0
体验入口
小提示
- 使用前请确保已注册火山方舟账号,并完成登录。
- 当前版本为测试阶段,生成结果可能存在不确定性,建议多次尝试以获得最佳效果。
- 若需生成长音频,建议分场景输入,以便模型更好地捕捉叙事逻辑。
常见问题
问:Seed Audio1.0可以生成哪些类型的音频?
答:支持生成包含人声、音效、环境声在内的完整声音场景,适用于影视、游戏、短视频等创作场景。问:是否需要专业音频知识才能使用?
答:不需要。模型设计为“一句话生成音频”,只需输入文字描述或参考音频,即可得到结果。问:生成的音频可以商用吗?
答:目前处于测试阶段,具体商用授权请参考火山方舟平台的使用条款。问:未来是否支持分轨导出?
答:团队计划优化分轨生成能力,后续版本可能支持单独导出人声、音效、环境声等轨道。