小米开源可控视频音效生成模型ControlFoley,实现声音精准定制
视频音效生成技术正迎来关键突破。小米大模型应用团队近日开源了名为ControlFoley的统一可控视频音效生成模型,旨在解决视频配音中的“可控性”难题。该模型不仅支持根据画面自动生成音效,更首次统一实现了文本引导、文本控制及参考音频控制三类核心任务,让创能够真正按意图为视频定制声音。

传统的视频音效生成模型主要依赖画面内容,虽然能让无声视频“有声音”,但创难以干预生成结果。ControlFoley的核心目标是将视频音效生成从“看画面配声音”推进到“按意图配声音”的新阶段。该模型在多个公开评测基准上取得了开源模型中的最佳表现,并在语义对齐、时间同步及声音质量等关键指标上实现全面提升。
统一框架支持三类可控生成任务
ControlFoley构建了一个统一的多模态音频生成框架,具备三类核心能力。首先是文本引导视频配音,模型根据视频和文本提示生成同步音效,文本用于补充和细化画面中的声音语义。其次是文本控制视频配音,当文本描述与视频画面语义发生冲突时,模型能
优先遵循文本意图生成目标声音
核心技术:联合编码与时间-音色解耦
为实现精准控制,团队提出了多项创新技术。针对视觉信息在多模态融合中过于强势的问题,团队自训练了时空音视频编码器CA V-MAE-ST。该编码器通过视频帧与音频特征的联合建模,专门捕捉“动作何时发生、声音应何时出现”这类音视频时空对应关系,增强了模型对动作节奏和时间同步的理解。
在参考音频控制方面,模型采用了
时间-音色解耦策略
多模态鲁棒训练与性能表现
为适应真实应用中用户输入条件不固定的情况,ControlFoley采用了随机模态丢弃和统一多模态表示对齐训练,确保模型在不同条件组合下都能稳定工作。评测结果显示,在VGGSound-Test、Kling-Audio-Eval等多个基准测试中,ControlFoley均取得了开源SOTA表现。
与部分方法相比,ControlFoley在乐器演奏、体育运动等场景中生成的声音,能在动作发生的关键时刻精准对齐视频节奏,并保留更完整的高频细节。对比商业闭源系统Kling-Foley,ControlFoley在语义对齐、时间同步和声音质量等关键体验指标上也展现出竞争力。目前,该模型的代码、模型权重、技术报告及在线演示均已向社区开放。
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |