MAGI-2-preview – Sand.ai 开源的多模态视频生成模型
来源:互联网
时间:2026-08-06 14:48:32
MAGI-2-preview是什么
先说说这个模型的身份——MAGI-2-preview来自Sand.ai,是开源社区首个千亿参数级别的MoE(混合专家)多模态视频生成模型。总参数114B,但激活参数只有6B,这意味着什么?简单说,大容量和低计算成本可以兼得。它延续了单流架构,把文本、视频、音频三种模态统一放进同一个Transformer里联合建模,而不是像传统做法那样后期拼接。这个原生多模态设计,让它能直接生成音画同步的内容。在AA视频生成榜单上,它排到了第六。代码和预训练权重已经开放,算是给视频生成领域的高效Scaling路径提供了一个新验证。
MAGI-2-preview的主要功能
来看看它能做什么,核心亮点集中在四个方向:
- :文本、图像、视频都能作为输入来生成新视频,关键它还原生融合了音频理解,画面和声音从底层就是一起处理的。
多模态视频生成
- :114B总参数里只激活6B,推理成本压得很低,部署门槛自然就降下来了。
MoE稀疏激活
- :不是传统那种cross-attention的拼接方式,而是从第一层开始就对画面和声音共同建模,效果更自然。
单流统一架构
- :针对视频生成场景,专门重构了MoE的通信和训练稳定性,解决了超长序列下跨卡通信的瓶颈问题。
高效Scaling
MAGI-2-preview的技术原理
技术层面,几个关键点值得拆开来说:
- :总容量114B,每次前向传播只激活6B参数,实现了容量和计算成本的解耦。
MoE混合专家架构
- :文本、视频、音频的token从输入层就进入同一个Transformer,通过自注意力直接交换跨模态信息,比多塔拼接架构更能捕捉音画同步的细节。
单流Transformer
- :视频超长序列对通信要求很高,这里重新设计了专家并行中的token路由和通信策略,降低了跨GPU的数据传输开销。
分布式通信优化
- :动态路由、专家负载均衡、多模态数据联合训练,三重保障机制确保训练过程不崩。
训练稳定性方案
(注:原文中有一段微信引导关注的内容已删除,此处不保留)
如何使用MAGI-2-preview
想上手跑一跑?流程很清晰:
- :克隆GitHub仓库
环境准备
SandAI-org/MAGI-2-preview,按README配置依赖。 - :从GitHub Releases获取预训练权重。
下载权重
- :修改配置文件与脚本参数,支持
运行推理
t2v(文本到视频)、i2v(图像到视频)、v2v(视频到视频)三种模式,参考MAGI-1的run.sh格式执行。 - :具体配置有待官方文档更新,建议参考MAGI-1的24B多卡H100或4.5B单卡24GB VRAM方案。
硬件要求
MAGI-2-preview的核心优势
和同类模型相比,它有几个很突出的点:
- :采用Apache 2.0协议,预训练权重和推理代码完全开放,商业使用没有法律障碍。
开源可商用
- :全球首个成功开源的千亿级MoE视频生成模型,验证了视频领域Scaling的新路径。
千亿MoE首创
- :6B激活参数就能驱动114B模型,推理成本远低于同规模稠密模型。
低成本高容量
- :单流架构让音视频在模型底层深度融合,避免了后期对齐带来的延迟和质量损失。
原生多模态
MAGI-2-preview的项目地址
- :https://sand.ai/blog/magi-2-preview
项目官网
- :https://github.com/SandAI-org/MAGI-2-preview
GitHub仓库
- :https://huggingface.co/sand-ai/MAGI-2-preview
HuggingFace模型库
MAGI-2-preview的同类竞品对比
把它和阿里通义实验室的Wan2.7-Video放在一起对比,可以看到各自的侧重:
| 对比维度 | MAGI-2-preview | Wan2.7-Video |
|---|---|---|
开发团队 |
Sand.ai | 阿里通义实验室 |
架构 |
MoE + 单流自回归 Transformer | 3D DiT + MoE + 流匹配 |
总参数 |
114B | 270B(14B系列) |
激活参数 |
6B | 140B |
生成范式 |
自回归 | 扩散(流匹配) |
多模态 |
原生音视频联合建模(单流统一) | 文本/图像/视频/音频全模态输入 |
视频时长 |
未明确(延续MAGI-1流式能力) | 2-15秒 |
分辨率 |
未明确 | 720P / 1080P |
开源协议 |
Apache 2.0(可商用) | 开源(权重开放) |
核心能力 |
高效Scaling、原生多模态视频生成 | 视频编辑、参考生视频、运镜控制、表情驱动 |
榜单表现 |
AA视频生成榜第六 | DesignArena V2V榜首 |
编辑能力 |
未明确 | 一句话修改视频、风格迁移、局部替换 |
从对比可以看出,MAGI-2-preview更强调效率(6B激活 vs 140B)和原生多模态,而Wan2.7-Video在时长、分辨率和编辑能力上更成熟。
MAGI-2-preview的应用场景
基于这些特性,它适合用在哪些地方?
- :MoE大容量支持复杂叙事建模,可以生成分钟级连贯剧情视频,不用再一段一段拼接。
长视频广告与短剧
- :原生音频理解能力,能实现配音、音效与画面的同步生成和编辑,拍片前预演很实用。
多模态影视预演
- :开源千亿级视频MoE权重,为学术界提供了一个可复现的Scaling基线,研究门槛大大降低。
AI视频学术研究
- :Apache 2.0协议支持金融、医疗等敏感行业构建私有视频生成能力,数据不出门。
企业私有化部署
- :稀疏激活降低了推理成本,可以支撑低延迟的实时视频生成和直播场景。
实时流媒体生成
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |