Wan-Animate-2 – 万相团队开源的新一代角色动画模型
来源:互联网
时间:2026-08-10 17:35:50
Wan-Animate-2是什么
Wan-Animate-2是万相
团队开源的新一代角色动画模型,作为 Wan-Animate 的重大架构升级,放弃了对显式姿态骨架和辅助姿态提取网络的依赖,改为端到端的双分支 Diffusion Transformer(DiT),直接从参考视频中捕捉运动先验。模型支持文本驱动的视角控制,提供可达 24 fps 的实时流式变体。
Wan-Animate-2的主要功能
- :输入参考图
驱动视频转角色动画
reference.png与驱动模板视频template.mp4,让参考角色复刻驱动视频中的动作与镜头节奏。 - :重新设计的 DiT 直接消费驱动视频,不再经过中间运动提取器,目标是同时提升运动保真与身份一致性。
端到端运动迁移
- :通过 reference image token 与 reference video token 参与注意力计算,把参考外观注入生成过程,减少“动作像但脸崩”的情况。
身份/外观保持
- :推理前先用 LLM 生成固定范式 caption,只写“人物外观描述 + 背景描述”,不描述动作、不推测情绪,再作为 Wan-Animate-2 的 prompt。
文本规范化控制
- :支持用文本把输出相机视角与驱动视频解耦,方便做“同一套动作、不同机位/视角”的生成。
文本驱动视角控制
- :默认推理脚本走常规配置,官方示例 Diffusers 侧为
Base 高质量模式
num_inference_steps=40,更偏质量优先。 - :蒸馏权重示例为 10 steps、
Distillation 低步数模式
guidance_scale=1.0、Euler solver/no CFG,面向更快出片与低延迟验证。 - :论文提出 Wan-Animate-2-Lite,用 teacher forcing、error buffer、Self-Forcing 蒸馏与 chunk-wise 反传,把延迟压向实时阈值,面向流式角色动画。
实时化前瞻功能
- :提供本地 Gradio 脚本,Base 用
本地与在线体验
wan_animate_2_gradio.py,蒸馏用wan_animate_2_gradio_distillation.py;README 也指向 ModelScope Studio 在线 demo。 - :权重走 HuggingFace/ModelScope,模型 ID 示例为
工程生态入口
Wan-AI/Wan2.2-Animate-2-14B;Diffusers 已可源码安装接入,ComfyUI/DiffSynth-Studio 仍在 Todo。 - :默认按 8×A800、720P 调参,也测过 2×A800、480P;不同硬件需要改 YAML 并行配置。
可配置并行生成
如何使用
Wan-Animate-2
- :优先按官方默认
准备硬件
规划;官方另测过8×A800、720P
,消费级单卡不要默认能跑。2×A800、480P
- :
克隆仓库
git clone --recursive https://github.com/Wan-Video/Wan-Animate-2.git。 - :Python 3.11;安装 torch 2.7.0 / torchvision 0.22.0 / torchaudio 2.7.0,CUDA 12.6 源;再装
建环境
requirements.txt、flash-attn,最后pip install -e .。 - :HuggingFace 用
下载权重
huggingface-cli download Wan-AI/Wan2.2-Animate-2-14B --local-dir ./ckpts/;ModelScope 用modelscope download --model Wan-AI/Wan2.2-Animate-2-14B --local_dir ./ckpts/。 - :用 Qwen3.7-Plus 之类 LLM,按官方中文范式只写“人物外观描述 + 背景描述”,不要写动作、情绪或评价。
先生成 caption
- :进入
跑 Base
infer,执行wan_animate_2_demo.py,传--prompt、--refer-img-file、--refer-video-file、--config ./wan_animate_2.yaml。 - :改用
跑蒸馏版
wan_animate_2_distillation.yaml,并加--sample_guide_scale 1.0 --step 10;Diffusers 侧对应guidance_scale=1.0、flow_solver="euler"。 - :GPU 数量/显存与官方不一致时,先改 YAML parallel configs,再排查 OOM 或速度异常。
改并行配置
- :不想部署可先试 ModelScope Studio;本地则运行
快速体验
wan_animate_2_gradio.py或wan_animate_2_gradio_distillation.py。

微信关注回复“
开源
AI开源项目交流群
Wan-Animate-2的核心优势
- :去掉中间运动提取器,理论上少一层误差累积。
动作保真与身份一致性是主卖点
- :官方把 caption 前置成固定范式,要求描述人物外观与背景、不描述动作,便于稳定复现。
更贴近生产链路
- :Distillation 已可跑 10 步推理;Lite 论文口径更是直指实时/流式数字人。
低延迟路线明确
- :Apache-2.0 对二次开发更友好,但实际商用仍要处理素材版权、肖像权与平台规则。
可商用友好度较高
Wan-Animate-2的项目地址
- :
项目官网
https://humanaigc.github.io/wan-animate-2
- :https://github.com/Wan-Video/Wan-Animate-2
Github仓库
- :
ModelScope
- :https://arxiv.org/pdf/2608.06009
arXiv技术论文
- :
在线体验Demo
感兴趣的话,可以直接前往这个地址查看:https://www.modelscope.cn/studios/Wan-AI/Wan2.2-Animate
Wan-Animate-2的同类竞品对比
| 对比维度 | Wan-Animate-2 | MagicAnimate | MusePose |
|---|---|---|---|
| 核心任务 | 参考图 + 驱动视频生成角色动画,强调端到端动作迁移与身份保持。 | 单张图 + motion video 生成动画,主打时序一致性与参考图保真。 | 参考图 + pose 序列生成虚拟人视频,偏舞蹈/全身动作。 |
| 技术路线 | 重新设计 DiT 直接消费驱动视频,去掉中间运动提取器;加文本驱动视角控制。 | 早期扩散方案,默认依赖 DensePose 驱动;需配 SD1.5、MSE VAE 与项目 checkpoints。 | diffusion-based + pose-guided;基于/优化 Moore-AnimateAnyone 路线,并提供 pose align。 |
| 动作信号 | 直接用 driving video,少一层姿态/关键点中间表示。 | 依赖 motion video/DensePose 类条件。 | 显式 dwpose 序列,先把舞蹈视频对齐到参考图再推理。 |
| 身份/细节 | 目标是高保真运动 + 强身份保持;真实效果仍建议同素材自测脸、手、闪烁。 | 官网自承脸和手可能失真,默认配置可能出现动漫到写实的风格漂移。 | 官方 Limitations 写明:脸部区域、复杂服装细节保持不稳定,复杂背景有噪声/闪烁。 |
| 速度/实时 | Distillation 示例 10 steps、无 CFG、Euler;论文另提 Lite 冲实时流式。 | 属早期高质量扩散路线,未以实时为主卖点。 | 未主打实时;优势在 pose align 提升可用性,不是低延迟架构。 |
| 分辨率/硬件 | 默认 8×A800、720P;官方测过 2×A800、480P;硬件不同要改 YAML 并行。 | 官网安装要求 python>=3.8、CUDA>=11.3、ffmpeg;未给新一代显存承诺。 | 官方给出 512×512×48 约 16GB VRAM、768×768×48 约 28GB VRAM;训练机示例为 8×80GB。 |
| 生态/易用 | HuggingFace/ModelScope 权重、Gradio、Diffusers 源码接入;ComfyUI 仍在 Todo。 | 有 HuggingFace/Replicate/Colab 等早期体验入口,但架构偏老。 | 已支持 Comfyui-MusePose,2025-03-04 发布 train codes。 |
Wan-Animate-2的应用场景
- :Lite 路线明确指向实时阈值与流式角色动画,适合做“真人驱动虚拟形象”的低延迟直播间。
虚拟主播 / 数字人直播
- :把演员的表演视频作为 driving video,套到角色立绘或参考图上,适合奇幻角色、IP 形象、低成本替身镜头;核心是端到端动作迁移与身份保持。
短视频 / 短剧角色替身
- :用一段舞蹈模板驱动不同角色形象,做多角色翻跳、同框换装或风格化 MV;视角控制还能做“同动作不同机位”的剪辑素材。
舞蹈、MV、手势舞二创
- :让品牌 mascot、虚拟模特按统一模板展示动作,用于上新短片、活动页视频、社媒素材;商用前要处理肖像、服装版权与平台合规。
电商与品牌内容
- :把讲师形象或卡通讲师驱动成固定动作模板,批量生成开场、转场、知识点提示镜头,降低重复拍摄成本。
教育 / 知识博主课件
- :策划先用真人表演快速驱动角色原型,验证动作节奏、镜头和情绪,再决定是否进入正式动捕与渲染管线。
游戏 NPC / 过场预演
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |