HOMIE – 香港科技大学开源的数字人视频生成框架
来源:互联网
时间:2026-08-12 15:35:11
HOMIE是什么
HOMIE 是香港科技大学开源的一套数字人视频生成框架,底层采用 Wan2.1-T2V-14B 骨干网络,并整合了 Qwen3-VL 多模态大模型。它的关键价值在于,能把数字人、商品、Logo 和文字这四类核心要素放进同一套生成流程里统一处理,针对人-物交互、品牌贴牌、OCR 文字保真以及多视角一致性这四个行业里最棘手的问题,给出了更精确的解决方案。训练成本也相当克制,整个模型只需 5.5K 步、约 1 万 A100 小时;在效果上,OCR 准确率比当前最强的开源模型再提升 38.7%,推理方面则覆盖从 480P 单卡到 720P 多卡的部署方式,明显拉低了电商带货、虚拟主播等场景的视频制作门槛。

HOMIE的主要功能
- :支持多个人物与多种物体同时出现在同一视频中,保持每个主体的外观一致性,并实现自然、合理的交互动作(如手持、展示、传递商品等)。
人-物交互视频个性化
- :用多模态大模型(MLLM)的语义推理能力,自动将品牌Logo等抽象概念贴附到语义最相关的物体上,无需在提示词中显式描述位置关系。
Logo / 抽象概念精准贴附
- :配合 OCR 参考图,确保产品包装、标签上的文字在生成视频中清晰可读、不模糊、不串字,解决 AI 视频生成中”文字糊成一团”的痛点。
OCR 文字高保真生成
- :给定同一物体的多视角参考图,当物体在视频中发生旋转或运动时,能保持一致的外观和细节,适用于手办、3D模型、玩偶等展示场景。
多视角一致性生成
HOMIE的技术原理
- 阿里 Wan2.1-T2V-14B 的 DiT 为骨干,引入 Qwen3-VL-2B-Thinking 作为视觉理解模块,配合 UmT5 文本编码器和 VAE 视觉编码器,形成”文本+多模态语义+视觉”三路并行的生成架构。
整体架构:
- 在不破坏原有文生视频对齐关系、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入 DiT,使模型能自动理解参考图像之间的潜在关系。
MLLM 集成策略:
- 在 DiT 的自注意力层中,将 MLLM 提取的语义特征与 VAE 视觉 token 进行全局对齐,通过投影、池化和仿射变换,让生成过程中的每个视频 token 都能”看到”参考图的全局语义信息。
全局多模态自注意力引导(GMG):
- 为 MLLM 特征 token 和 VAE 视觉 token 分别赋予模态嵌入,为不同参考图像赋予独立参考嵌入,并将同一主体的多视角/OCR 参考图 token 关联起来,避免信息混淆。
模态-参考嵌入(MRE):
- 单主体 480P→ 多主体 480P→ 高清 720P,总计仅 5.5K 步完成训练,远低于同类方法的数万步。
三阶段渐进训练:

微信关注回复“
开源
AI开源项目交流群
如何使用HOMIE
- :从 GitHub 克隆 HOMIE 代码仓库到本地并完成环境依赖安装。
环境准备
- :从 HuggingFace 下载官方发布的预训练权重到指定模型目录。
权重下载
- :准备参考图像,包括人物照片、商品图、Logo 图或 OCR 文字图等多主体素材。
素材准备
- :编写文本提示词,准确描述目标视频中人物与物体之间的交互动作和场景。
提示词编写
- :运行推理脚本,HOMIE 会自动融合多模态参考信息并生成个性化视频。
运行推理
- :单卡 GPU 可直接生成 832×480 分辨率视频,多卡 FSDP 可扩展至 720P 高清输出。
分辨率选择
HOMIE的核心优势
- :一个框架同时处理人-物交互、Logo 贴牌、OCR 文字保真和多视角一致性四大任务,无需为不同场景切换不同模型。
统一框架
- :仅需 5.5K 步 / 约 1 万 A100 小时即可完成训练,成本远低于同类方法通常所需的 3–4 万步。
训练高效
- :在不牺牲文本编码器可控性、不产生昂贵重对齐成本的前提下,将多模态大模型的语义推理能力注入视频生成管线。
MLLM 无损集成
- :OCR 准确率相对提升 38.7%,多视角一致性提升 8.2%,40 人用户研究中 64.7% 将整体质量票选为第一。
质量领先
- :支持 480P 单卡到 720P 多卡推理,并可输出 1280×720 竖屏视频,直接适配直播带货与短视频制作。
推理灵活
HOMIE的项目地址
- :https://yiyangcai.github.io/homie-page.github.io
项目官网
- :https://github.com/YIYANGCAI/HOMIE
GitHub仓库
- :https://huggingface.co/yychai/homie-r2v-wan2.1
HuggingFace模型库
- :https://arxiv.org/pdf/2607.18217
arXiv技术论文
HOMIE的同类竞品对比
| 对比维度 | HOMIE | SkyReels-V3 |
|---|---|---|
| 发布方 | 香港科技大学 | 昆仑万维 |
| 骨干网络 | Wan2.1-T2V-14B | 自研视频模型 |
| MLLM 集成 | Qwen3-VL-2B,保留文本编码器无损注入 | 集成 MLLM,但替换文本编码器 |
| OCR 准确率 | 0.452(开源最高) | 0.326 |
| 多视角一致性 (DINOrec) | 0.685 | 0.654 |
| 主体一致性 (Face-Sim) | 0.786 | 0.751 |
| Logo 细节保真 | 能忠实渲染 Logo 细节 | Logo 位置正确但细节易模糊 |
| 训练成本 | 5.5K 步 / ~1 万 A100 小时 | 未公开,推测远高于 HOMIE |
| 开源协议 | Apache 2.0(可商用) | 开源可商用 |
HOMIE的应用场景
- :生成指定数字人手持指定商品做指定动作的带货视频,支持 1280×720 竖屏输出,直接适配短视频平台。
电商直播带货
- :自动将品牌 Logo 贴附到语义相关的产品上,无需在提示词中显式指定位置关系。
品牌广告制作
- :保持数字人身份一致的同时,与多种商品进行自然交互。
虚拟主播 / 数字人
- :给定手办、3D 模型或玩偶的多视角参考图,生成旋转展示视频,各角度外观保持一致。
产品多视角展示
- :配合 OCR 参考图,确保产品包装、标签上的文字在视频中清晰可读,适用于食品、化妆品、保健品等需要展示成分/说明的场景。
包装文字保真