UniWorld-View:大联合兔展智能等开源的单输入通用4D世界新视角生成模型
一、UniWorld-View是什么
先抛出一个核心结论:
UniWorld-View
单输入通用4D世界新视角生成模型
它跟传统的NeRF、3D高斯重建方案不一样,不需要多张多角度拍摄素材。普通用户随手拍的生活照片、手机短视频都能当输入。它把深度估计、实例分割、动态视频扩散、相机位姿预测这些模块都融合在一起,统一实现了静态场景和动态人物物体的4D动态视角生成。
二、功能特色
极简输入门槛
不需要专业摄影设备,也不需要多视角素材,一张图或者一段单目短视频就能完成场景重建和新视角渲染,3D视觉创作的素材成本大大降低。自由可控相机轨迹生成
支持自定义环绕、推拉、平移、旋转这些任意相机运动路径,能精准控制相机位姿,输出的动态视角视频连贯、没有畸变。静态/动态场景双兼容
静物、建筑这些静态场景,还有人物、动物、流体这些动态运动物体,它都能适配。4D时序动态重建(recon分支专属能力)也支持。多硬件平台适配
原生支持NVIDIA GPU推理,还有一个独立的npu分支,专门适配国产昇腾NPU算力,满足国产算力部署需求。开箱即用可视化工具
内置了Gradio网页交互Demo,本地浏览器就能可视化操作,不用写代码。还配套了Shell一键脚本,支持批量视频推理。完整配套预训练权重生态
内置了自动化权重下载脚本,主干模型、深度模型SAM2、BLIP2图文理解、Video-Depth-Anything、Wan2.1-VACE,全套模型一键就能拉取下来。
三、技术细节
3.1 整体架构
UniWorld-View采用
场景重建前置模块 + 视频扩散视角生成主干
前置重建模块:
- 深度估计:调用Video-Depth-Anything提取单目素材的稠密深度图;
- 实例分割:SAM2完成物体掩码区分,把前景主体和背景分离开;
- 相机位姿预测:轻量化位姿解算网络,预估输入素材的原始相机参数;
- 4D时序编码:针对视频输入增加时间维度编码,记录物体运动轨迹。
扩散生成主干:
基于Wan2.1-VACE视频扩散底座改造,把三维空间坐标、自定义相机参数作为条件嵌入扩散UNet,将视角偏移量转化为视频生成条件,实现跨视角画面连贯生成,解决了传统扩散模型视角抖动、物体形变崩坏的问题。
3.2 分支技术区分
- main主分支:通用图文/短视频视角生成,面向普通用户推理;
- recon分支:强化4D动态时序重建,适合动态人物、运动物体的高精度创作;
- npu分支:算子适配昇腾NPU,重构了CUDA扩展逻辑,适配国产算力设备。
3.3 环境与编译依赖
- 运行环境:Python3.10、PyTorch 2.4.0+CUDA12.1;
- 编译组件:PyTorch3D源码编译、CUDA nvcc C++扩展(vipe视觉处理库);
- 辅助模型:BLIP2图文对齐、SAM2分割、深度预估模型协同辅助场景理解。
3.4 硬件推理门槛
最低显存需求是40GB,推荐60GB及以上的A100、RTX 6000这类专业GPU。低显存显卡容易出现画面截断、显存溢出的报错。
四、应用场景
短视频影视创作
自媒体、短视频创作者用单张场景图就能生成环绕运镜视频,不需要专业3D建模软件,快速产出航拍、环绕镜头素材。虚拟数字人/虚拟场景
单张数字人图片就能生成360°环绕展示视角,用于虚拟直播、数字人展厅素材制作。建筑/室内设计展示
室内效果图、建筑外景单图生成漫游视频,房产、设计行业快速制作全景漫游宣传片。学术计算机视觉研究
4D重建、新视图合成、视频扩散方向的科研实验,提供了开源可复现的SOTA基线模型。国产AI算力落地测试
npu分支适配昇腾设备,企业可以用于国产算力平台的多模态视觉模型部署验证。游戏素材快速生成
游戏原画、场景概念图一键生成多角度动态预览镜头,缩短游戏美术制作周期。
五、使用方法
5.1 仓库克隆与环境准备
拉取项目代码,同步外部依赖库
git clone https://github.com/PKU-YuanGroup/UniWorld-View.git cd UniWorld-View
配置conda虚拟环境,安装基础依赖,编译PyTorch3D与vipe CUDA扩展
执行权重下载脚本,自动下载全部预训练模型到checkpoints文件夹
bash download_weights.sh
5.2 网页可视化Demo(零代码推荐)
执行启动脚本,本地打开浏览器访问可视化界面
bash run_app.sh
默认地址是127.0.0.1:7860,添加环境变量可以开放公网远程访问。
5.3 批量命令行推理
批量处理图片/短视频素材,自定义相机轨迹参数,批量输出视角视频
bash run_infer.sh
可以前置指定GPU卡号,多显卡并行推理加速。
5.4 分支切换使用
- 动态4D重建:切换到recon分支
- 昇腾NPU部署:切换到npu分支,配套国产算力编译脚本
六、竞品对比
选了两款同赛道的开源新视角生成模型,从输入、算力、动态支持、可视化、国产适配这几个维度做了对比:
| 对比维度 | UniWorld-View(PKU-YuanGroup) | ViewCrafter | GS-DiT |
|---|---|---|---|
| 素材输入 | 单图/单目短视频双支持 | 仅单张图片 | 多视角图片序列 |
| 动态场景支持 | 支持4D动态物体重建 | 仅静态场景 | 动态效果差,易形变 |
| 可视化工具 | 内置Gradio网页,一键启动 | 无原生可视化界面 | 仅命令行运行 |
| 国产算力适配 | 独立npu分支适配昇腾NPU | 仅支持NVIDIA GPU | 仅支持NVIDIA GPU |
| 榜单性能 | WorldScore榜单第一SOTA | 中等水平 | 中等水平 |
| 使用门槛 | 一键脚本,全自动权重下载 | 需手动下载多个模型权重 | 需要多张多角度拍摄素材 |
七、常见问题解答
Q:运行代码时出现CUDA out of memory显存溢出报错怎么办?
A:这个模型最低推荐40GB显存。显存不够的话,可以降低生成视频的分辨率、缩短输出视频的帧数,或者换60GB以上的专业GPU。也可以把素材拆开分批推理,减少单次并行生成的数量。
Q:npu分支部署昇腾设备失败,编译vipe扩展报错?
A:npu分支需要配套对应版本的CANN驱动。编译前要切换到昇腾专属编译环境,关闭CUDA相关依赖,重新执行分支内配套的编译脚本。
Q:输入短视频生成视角画面出现人物扭曲、物体崩坏?
A:建议优先切换到recon动态重建分支。同时要保证输入视频主体清晰、没有大幅度遮挡。复杂运动流体、高速运动物体的生成效果会自然下降,这是模型固有的局限。
Q:权重下载脚本执行失败,模型文件缺失?
A:检查一下网络连通性。脚本默认从Hugging Face拉取权重,国内网络环境可以手动下载权重文件,放到checkpoints对应的目录里,然后关闭自动下载参数再运行推理。
Q:Gradio网页无法从外网访问,只能本地打开?
A:启动run_app.sh时添加开放公网的环境参数,关闭本地IP限制,开放7860端口的防火墙,就可以外网访问了。
Q:是否支持Windows系统本地运行?
A:项目原生是基于Linux开发的,Windows可以通过WSL2子系统搭建CUDA环境来运行。原生Windows没有适配脚本,推荐使用Ubuntu22.04系统。
八、相关链接
- GitHub仓库:https://github.com/PKU-YuanGroup/UniWorld-View
- Hugging Face仓库:https://huggingface.co/Drexubery/UniView
九、总结
UniWorld-View作为北大联合兔展智能等开源的SOTA级通用世界新视角合成AI模型,单图、短视频双输入的低素材门槛,静态动态场景兼容,原生可视化交互,再加上国产算力适配,这些核心优势让它既适合学术科研,也能满足商用素材创作的需求。完整配套的一键部署脚本、全套预训练权重和多场景适配分支,让它成为当前开源领域综合实用性最强的多视角视频生成工具之一。
-
- 元宵节猜灯谜的祝福短信
- 角色扮演 |
-
- 关于柯南的沙雕网名有哪些
- 角色扮演 | 1
- 网名
-
- 最新中性名字男女通用网名有哪些
- 角色扮演 | 1
- 网名
-
- 关于蓝色说唱的网名有哪些
- 角色扮演 | 1
- 网名
-
- 我好喜欢你是什么梗?
- 角色扮演 |