Cosmos 3 Edge:英伟达推出的轻量化全模态物理AI世界模型
一、Cosmos 3 Edge是什么
对于边缘AI落地这件事,业内常有这样的纠结:模型小了,精度不够,难以应对复杂的物理场景;模型大了,推理速度跟不上,又跑不动。NVIDIA最新发布的
Cosmos 3 Edge
它属于Cosmos 3轻量化家族,基于Nemotron底座与MoT混合Transformer双塔架构开发。核心目标很明确:让机器人在本地离线完成环境感知、未来视频预测和动作序列生成,不必依赖云端算力。权重和配套代码已按OpenMDW 1.1协议开源,支持商用微调和二次分发。
Cosmos 3完整产品线分为三档,覆盖从边缘到数据中心全算力层级:
表1 Cosmos 3全系列模型规格对比
| 模型名称 | 总参数量 | 核心硬件适配 | 核心定位 |
|---|---|---|---|
| Cosmos 3 Edge | 4B(2B稠密主干) | Jetson全系列、RTX 30/40/50系消费显卡、RTX PRO工业卡 | 边缘实时推理、机器人本地控制 |
| Cosmos 3 Nano | 16B(8B稠密主干) | 高端RTX工作站、小型DGX | 本地高精度场景仿真、机器人离线训练 |
| Cosmos 3 Super | 64B(32B稠密主干) | Hopper/Blackwell数据中心GPU | 大规模物理仿真、行业大模型预训练 |
二、功能特色
全模态统一输入输出
原生支持文本、图像、视频、环境音频和机器人动作轨迹的多模态输入,输出则是一套组合:未来预测视频、连续动作指令、场景文本描述。一个模型同时搞定视觉感知与运动决策,省去了多模型拼接的麻烦。Policy Mode机器人实时控制
内置专属动作输出分支,针对机械臂、移动AGV做了专门优化。在Jetson Thor设备上可实现15Hz的闭环实时控制,单次推理输出32组连续动作。配套的DROID预微调权重,让抓取、分拣、搬运等任务开箱即用。低内存边缘轻量化推理
2B稠密主干可以独立拆分运行,最低8GB显存的Jetson Orin就能部署,推理内存占用不到1.7GB。支持vLLM、ONNX、NVIDIA NIM等多种格式导出,跨NVIDIA硬件无缝迁移。极速行业微调能力
依托Cosmos开源训练框架,单台H100或高端RTX工作站,1天内就能完成自有产线、机器人、传感器数据的微调。定制化开发周期被大幅压缩。物理动力学双向推演
同时支持正向动力学(由当前画面预测未来场景)和逆动力学(从无标注视频反推物体运动动作)。这意味着可以用它来生成仿真数据,或者对机器人策略做离线评估,减少实体设备损耗。高基准边缘性能表现
在同为4B参数级别的模型中,VANTAGE-Bench视觉理解基准测试排名第一。视频生成、物理逻辑推理、机器人动作预测三项核心能力均衡,没有明显短板。

三、技术细节
3.1 MoT混合Transformer双塔核心架构
模型采用双塔式Mixture-of-Transformers架构,两个模块共享统一物理表征空间:
- (2B稠密主干):共28层,隐藏维度2048,16个注意力头,负责解析当前环境、理解物理规则、输出场景语义;
自回归推理塔
- :负责生成符合物理规律的未来画面和多帧时序视频;
扩散视频生成塔
双塔共用时序对齐模块,统一多模态令牌的时间坐标系,解决了图像、音频、动作不同帧率的同步问题。基础TPS设置为6,适配24fps的工业视频标准。
3.2 硬件优化技术
- :权重量化、KV缓存复用,适配边缘低显存设备;
显存分层压缩
- :针对Orin/Thor芯片做了TensorRT加速,大幅降低推理延迟;
Jetson专属算子
- :提供latency低延迟模式和throughput高吞吐模式两种运行策略,分别适配机器人实时控制和批量视频仿真场景。
并行推理预设
3.3 视频生成参数标准
原生支持256p/480p分辨率,单次最长生成121帧,帧率12–30fps,采样器采用UniPC,默认采样步数50步。主打工业异常模拟和场景仿真数据生成,并非影视级高清视频生成赛道。
3.4 许可证与开源范围
权重、推理脚本、微调代码、示例素材遵循OpenMDW 1.1开源协议,允许商业使用、模型微调和私有化部署。唯一限制是不能单独拆分架构闭源售卖。完整开源物料包含图像转视频Demo、机器人Policy推理脚本和Prompt配置模板。
四、应用场景
工业制造机器人
车间机械臂抓取、工件分拣、产线缺陷预判、设备安全监控。本地实时识别工件姿态并生成抓取动作,断网也不中断自动化流程。仓储物流AGV
仓库货物识别、路径预判、货物搬运动作规划,预测货架倾倒、货物掉落风险,自主调整行驶路线。边缘巡检设备
园区、矿山、厂区低速巡检小车,实时识别障碍物、人员、设备故障,本地输出避障动作指令。医疗边缘视觉设备
手术室本地影像分析、辅助器械动作预判,数据全程本地处理,满足医疗数据隐私合规要求。仿真数据生产
利用正向动力学批量生成工业场景仿真视频,补充真实采集数据的不足,降低机器人训练数据采集成本。
五、使用方法
5.1 硬件最低要求
基础原型:RTX 3070 8GB及以上消费显卡;
嵌入式部署:Jetson Orin 8GB/16GB、Jetson Thor;
微调训练:单张RTX A6000/H100显卡。
5.2 环境部署步骤
拉取官方Cosmos框架代码,安装PyTorch、TensorRT、vLLM依赖库;
从Hugging Face下载Cosmos3-Edge模型权重与配套素材;
构造JSON输入配置文件,填写输入图片路径、分辨率、帧数、采样参数;
选择推理模式:image2video视频生成 / policy机器人动作输出;
执行推理脚本,输出预测视频与机器人动作序列文件。
5.3 核心推理示例代码
import json
import urllib.request
# 加载官方示例Prompt
base_url = "https://huggingface.co/nvidia/Cosmos3-Edge/resolve/main/assets"
prompt_data = urllib.request.urlopen(f"{base_url}/example_i2v_prompt.json").read().decode()
input_config = {
"model_mode": "image2video",
"prompt": prompt_data,
"vision_path": f"{base_url}/example_i2v_input.jpg",
"resolution": 480,
"num_frames": 121,
"fps": 24
}
# 保存配置文件
json.dump(input_config, open("edge_infer.json", "w"), indent=2)终端执行推理命令:
python -m cosmos_framework.scripts.inference --parallelism-preset=latency -i edge_infer.json -o outputs/result --checkpoint-path Cosmos3-Edge --sampler unipc --seed 0
六、竞品对比
表2 Cosmos 3 Edge竞品综合对比表
| 对比维度 | Cosmos 3 Edge | RoboGen Edge | WorldDreamer-Lite |
|---|---|---|---|
| 参数量 | 4B | 3B | 5B |
| 架构 | MoT双塔,统一多模态表征 | 单编码器+独立动作头,多模型分离 | 单扩散架构,无专属Policy分支 |
| 机器人实时控制 | 原生Policy Mode,15Hz闭环控制 | 需额外动作微调模块,延迟偏高 | 仅支持静态动作预测,无实时闭环 |
| 最低部署显存 | 8GB Jetson Orin | 12GB显卡起步 | 10GB显存门槛 |
| 微调周期 | 单卡1天完成行业定制 | 3–5天微调周期 | 2天以上微调 |
| 开源协议 | OpenMDW 1.1(商用允许) | 学术非商用协议 | MIT协议,商用无保障 |
| 基准VANTAGE-Bench | 同规模第一 | 中下游水平 | 中等水平 |
| 核心优势 | NVIDIA硬件深度优化、机器人原生适配、离线全功能 | 轻量化视频生成,代码简洁 | 开源限制少,纯视觉生成能力强 |
| 短板 | 非影视向视频生成效果一般 | 机器人闭环控制性能弱 | 无原生动作输出,工业适配差 |
七、常见问题解答(FAQ)
Q1:Cosmos 3 Edge可以离线部署吗?
A:完全支持离线运行。模型权重、推理代码全部本地加载,推理过程无需联网,仅下载模型阶段需要网络。适合无外网的工厂、矿区等封闭场景。
Q2:普通游戏显卡能否运行Cosmos 3 Edge?
A:RTX3070 8GB及以上显卡均可本地运行基础推理。若需要做行业微调,建议使用16GB及以上显存显卡。低显存显卡仅能执行视频预测和简易动作推理,不支持批量微调。
Q3:Cosmos 3 Edge和Cosmos 3 Nano该如何选择?
A:Jetson嵌入式设备、需要实时机器人闭环控制、低显存硬件选Edge;工作站、需要高精度仿真、大批量离线训练场景选择Nano。Nano精度更高但硬件门槛也更高。
Q4:模型是否支持商用落地?是否收费?
A:基于OpenMDW 1.1开源协议,免费商用,无授权费用。唯一限制是不能单独拆分模型架构封装后闭源售卖。企业可基于模型开发自有行业解决方案。
Q5:没有机器人动作标注数据,还能训练Policy模式吗?
A:可以。依托模型逆动力学能力,仅使用无标注现场视频即可反推潜在动作序列,生成伪标签用于微调,大幅降低数据采集成本。
Q6:推理时出现显存溢出该如何解决?
A:切换latency低延迟并行预设、降低输出分辨率、减少生成帧数。也可以拆分2B稠密主干单独运行,关闭批量推理功能,降低显存占用。
Q7:模型可以导出ONNX部署到第三方边缘设备吗?
A:支持导出ONNX格式,但TensorRT加速仅原生适配NVIDIA GPU。非NVIDIA硬件运行会出现明显延迟上升,官方推荐Jetson、RTX系列硬件部署。
八、相关链接
Hugging Face官方博文:https://huggingface.co/blog/nvidia/cosmos3edge
Cosmos 3 Edge模型库:https://huggingface.co/nvidia/Cosmos3-Edge
Cosmos开源框架GitHub地址:https://github.com/nvidia/cosmos
九、总结
Cosmos 3 Edge是NVIDIA面向边缘物理AI打造的轻量化开源世界模型。它通过创新MoT双塔架构,将多模态统一处理与机器人原生实时控制融为一体,在边缘设备显存限制与物理场景推理精度之间找到了一个不错的平衡点。覆盖工业机器人、仓储AGV、巡检设备等多类线下自动化场景,配套完整开源推理、微调工具链与轻量化硬件适配方案。相比同类边缘世界模型,它的部署门槛更低、定制迭代速度更快,且有成熟的NVIDIA硬件生态支撑。对于具身智能端侧落地而言,这算得上是一个高性价比的开源基础模型选择。