MiniCPM-Robot:面壁智能推出的开源机器人视觉动作大模型开发套件
一、MiniCPM-Robot是什么
先说说MiniCPM-Robot是什么。它其实是面壁智能OpenBMB团队开源的一套轻量化视觉-语言-动作(VLA)完整解决方案,专门面向实体机器人。项目采用Apache 2.0开源协议,里头配套了两套专用具身大模型,外加一个PhyAI优化推理框架。这套方案特别针对机械臂、四足机器人这类硬件进行了优化,支持离线本地运行,完全不需要依赖云端大模型来干活。
总的来说,它解决了小型硬件设备运行具身智能模型时的几个核心痛点:算力不够用、推理延迟高、一断网就歇菜。覆盖的场景也很明确——机械臂操作任务和四足机器人目标跟踪导航,可以说是面向科研开发者和硬件爱好者的低成本具身智能开发底座。

二、功能特色
聊到具体功能,这套方案有不少设计上的亮点。
首先是双模型分工架构——内置了两个模型,MiniCPM-RobotManip管机械操作,MiniCPM-RobotTrack管目标跟踪,分别对应机械臂和机器狗的语言指令跟随,各司其职,兼顾了性能和轻量化。
然后,所有模型都支持本地部署,也就是说,即使在断网环境下,也能正常完成视觉识别、语言理解、动作决策,彻底摆脱了对网络和云端接口的依赖。
在实时性方面,针对机器人控制场景做了视觉Token压缩和特征推理链路的优化,能够满足机械臂和四足机器人运动控制对实时性的要求。
模型还具备长时序视觉记忆能力,能缓存历史帧画面,理解连贯的长流程任务,遇到异常时还能自动重试。
此外,项目提供了统一的PhyAI推理框架,标准化了硬件适配接口,原生兼容仿真环境和实体机器人,还配套了数据回流管线,方便使用者采集数据来迭代模型。
最后,模型本身走的是轻量化小参数量路线,参数规模小,消费级显卡和机器人机载算力都能承载,大幅降低了入门具身智能的硬件门槛。
三、技术细节
技术层面,我们挨个看看。
MiniCPM-RobotManip(1.5B VLA操作模型)
这个模型专门面向机械臂抓取、组装、连续操作这类任务。它采用统一权重范式来适配多种操纵任务,引入了流式长时视觉记忆,能缓存历史图像序列,并通过视觉Token压缩技术降低计算量,有效削减了推理算力消耗,最终输出机械臂连续动作指令。在仿真环境和实体机械臂上,都能完成多步骤复合任务。
MiniCPM-RobotTrack(0.4B跟踪导航模型)
这个模型是和南京大学联合研发的,适配宇树Go2 Edu四足机器狗。它融合了DINOv3和SigLIP的视觉特征,能接收自然语言指令,预测多组未来位置坐标和航向角。针对遮挡、多目标干扰这类场景,优化了特征匹配逻辑,端侧运行帧率很稳定,实现了语言驱动的自主目标跟随。
PhyAI专用推理框架
这个框架是整个系统的运行底座,负责模型推理加速、机器人硬件通信、长任务上下文管理、故障恢复,以及任务数据的自动采集。它把模型调用接口统一封装好了,减少了开发者重复开发推理适配代码的工作量。
整体技术链路
整个流程是:摄像头图像输入→视觉特征编码→语言指令融合→VLA模型推理→运动指令输出到机器人控制器。全程端到端本地计算,没有云端中转,干净利落。
四、应用场景
这套方案可以应用在不少地方:
科研实验:高校和实验室用它来做轻量化视觉动作大模型、具身智能相关的算法研究;
个人开发:爱好者用低成本硬件搭建机械臂视觉抓取、四足机器狗语言跟随的Demo;
小型自动化:轻量化机械臂搞本地视觉分拣、简易组装操作;
移动机器人:室内四足机器人做离线目标跟随、巡逻导航;
机器人二次开发:基于这个开源底座,快速定制专属的机器人视觉控制程序。
五、使用方法
上手其实不复杂,按步骤来就行:
环境准备:搭建Python运行环境,安装项目依赖库,准备好支持CUDA的显卡或机器人机载计算单元;
代码拉取:从官方GitHub仓库克隆代码;
模型下载:从Hugging Face把MiniCPM-RobotManip和MiniCPM-RobotTrack的权重文件下载下来;
硬件配置:根据机械臂或四足机器人的型号,修改通信配置文件,完成硬件驱动对接;
启动推理:调用PhyAI推理接口,加载对应的模型;
任务测试:输入自然语言指令,执行抓取操作或目标跟随任务;
迭代优化:开启数据采集功能,收集任务样本,用于后续模型微调。
六、竞品对比
为了更直观地了解它在行业中的位置,我们选取了目前主流的几个开源具身视觉动作方案做个横向对比。
| 项目名称 | 开发主体 | 模型定位 | 部署方式 | 典型硬件适配 | 核心优势 |
|---|---|---|---|---|---|
| MiniCPM-Robot | OpenBMB面壁智能 | 轻量化双模型,机械臂+四足机器人 | 本地离线端侧部署 | 机械臂、宇树Go2机器狗 | 双场景专用模型,内置推理框架,低算力友好 |
| π₀ (PiZero) | Physical Intelligence | 通用机器人操作VLA模型 | 推荐GPU本地部署 | 各类机械臂 | 通用操纵能力强,模型参数量更大,硬件要求更高 |
| Qwen-VLA | 阿里通义实验室 | 通用视觉动作大模型 | 云端/本地部署 | 机械臂仿真环境 | 生态完善,通用多模态能力强,缺少原生四足机器人适配 |
七、常见问题解答
问:MiniCPM-Robot必须用宇树Go2机器狗才能跑吗?
答:那倒不是。MiniCPM-RobotTrack原生适配了宇树Go2 Edu做目标跟随,但MiniCPM-RobotManip是面向机械臂的,其他品牌机械臂和仿真环境都支持,只要自己适配一下硬件通信协议就行。
问:普通笔记本显卡能流畅运行整套模型吗?
答:做功能调试和演示没问题。不过1.5B的RobotManip模型,建议至少配备8GB显存的显卡。显存太低的设备,推理速度会明显下降,很难满足机器人实时运动控制的需求。
问:项目能商用吗?
答:可以。项目采用Apache 2.0开源协议,只要遵循协议规范,就能商用。使用前记得仔细阅读仓库里的完整协议文本。
问:模型支持云端API调用吗?
答:项目原生设计就是本地离线端侧推理,官方没有提供云端调用方案。如果想云端部署,得自己动手改造推理服务代码。
问:能不能直接在仿真环境里测试,不用实体机器人?
答:当然可以。项目兼容主流机器人仿真平台,开发者可以先在仿真环境里验证算法逻辑,再迁移到实体硬件上。
八、相关链接
GitHub仓库地址:https://github.com/OpenBMB/MiniCPM-Robot
Hugging Face模型库:https://huggingface.co/collections/openbmb/minicpm-robot
ModelScope模型库:https://modelscope.cn/collections/OpenBMB/MiniCPM-Robot
九、总结
总的来说,MiniCPM-Robot是面壁智能推出的一套轻量化开源具身智能解决方案。它靠两套针对性优化的小参数量视觉语言动作模型,外加PhyAI推理框架,打通了从视觉感知、语言理解到机器人动作输出的完整链路。在离线运行、低延迟和低成本硬件适配方面都有不错的表现,给科研人员和开发者提供了一个开箱可用、能二次开发的机械臂操作和四足机器人导航开源底座。