通用机器人迎来“珠峰级”考试:人类登顶满分,最强AI还在山脚
具身智能时代,通用机器人策略离“登顶”还有多远?现有基准恐怕还回答不了这个问题。
问题出在哪儿?不少基准依赖的任务要么太简单、要么太短程,或者技能范围太窄。仿真评估效率高、容易扩展,但很难反映真实物理世界的部署能力;而真实世界评估虽然更贴近实际部署,成本高、耗时长,可复现性也是个难题。
针对这一困境,来自香港大学、加州大学伯克利分校、清华大学、北京大学等机构的研究团队,联合提出了一个面向仿真与真实世界的统一评估基准——
RoboDojo

论文链接:https://arxiv.org/abs/2607.04434
实验数据摆在眼前:
现有通用机器人操作策略
基于这些结果,研究团队建立了
公开排行榜
局限
关键方向

图|RoboDojo 概览。
RoboDojo:统一的机器人评估基准
RoboDojo:统一的机器人评估基准
从整体架构来看,RoboDojo以五类核心操作能力定义了仿真基准,并通过仿真评估平台、真实世界评估平台和XPolicyLab共同完成从任务构建、策略训练、部署到评估的完整闭环。

图|RoboDojo 任务概览。
仿真基准覆盖了五类核心操作能力:
泛化、记忆、长程执行、精细控制与开放指令理解
- 测试策略对未见背景、光照、目标和杂物的适应能力;
泛化任务
- 考察历史信息的利用情况;
记忆任务
- 评估策略完成多步骤操作序列的能力;
长程任务
- 聚焦窄孔插入等高精度接触操作;
精细控制任务
- 测试策略能否将已学技能迁移到未见语言指令和新目标。
开放任务
从系统构成来看,RoboDojo由仿真评估平台、真实世界评估平台和XPolicyLab三部分构成,具体如下:
仿真平台:
任务构建、资产生成、并行评估和数据采集

图|RoboDojo 中的技能多样性。
真实世界评估:
可复现性

图|真实世界任务亮点。
XPolicyLab:
此外,RoboDojo还设立了仿真与真实世界双榜单

图|RoboDojo-RealEval 系统概览。
RoboDojo 的评测结果如何?
RoboDojo 的评测结果如何?
研究团队发现,
现有通用机器人操作策略整体仍不可靠
1.仿真结果
目前领先策略仍远低于人类水平:

图| RoboDojo 仿真基准排行榜。
不同模型能力发展不均衡:
泛化方面,场景随机化会显著削弱策略表现:

图|标准与随机化视觉设置下的策略性能。
长程执行方面:
模型能推进部分多步任务
技能组合
阶段决策
错误恢复能力
精细控制方面:
可靠水平
整体表现不能直接转化为局部精细控制
记忆方面:
记忆能力
可靠控制
开放语义操作方面:
语义目标
机器人行为
2.真实世界结果
真实世界部署方面,当前通用机器人操作策略仍不可靠

图| RoboDojo 真实世界基准排行榜。
仿真性能与真实可部署性并不完全一致
真实世界评估暴露了成功率之外的执行与安全风险
3.评估效率与稳定性
RoboDojo具备较好的评估效率和稳定性。

图|每个任务的真实世界评估时间。
重复评估结果

图|多次重复运行中各任务真实世界评估的完整稳定性。
不足和未来发展
不足和未来发展
研究团队指出,尽管RoboDojo已覆盖
仿真与真实世界评估
明显短板
不够稳定
研究团队表示,他们将在未来持续更新RoboDojo的策略、任务和评估结果,并扩展到更广泛的
场景
机器人本体
感知模态

图|RoboDojo 的未来扩展。
同时,他们也将为RoboDojo在不同方向引入多个机器人本体,提升基准的可访问性,增强跨硬件平台比较的公平性,最终发展为面向具身操作的通用评估平台。
更多技术细节,详见原论文。