大语言模型助力机器人理解模糊指令并聚焦关键细节
想象一下这个场景:你在仓库或者办公室里,手头一堆事,突然需要帮一个“新员工”熟悉基本操作。只不过这位新员工不是人类,而是一台机器人。要教会它,最简单的方式大概是“我做你看,边说边练”——亲自演示几种不同的做法,同时口头解释你在干嘛。

举个例子,你让机器人把咖啡放到桌上,但前提是不能打扰你正在进行的视频会议。你希望它离你和笔记本电脑远一点,免得影响会议。要实现这个行为,机器人需要的是能清晰展示完整任务的数据来训练。之前,计算机科学家们试过两条路:要么录一大堆实物演示,要么写一份超详细的操作说明。可问题是,这两样东西但凡缺一样,机器人很可能就搞不清自己到底该干什么。
让人类同时把“示范”和“讲解”都做足,实在是又耗时又费力。针对这个痛点,麻省理工学院计算机科学与人工智能实验室(CSAIL)的研究团队,直接把机器人教学流程自动化了——不仅能自动理清操作指令,还把需要的演示数据量砍掉了将近五倍。他们提出的方法叫“掩码逆强化学习”(Masked IRL),核心思路是:先用一个大语言模型,根据用户的演示数据,把模糊的提示翻译成更具体的指令;再让第二个大语言模型从中筛出那些真正关键的环境细节,供算法在制定运动计划时参考。这样一来,机器人就能安全地在家庭、办公室和工厂里完成任务。
“人跟机器人交互的时候,肯定不想把每个步骤的细节都掰扯清楚,这时候我们的方法就派上用场了,”麻省理工博士生、CSAIL研究员、论文第一作者黄敏英(Minyoung Hwang)说,“目标是让机器人真正弄懂用户的意图,把人类的操作负担降到最低。”
黄敏英指出,Masked IRL能帮机器人应付复杂环境下的安全移动——这种环境里,总有一些人类在操作提示里根本不会主动提、但至关重要的东西。比如,机器人去厨房拿零食,可能不知道要躲开你的笔记本电脑;工厂机器人在往不同箱子里放物品时,也必须小心绕开货架。
学习新任务的时候,Masked IRL会通过机器人的传感器采集周围环境信息,同时记录运动示教过程中每一个动作。所谓运动示教,就是由人类亲手引导机器人执行动作,有点像给机器人做物理治疗——弯弯关节,示范怎么抓、怎么拿、怎么放。
然后,麻省理工的系统调用一个大语言模型,把这一连串动作(也就是运动轨迹)跟最短路径做个比较,同时对提示里模糊的地方展开解读。像“保持靠近”这种笼统请求,会被翻译成更明确的表述,比如“保持靠近桌面”。借助轨迹比较和明确后的指令,大语言模型就开始理解哪些训练动作对完成任务是真正有意义的。
第二个大语言模型则负责评估环境细节——比如障碍物的位置、目标物体的形状。在这个过程中,它会判定哪些元素跟当前任务无关,然后进行“掩码”处理(直接忽略),并为每个元素打分:“1”代表重要,“0”代表不重要的。比方说,用户在演示时是不是靠在桌子上,这类信息会被标成“0”;而所有被评为“1”的细节,都会被算法纳入最终的行动计划。
这个掩码机制让Masked IRL在三维仿真和真实场景演示里,表现都优于同类基线方法——因为它教会了机器人什么值得关注,什么可以忽略。借助这套系统,虚拟和真实的机器人都能灵活地绕过障碍物移动物体,比如绕过笔记本电脑,把咖啡杯放到桌上的不同位置。在这些任务中,Masked IRL正确识别用户未在提示里明确表达的偏好的准确率,比同类基线方法最高提升了15%。
仿真实验中,CSAIL的研究人员还发现Masked IRL的学习效率更高。跟基线方法比,它只需要更少的演示次数就能学会怎么移动马克杯。而且,当大语言模型负责厘清指令时,机器人表现得比直接跟着模糊指令走要好得多。
这种更聚焦的方法同样适用于真实的机械臂——能执行系统在训练阶段从没见过的指令。经过50次运动示教训练之后,机器人可以小心地端着杯子递向人类,同时避免碰到用户的电脑。这个需要回避的障碍,正是系统通过解析“保持距离”这个笼统请求学到的。此外,机器人还能在“保持贴近”桌面的前提下完成擦桌任务,以及在同时“远离”人类和桌子的条件下,把一袋薯片递给用户。
Masked IRL能感知并解读用户没说出口的意图。不久的将来,它还能拥有“视觉感知”能力。CSAIL的研究团队计划给系统装上摄像头,让机器人拍下周围环境的图像,进而识别并聚焦于附近的特定元素。举个例,当你说“捡起那个玩具”,它可能会先看到旁边的香蕉,但在抓取目标之前,会自动把香蕉忽略掉。
这篇论文由黄敏英与三位CSAIL同事共同撰写,包括博士生亚历山德拉·福西-斯梅雷克(Alexandra Forsey-Smerek,学士2020届、硕士2022届)、博士后纳撒尼尔·丹勒(Nathaniel Dennler),以及麻省理工学院助理教授、航空航天系暨CSAIL成员安德烈亚·博布(Andreea Bobu)。该研究得到了塔塔集团通过麻省理工学院生成式AI影响力联盟奖及美国国防部的部分资助。研究团队将于今年6月在2026年IEEE国际机器人与自动化大会上正式发表这一成果。
Q&A
Q1:Masked IRL技术是什么?它如何帮助机器人理解指令?
A:Masked IRL(掩码逆强化学习)是麻省理工学院CSAIL研究团队开发的一套机器人教学方法。它利用大语言模型对用户模糊的操作提示进行扩展解读,同时通过第二个大语言模型对环境细节进行重要性评分,忽略无关信息,聚焦关键要素,从而帮助机器人准确理解用户真实意图,并生成合理的运动计划。
Q2:Masked IRL相比传统机器人训练方法有哪些优势?
A:相比传统方法,Masked IRL主要有两大优势:一是大幅减少了所需的演示数据量,训练效率提升近五倍;二是通过大语言模型自动厘清模糊指令,避免了机器人因指令不清而产生误解。此外,该方法正确识别用户隐含偏好的准确率比同类基线方法最高提升15%。
Q3:Masked IRL目前能在真实场景中应用吗?
A:可以。研究人员已在真实机械臂上验证了Masked IRL的实际效果。经过50次运动示教训练后,机器人能够完成多项现实任务,例如绕开笔记本电脑递送杯子、贴近桌面擦拭,以及在远离人类和桌子的前提下递送物品。未来研究团队还计划为系统配备摄像头,进一步增强其对真实环境的感知与理解能力。