首页 > 教程攻略 > ai资讯 >Gemini 1.5 Pro装进机器人,参观一遍公司就能礼宾、带路

Gemini 1.5 Pro装进机器人,参观一遍公司就能礼宾、带路

来源:互联网 时间:2026-08-16 14:26:48

说来有趣,机器人导航这摊子事,最近被谷歌DeepMind用大模型玩出了新花样。他们没去折腾那些复杂的底层传感器融合,而是把一个装了大模型“大脑”的机器人,直接扔进了真实的办公室。结果呢?这个机器人不仅能听懂模糊的口语指令,还能像老员工一样,带着访客在公司里自如穿梭。

Gemini 1.5 Pro装进机器人,参观一遍公司就能礼宾、带路

让机器人实现“指哪打哪”的核心,正是前不久发布的Gemini 1.5 Pro。它与传统AI模型的关键差异,在于那惊人的百万级token上下文长度。这个能力对机器人意味着什么?简单说,就是它能“记住”整个环境的游览视频。工程师只需带着它“参观”一遍办公室,标记几个关键地点,比如“刘易斯的办公桌”,之后任何人问起,它都能凭借这段记忆准确地带你过去。

更神奇的是,你甚至不需要说出具体地名。比如你拿着一杯咖啡想找地方放下,只需问一句“哪儿能放这个?”,机器人就能结合你手中的物体(视觉信息)和你的问题(语言信息),推理出“茶水间”或“公共休息区的桌子”才是正确目标,然后领你过去。这背后,正是大模型的常识推理能力在三维物理世界中的落地体现。

这一切的实现,都归功于一个名为“Mobility VLA”的导航新策略。

Mobility VLA:长上下文模型如何为机器人注入“环境记忆”

机器人导航技术的发展,其实是一条不断提升交互自然度的路径。最早,你得告诉机器人精确的坐标;后来进步到开放词汇的视觉语言导航,可以说“去沙发那里”;而现在,DeepMind的目标是将其推向“多模态指令导航”。这意味着机器人能同时理解语言和图像指令,比如你拿着一把钥匙问“这该还到哪儿?”,它需要综合钥匙的图像和你的话语,找到对应的钥匙柜。

在多模态指令导航中,有一类特别实用的场景,研究者称之为“多模态指示游览导航”。它的思路很巧妙:与其让机器人盲目探索一个陌生环境,不如先让人或机器人自己录制一段游览环境的视频。这段视频就像一张“记忆地图”,之后机器人所有的导航任务,都基于对这段视频的理解来完成。

这种方法有几个显而易见的好处:一是数据获取极其简单,用手机拍段视频就行;二是符合人类习惯——买了新家电,谁不会先在家里转一圈看看怎么用?三是安全可控,可以将机器人的活动范围严格限制在游览过的区域。

那么,谁来理解和分析这段冗长的游览视频呢?最合适的候选者自然是大型视觉语言模型。它们强大的图文理解和常识推理能力,似乎是解决此问题的完美答案。但现实有两个“拦路虎”:第一,大多数VLM的上下文长度有限,塞不下长达几百帧的环境视频;第二,让VLM直接输出控制机器人的转向、前进等底层动作指令,完全超出了其训练范围,效果惨不忍睹。

DeepMind提出的Mobility VLA,就是一套聪明的分层解决方案,它结合了“最强大脑”和“稳健双腿”。

技术架构:分层策略与拓扑地图

Mobility VLA的运作分为离线和在线两个阶段,结构清晰。

离线阶段,系统会处理那段示范游览视频,构建一张“拓扑地图”。这张地图不需要精确的几何测量,它更像一个由关键帧作为“景点”、帧与帧之间的可达关系作为“道路”连接起来的示意图。这样,环境的整体连通性就被简洁地记录了下来。

到了在线执行阶段,当用户给出一个多模态指令(比如举着一本书问“这本书该放回哪里?”),系统便开始分层工作:

1. 高层规划(用脑):

由Gemini 1.5 Pro这样的长上下文VLM担任“总指挥”。它将整个游览视频(关键帧和描述)与用户当前的指令(文字和图像)一起分析,运用常识进行推理,最终从视频中挑选出最符合指令目标的那一帧。例如,它判断出用户应该去“书架附近”的那个帧。

2. 底层执行(用腿):

一旦目标帧被确定,就轮到基于拓扑地图的底层导航策略上场了。它不负责理解,只负责高效、稳定地抵达。系统会先定位机器人当前在地图中的位置,然后通过最短路径算法规划出通往目标帧位置的路线,并一步步生成具体的移动指令,驱动机器人到达目的地。

这套分工明确的体系,既利用了VLM强大的理解与推理能力,又用经典的、鲁棒的导航方法规避了VLM不擅长的直接动作控制难题。

实验结果:为何说这是关键一步?

研究团队在现实世界的办公室和模拟家庭环境中进行了全面测试,重点回答了三个核心问题。

第一个问题,Mobility VLA在实际中靠谱吗?

答案是相当可靠。在涉及复杂推理(如“我想把这个藏到别人看不见的地方,该去哪?”)和多模态指令的任务上,该系统分别取得了86%和90%的成功率,比基线方法高出26%和60%。更重要的是,其底层导航的成功率达到了100%,这证明了拓扑地图方法在不同时间、光照和物体摆放变化下的强大鲁棒性。

第二个问题,长上下文模型是不是不可替代?

实验数据给出了肯定答复。当研究者尝试降低输入VLM的视频帧率以节省token时,高层目标查找的成功率随之显著下降,因为许多关键帧信息丢失了。而在不同VLM的横向对比中,只有拥有百万token上下文能力的Gemini 1.5 Pro表现出了令人满意的高成功率。这清晰表明,对完整环境记忆的高保真理解,是完成复杂导航指令的基础。

第三个问题,直接用VLM控制机器人动作行不行?

现实很骨感。当尝试提示Gemini 1.5 Pro直接输出“前进0.5米,左转30度”这类指令时,端到端成功率直接归零。模型几乎只会反复输出“向前移动”的指令,完全无法有效导航。此外,这种方式的成本也高得离谱——每移动一米需要推理26秒,且每次都要重新上传全部环境图像。相比之下,Mobility VLA的分层设计,让VLM只需在开始时花10-30秒确定目标,后续便交给高效的拓扑地图导航(每步仅需0.19秒),在成本和实用性上实现了完胜。

可以说,Mobility VLA的核心突破,在于它找到了一条将前沿大模型的“智能”与经典机器人的“体能”无缝衔接的工程化路径。它没有强行让大模型去做它不擅长的事,而是让其专注于高层理解与决策,再通过一个轻量而稳健的中间层(拓扑地图)来对接物理世界。这套方法论,为人机交互带来了全新的想象空间:未来,或许我们只需用手机给家里拍段视频,就能让新到的机器人助手迅速理解环境,成为真正的家庭伙伴。