Gemini 1.5 Pro装进机器人,参观一遍公司就能礼宾、带路
说来有趣,机器人导航这摊子事,最近被谷歌DeepMind用大模型玩出了新花样。他们没去折腾那些复杂的底层传感器融合,而是把一个装了大模型“大脑”的机器人,直接扔进了真实的办公室。结果呢?这个机器人不仅能听懂模糊的口语指令,还能像老员工一样,带着访客在公司里自如穿梭。

让机器人实现“指哪打哪”的核心,正是前不久发布的Gemini 1.5 Pro。它与传统AI模型的关键差异,在于那惊人的百万级token上下文长度。这个能力对机器人意味着什么?简单说,就是它能“记住”整个环境的游览视频。工程师只需带着它“参观”一遍办公室,标记几个关键地点,比如“刘易斯的办公桌”,之后任何人问起,它都能凭借这段记忆准确地带你过去。
更神奇的是,你甚至不需要说出具体地名。比如你拿着一杯咖啡想找地方放下,只需问一句“哪儿能放这个?”,机器人就能结合你手中的物体(视觉信息)和你的问题(语言信息),推理出“茶水间”或“公共休息区的桌子”才是正确目标,然后领你过去。这背后,正是大模型的常识推理能力在三维物理世界中的落地体现。
这一切的实现,都归功于一个名为“Mobility VLA”的导航新策略。
Mobility VLA:长上下文模型如何为机器人注入“环境记忆”
机器人导航技术的发展,其实是一条不断提升交互自然度的路径。最早,你得告诉机器人精确的坐标;后来进步到开放词汇的视觉语言导航,可以说“去沙发那里”;而现在,DeepMind的目标是将其推向“多模态指令导航”。这意味着机器人能同时理解语言和图像指令,比如你拿着一把钥匙问“这该还到哪儿?”,它需要综合钥匙的图像和你的话语,找到对应的钥匙柜。
在多模态指令导航中,有一类特别实用的场景,研究者称之为“多模态指示游览导航”。它的思路很巧妙:与其让机器人盲目探索一个陌生环境,不如先让人或机器人自己录制一段游览环境的视频。这段视频就像一张“记忆地图”,之后机器人所有的导航任务,都基于对这段视频的理解来完成。
这种方法有几个显而易见的好处:一是数据获取极其简单,用手机拍段视频就行;二是符合人类习惯——买了新家电,谁不会先在家里转一圈看看怎么用?三是安全可控,可以将机器人的活动范围严格限制在游览过的区域。
那么,谁来理解和分析这段冗长的游览视频呢?最合适的候选者自然是大型视觉语言模型。它们强大的图文理解和常识推理能力,似乎是解决此问题的完美答案。但现实有两个“拦路虎”:第一,大多数VLM的上下文长度有限,塞不下长达几百帧的环境视频;第二,让VLM直接输出控制机器人的转向、前进等底层动作指令,完全超出了其训练范围,效果惨不忍睹。
DeepMind提出的Mobility VLA,就是一套聪明的分层解决方案,它结合了“最强大脑”和“稳健双腿”。
技术架构:分层策略与拓扑地图
Mobility VLA的运作分为离线和在线两个阶段,结构清晰。
在离线阶段,系统会处理那段示范游览视频,构建一张“拓扑地图”。这张地图不需要精确的几何测量,它更像一个由关键帧作为“景点”、帧与帧之间的可达关系作为“道路”连接起来的示意图。这样,环境的整体连通性就被简洁地记录了下来。
到了在线执行阶段,当用户给出一个多模态指令(比如举着一本书问“这本书该放回哪里?”),系统便开始分层工作:
1. 高层规划(用脑):
2. 底层执行(用腿):
这套分工明确的体系,既利用了VLM强大的理解与推理能力,又用经典的、鲁棒的导航方法规避了VLM不擅长的直接动作控制难题。
实验结果:为何说这是关键一步?
研究团队在现实世界的办公室和模拟家庭环境中进行了全面测试,重点回答了三个核心问题。
第一个问题,Mobility VLA在实际中靠谱吗?
第二个问题,长上下文模型是不是不可替代?
第三个问题,直接用VLM控制机器人动作行不行?
可以说,Mobility VLA的核心突破,在于它找到了一条将前沿大模型的“智能”与经典机器人的“体能”无缝衔接的工程化路径。它没有强行让大模型去做它不擅长的事,而是让其专注于高层理解与决策,再通过一个轻量而稳健的中间层(拓扑地图)来对接物理世界。这套方法论,为人机交互带来了全新的想象空间:未来,或许我们只需用手机给家里拍段视频,就能让新到的机器人助手迅速理解环境,成为真正的家庭伙伴。
-
- 关于宇宙的好的网名有哪些
- 角色扮演 | 1
- 网名