谷歌发布新一代机器人AI模型 剑指“灵巧性”难题
话不多说,先看一个关键判断:谷歌DeepMind这次放出的新模型,核心卖点就是——它能让机器人实现全身协调动作。这可不是简单的升级,而是把机器人的能力从“上半身”延展到了“脚底下”,意味着人形机器人终于能像人一样,用整个身体去完成任务了。

这是谷歌将Gemini人工智能技术进一步拓展至机器人领域的最新动作。说到底,目标很明确:让机器人具备推理能力,能规划多步骤任务,并且真正适应人类生活环境,而不是只在实验室里走直线。
新系统叫Gemini Robotics 2,它能让机器人在执行任务时,一边行走、下蹲、操控物体,一边结合推理能力自主完成整个流程,而不是像过去那样,只能坐在那里动动手臂。
与此前主要控制机器人上半身动作的模型不同,Gemini Robotics 2实现了对整个人形机器人的全身控制。这意味着,机器人可以完成更复杂的动作组合,比如边走边捡东西,或者蹲下后再站起来。
在一段预录的演示中,DeepMind的新模型操控Apptronik公司的人形机器人Apollo,上演了一出“穿越房间,拿起洒水壶,再放到架子上”的完整流程,而且全程都能主动避开障碍物。这看起来已经有点“懂事了”。
与此同时,DeepMind还发布了另外两款机器人AI模型,它们既可以协同工作,也可以独立运行,形成了一套组合拳。
具体来说,Gemini Robotics 2负责将摄像头画面和自然语言指令,直接翻译成机器人的电机控制指令;而Gemini Robotics ER 2则充当机器人的“推理系统”,负责规划多步骤任务,并协调多个机器人共同完成同一目标。一个管执行,一个管规划,分工明确。
在灵巧性方面,谷歌也展示了显著提升。研究人员透露,在测试中,系统完成“拧下灯泡”这一任务的成功率达到了92%。不过,当遇到扎垃圾袋、封好Ziplock密封袋这类更复杂的操作时,成功率仍然相对较低。这说明,触觉感知和精细操控依然是目前最难啃的骨头。
此外,谷歌还推出了一套新的机器人安全评测基准,专门用于测试机器人是否能够识别不确定情况,并拒绝执行存在安全风险的指令。这就像给机器人装了一个“安全大脑”,知道什么时候该停下来。
谷歌表示,相较此前的模型,Gemini Robotics ER 2是公司迄今最安全的机器人模型,尤其在遵循指令以及避让人类方面表现更佳。安全,永远是机器人走进现实世界的第一道门槛。
在开放策略上,谷歌这次也显得比较务实。Gemini Robotics ER 2将通过公司的开发者平台AI Studio开放,并在企业级AI平台上提供私人预览;而更加专业化的Gemini Robotics 2和On-Device 2模型,则将率先向早期合作伙伴及100多家受信任测试机构开放。
公司还宣布,将向机器人开发者开放模型候补名单,并正与包括Apptronik、Agile Robots SE以及Boston Dynamics在内的一系列核心合作伙伴展开合作。这显然是在搭建一个更开放的生态,而不是闭门造车。
DeepMind机器人业务副总裁Carolina Parada在介绍时表示:“我们的目标是将AI带入物理世界,并构建一层能够被所有机器人使用的智能系统。”这句话的潜台词是,他们想做一个通用的机器人“大脑”。
但DeepMind机器人业务总监Kanishka Rao也坦言,真正实现机器人媲美人类的灵巧性仍然任重道远。目前机器人动作依然缓慢且谨慎,因为机器在执行过程中仍需停下来思考那些人类能够凭直觉完成的决策。换句话说,机器人现在还是“愣头青”,远没到“游刃有余”的地步。
Rao特别强调了一个关键点:机器人目前的学习效率仍远低于人类。人类往往只需经历一两次错误便能调整行为,而机器人距离这一水平仍有较大差距。这或许才是当前人形机器人面临的最大瓶颈,不是硬件,而是学习机制。
此次发布建立在谷歌于2025年推出Gemini Robotics的基础上,后者是Gemini旗舰AI模型的机器人版本,能够将语言和视觉信息转化为机器人的实际动作。可以说,这是一次从“理解”到“行动”的跨越。
这一产品也标志着谷歌重新点燃了延续十余年的机器人战略。要知道,Alphabet曾收购多家机器人初创公司,但随后逐步缩减相关业务,并于2023年关闭了Everyday Robots部门。如今重新高调进场,显然是想在AI时代重新定义机器人的玩法。
与此同时,谷歌的竞争对手OpenAI和英伟达也在积极布局机器人AI。OpenAI一直探索融合视觉、语言和动作能力的通用机器人基础模型,而英伟达则提供帮助开发者训练AI机器人的软件平台。这场围绕“机器人AI操作系统”的竞赛,已经进入了白热化阶段。