Google Gemini Robotics 2发布:AI正式踏入物理世界,可操控人形机器人
7月31日,据谷歌团队官方消息,DeepMind正式推出面向机器人的最强具身推理模型Gemini Robotics ER 2。作为机器人的"高级大脑",该模型负责理解物理世界、规划多步骤任务,并将执行指令分派给底层视觉-语言-动作(VLA)模型。
Gemini Robotics 2将多个AI模型组合成一个系统。它们共同使机器人能够理解周围环境以及如何在其中行动。一个视觉语言模型(VLM)可以理解图像和视频,与人类交流并推理如何执行不同任务。两个视觉语言动作(VLA)模型经过训练,理解如何在物理空间中移动,分别控制机器人的全身运动以及抓手或机械手的运动。
在发布前分享的视频演示中,该公司展示了几个不同的机器人在使用组合模型后自主执行复杂任务。其中一个演示中,Apptronik的Apollo 2机器人使用Sharpa公司的机械手整理货架。Google DeepMind使用人类遥操作、视频示例和模拟的组合来训练模型执行这些任务——目前AI模型还无法在没有特定训练的情况下执行广泛的复杂任务。
Google DeepMind机器人负责人Carolina Parada对Wired表示:"这是我们通往所谓物理AGI之路上的又一个里程碑,这意味着让机器人做任何人类能做的事。"
然而,让前沿AI模型接入机器人,使其能够在工作场所或家庭中漫游并操控物体,确实伴随着风险。此前的研究表明,使用前沿AI控制机器人可能产生意外甚至危险的行为。最近OpenAI开发的未发布AI代理入侵多个系统的事件也证明了这些模型在数字领域可能采取突然或不受欢迎的行动。
Parada表示安全性问题更为紧迫:"因为你在更多场景中使用它们,会出现大量不确定性,所以你需要更深入地理解安全问题。"她表示Google采用多层安全方法,在每个模型层都应用防护栏。公司还推出了ASIMOV-Agentic,一个用于衡量各种AI系统协作控制机器人安全性的新基准。该基准检测命令是否会导致有害或不确定的结果。
Google CEO Demis Hassabis此前表示,他希望为各种机器人开发一个AI操作系统,类似于智能手机的Android操作系统。