seedance2.5

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

AIGC行业资讯2小时前发布 zhang
1 0

谷歌:在LLM圈里我唯唯诺诺,在机器人圈里我直接大打出手!

刚刚,谷歌DeepMind发布了新一代的机器人大脑Gemini Robotics 2

从官方放出的Demo来看,这一代模型不仅能听懂人类指令,还能控制机器人调动整个身体,完成移动、抓取和灵巧操作等一系列任务。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

和以往各家具身demo集中展示的桌面操作不同,这一次,Gemini Robotics 2明显把战场从桌面扩大到了机器人的全身

机器人不再只是站在原地伸手拿东西,而是要自己走到目标面前、调整身体姿态,再用双手乃至多指灵巧手完成精细操作。

与此同时,除了负责运动控制的Gemini Robotics 2,谷歌这次还一口气推出了另外两款模型,分别负责高级推理和端侧部署,直接凑齐三件套:

  • Gemini Robotics 2:一个VLA模型,负责把视觉和语言输入直接转化为机器人的控制指令。它既可以控制全尺寸人形机器人从脚到指尖的运动,也可以适配双臂机器人和不同类型的末端执行器,重点提升全身移动、双手协同和灵巧操作能力。
  • Gemini Robotics ER 2:机器人的高级大脑,它负责理解人类指令、观察周围环境、拆解多步骤任务,并持续跟踪任务进展。遇到执行错误时,它还可以重新规划,甚至调度多台机器人一起协作。
  • Gemini Robotics On-Device 2:端侧部署的小模型,可以直接在机器人本地运行,不需要持续连接云端。同时,它还能用不到200个示例,在几小时内适配一套全新的双臂机器人本体。

基于这套小连招,Gemini Robotics 2在全身操作、多指灵巧操作以及夹爪操作等任务上,都取得了相当不错的成绩。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

By the way,在官方发布视频中,我们还发现了谭捷老师也全程亮相,并负责介绍这次工作。

他目前是Google DeepMind机器人团队的首席研究科学家、技术负责人,本科毕业于上海交通大学。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

接下来,我们具体来看。

基于全身控制的物理AI

咱先从负责运动控制的Gemini Robotics 2说起。

如前所说,Gemini Robotics 2本质上仍然是一款VLA模型。它接收人类的语言指令和机器人摄像头捕捉到的视觉信息,再直接输出机器人的动作。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

不过,这一代模型最大的变化,是开始把机器人的整个身体纳入统一控制,而不是上下半身的操作-移动解耦。

比如,当人类下达“把洒水器放进底层架子的绿色收纳箱里”这一指令后,Apollo需要先理解洒水器和绿色收纳箱分别在哪里,然后走向桌子、拿起洒水器,再移动到货架旁,弯下身体,将其准确放进指定位置。

这看上去只是一次简单的收纳任务,但背后涉及的其实是一整套连续的全身移动与操作:

机器人既要控制双腿行走和转向,也要调整躯干与手臂姿态,最后还要完成稳定抓取和精确放置。

换句话说,这一次的Gemini Robotics 2,不只是让机器人拥有了一双更灵巧的手,而是开始尝试把腿、腰、手臂和手指连成一个整体。

除了全身移动操作,官方展示的几个灵巧操作Demo也都相当惊艳。

比如,机器人可以拿起灯泡,将它旋出灯座,同时控制手指的力度,避免把灯泡捏碎。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

它还可以双手协同,一只手拿着簸箕,另一只手拿着刷子,把桌面上的垃圾扫进去。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

也可以将葡萄装进密封袋,再捏住袋口两端,把塑封条完整拉上。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

还有一个操作更离谱:机器人会用一种人类看上去都相当别扭的指法,把塑料袋一点点撑开并套上去。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

从Demo画面来看,这套系统似乎同时使用了头部的第一视角摄像头和腕部相机,让机器人既能观察整体环境,也能在接触物体时获得更近距离的视觉反馈。

当然,正如谷歌这次反复强调的,Gemini Robotics 2并不是只为某一台机器人定制的“大脑”。

同一套模型可以迁移到不同机器人本体和末端执行器上,继续完成相似的操作任务。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

这也意味着,谷歌希望解决的不只是“让一台机器人学会一个动作”,而是让同一种能力能够在不同身体之间迁移。

最后,从Demo中我们也不难看出,谷歌DeepMind这次没有继续使用此前长期合作的波士顿动力机器人,而是把模型部署到了多套不同硬件上,包括Apptronik的Apollo 2人形机器人、拥有22个自由度的Sharpa灵巧手,以及由两台Franka机械臂组成的双臂平台。

用高级推理解锁长程任务

除了负责运动控制的VLA模型,谷歌还推出了Gemini Robotics ER 2,作为整套系统里的“高级大脑”。

简单来说,如果Gemini Robotics 2负责“怎么动”,那么ER 2负责的就是“接下来做什么”。

它会理解用户指令、观察周围环境,将复杂任务拆成多个步骤,再调用VLA模型逐步执行,并持续跟踪任务进度。

这次更新后,ER 2已经能够更稳定地处理持续数分钟、涉及数百次决策的长序列任务。它不仅知道任务何时开始和结束,也能识别拿起物体、完成放置等关键事件。

如果中间某个步骤出现错误,机器人还可以重新观察环境、调整计划,再继续执行,而不是一次失败就直接停机。

此外,谷歌还展示了多机器人协作能力。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

不同类型的机器人可以相互传递任务信息、分工完成同一套工作流,从而处理那些单台机器人难以独立完成的复杂任务。

换句话说,ER 2不直接负责控制机器人的每一个关节,而是站在更高层,负责规划任务、跟踪进度,以及调度不同的机器人身体。

几小时适配一套新机器人

最后是负责端侧部署的Gemini Robotics On-Device 2。

它是谷歌目前效率最高的VLA模型,可以直接在机器人本地运行,避免网络延迟,也能适应工厂、户外等无法稳定连接云端的场景。

更重要的是,它原生支持多种机器人本体。

谷歌DeepMind发布机器人大脑Gemini Robotics 2,用VLA从头控到脚

借助从Gemini Robotics 1.5继承的“运动迁移”能力,On-Device 2通常只需要不到200个示例和几个小时的适配,就能迁移到一套新的双臂机器人上。

即使新机器人的外形、传感器和自由度差异很大,这套方法依然可以工作。

谷歌也在Dexmate、SO101和Trossen等不同平台上展示了这一能力。

整体来看,谷歌这次发布的三款模型分工相当明确:

ER 2负责理解和规划任务,Gemini Robotics 2负责把计划变成全身动作,而On-Device 2则负责将这些能力快速装进不同的机器人身体里。

目前, Gemini Robotics ER 2 现已在Google AI Studio上可用,同时也在 Gemini Enterprise Agent Platform 平台上提供私有预览版本。具体可参开发者博客。

© 版权声明

相关文章

堆友更新