谷歌推出 Gemini Robotics 2,兼顾灵巧操作与多机器人协同作业能力
谷歌推出 Gemini Robotics 2.兼顾灵巧操作与多机器人协同作业能力。当科幻电影里的机器人管家还在银幕上做着各种家务时,现实世界中的机器人正在迎来一次真正的“大脑升级”。当地时间7月30日,Google DeepMind正式发布了新一代机器人AI模型——Gemini Robotics 2.与以往主要控制机器人上半身“比划比划”的模型不同,这次的新模型实现了从脚趾到指尖的全身统一控制。更值得关注的是,它同时具备了精细的灵巧操作能力和多机器人协同作业的能力。谷歌这次的目标很明确:不造机器人的“身体”,而是打造一颗能装进任何机器人脑袋里的“通用大脑”。

一、从“上半身”到“全身”:机器人终于学会“动脑子走路”了
以前的机器人演示,总有一种“回合制游戏”的感觉——机器人先走到桌子前、停稳、站好,然后才伸出手去抓东西。抓完之后,它又要切换到行走模式,才能去下一个位置。上半身和下半身像是两个各管一摊的部门,配合起来总有点生硬。
Gemini Robotics 2的出现改变了这个局面。它是一个“视觉-语言-动作模型”(VLA),能把摄像头看到的东西和人类的语言指令,直接转化成机器人的电机控制信号。通俗地说,机器人不再需要“先想好怎么走、再想好怎么拿”,而是把行走、弯腰、伸手、抓取当作一个整体来规划和执行。
官方演示视频中,Apptronik公司的人形机器人Apollo 2接到“把洒水壶放进底层架子的绿色收纳箱里”这个指令后,自己走过去、弯腰、拿起水壶、再走到货架旁、弯腰把水壶放进指定位置。整个过程一气呵成,没有“停一下再走”的顿挫感。谷歌表示,这套模型已经可以控制全尺寸人形机器人从脚到指尖的每一个关节。
二、三个模型各司其职:一套完整的“机器人大脑”方案
Gemini Robotics 2不是单独一个模型,而是一套三款模型组成的完整方案。每款各管一摊,配合起来就是一套完整的机器人大脑。
第一款是Gemini Robotics 2本身,也就是前面说的VLA模型。它负责把视觉和语言直接转化成动作指令,管的是“怎么做”。
第二款是Gemini Robotics ER 2.这是一个“具身推理模型”。它不直接控制电机,而是充当机器人的“高级大脑”——理解人类的指令、观察周围环境、规划需要多个步骤才能完成的长任务。如果执行过程中出了差错,它还能重新规划。打个比方,ER 2是“想怎么做”的指挥官,VLA模型是“具体怎么做”的执行者。
第三款是Gemini Robotics On-Device 2.这是一个轻量版模型,可以直接在机器人本体上本地运行,不需要时刻连着云端。它的厉害之处在于适配能力——只需要不到200个示例数据、花几个小时,就能让一套全新的机器人“学会”怎么动。这意味着不同厂家、不同形状的机器人,都可以快速装上这套“大脑”。

三、灵巧操作:拧灯泡、封袋口,考验的是“最后几厘米”
如果说全身控制解决的是“怎么走到位”的问题,那灵巧操作解决的就是“怎么干得细”的问题——这也是机器人行业公认最难啃的骨头。
Gemini Robotics 2在灵巧操作方面有不少亮眼表现。官方演示中,机器人可以拿起一个灯泡、稳稳地把它从灯座里旋出来,同时控制手指力度避免捏碎。它还能双手配合——一只手拿着簸箕、另一只手拿着刷子,把桌面上的垃圾扫进去。更复杂一点的,比如把葡萄装进密封袋、再把塑封条完整拉上,这套系统也能完成。在测试中,“拧下灯泡”这项任务的成功率达到了92%。
当然,谷歌也坦诚地指出,真正实现人类级别的灵巧操作还有很长的路要走。目前机器人的动作依然偏慢偏谨慎,因为在执行过程中它还需要“停下来想一想”——而人类做同样的动作几乎都是凭直觉完成的。官方测试数据也显示,Apollo从地面取物的成功率约为45.7%,从桌面取物为68.4%。方向是对的,只是动作还不够利索。
四、多机器人协同:让不同型号的机器人“组队干活”
单个机器人再能干,也有忙不过来的时候。Gemini Robotics 2这次还首次引入了多机器人协作能力。
不同类型的机器人可以通过共享的语义理解进行沟通、交接任务,完成单台设备难以独立完成的复杂工作流。谷歌展示了一个协作案例:Apollo 2人形机器人和Franka的双臂机器人在同一个车库里协同清理——一台负责识别和指挥,另一台负责具体执行。
这种能力的关键在于,Gemini Robotics ER 2作为“高级大脑”,可以同时调度多台机器人,让它们分工配合。一台机器人做不了的活,多台机器人组队就能搞定。这为未来工厂、仓库、医院等需要多工种配合的场景,打开了很多想象空间。

五、安全与开放:谷歌的“机器人操作系统”野心
谷歌还特别强调了安全性。Gemini Robotics ER 2被称作公司“迄今最安全的机器人模型”——它能更好地检测到附近有人类,一旦有人靠得太近,就会触发安全机制让机器人停下来。谷歌还推出了一套新的机器人安全评测基准,用于测试机器人能否识别不确定情况、拒绝执行存在安全风险的指令。
在开放策略上,Gemini Robotics ER 2已经通过Google AI Studio向开发者公开。VLA模型和On-Device模型则先向早期合作伙伴开放。谷歌正在与包括Apptronik、Agile Robots SE、Boston Dynamics在内的一系列机器人公司展开合作。谷歌的目标很明确——不卖机器人本体,而是打造一层能被所有机器人使用的智能系统。
谷歌推出 Gemini Robotics 2.兼顾灵巧操作与多机器人协同作业能力。Gemini Robotics 2带来的不是某款更聪明的机器人,而是一套能让各种机器人变得更聪明的“通用大脑”。从全身控制到灵巧操作,从单机作业到多机协同,谷歌正在把AI从虚拟世界的对话、写诗、画画,一步步推进到物理世界的行走、抓取、协作。虽然机器人的动作还不够快、成功率还有提升空间,但“从脚到指尖”的全身智能这道坎,已经被跨过去了。接下来要等的,就是这颗“大脑”装进更多机器人身体里,真正走进我们的生活。
相关阅读
- 产åæç« å®£ä¼ æç¥ä¹é°å°ä¼ åªï¼åªä½å®£ä¼ ã软æåå¸å©æ¨ç è¡åç¨¿æ¸ é
- 柬首相提名特朗普获诺贝尔和平奖 特朗普是否有资格获得诺贝尔和平奖
- T3出行全力推进反诈工作 以安全赋能智慧出行
- 清华大学乡村振兴南和教学站组织全区中小学师生收看学习讲座
- 零投入轻创业!加入微享集,看广告赚稳定收益(邀请码:700127H)
- 剑指“幽灵外卖”、虚假宣传等顽疾 两项新规守护“舌尖安全”
- 青海省人大常委会全票通过《青海省安全生产条例》
- 上海文化人才之家正式投用
- 两部门启动征集计量支撑产业新质生产力发展项目
- 爆零诞生!钰尚网络助你轻松发母婴软文!母婴产品软文代发