谷歌DeepMind近日宣布推出新一代机器人基础模型系列——Gemini Robotics 2,标志着人形机器人控制技术迈入全新阶段。与前代仅能操控上半身完成桌面任务不同,此次升级的视觉-语言-动作(VLA)模型首次实现了对完整人形机器人的全身控制,覆盖从双腿到手指的全自由度,并支持在多种硬件平台上共享同一模型权重,为机器人跨平台协作提供了技术基础。
传统机器人开发长期面临两大核心挑战:一是控制系统的碎片化,例如波士顿动力的Atlas等机型依赖独立控制器分别管理行走、平衡等能力,而Figure、特斯拉等厂商虽采用学习策略,但仍将行走控制与操作策略分离,导致真实环境中“边走边做”的协调性不足;二是硬件适配的封闭性,多数策略需针对特定机型训练,更换传感器或执行器后需重新采集数据,限制了通用模型的规模化应用。Gemini Robotics 2的推出旨在破解这些难题,其模型家族包含三个关键组件:主力VLA模型、具身推理模型ER 2和端侧模型On-Device 2。
主力VLA模型作为核心控制单元,可直接将摄像头画面与自然语言指令转化为电机控制信号,实现端到端的全身动作输出。在演示中,同一模型检查点成功驱动了三种不同配置的机器人:Apptronik的Apollo 2搭配两种机械手,以及双臂平台Franka Duo搭配夹爪。具身推理模型ER 2则扮演“高层规划者”角色,通过分析连续视频流将复杂任务拆解为子步骤,并实时监控执行进度,在失败时触发重试或求助人类。其与VLA模型通过双向流式接口通信,可提前推理下一步动作,避免传统“停一步、想一步”的延迟。端侧模型On-Device 2专为无网络或低延迟场景设计,可直接部署于机器人本地芯片,继承自前代的运动迁移技术使其能在200个演示样本内快速适配新硬件,显著降低部署成本。
在功能验证中,Apollo 2机器人展示了从接收指令到完成“将浇水壶放入货架绿色箱子”的全流程自主操作,涵盖行走、抓取、放置等动作。然而,技术团队坦言当前模型仍存在局限:桌面物品拿取成功率为68.4%,地面拿取降至45.7%,移动速度也明显慢于人类。面对不同手部形态时,模型表现差异显著——两指夹爪在通用抓放任务中成功率达74.2%,而五指机械手SharpaWave在拧灯泡、垃圾袋打结等精细操作中成功率不足40%,暴露出多指灵巧控制的薄弱环节。
协作能力是此次升级的另一亮点。ER 2模型支持异构机器人通过共享语义理解分配子任务,无需预设通信协议即可实现分工。例如,轮式机器人可负责室内平地移动,人形机器人处理复杂地形,二者通过ER 2协调完成单机无法胜任的任务流。为保障安全,DeepMind同步推出ASIMOV-Agentic基准,通过拒绝不安全指令、预测任务可行性及主动请求人类介入等功能,构建具身场景下的安全编排体系。ER 2的空间推理能力亦获增强,可基于连续视频流检测液体洒出等中间事件,并扩展至数字显示屏、液体温度计等10类仪表的读数识别。
横向对比行业竞品,Gemini Robotics 2的差异化优势在于硬件适配的开放性。Figure公司此前发布的Helix 02虽在长时序全身控制完整度上更胜一筹,但其架构仅适配自家机器人,而Gemini系列可驱动第三方平台。Physical Intelligence的π0.7模型主打技能重组解决新任务,但尚未展示下肢与操作的联合控制能力。目前,ER 2已通过Google AI Studio开放使用,VLA主力模型与On-Device 2则面向Apptronik、Franka等早期合作伙伴部署,标志着通用机器人智能层从实验室走向产业应用的关键一步。










