2026 年 7 月 30 日,Google DeepMind 发布了 Gemini Robotics 2,将机器人 AI 的控制范围从上半身桌面操作扩展到了从脚到指尖的全身协调。这是自 2025 年 3 月初代 Gemini Robotics 以来最大幅度的一次架构升级,新增了三个核心能力:全身人形机器人控制、跨本体快速适配(few hours of data),以及多机器人协作。

三个模型,各司其职
Gemini Robotics 2 由三个高度协同的模型组成:
| 模型 | 类型 | 定位 |
|---|---|---|
| Gemini Robotics 2 | VLA(Vision-Language-Action) | 核心运动控制,将视觉和语言指令转化为电机控制 |
| Gemini Robotics ER 2 | VLM(Vision-Language Model) | 高层推理大脑,负责任务理解、规划和多步协调 |
| Gemini Robotics On-Device 2 | VLA(本地优化版) | 边缘部署,无需网络即可运行 |
三者之间的分工逻辑清晰:ER 2 是"大脑",接收用户的自然语言指令后观察环境、推理任务步骤、与 VLA 模型协调执行动作,并持续追踪进度直到任务完成。Gemini Robotics 2(VLA)是"小脑+肌肉",把高层指令翻译成精确的关节运动。On-Device 2 则是这套系统的离线版本,针对本地推理做了效率优化。
从上半身到全身:人形机器人的"第一步"
初代 Gemini Robotics 在人形机器人上只能控制上半身,执行桌面级别的操作任务。Gemini Robotics 2 首次实现了对整个人形机器人的端到端控制——从行走、蹲下、伸展到精细物体操作,全部由同一个模型驱动。
DeepMind 给出的演示场景:当向 Apptronik Apollo 2 人形机器人发出指令"把浇水壶放进底层架子的绿色箱子里"时,机器人会自主走向桌子、拾起水壶、走到架子前、弯腰将水壶精准放入指定位置。整个流程涉及移动导航、全身平衡、精细抓取和物体放置,全部由 Gemini Robotics 2 统一控制,无需人工编写中间步骤脚本。
这意味着同一个模型 checkpoint 可以直接部署到形态完全不同的机器人平台上:Apptronik Apollo 2 搭配 SharpaWave 五指灵巧手、Apollo 2 搭配 Inspire 手、以及 Franka Duo 搭配 Robotiq 夹爪。博客配图中的六格对比展示了一组不同硬件平台在家庭、办公和厨房环境中执行自主操作的画面。

灵巧操作的边界:22 自由度五指手
Gemini Robotics 2 在灵巧操作方面有了质的提升。以 Apptronik Apollo 2 上的 SharpaWave 五指手为例,该手具备 22 个自由度(degree of freedom),Gemini Robotics 2 能够控制它完成打结、封 ziplock 袋等需要精细指尖协调的动作。同时也能操控标准两指平行夹爪在 Franka Duo 平台上执行紧凑包装等工业任务。
DeepMind 在博客中坦诚承认了当前的局限:全身运动和夹爪操作的成活率达到中高水平,但多指灵巧操作仍然是主要挑战。模型在"粗大运动"层面已经接近实用化,"精细运动"层面仍需要持续迭代。
On-Device 2:200 个样本适配新机器人
On-Device 2 最值得关注的技术突破是快速跨本体适配。继承自 Gemini Robotics 1.5 的 motion transfer 技术,现在只需要不到 200 个示例数据,就能在几小时内适配一个全新的双臂机器人本体。
这个数字的意义需要放在机器人学习的背景下理解:传统的模仿学习方法通常需要数千次人类演示才能学会一个新任务,而且换一个机器人平台几乎要从头训练。On-Device 2 的"few-shot adaptation"即使在传感器配置和自由度数量完全不同的平台上也能工作——DeepMind 展示了 Dexmate、SO101 和 Trossen 三个形态差异巨大的平台各自执行任务的效果。
ER 2 与多机器人协作
Gemini Robotics ER 2 新增了两个关键能力:
长时间任务管理:之前的版本难以维持超过几十秒的多步任务。ER 2 现在能够理解任务的开始和结束状态,精准定位关键事件发生的时间点,支持持续数分钟、涉及数百次决策的任务序列。如果中间某一步失败,模型能够自我修正并继续执行。
多机器人协作:不同类型的机器人之间可以通信并分工合作,解决单个机器人无法独立完成的复杂工作流。DeepMind 展示了多个机器人协同清理房间的场景——不同的机器人各司其职,配合完成一个人形机器人单独做起来很慢的任务。
在部署方面,Gemini Robotics ER 2 已在 Google AI Studio 和 Gemini Enterprise Agent Platform(私有预览)上线,VLA 和 On-Device 模型则面向早期合作伙伴开放。
ASIMOV-Agentic:安全不只是约束
随着机器人获得更强的物理能力,安全框架也需要相应升级。Gemini Robotics 2 引入了 ASIMOV-Agentic,一个新的 agentic 安全编排基准,专门测量以下能力:
- ER 代理拒绝 VLA 模型发出的不安全工具调用(类比 AI Agent 拒绝执行危险操作的机制)
- 预测任务是否可行,在不确定时主动请求人类介入
- 检测人类靠近时触发安全工具调用,让机器人安全停止
ASIMOV-Agentic 的思路把安全问题从"禁止做什么"升级到了"在什么条件下可以做什么"——更接近真实工业场景中的人机协作安全标准(如 ISO 10218)。DeepMind 同步发布了 Gemini Robotics 2 Safety Technical Report 做详细说明。
合作伙伴与生态
Gemini Robotics 2 的硬件合作伙伴涵盖三条路线:
- Apptronik:Apollo 2 人形机器人作为主要测试平台,2026 年 6 月与 DeepMind 共同开设了 90,000 平方英尺的 "Robot Park" 训练设施
- Boston Dynamics:2026 年 1 月 CES 上宣布合作,计划在电动版 Atlas 上部署 Gemini Robotics 模型,并计划在现代汽车工厂测试
- Agile Robots:2026 年 3 月宣布战略合作,聚焦工业环境中的 AI 机器人部署
从 VLA 到全身智能:技术路线回顾
Gemini Robotics 系列的技术核心是 Vision-Language-Action(VLA)架构。传统机器人控制通常需要为每个任务单独编写运动规划代码或训练专门的策略网络。VLA 模型把视觉感知、语言理解和运动控制统一到了一个端到端的神经网络中——模型"看到"什么、"理解"了什么指令,就直接输出关节控制信号。
2025 年 3 月发布的初代 Gemini Robotics 证明了 VLA 架构的可行性:在综合泛化基准测试上相比其他 VLA 模型成绩翻倍,学会了叠衣服、包装午餐盒、折纸等高难度任务。但初代模型局限于桌面场景的上半身操作。
Gemini Robotics 2 把这套架构推向了更复杂的全身控制场景。真正的突破点在于:一个统一的基础模型可以泛化到完全不同的机器人形态和任务空间——这是通向通用机器人智能的关键一步。
DeepMind 在博客最后将 Gemini Robotics 2 定位为"解决物理世界 AGI 道路上的重要里程碑"。无论这个定位是否准确,VLA 模型从实验室演示到跨平台部署的速度正在加快。