一句话看懂:Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics 2 系列,包含三个新模型,将视觉‑语言‑动作能力融合进人形机器人,实现全身控制和精细操作,并支持多机器人协作。这意味着物理 AI 从桌面任务走向真实场景,机器人“通用大脑”雏形初现。
事件核心:发生了什么
Google DeepMind 在 X 上正式推出 Gemini Robotics 2,这是一套面向物理世界的 AI 模型家族,包含三个核心模型:Gemini Robotics 2(视觉‑语言‑动作模型,可直接控制人形机器人从脚趾到指尖的全身动作);Gemini Robotics ER 2(具备现实世界视频理解和复杂多步规划能力);On‑Device 2(可在本地设备上运行并实时自适应)。
展示中,搭载该模型的 Apptronik 公司 Apollo 2 人形机器人能根据单条指令“走过去、弯腰、拾起浇水壶”。同时,模型也能驱动五指机械手完成打结、拧灯泡等高灵巧任务,并兼容不同厂商的硬件平台(包括平行夹爪)。官方强调,这是首次将全身智能(full body intelligence)赋予人形机器人,突破此前仅限桌面操作的局限。
为什么重要
Gemini Robotics 2 的意义在于它把大型语言模型的多模态推理能力直接映射到物理动作上,形成闭环控制。与以往依赖预编程或强化学习的机器人方案不同,这套模型能理解自然语言指令并结合实时视觉信息,做出全身协调的动作规划——这是人形机器人商用化的关键瓶颈(平衡、避障、灵巧抓取等)。对行业而言,Google DeepMind 的入场会加速硬件厂商(如 Apptronik、波士顿动力)的软件栈迭代,同时挑战特斯拉 Optimus、Figure 等竞争对手在“具身智能”上的技术路线。
此外,“On‑Device 2”模型本地运行的特性意味着机器人不必依赖云端低延迟网络,更符合工业和服务场景的实时性要求,也为后续低成本部署提供可能。
对用户/开发者/创作者的影响
- 开发者:可基于 Gemini Robotics 2 的视觉‑语言‑动作接口,用自然语言直接编写机器人行为逻辑,无需编写底层运动控制代码。ER 2 模型的多步规划能力适合复杂任务拆解(如仓库拣选、家庭清洁)。
- 硬件厂商:可将其视为“即插即用”的通用大脑,降低研发专用控制算法的成本,加速产品落地。
- 普通用户:未来家用人形机器人可能通过简单语音指令完成取物、整理等任务,但目前公开信息未提及消费级产品时间表。
值得关注的后续
1. 开放与商业化路径:目前 Google DeepMind 未明确是否提供 API 或开源模型。若开放,将极大加速机器人开发社区创新;若仅限合作伙伴使用,则可能形成生态壁垒。
2. 硬件适配范围:演示仅涉及 Apptronik Apollo 2 及部分灵巧手平台,能否高效迁移至不同构型(如四足、轮式)尚未公布。
3. 竞品反应:特斯拉、Figure 等公司可能加速发布类似 VLA 方案,行业或将进入“模型能力竞赛”,而非过去单纯的硬件指标比拼。



