Gemini Robotics ER 2:用视频理解、任务编排与多机器人协作赋能机器人

Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics ER 2 模型,这是一个用于机器人的“高级大脑”,具备实时视频理解、多步骤任务编排和多机器人协作能力,现已通过 Gemini API 和 Google AI Studio 向开发者开放。

一句话看懂:Google DeepMind 于 2026 年 7 月 30 日发布 Gemini Robotics ER 2 模型,这是一个用于机器人的“高级大脑”,具备实时视频理解、多步骤任务编排和多机器人协作能力,现已通过 Gemini API 和 Google AI Studio 向开发者开放。

事件核心:发生了什么

Google DeepMind 正式推出 Gemini Robotics ER 2(Embodied Reasoning 2),替代此前的 ER 1.6。与常见的端到端视觉-语言-动作模型不同,ER 2 定位为“高级大脑”,它负责推理、规划和协调,而将具体的电机执行交给低层 VLA 模型或导航 API。该模型能够通过连续视频流实时追踪机器人自身进度,在任务出错时自动纠正,并判断何时切换步骤。它原生集成了 Gemini Live API,利用双向流式端点实现低延迟的连续推理,避免了传统的“停顿-思考”模式。此外,ER 2 首次支持多机器人在同一空间内协同工作,完成单个机器人无法独立完成的复杂任务。DeepMind 还公布了与波士顿动力 Spot 机器人的集成演示:用户通过自然语言指令,就能让 Spot 完成取物等动作。

为什么重要

机器人行业长期面临“规划-执行脱节”的难题:高层任务规划速度慢、无法实时适应环境变化,导致机器人频繁中断或出错。Gemini Robotics ER 2 将大语言模型的通用推理能力与低延迟流式交互结合,实现了“边做边想”——机器人可以在执行动作的同时规划下一步,并在视频反馈中自我校正。这大大提升了机器人在非结构化环境中的实用性。更重要的是,多机器人协作能力让一个高级大脑可以调度多个异构机器人(如机械臂、轮式平台)完成递进式工作流,例如仓库分拣、家庭清洁等。相比 ER 1.6,ER 2 在三种控制模式(真实 VLA、模拟 VLA、远程操控)下的工具编排性能均显著提升,表明大模型从“对话助手”向“物理世界代理”的进化迈出了一大步。

对用户/开发者/创作者的影响

对开发者而言,ER 2 可以通过 Gemini API、Google AI Studio 直接调用,并且支持在 Gemini Enterprise Agent Platform 上构建私有物理 AI 代理。开发者只需声明底层控制接口(如 VLA 模型或导航 API)作为工具,再将视频、音频或文本流输入模型,即可快速搭建具备自主决策能力的机器人应用。Google 已提供 GitHub 示例代码和提示词配置指南,大幅降低了机器人编程的入门门槛。对于企业用户,这意味着可以更灵活地集成现有机器人硬件,无需从头训练专用模型。对于普通消费者,虽然短期内不会直接接触模型,但搭载 ER 2 的机器人将具备更自然的交互和更强的故障恢复能力,例如家庭服务机器人拧灯泡失败后可自动重试,而非卡死报错。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

第一,ER 2 的实际部署效果仍需观察:目前公开信息显示其真实性评估主要基于模拟环境和远程操控演示,在真实工厂或家庭中的延迟、稳定性和成本能否满足商业需求尚未明确。第二,多机器人协作是否兼容不同厂商的硬件生态——DeepMind 展示了与波士顿动力的合作,但未来若支持更多机器人品牌(如 Agility Robotics、宇树科技),将决定其生态扩张速度。第三,定价与调用限制是关键:ER 2 通过 Gemini API 提供,Google 是否会像对待图像生成模型那样分级收费、是否有免费额度,将直接影响中小开发者的采用意愿。第四,安全性与对齐:大模型作为机器人“大脑”一旦误判,物理后果比对话系统严重得多,DeepMind 是否发布安全约束工具或评估基准值得追踪。

来源:Google DeepMind

celebrityanime
celebrityanime
文章: 16057

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注