Google DeepMind 新 AI 模型可操控机器人全身

Google DeepMind 发布 Gemini Robotics 2,新模型能控制人形机器人的全身运动(从脚趾到手指),并支持更精细的五指操作和多机器人协作。这是向通用型家用或工业机器人迈出的实际一步,但运动速度仍需提升。

一句话看懂:Google DeepMind 发布 Gemini Robotics 2,新模型能控制人形机器人的全身运动(从脚趾到手指),并支持更精细的五指操作和多机器人协作。这是向通用型家用或工业机器人迈出的实际一步,但运动速度仍需提升。

事件核心:发生了什么

7 月 30 日,Google DeepMind 宣布推出 Gemini Robotics 2(简称 GR-2),这是其机器人 AI 模型的最新版本。此前版本仅能控制人形机器人的上半身,GR-2 则支持“全身运动”——机器人可以行走、下蹲、弯腰、伸展,并操作物体。演示视频中,Apptronik 的 Apollo 2 机器人能够俯身捡起水壶、从货架上找到并取下特定物品。

同时上线的还有 Gemini Robotics ER 2(具身推理模型),它升级了视觉-语言能力,能更准确地理解任务起始与结束,并在长时间任务中保持连贯性。ER 2 还支持异构机器人协作,例如 Apollo 2 指挥另一台双臂机器人整理工具。

灵巧性方面,GR-2 可控制更复杂的五指机械手,完成密封塑料袋、系垃圾袋、拧灯泡等精细操作。此外,Gemini Robotics On-Device Model 也得到改进,现在无需联网即可在机器人本体上运行,并更快适配不同外形(不同形状、传感器、自由度)的机器人。

为什么重要

这是机器人控制从“上半身固定工位”走向“全场景灵活操作”的关键技术里程碑。以往人形机器人要么只能做桌面级的抓取,要么全身运动反应迟缓。GR-2 首次将全身协调与精细操作整合到大模型框架中,使得机器人有可能胜任家政、仓储、制造业中的复杂任务。

从竞争格局看,谷歌 DeepMind 选择走大模型+通用的路线,与特斯拉 Optimus、Figure、1X 等硬件厂商形成差异化——它不直接造机器人,而是提供可适配多种机体的“大脑”。如果这套模型能够通过 Gemini Robotics ER 2 的安全调用和人体接近检测机制保障现场安全,将大幅降低人形机器人落地的风险门槛。

值得注意的保留意见:Google DeepMind 自己承认“机器人在运动速度方面还有很大提升空间”。目前演示中的动作仍然偏慢,距离真正替代人类劳动者的效率还有距离。

对用户/开发者/创作者的影响

机器人硬件厂商:像 Apptronik 这样的合作伙伴可以直接将 GR-2 集成到自己的机器人中,省去从头训练全身运动模型的高昂成本。对于中腰部的机器人创业公司而言,这意味着可以更专注于机械结构和应用场景,而非底层控制算法。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

AI 开发者与研究者:Gemini Robotics On-Device Model 支持本地运行且无需联网,降低了机器人部署的算力门槛。同时,ER 2 的长时间任务理解能力使得开发者可以设计更复杂的多步指令工作流。

企业与终端用户:如果未来商用化,仓库、工厂可能最先受益——机器人能完成弯腰取货、拧螺丝、封箱等全身动作。家庭场景(整理房间、清理桌面)则仍需观望,因为速度和安全冗余尚未完全达标。

值得关注的后续

  1. 运动速度的迭代:Google DeepMind 已明确速度是短板,后续更新能否将操作频率提升到接近人类水平,将是判断模型实用性的关键指标。
  2. 适配范围与开放策略:目前只展示了在 Apptronik 上的案例,是否会开放给更多机器人平台?模型是否开源或提供 API?这直接影响市场竞争格局。
  3. 安全与监管落地:ER 2 号称“最安全的机器人模型”,但真实场景中的误判风险仍需验证。如果进入规模化部署,各国对协同作业的安全认证将是一道现实门槛。

来源:The Verge

celebrityanime
celebrityanime
文章: 16096

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注