Google DeepMind 发布三款实体AI模型,用于全身控制、灵巧操作和多机器人协作

Google DeepMind 推出了三款基于 Gemini 2.0 的实体 AI 模型,分别专注全身协调控制、高精度灵巧操作和多机器人协同作业。这是视觉-语言-动作(VLA)模型从“会看会说”到“动手做事”的一次系统性升级。

一句话看懂:Google DeepMind 推出了三款基于 Gemini 2.0 的实体 AI 模型,分别专注全身协调控制、高精度灵巧操作和多机器人协同作业。这是视觉-语言-动作(VLA)模型从“会看会说”到“动手做事”的一次系统性升级。

事件核心:发生了什么

根据 MarkTechPost Research 发布的信息,Google DeepMind 在 2026 年 7 月 30 日正式发布 Gemini Robotics 2 系列模型。这并非单一产品,而是一个模型矩阵:

第一,全身控制模型,能够协调机械臂与移动底盘,使机器人在执行任务时同步保持平衡与姿态调整;

第二,灵巧操作模型,强化了手指级的精细动作,可完成抓取脆弱物体、穿线等此前难以在物理环境中稳定复现的任务;

第三,多机器人协作模型,支持两个及以上机器人通过通信共享视觉-语言指令,实现分工作业。

这套模型均基于 Gemini 2.0 多模态大模型架构,将视觉理解、语言推理与物理动作指令在训练阶段深度融合,不再依赖外部规划器或人为编写的动作脚本。

为什么重要

当前主流具身智能方案倾向于将感知、规划、控制拆分为独立模块,虽然有灵活性,但端到端延迟高、调试成本大。Gemini Robotics 2 的发布表明,Google DeepMind 试图用单个大模型统一处理“看见-理解-行动”全链条。这一技术路线一旦跑通,可以大幅度降低机器人开发中对底层运动控制工程师的依赖。

从行业竞争角度看,这给其他 VLA 模型厂商——如 Physical Intelligence 的 π0、Figure AI 的 01 系统——施加了压力。Google DeepMind 拥有 Gemini 大模型的原生多模态能力与 Google 云计算资源,在数据生成和仿真训练上的规模化优势明显。

对用户/开发者/创作者的影响

对开发者而言,目前公开信息显示,Gemini Robotics 2 提供了针对机器人任务的微调工具和仿真环境接口,开发者可以在降低硬件成本的前提下预先验证动作策略。不过,模型是闭源的,实际调用可能需要通过 Google Cloud 的定制化 API,这意味着企业端用户将面临使用成本与数据隐私的权衡。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对行业用户,尤其是在物流分拣、精密装配、实验室自动化等场景的企业,这套模型有望缩短从示教编程到自主操作的距离。多机器人协作模型对产线柔性与快速换线有直接价值。

对政策制定者与安全研究者,模型越强,对物理世界安全的考验越大。Google DeepMind 并未公布完整的安全限制与纠错机制,这需要后续观察。

值得关注的后续

第一,何时开放商用 API。目前材料未给出明确的定价方案和可用地区,这是开发者决定是否跟进的关键变量。

第二,是否会在仿真平台上大规模开放评测数据集。如果 Google 发布公开的基准测试(例如与 Robosuite、Maniskill 等对标),将直接推动学界和竞争公司加速迭代。

第三,多机器人模型的实际延迟与稳定性。高频通信与实时推理依然是物理机器人落地的核心瓶颈,Google DeepMind 能否在低成本硬件上跑出可部署的性能,将决定产品是实验室演示还是真正商用。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 16086

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注