GEN-1.5: 通用型AI通过一次演示让机器人学会新任务

机器人创业公司 Generalist AI 发布 GEN-1.5 模型,只需给机器人看一段 3-12 秒的演示视频,它就能直接执行对应任务,无需任何额外训练。这项进展把“上下文学习”从语言模型带进了物理机器人操作领域。

一句话看懂:机器人创业公司 Generalist AI 发布 GEN-1.5 模型,只需给机器人看一段 3-12 秒的演示视频,它就能直接执行对应任务,无需任何额外训练。这项进展把“上下文学习”从语言模型带进了物理机器人操作领域。

事件核心:发生了什么

8 月 20 日,机器人初创公司 Generalist AI 发布了通用型 AI 模型 GEN-1.5。该模型的核心能力是:将一段 3 到 12 秒的人类操作演示视频作为“物理提示”加载进模型的上下文窗口,相当于给机器人一段短期记忆,之后机器人便能直接复现该任务,全程不需要额外的训练或微调。在开罐子、从钱包取钱等十项测试中,公司报告的平均成功率为 59%。如果先用五分钟数据、十个训练步骤进行快速适配,成功率可以提升到 83%。此外,GEN-1.5 还能将两个提示串联成更长序列,支持使用仿真环境生成的演示,并能部分模仿人类手部动作。该公司称,这些能力是在超过八个月的大规模交互数据预训练中自发涌现的,并未显式编程或训练。

为什么重要

此前,类似“从单次演示中学习”的能力已在研究实验室中出现过,但大多局限在少数几类任务上。Generalist AI 声称自己是首个将这种上下文学习能力扩展到广泛任务范围的团队。相比传统机器人方案需要针对每个新任务重新采集数据、训练模型,GEN-1.5 把机器人训练的门槛大幅降低——用户不需要写代码或标注数据,只需拍一段演示视频即可。这意味着机器人软件从“专用模型”向“通用具身智能底座”迈出了一步,在行业叙事上直指 OpenAI 等大模型公司的技术路线:如果大语言模型靠“提示词”调用能力,那么机器人模型靠“物理提示”调动操作能力。不过需要特别注意的是,目前所有测试结果均来自公司自报,尚未经过第三方独立验证,公开演示的任务也较为简单且耗时较短。

对用户/开发者/创作者的影响

对普通用户或企业而言,GEN-1.5 的价值在于降低了机器人部署的试错成本:以往部署一个分拣或装配类机器人任务,往往需要数周的数据采集与模型训练,而这类“单次演示”能力可能将上线周期压缩到分钟级。对开发者来说,如果该模型后续开放 API 或本地部署接口,意味着机器人应用开发将从“训练范式”转向“提示范式”,开发者的核心工作从调模型权重变为录演示视频、设计示例流程。对具身智能领域的创业团队和研究者而言,这是一个值得跟踪的技术信号:如果 GEN-1.5 的可复现性和泛化能力经得起推敲,可能会迫使更多机器人厂商将“上下文学习”纳入产品规划。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,公司尚未披露 GEN-1.5 的商用时间表、API 开放计划或定价模式,也未见第三方独立复现的测试报告。建议关注以下三点:第一,Generalist AI 是否会公开更多跨场景、跨硬件平台的测试数据,以证明模型的泛化能力而非单一机械臂的拟合能力;第二,在复杂长程任务(如多步骤装配、动态环境适应)中,这种基于上下文窗口的方案能否突破目前“演示后立即执行”的上限;第三,包括 Google DeepMind、Physical Intelligence 在内的竞品是否会跟进同类“物理提示”路线,从而引发一轮机器人模型架构的集中迭代。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 19311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注