Generalist AI 发布 GEN-1.5:能从 3–12 秒演示中学习新任务的机器人基础模型

机器人基础模型公司 Generalist AI 发布 GEN-1.5,机器人只需看一段 3 到 12 秒的演示视频,就能学会执行一项新任务,无需重新训练模型。

一句话看懂:机器人基础模型公司 Generalist AI 发布 GEN-1.5,机器人只需看一段 3 到 12 秒的演示视频,就能学会执行一项新任务,无需重新训练模型。

事件核心:发生了什么

Generalist AI 于近期发布了其新一代机器人基础模型 GEN-1.5。根据公开信息,该模型的核心能力在于“少样本学习”:机器人不再需要针对每个新动作进行大量的数据采集和微调,只需观察一段 3 至 12 秒的人类操作演示,即可理解任务目标并自主执行。这一特性针对的是机器人行业中长期存在的“长尾任务”难题——即场景中大量出现但频率低、难以预编程的操作。GEN-1.5 的具体参数量、训练数据规模以及是否开放 API 或提供本地部署方案,目前公开信息尚未披露。

为什么重要

GEN-1.5 的发布踩中了具身智能赛道的核心痛点:数据效率。当前多数机器人操作模型依赖大规模遥操作数据或强化学习,成本高且泛化能力弱。如果 GEN-1.5 的演示学习能力真实可靠,它将把机器人的任务扩展成本从“数周的数据采集与训练”压缩到“几分钟的视频录制”,这直接动摇了现有机器人模型“一任务一训练”的商业模式根基。从竞争格局看,此举将对标谷歌 RT-2、Physical Intelligence 的 π0 等主流方案,将行业竞争焦点从“模型参数规模”拉回“交互学习效率”。同时,这也为机器人模型从实验室走向工厂、仓储、家庭等非结构化场景提供了更现实的技术路径。

对用户/开发者/创作者的影响

对机器人开发者:GEN-1.5 意味着未来的部署逻辑可能改变。开发者不再需要为每一个工位定制训练集,只需录制一段标准操作视频即可完成新技能导入,这将显著降低集成商的项目交付周期和人力成本。对制造业与仓储企业:产线换型或新增工序的自动化改造门槛降低,小批量、多品种的生产场景更有可能引入机器人方案。对 AI 应用层创作者:该模型展示了基础模型“通用性”在物理世界中的延伸——类似大语言模型的提示词工程,未来机器人任务描述或许会演变为“视频提示”。不过,目前尚不清楚 GEN-1.5 是否对第三方开放测试接口,实际落地效果仍需看到独立的第三方复现报告。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是验证真实性能:目前官方信息有限,需关注是否有第三方实验室或在真实客户场景中复现“单段视频学会任务”的效果,特别是对精细操作(如插线、装配)的鲁棒性。二是商业化路径:关注 GEN-1.5 是作为云端 API 提供,还是与特定硬件厂商绑定,其定价策略将直接影响中小集成商的采用意愿。三是竞品反应:谷歌、Physical Intelligence 以及国内具身智能团队是否会跟进推出类似“视频演示学习”功能,如果跟进,行业标准可能在 2026 年底前快速收敛。

来源:MarkTechPost Research

celebrityanime
celebrityanime
文章: 20035

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注