一句话看懂:机器人初创公司 Generalist AI 展示了仅凭一段短视频就能现场学会新任务的机器人,其泛化能力和临场应变表现接近人类幼儿的物理直觉,预示着具身智能从“单一任务训练”走向“通用物理模型”的可能性。
事件核心:发生了什么
上周,Wired 记者参观了位于美国马萨诸塞州剑桥市的机器人初创公司 Generalist AI 办公室,亲眼目睹了机器人手臂在未经特定任务训练的情况下,仅通过观看一段简短教学视频,现场学会叠杯子、积木入碗、用簸箕清扫积木等操作。最令人惊讶的案例中,当刷子被移除,机器人竟主动改用簸箕边缘将积木拨入碗中;而在完成“拉开拉链取出钞票”的任务时,机器人在首次抓取失败后,主动切换机械爪左右手以改变攻击角度,在场工程师表示“它以前从未这样做过”。
据公司介绍,其机器人完成示范任务的平均成功率目前约为 59%,距离理想的 99% 以上仍有较大差距。公司联合创始人兼 CEO Pete Florence 将这一能力类比为 GPT-3 时代的“零样本提示”:模型即拿即用,无需微调即可尝试新任务。目前公开信息显示,该公司由曾任职于 Google DeepMind 和 Boston Dynamics 的 Pete Florence、Andrew Barry 和 Andy Zeng 三人联合创立,模型完全自研,未依赖开源语言模型。
为什么重要
传统机器人学习依赖数千个标注样例,且一旦环境光照或物体位置改变,模型表现便急剧下降。Generalist AI 的路线则强调通过大规模“物理交互数据”训练通用机器人模型,而非绑定特定硬件。斯坦福大学机器人专家 Karen Liu 评价称,该公司的数据策略“没有把物理交互数据与某一种特定机器人强绑定”,其初步成果表明这一押注方向可能成立。Georgia Tech 机器人学者 Danfei Xu 则认为,Generalist 在追求通用机器人模型的公司中将数据规模与执行质量推向了极端,目前“最接近可部署状态”。
与多数同行不同,Generalist 并未借助现成的大语言模型作为“大脑”,而是从零构建模型,专门学习物体之间的物理规律。这种“幼儿式”的以物理直觉为核心的学习方式,如果持续取得突破,可能改变机器人在非结构化环境(家庭、仓库、医疗)中的落地节奏,让机器人从“按程序执行”进化为“看一遍就会”。
对用户/开发者/创作者的影响
对开发者而言,如果这类通用物理模型成熟,机器人应用开发将不再需要为每个动作采集数万条轨迹数据,工作重心可能从数据标注转向“提示设计”——即如何用教学视频或演示更有效地教会机器人新技能。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对企业和采购方,尤其是物流、制造、餐饮服务等行业,这意味未来机器人的部署成本可能显著下降:机器换新任务不再需要重新训练数月,只需提供一段演示视频即可切换工作内容,且能在环境变动(如工具被拿走)时自主寻找替代方案,可靠性依然有待提升,但趋势值得跟踪。
对普通用户而言,现阶段影响主要体现在概念理解上:AI 的能力边界正从“数字世界的内容生成”扩展到“物理世界的操作理解”,日常家务、搬运、护理等场景的自动化想象空间被打开,但距离真正稳定进入家庭还有明显差距。
值得关注的后续
1. 成功率提升路径:目前 59% 的平均成功率距离商业可用(99% 以上)还有明显差距,未来半年是否能在更多任务上将成功率提升至 80% 以上,是判断技术路线是否成立的关键指标。
2. 数据成本与商业模式:该公司已向墨西哥等地分发数百套带摄像头的特制机械爪手套用于采集数据,这种“人肉遥操作+大规模数据”模式能否持续支撑模型迭代,以及后续是否开放 API 或授权模型给第三方硬件厂商,值得关注。
3. 行业竞争与生态分化:Google DeepMind、波士顿动力及多家初创公司均在追逐通用机器人模型,Generalist 能否凭借自研 + 大规模物理数据策略在融资、人才和早期客户争夺中保持优势,也是观察行业格局的窗口。
来源:Wired AI


