一句话看懂:Figure 发布人形机器人神经网络 Helix2.5,靠 Index 人类行为数据集预训练,在 30 户从未采集过的旧金山湾区家庭里把零样本任务成功率从 9% 提到 56%。这说明人形机器人的泛化能力,可能正从“逐户调参”转向“预训练底座 + 少量适配”。
事件核心:发生了什么
2026 年 9 月 17 日,Figure 发布 Helix2.5。它基于一个 Index 预训练底座模型,支持整理客厅、叠毛巾、铺床三类全身动作。测试选在旧金山湾区 30 户此前未采集数据的陌生家庭,任务中的玩具、毛巾、床品均不在任务规格数据内,且必须完整完成才算成功。结果是零样本成功率 56%,而同样条件下从零训练的策略只有 9%。Figure 还称,Helix2.5 只用上一代 Helix02 一半的适配数据就达到了相近成功率,并出现后退调位、换站姿、床上移动等全身自我纠错行为。
为什么重要
为了隔离预训练的贡献,Figure 固定了模型架构、优化方法、超参数、下游数据和评测条件,只改初始化方式,并声称 Index 数据集中没有任何单一评测任务占比超过 1.90%。这类控制变量在机器人领域并不多见,它把“预训练能否带来泛化”变成了可量化的结论。更现实的意义在于成本:如果底座模型足够强,未来部署人形机器人可能不再需要为每个家庭重新采数据、重新训练,而是调用统一模型加少量适配。Index 本身 8 月 25 日上线,目前下载 26.4 万次、周活超 4.4 万,已收集超 1600 万条视频,向数据贡献者支付 1500 万美元;Figure 称已投入 35 亿美元算力训练 Helix 系列。数据飞轮和算力投入,正在成为人形机器人的新竞争壁垒。
对用户/开发者/创作者的影响
对开发者而言,这条路线释放的信号是:具身智能的入口可能不是自研全套模型,而是围绕一个预训练底座做垂直任务适配和评测。对关注数据的人,Index 的付费采集模式提供了一种可参考的变现路径。对企业采购方,目前公开信息显示 Helix2.5 仍处于家庭场景评测阶段,尚未公布价格、API 或商用时间表,短期不宜按成熟产品做预算。对内容创作者,这类演示视频的传播价值高,但要注意区分“零样本成功率”和“真实家庭长期可用性”。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Figure 是否公开 Helix2.5 的失败案例分布,56% 背后哪些任务最容易掉链子。二是 Index 数据翻倍后动作预测损失下降的趋势,能否被第三方复现,从而验证人形机器人的数据缩放律。三是竞品是否跟进“统一预训练底座 + 少量适配”的路线,以及 Index 这类数据平台会不会形成新的生态入口。
来源:AIbase


