PhysEvo:冻结大模型下物理机器人自我进化,真实任务成功率84%

新论文提出 PhysEvo,在不更新模型权重的前提下,让一个任务 agent 与一个元 agent 通过轨迹诊断、工具修订和自我改进,把机器人操控成功率从直接调用 Astra 的 1.25% 提升到 55%,并在真实机器人上达到 84%。

一句话看懂:新论文提出 PhysEvo,在不更新模型权重的前提下,让一个任务 agent 与一个元 agent 通过轨迹诊断、工具修订和自我改进,把机器人操控成功率从直接调用 Astra 的 1.25% 提升到 55%,并在真实机器人上达到 84%。

事件核心:发生了什么

2026 年 10 月 6 日,Hugging Face Papers 收录了一篇关于机器人物理递归自我改进的论文。论文提出 PhysEvo 框架,围绕一个完全冻结的基础模型运行:任务 agent 负责执行机器人操作,元 agent 根据任务轨迹诊断失败原因、修改工具和技能,并测试修正效果。元 agent 还能改进自己的诊断工具,使保留的修订同时服务于后续动作和后续自我改进。整个过程不更新模型权重,也不单独训练动作策略。在 42 项 RoboDojo 任务上,保留的任务专用部署版本在留出布局评测中取得五维平均 68.14/100、成功率 62.00%,而对比中已发表的最强参考 RoboDawn 一次性 Astra agent 为 47.17%。在 8 项直接挑战 Astra 的操控任务上,PhysEvo 成功率 55.00%,直接 Astra 参考仅 1.25%。将仿真演化出的执行框架部署到 AgileX PiPER 后继续技能修订,在 5 项真实任务 25 次试验中取得平均 90.60/100、成功率 84.00%。需要说明,以上数据来自论文摘要,全文实验尚未核验,也不代表已上线产品。

为什么重要

这条技术路线把提升机器人能力的重心从“改模型权重”转向“改模型外部的工具、技能和诊断流程”。对于大模型在机器人场景的落地,这意味着即使基础模型保持冻结,也可以通过物理环境中的递归自我改进获得更强的操控能力。它对当前依赖大规模训练和真机数据采集的机器人 AI 路线构成一种互补思路:推理侧和系统侧的结构化演化可能比单纯堆算力更直接地解决长尾失败。同时,RoboDojo 与 AgileX PiPER 的跨仿真到真机结果,为通用机器人 agent 的可迁移性提供了可检验的参考。

对用户/开发者/创作者的影响

对机器人开发者和 AI 应用团队,PhysEvo 的思路提示可以优先构建可测试、可回滚的技能库与诊断工具,而不是等待基础模型更新。若后续开源或提供 API,围绕冻结大模型做 harness 层优化的工程价值会上升,尤其是在算力有限、真机数据稀缺的团队中。对企业采购方,真实任务高成功率如果可复现,会降低对特定闭源模型权重迭代的依赖,但采购前仍需确认任务分布、硬件配置和长期稳定性。对创作者和内容侧,该框架本身不直接涉及图像生成或文本创作,但“用行动结果反向改进系统”的范式可能被更多 agent 产品借鉴。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

目前公开信息显示,值得观察三点:一是 PhysEvo 是否开源代码或发布可复现的执行框架;二是仿真演化结果迁移到更多型号机械臂时,成功率是否仍能保持;三是 RoboDojo 等基准上的对比方法是否跟进,以及冻结模型方案与微调方案在真实部署中的成本与稳定性差异。

来源:Hugging Face Papers

celebrityanime
celebrityanime
文章: 28629

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注