一句话看懂:一篇新论文提出 EmbodiedRSI,让机器人不重新训练基础模型,而是用“假设图+信息价值选实验”自动改写外层代码与技能,在 RoboCasa365 与 LIBERO-Pro 基准上跑出明显高于基线的成功率。
事件核心:发生了什么
alphaXiv 收录的论文摘要显示,作者在 2026 年 10 月提出 EmbodiedRSI,一个自演化的代理式 harness。机器人基础模型本身保持冻结,系统把每次物理交互转化为对代码和技能候选的更新。它用快慢双系统:快系统维护一个假设图,节点存放代码与技能假设,边表示修订关系,实验证据更新置信度;再通过“信息价值”给候选实验打分,即预期不确定性的下降除以时间、模拟器步数、GPU 和重置等加权成本。慢系统则构建分层记忆,并按对后续快系统改进的价值筛选记忆。
结果上,在 RoboCasa365 的 Composite-Unseen 套件中,EmbodiedRSI 报告成功率为 71.3%,对比最强基线 Harness VLA 的 40.1%;整体成功率 77.0%。在 LIBERO-Pro 上整体成功率为 86.8%。论文还称其零样本迁移到真实机器人,在多项挑战任务中整体成功率为 71.3%。
为什么重要
机器人基础模型擅长视觉运动控制,但物体位置或指令一变,性能就可能退化;重新采集遥操作数据做后训练成本很高。EmbodiedRSI 的思路是把“学习”放到模型外围的软件层,用物理实验区分竞争性假设,避免盲目试错。它同时测试代码和技能的联合更新,这比只改代码或只调技能更接近实际部署需求。对行业而言,这代表一条不靠堆机器人数据、而靠编排与记忆来提升泛化性的技术路线,与当前 VLA 模型、智能体框架的演进方向直接相关。
对用户/开发者/创作者的影响
目前公开信息显示,这仍是论文层面的方法,不是已上线产品。对开发者来说,值得留意的是“harness 层”的价值:如果基础模型继续趋向通用和闭源,外围的假设管理、实验选择和记忆机制可能成为差异化的工程环节。对做机器人应用或具身智能内容的创作者,可以关注两个变量:一是该方法对真实机器人任务的零样本迁移是否可复现;二是它依赖模拟器步骤和 GPU 成本,实际部署时的算力开销可能决定其可用性。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
第一,论文是否公开代码与完整实验细节,尤其是真实机器人任务的具体设置。第二,VOI 实验选择在真实硬件上是否仍比随机或启发式策略更省试错成本。第三,RoboCasa365 与 LIBERO-Pro 的对比结果在不同随机种子和任务分布下能否稳定,以及是否有团队跟进类似的“代码-技能共演化” harness。
来源:alphaXiv


