一句话看懂:alphaXiv 上的一篇论文提出 Code-Only-as-Policy(COAP),尝试把机器人决策完全写成代码,用显式状态替代 VLM/VLA 推理;在 RoboDojo 的 42 个双臂任务上,测试时不调用任何模型,报告成功率 70.24%。
事件核心:发生了什么
2026 年 10 月 8 日,alphaXiv 发布了一篇题为《Embodied Turing Machines: Stateful Code for Robot Recursive Self-Improvement》的论文摘要。作者提出把机器人所处环境看作一台“具身图灵机”:机器人状态和环境状态是纸带,策略是规则,如果状态能被准确表示,决策就可以完全由代码完成。
基于这一设想,论文给出 COAP 方法:代码从摄像头图像和本体感知中测量并追踪机器人、环境和任务状态,所有决策都从这些状态出发。同一套代码跨多个 episode 复用,不同任务共享同一个代码库,全程不引入 VLM 或 VLA。目前公开信息显示,这是在 RoboDojo 的 42 个双臂任务上验证的,测试阶段没有模型在环,成功率 70.24%。
为什么重要
当前主流的机器人策略,无论是 VLA 直接映射观测到动作,还是 Agent Harness 在运行时查询 VLM 做决策,都把模型放在控制回路里。COAP 的思路是把“决策”和“模型推理”解耦:模型可以用于开发期,运行期只跑代码。论文强调三个优势:状态显式可存储、执行可控且快而便宜、新任务能复用和扩展共享库,使能力可以跨任务累积。
更值得关注的是它对“递归自我改进”(RSI)的适配性。编码智能体可以在闭环中持续开发这个代码库,每次修改都是显式的、可控的,而不是去调整一个难以解释的大模型。如果这条路走通,机器人策略的迭代方式可能更接近传统软件工程,而不是模型训练。
对用户/开发者/创作者的影响
对机器人开发者而言,COAP 提供了一种不用把 VLM 塞进推理链的选项:决策逻辑可以调试、回滚、版本管理,失败恢复也更灵活。运行期没有大模型调用,意味着推理成本和延迟的账要重新算。论文还提到,跨 episode 的代码可以充当 VLA 和 Agent Harness 的数据引擎,这对做数据闭环的团队有参考价值。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
但需要明确:这是论文摘要层面的工作,不是已上线的产品。70.24% 的成功率只对应 RoboDojo 的 42 个双臂任务和特定评测条件,不能外推为通用能力,也不代表已经过同行评审或大规模复现。
值得关注的后续
一是状态表示的精度和代码逻辑的鲁棒性,这是 COAP 自己承认的上限;二是代码库能否在更多任务和真实硬件上迁移,而非只在仿真基准里成立;三是社区是否会围绕“代码即策略”形成开源库和开发工具,以及它与 VLA 路线在实际部署中的成本对比。
来源:alphaXiv


