ARC-AGI-3 is nearly solved by merely adding a coding harness. As predicted, coding generalizes LLMs. https://t.co/ynhHVkdObE https://t.co/8KPQvVsNb0

Amjad Masad 发帖称,给 LLM 加一个代码执行循环(coding harness)后,ARC-AGI-3 这个被视为 AGI 测量基准的测试几乎被攻克;开发者 Jeremy Berman 确实证明了这一点——用 Claude Code 配上 Opus 5,得分 96.2%,pass@2 达到 99…

一句话看懂:Amjad Masad 发帖称,给 LLM 加一个代码执行循环(coding harness)后,ARC-AGI-3 这个被视为 AGI 测量基准的测试几乎被攻克;开发者 Jeremy Berman 确实证明了这一点——用 Claude Code 配上 Opus 5,得分 96.2%,pass@2 达到 99.3%。这件事值得关注,不是因为它证明”模型什么都会”,而是因为”代码执行”可能是让大模型真正跨越推理与行动之间鸿沟的通用路径。

事件核心:发生了什么

8 月 14 日,Replit 创始人 Amjad Masad 在 X 上发帖表示:ARC-AGI-3 只需加上一个 coding harness 就几乎被解决,”代码让 LLM 获得了泛化能力,这与此前预测一致”。同日,开发者 Jeremy Berman 在回复中公开了具体成绩单:使用 Claude Code + Opus 5(high)的配置,仅靠一个 action command 和文件系统日志,就拿到 ARC-AGI-3 的 96.2% 得分,pass@2 更是达到 99.3%。他特别强调,这套方案几乎没有针对 ARC 做任何定制,相关代码已开源在 github.com/jerber/arc-code。

值得注意的是,ARC-AGI 系列基准向来以考察抽象推理能力著称,此前模型得分长期低于 50%,它一直被当作”大模型是否逼近 AGI”的重要标尺。如今连续三个版本的测试被逐步攻克,讨论重心从”模型能不能推理”转移到了”用什么样的执行架构让推理能力真正落地”。

为什么重要

这次突破的关键词不是”分数”,而是”泛化”——BERT 时代的模型很擅长单一任务,但换一个任务就崩;而代码执行循环的核心是”计划、执行、验证、修正”四步闭环,这套机制本身与具体任务无关。ARC-AGI-3 的题目千变万化,但模型只需写代码、跑代码、看日志、再改代码,一个通用的能力循环就能应对所有题目。

这意味着行业的技术路线可能正在发生一次明显的重心迁移:过去大家比的是单次推理有多聪明(单纯加大模型参数量、堆算力),现在则开始比拼”模型放在什么样的 Agent 框架里”——外部工具、反馈循环、环境交互能力,正在成为大模型性能表现里越来越重要的变量。对 OpenAI、Anthropic、Google 等闭源模型厂商来说,模型本身的推理能力依然是基础;但开源社区如果配合 harness 和 Agent 框架,有可能在推理之外的”工程层”追平甚至超过闭源方案。

对用户/开发者/创作者的影响

对普通用户来说,这个信号意味着 AI 工具的形态将持续改变:以后用得更多的可能不是”一个对话框里问一句、答一句”,而是”AI 自己动手写代码、运行、看结果、反复修到成功”——像 Claude Code 这样带执行能力的 Agent 产品,很可能成为未来 AI 应用的主流交互范式。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,最直接的启示是:调模型时不要只关注 Prompt 写得好不好,更要关注模型是否拥有一个可”行动”的环境。现在 Claude Code、Codex 等工具直接提供了现成 harness,配套的 API 接口、日志系统、命令行工具成了与模型能力同等重要的组件。基于开源方案搭建自己的”模型 + 代码执行循环”再针对垂直场景微调,成本可能远低于想象。对创作者而言,生成代码只是第一步,接下来更值得尝试的是让 AI 把代码”跑起来”验证效果,比如自动生成网页、图片处理脚本或视频渲染流程,再用反馈闭环自主迭代。

值得关注的后续

第一,关注这套方案在 ARC-AGI-3 之外的真实任务上的表现。OpenAI、Anthropic 等厂商此前都有类似发现,但独立第三方(比如 Meta 的论文、MIT 的独立复现)给出的结论更能说明”代码执行泛化”是不是一条普遍规律。

第二,关注 Claude Code 这类 Agent 开发工具的生态变化。Jeremy Berman 只用了”一个 action command + 文件系统日志”,这意味着未来 Agent 工具的接口标准化、日志系统设计、上下文管理能力,可能成为开发者选型时的新硬指标。

第三,关注 ARC 基准本身的命运。如果 ARC-AGI-3 被代码 harness 轻易攻克,下一个被广泛认可的测量基准是什么?是否有更难的新基准出现,还是说行业干脆放弃”考试式测评”,改用真实任务的自动化评测?目前公开信息仍存在争议,但合理猜测是:一旦”代码执行 + 环境反馈”成为标配,衡量 AI 的标准就会从中考模拟题,切换成工程实战。

来源:Follow Builders · X · Amjad Masad

celebrityanime
celebrityanime
文章: 18396

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注