ARC Prize Foundation 推出第二代抽象推理基准 ARC-AGI-2

ARC Prize Foundation 发布第二代抽象推理基准 ARC-AGI-2,用 1360 道网格题测试 AI 的少样本推理和泛化能力,同时被刻意设计成“对机器更难、对人仍可解”。发布时纯 LLM 得分 0%,前沿推理系统也只有个位数百分比。

一句话看懂:ARC Prize Foundation 发布第二代抽象推理基准 ARC-AGI-2,用 1360 道网格题测试 AI 的少样本推理和泛化能力,同时被刻意设计成“对机器更难、对人仍可解”。发布时纯 LLM 得分 0%,前沿推理系统也只有个位数百分比。

事件核心:发生了什么

ARC-AGI-2 是抽象推理语料库(ARC)的第二代版本,由 ARC Prize Foundation 开发。它延续了前代的题型:给系统若干组网格输入输出示例,让模型自行推断变换规则,再应用到新的测试输入上,每个测试用例允许两次尝试(pass@2)。

整个基准共 1360 道题,其中 1000 道为训练任务,360 道为评估任务,评估集平均分成公开、半私有和私有三组,各 120 道。相比初代,新版本删除了那些容易被暴力程序搜索攻破的题目,新增题目集中在符号解读、组合推理和上下文规则应用上——也就是当前系统容易停留在表层视觉模式、难以同时处理多条相互作用规则的薄弱环节。官方组织了 400 多名参与者的人类对照测试,确认每道评估题至少有两名受试者能在两次尝试内解出,人类平均得分约 60%。

为什么重要

ARC 系列一直是衡量“AI 是否具备类人抽象推理”的代表性标尺。ARC-AGI-2 把难度拉开后,暴露出一个清晰断层:依赖大规模预训练和模式匹配的大模型,在这类需要现场归纳规则的题目上几乎无能为力。这为行业提供了一个相对干净的对照——算力、数据规模与推理能力并非线性关系。对正在推进推理模型、神经符号系统或程序合成路线的团队来说,这个基准既是压力测试,也是路线选择的参考坐标。它还强调“每道题解出所耗算力”,意味着单纯堆推理时长的做法会被更严格地审视。

对用户/开发者/创作者的影响

对普通用户而言,短期内直接影响有限,但它提示了一件事:当前 AI 应用在面对真正新颖、需要现场推理的任务时,可靠性仍不稳定。开发者如果正在做 Agent、自动化流程或结构化数据处理,应意识到模型在规则归纳类任务上的短板,必要时引入程序化验证或人工兜底。做评测和模型选型的团队,可以把 ARC-AGI-2 纳入参考,但要注意它衡量的是抽象推理这一特定维度,不能直接等同于产品体验。内容创作者则可关注“人类平均 60%、AI 个位数”这一对比,它比笼统的“AI 超越人类”叙事更接近真实能力边界。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是后续是否有模型或方法在 ARC-AGI-2 上取得实质突破,尤其是结合程序搜索、符号推理或混合架构的方案;二是“单位任务算力”这一指标是否被更多评测采纳,进而影响推理成本与定价逻辑;三是公开、半私有、私有三组评估集的分数差异,能否反映模型是真正泛化还是在拟合公开数据。目前公开信息显示,该基准发布时的领先成绩仍停留在个位数百分比,后续变化值得跟踪。

来源:Epoch AI:研究、数据与评测

celebrityanime
celebrityanime
文章: 27128

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注