一句话看懂:AI 实验室 Pathway 发布了一款仅 150M 参数的推理模型 BDH-CQ,在 ARC-AGI-1 基准上拿到 29.5% 准确率,单任务推理成本仅 0.0007 美元,比 ChatGPT 所用的 Luna 模型便宜约 11 倍——推理不一定要”写出来”,在内部默默计算同样有效。
事件核心:发生了什么
Pathway 是一家专注构建 Post-Transformer 架构的 AI 实验室,近期公开了 BDH-CQ 模型的基准测试结果。这个仅有 1.5 亿参数的模型,在公开的 ARC-AGI-1 评测集上取得了 29.5% 的 pass@2 成绩,而每个任务的推理成本折算下来只有 0.0007 美元。
作为对比,OpenAI 的 GPT 5.6 Luna(Low)模型在该基准上得分 34.2%,略高于 BDH-CQ,但单任务成本为 0.008 美元,即便计入 OpenAI 今年 7 月 30 日开始的 80% 降价,两者仍有约 11 倍价差。再往上看,Claude Opus 5 和 Gemini 3.1 Pro 虽然能到 97%–98% 的准确率,但单任务成本在 0.5–0.6 美元区间,比 BDH-CQ 贵了近千倍。另一款低价方向的 Qwen3 235B 成本超过 BDH-CQ 三倍,得分却更低,性价比上没有竞争力。
为什么重要
这项结果的深层意义在于:AI 推理的高成本可能不是智能的”必要代价”,而是架构选择的结果。目前主流的推理模型会在回答前先生成大段中间文本,逐步”出声思考”,token 越长、算力开销越大。BDH-CQ 则不同——它把推理过程压缩在内部记忆状态中完成,不把中间步骤显式写出,从而大幅降低推理成本。
Pathway CEO Zuzanna Stamirowska 评论称,这种 token 成本是架构强加的,而非智能的必然要求。Transformer 论文联合作者 Łukasz Kaiser 也表示,模型架构而非单纯规模,可能驱动下一轮推理能力突破。如果这条路成立,AI 行业的竞争维度可能从”谁更聪明”扩展到”同样聪明下谁更便宜”。
对用户/开发者/创作者的影响
对开发者和企业用户而言,最直接的变化是推理成本门槛被拉低。每任务不到 0.001 美元的推理费用,意味着更多中小团队可以把推理能力嵌入高频、低客单价的 AI 应用——比如内容分类、客服路由、轻量级编程辅助——而不用担心 API 账单失控。AWS 方面已表示,认为 BDH-CQ 的结果是把高级推理从实验推向生产的积极一步。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对创作者而言,这类模型短期内不会直接替代图像生成或视频生成工具,但它可能降低 AI 功能在内容平台中的接入成本,让更多”自带推理”的小工具出现在日常创作流程里。需要留意的是,29.5% 的 ARC-AGI-1 得分仍属于中等水平,目前公开信息显示它还不足以胜任复杂逻辑任务,选择接入时需要匹配实际场景。
值得关注的后续
接下来值得观察三点:第一,BDH-CQ 是否从论文结果走向实际可用的 API 或开源权重,开发者能否真正调用到;第二,Pathway 声称 1B 到 600B 参数规模都遵循类似 Transformer 的缩放规律,更大模型能否延续这种性价比优势,并在数学推理、ARC-AGI-2 甚至 ARC-AGI-3 上证明自己;第三,OpenAI、Anthropic 等头部厂商会不会被迫调整定价策略,或者跟进研发”内部推理”类架构。至少目前来看,价格战已经从模型能力延伸到了推理效率的维度。
来源:TechRadar


