一句话看懂:Artificial Analysis 评测显示,OpenAI 的 GPT-6 Sol 与 Luna 把每任务成本压到 GPT-5.6 的一半左右,智能指数和编程智能体指数基本持平,但知识工作类评测出现下滑,是一组“省钱不涨分”的迭代。
事件核心:发生了什么
据 Artificial Analysis 在 X 上发布的评测,GPT-6 Sol 和 Luna 相比 GPT-5.6 同名型号,价格约降低 50%。Sol 从每百万输入/输出 token 的 4 美元/20 美元降到 2 美元/10 美元,Luna 从 0.20 美元/1.20 美元降到 0.10 美元/0.50 美元,缓存读取 90% 折扣、缓存写入 25% 溢价保持不变。
智能指数和编程智能体指数与 GPT-5.6 持平。运行智能指数时,GPT-6 Sol(max)每任务约 1.06 美元,比 GPT-5.6 Sol 的 1.99 美元少约一半;Luna(max)每任务 0.07 美元,比 0.18 美元少约 60%。值得注意的是,两者单任务输出 token 反而更多(Sol 31k 对 29k,Luna 51k 对 41k),成本下降主要来自单价下调。
为什么重要
这轮更新的重点是成本效率,而不是能力跃迁。Artificial Analysis 称两款模型让 OpenAI 占据了成本效率帕累托前沿的相当一部分位置,意味着在同等预算下,企业可以部署更多并发推理任务。在编程智能体指数中,Sol(max)得 57 分、比 GPT-5.6 Sol 高 2 分,每任务 2.99 美元、便宜约一半;但 Luna(max)得 41 分、下降 2 分。测评方也指出,知识工作类评测出现回退,GDPval-AA v2.1 中 Sol 掉约 100 Elo、Luna 掉约 75 Elo,部分原因是呈现质量和交付内容覆盖度下降。此外,幻觉率明显改善:Sol 从 92% 降到 60%,Luna 从 93% 降到 77%,但 Sol 是靠更频繁拒答换来的,答题率从 99% 降到 83%,准确率也从 59% 降到 54%。
对用户/开发者/创作者的影响
对调用 API 的开发者而言,输入输出单价减半直接降低推理账单,缓存读取 90% 折扣对长上下文、多轮对话类 AI 应用尤其友好,适合把此前因成本搁置的批处理或 Agent 工作流重新跑起来。但知识工作类能力回退提醒团队不要只看指数:涉及文档交付、报告撰写、多周项目类任务时,可能需要人工复核或改用更稳的型号。普通用户短期内感受到的可能是订阅或免费额度层面更宽松,而非能力明显变强。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 Sol 与 Luna 是否会在 Codex、ChatGPT 等产品线全量落地,以及 API 限速和上下文窗口是否同步调整;二是知识工作类评测的回退是训练取舍还是提示词适配问题,OpenAI 后续是否推出修复版本;三是 Anthropic、Google 等竞品是否跟进降价,以及成本效率这条赛道会不会成为下一轮模型发布的主要卖点。


