一句话看懂:Artificial Analysis 评测显示,OpenAI 的 GPT-6 Sol 和 Luna 把每百万 token 价格降到上一代约一半,推理成本明显下降,但知识与编程等评测出现有升有降,能力并非全面进步。
事件核心:发生了什么
2026 年 9 月 22 日,Artificial Analysis 发布了 GPT-6 Sol 与 GPT-6 Luna 的第三方评测。价格是这次最直观的变化:Sol 从每百万输入/输出 token 4 美元/20 美元降到 2 美元/10 美元;Luna 从 0.20 美元/1.20 美元降到 0.10 美元/0.50 美元,缓存读取仍保留 90% 折扣、缓存写入 25% 溢价。不过两者每次任务消耗的输出 token 反而更多(Sol 约 3.1 万 vs 2.9 万,Luna 约 5.1 万 vs 4.1 万),最终每个任务的成本仍下降约 50% 和 60%。跑完 Intelligence Index,Sol(max)单任务约 1.06 美元,Luna(max)约 0.07 美元。
为什么重要
这轮更新的重点不是能力跃升,而是成本效率。Artificial Analysis 的 Intelligence Index 和 Coding Agent Index 总分与 GPT-5.6 基本持平,说明 OpenAI 在用价格换市场份额,抢占成本效率的帕累托前沿。同时评测结果分化:GPT-6 Sol 在 Codex 环境下的 Coding Agent Index 提升 2 分至 57,Terminal-Bench 4.0 从 37% 升到 43%;Luna 则下降 2 分至 41。更值得注意的是幻觉率大幅下降——Sol 从 92% 降到 60%,Luna 从 93% 降到 77%,但 Sol 的代价是只尝试回答 83% 的问题(上一代为 99%),准确率也从 59% 小幅回落到 54%。
对用户/开发者/创作者的影响
对开发者和企业采购而言,单位任务成本减半是最实际的信号,尤其适合高频调用、成本敏感的 AI 应用,比如批量文档处理、Agent 工作流。但要注意,Luna 在 Agent 编程和部分知识工作上出现退步,GDPval-AA v2.1 中 Sol 下降约 100 Elo、Luna 下降约 75 Elo,AA-Briefcase v1.1 中 Luna 也降约 45 Elo,原因偏向交付物更短、遗漏评分点、呈现质量下滑。因此,如果业务依赖多周知识工作或复杂编程任务,建议先做小规模 A/B 测试,而不是直接按价格切换。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是 OpenAI 是否会在后续版本中修复 GDPval 和 AA-Briefcase 的退步;二是竞品(如 Claude Opus 5.5 等)是否跟进降价或加大缓存折扣;三是幻觉率下降能否在真实生产环境中稳定复现,而不是靠“少答”换来。


