一句话看懂:Entelligence 用 50 个公开基准 PR 对比 GPT-5.6 Luna 与 GPT-6 Astra,发现 Luna 只花 3.6% 的钱就查出 Astra 约 75% 的真实 bug,但误报率接近四分之一,且安全类缺陷漏得最多。
事件核心:发生了什么
Entelligence 在自家博客发布了一项代码评审对比测试。参评模型是 GPT-5.6 Luna 和 GPT-6 Astra:Luna 输入每百万 token 收费 0.20 美元、输出 1.20 美元,Astra 对应为 10 美元和 50 美元。单次 PR 评审成本,Luna 约 0.0041 美元,Astra 约 0.113 美元,相差 28 倍。
测试用的是 AI-Code-Review-Evals 组织的 50 个公开基准 PR,来自 Cal.com、Sentry、Discourse、Keycloak 和 Grafana 各 10 个,每个都人为注入了缺陷。同一份 prompt、同一份 diff,Luna 共确认 69 个真实 bug,Astra 确认 92 个。整轮跑下来,Luna 花 0.20 美元,Astra 花 5.66 美元。Luna 的 93 条报告中有 24 条未通过验证,Astra 的 96 条中只有 4 条;24 个安全类 bug 里,Luna 只找到 9 个,Astra 找到 19 个。
为什么重要
这组数据把大模型“便宜够用”的边界画得更具体了。Luna 的输出价格是 Astra 的约 1/42,每查出一个真实 bug 的成本,Astra 是 Luna 的 20 倍。如果只看日常逻辑错误,低价模型的性价比确实成立,这意味着代码评审这类高频 AI 应用有机会压到几乎可以忽略的调用成本。但另一面同样清楚:低价换来的是更粗的精度,以及安全、并发等上下文强相关缺陷的明显漏检。对企业来说,模型选型不再是“哪个最强”,而是“哪类代码允许用哪个档位”。
对用户/开发者/创作者的影响
如果团队已经在 CI 里挂 AI 代码评审,这项测试给出的策略是:用 Luna 扫日常正确性 bug,成本极低;但认证、权限、并发相关代码不要让它单独把关。数据也显示,Luna 和 Astra 的发现并不完全重叠——143 个已确认 bug 中,只有 44 个是两者都找到的,48 个仅 Astra 发现,25 个仅 Luna 发现。两个模型都跑一遍,能覆盖 117 个(约 82%),总成本 5.86 美元。对于预算敏感的小团队,这意味着可以先用低价模型做第一层过滤,再把安全敏感路径交给高配模型或人工复核,而不是二选一。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是按代码库拆分的结果是否会稳定复现,目前公开信息显示 Luna 在 Keycloak 这类身份权限项目上差距最大,评审命中率只有 50%,Astra 为 93%。二是基准集本身存在污染风险,有读者指出这些仓库是公开的,修复补丁可能已进入模型训练数据,需要按时间切分 PR 才能验证排名是否成立。三是价格与能力是否继续下探:若低价模型把误报率压到 10% 以内,代码评审的默认档位可能会整体下移。


