一句话看懂:Vercel CEO Guillermo Rauch 公布了新一轮 Next.js 代码评测结果,四款前沿模型中有三款同时达到 97% 成功率,而 Grok 4.7 以 94% 紧随其后,但调用成本低 2 到 7 倍。这组数据把“顶级能力是否必须付顶级价格”这个老问题重新摆上了桌面。
事件核心:发生了什么
Guillermo Rauch 在 X 上发布了基于 Next.js 场景的最新评测榜单,用于衡量各家大模型在该框架下完成开发任务的成功率。结果显示:Opus 5.5、GPT 6 Sol、Fable 5.1 三款模型均拿到 97%,并列第一。Next.js 官方账号补充说明,GPT-6 Sol 是首次上榜即达到 97%,追平历史最高成功率;Claude Opus 5.5 同样达到 97%,与 Claude Fable 5.1 并列,并在三者中平均成本最高。Grok 4.7 以 94% 排在第四,但 Rauch 特别强调它的价格是前几名的 2 到 7 分之一。完整榜单可在 nextjs.org/evals 查看。
为什么重要
这组结果透露出两个信号。第一,头部闭源模型在特定工程任务上的能力正在收敛——97% 这个数字被三款模型同时触及,说明单看成功率已经很难区分第一梯队,模型之间的差距开始从“能不能做对”转向“用多少成本做对”。第二,Grok 用 94% 的成功率换取了显著更低的推理价格,把性价比拉进了主战场。对开发者和企业采购来说,这意味着选型逻辑正在从“挑最强的模型”转向“在可接受的成功率内挑最便宜的模型”,而评测基准的权重也随之上升。
对用户/开发者/创作者的影响
对开发者而言,如果项目本身对错误容忍度较高、可以配合人工校验或重试机制,94% 成功率叠加低数倍的 API 单价,可能比追求 97% 更划算;反之,涉及生产环境关键路径时,3 个百分点的差距是否值得付出 2 到 7 倍成本,需要结合实际返工率来算。对企业采购来说,评测榜单可以作为供应商比价的起点,但要注意 Next.js 评测只覆盖特定框架和任务类型,不能直接外推到图像生成、长文本推理等其他场景。对创作者和轻量 AI 应用团队,成本下降通常意味着可以更大胆地做高频调用型产品,而不再被 token 账单卡住。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是评测方法是否公开透明:97% 的题目构成、难度分布和判定标准,决定了这个数字的可比性。二是价格是否稳定:Grok 的低价是长期策略还是阶段性补贴,会直接影响选型决策。三是竞品是否跟进:如果第一梯队模型不调整定价,性价比叙事可能进一步向低成本一方倾斜。四是榜单是否扩展到更多框架和任务类型,目前公开信息显示,这仍是一次聚焦 Next.js 的专项评测。


