标签: GPT-4

We ran fresh Next.js evals. The tally: ① Opus 5.5 [𝟿𝟽%] ② GPT 6 Sol [𝟿𝟽%] ③ Fable 5.1 [𝟿𝟽%] ④ Grok 4.7 [𝟿𝟺%] Notably, Grok is 2x-7x cheaper https://t.co/BAUg14981G

We ran fresh Next.js evals. The tally: ① Opus 5.5 [𝟿𝟽%] ② GPT 6 Sol [𝟿𝟽%] ③ Fable 5.1 [𝟿𝟽%] ④ Grok 4.7 [𝟿𝟺%] Notably, Grok is 2x-7x cheaper https://t.co/BAUg14981G

Vercel CEO Guillermo Rauch 公布了新一轮 Next.js 代码评测结果,四款前沿模型中有三款同时达到 97% 成功率,而 Grok 4.7 以 94% 紧随其后,但调用成本低 2 到 7 倍。这组数据把“顶级能力是否必须付顶级价格”这个老问题重新摆上了桌面。

Claude Opus 5.5

Claude Opus 5.5

Product Hunt 上出现了一款名为 Claude Opus 5.5 的产品条目,来源链接指向 claude-fable-5-1,但目前原始页面抓取失败,公开可核实的信息非常有限。值得关注的原因在于,Claude 系列命名一旦出现新的版本号或衍生名称,通常意味着 Anthropic 在产品线或模型能力上…

虚幻特工

虚幻特工

Unreal Labs 发布 Unreal Agent,用完全异步的工具调用机制替代模型自身轮询等待,在真实工作负载中相比 Codex 最高省 40% 成本、相比 Pi 最高省 20%。它提醒行业:除了模型和提示词,Agent 的“外挂框架”(harness)本身也是能省钱的研究方向。