一句话看懂:Artificial Analysis 评测显示,Grok 4.7 在智能体知识工作基准上大幅跃升,综合智能指数升至 46 分,编码代理指数升至 56 分,帮助 xAI 进入顶级实验室前四;但这一进步伴随明显的 token 消耗上升。
事件核心:发生了什么
Artificial Analysis 于 9 月 21 日发布了对 Grok 4.7 的完整评测。该模型在综合智能指数上得分 46,比 Grok 4.6(high)提升 2 分,测试采用 xhigh 推理强度。最突出的变化出现在智能体知识工作场景:在私有基准 AA-Briefcase 上,Grok 4.7 拿到 1657 Elo,比 Grok 4.6(high)高出 111 分,仅次于 Claude Opus 5 和 Claude Fable 5.1;在 GDPval-AA 上得 1695 Elo,领先前代 90 分,主要提升来自分析质量。
编码代理方面,Grok 4.7(xhigh)搭配 xAI 自家编码代理 Grok Build,在 Coding Agent Index 上从 47 分升至 56 分,三个子项全部改善:DeepSWE v1.1 从 65% 升至 73%,Terminal-Bench 4.0 从 18% 升至 33%,SWE-Atlas-QnA 从 58% 升至 63%。按原生工具链口径,它排到第四,落后于 Claude Fable 5.1、GPT-6 Astra 和 Claude Opus 5。
为什么重要
这组数据把 xAI 送进了前沿模型的第一梯队。此前 Grok 系列的优势更多集中在通用对话和推理,而 AA-Briefcase 这类长周期、多步骤的专业工作任务,长期由 Claude 和 GPT 系列占优。Grok 4.7 在这条线上逼近领先者,说明智能体知识工作不再是单一厂商的护城河。同时,编码代理分数反超 GPT-5.6 Sol,意味着在开发者工具这一商业化路径最清晰的场景中,竞争进一步加剧。
另一个值得注意的信号是效率问题。Grok 4.7(xhigh)在智能指数上每题消耗约 81k 输出 token,远高于 Grok 4.6(high)的 36k 和 GPT-6 Astra(max)的 27k。换言之,部分性能提升是靠更多推理算力换来的,这对 API 成本和延迟有直接影响。
对用户/开发者/创作者的影响
对开发者而言,Grok 4.7 的定价保持 2 美元/百万输入 token、6 美元/百万输出 token,缓存命中降至 0.5 美元,与前代一致,500k 上下文窗口也未变。但输出 token 用量翻倍以上,实际调用成本可能高于账面价格,长任务需要提前估算预算。Grok Build 的进步让 xAI 在编码代理赛道更有竞争力,使用其原生工具链的团队值得重新评估选型。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
对知识工作者和内容创作者,AA-Briefcase 和 GDPval-AA 考的是文档、表格、幻灯片等实际交付物,Grok 4.7 在这类任务上的提升意味着它能承担更复杂的研究整理和报告生成工作,但演示质量分数反而略低于前代,人审环节仍不可省略。
值得关注的后续
第一,观察 Grok 4.7 在真实 API 场景中的 token 效率是否优化,以及 xhigh 之外的中低推理档位性能落差。第二,看 Claude、OpenAI 是否在下一版中回应编码代理和知识工作基准的竞争。第三,Grok Build 的开发者生态和可用范围是否扩大,目前公开信息显示它仍是 xAI 一方工具,第三方集成情况尚不明确。


