一句话看懂:SpaceXAI 于 9 月 22 日发布 Grok 4.7,主打长任务执行、自我检查和长上下文管理,官方称速度是同级模型的两倍、价格只有旗舰模型一半。它的重点已从单轮答题转向模型与工具、执行环境的持续协作。
事件核心:发生了什么
Grok 4.7 换用了比 Grok 4.6 更大的基础模型,并延长了强化学习训练周期,不少训练样本需要数小时才能完成,任务组合难度同步提高。官方定位相当直接:面向编程和知识工作的最强模型,速度翻倍、价格减半。马斯克在推文中称其在智能、速度与成本之间取得了“非常有竞争力的平衡”。
长任务是这次升级的主战场。针对编程 Agent 最头疼的环节——读仓库、拆需求、改多个文件、跑测试、反复调试——Grok 4.7 强化了自查与长上下文管理。数据上,CursorBench4.0 从上一代 40.4% 提升到 46.3%,Terminal-Bench4.0 从 20.3% 升至 38.0%,DeepSWE v1.1 高推理强度得分 71.0%。模型还原生理解 Grok Bot 运行框架。
评测范围也明显拓宽:AA Briefcase v1.1 得 1657 分(前代 1546),GDPval Elo 从 1605 升到 1695,接近 Fable5.1 的 1735,高于 GPT-6Astra 的 1542。垂直领域同样有进步:EEBench 从 53.0% 到 64.0%,Harvey 法律 Agent 基准从 15.8% 到 19.6%,HealthBench Professional 从 48.5% 到 56.7%。安全方面,官方称新保护系统在拒答和抗越狱上最强,LatchBio 生物安全基准达 62.4%,HackerBench v0.3 仅放行 3.3% 高风险两用提示,并已向少数网络安全伙伴开放邀请制红队能力。
为什么重要
这批数据指向一个清晰趋势:前沿模型的竞争正从“单轮答得好”转向“把整件事做完”——理解任务、调用工具、产出文件、自我复核。对编程 Agent 而言,长时间执行链中能否守住目标、发现错误,往往比一次写出干净代码更关键。Grok 4.7 以半价对标旗舰,等于把长任务能力拉进更低价位段,会直接压缩同类模型的定价空间。目前公开信息显示,SpaceXAI 尚未披露具体定价数字与 API 细则。
对用户/开发者/创作者的影响
开发者可以重点关注长任务与工具调用场景:如果 Terminal-Bench 和 CursorBench 的提升在实际仓库中能复现,多文件改造、测试调试类 Agent 的成本会明显下降。知识工作者和法律、医疗、工程等垂直场景的用户,可留意 Harvey、HealthBench 等基准背后的真实可用性。企业采购层面,“旗舰一半价格”若成立,会改变推理成本的预算分配;创作者则可关注其在文档、演示类任务上的产出是否真能直接使用。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是价格与 API 是否如宣传落地,实际调用成本能否兑现“半价旗舰”;二是长任务成绩在真实项目中是否稳定复现,而非只体现在基准分数;三是竞品是否跟进降价或推出对应的长任务能力,以及邀请制红队合作是否会扩大。
来源:AIbase


