性能狂飙!Grok 4.6正式发布,实力比肩GPT-5.6 Sol

SpaceX AI 于 8 月 13 日发布旗舰模型 Grok 4.6,重点强化长期复杂智能体任务,综合基准得分追平 OpenAI 的 GPT-5.6 Sol,并延续了高速度、低定价的策略,直接冲击闭源大模型第一梯队。

一句话看懂:SpaceX AI 于 8 月 13 日发布旗舰模型 Grok 4.6,重点强化长期复杂智能体任务,综合基准得分追平 OpenAI 的 GPT-5.6 Sol,并延续了高速度、低定价的策略,直接冲击闭源大模型第一梯队。

事件核心:发生了什么

SpaceX AI 正式推出升级版旗舰模型 Grok 4.6。该模型聚焦长周期、多步骤的智能体任务场景,在权威评测机构 Artificial Analysis 的九项流行基准综合指数中,总分追平 OpenAI 的 GPT-5.6 Sol,目前仅次于 Claude Opus 5 和 Fable 5 Max。具体来看,Grok 4.6 在评估逻辑与知识水平的 GDPval-AA v2 测试中拿到 Elo 1753 分,在衡量长期知识工作智能体任务的私有基准 AA-Briefcase 中取得 Elo 1577 分,两项均仅次于 Claude Opus 5。

技术层面,Grok 4.6 在 7 月发布的 Grok 4.5 基础上前进,后者曾由数万块 NVIDIA GB300 GPU 训练。4.6 版本重点针对长期复杂任务做全链路优化,训练数据大量采用模型自身生成的推理内容、高级技术概念和高质量工程代码,并结合覆盖知识工作、通用编程及多个专业领域的智能体强化学习训练,使模型在生成可视化、交互式应用时能产出更高质量的初始结果。定价与速度方面,该模型运行速度达 80 TPS,基础版输入/输出价格分别为每百万 token 2 美元和 6 美元,高速版为 4 美元和 12 美元。

为什么重要

这次发布的意义不只是性能数字的上涨,更在于竞争位置的变化。Grok 4.6 在核心基准上追平 GPT-5.6 Sol,意味着闭源模型的头部格局从“OpenAI 单极领先”转向更明显的多强竞争。与此同时,SpaceX AI 延续了高速率和低定价的组合:80 TPS 的运行速度搭配明显低于部分同档模型的 API 价格,会进一步压低企业调用顶尖模型的实际成本。

从技术路线看,Grok 4.6 把重心放在智能体任务而非单纯的聊天能力上,训练中大量使用模型生成数据与强化学习,说明 SpaceX AI 押注的下一代应用场景是“能长期执行复杂任务的 AI 员工”,而非“更快出字的聊天机器人”。这与 Cursor、Grok Build 等产品场景的深度绑定也表明,模型能力正越来越多地直接转化为生产力工具。

对用户/开发者/创作者的影响

对开发者而言,Grok 4.6 通过 API 开放访问,调用成本维持低位,适合做智能体类应用、编程辅助工具和长流程自动化任务的迭代实验;Cursor 和 Grok Build 用户现在即可直接使用,说明其能力已经接入真实开发工作流。对创作者来说,模型更强的初始结果生成能力意味着在构建可视化、交互式内容时,可以在提示阶段就获得更高完成度的输出,减少反复修改的轮次。对企业用户而言,Grok 4.6 在知识工作智能体任务上的高分表现,可能意味着更可靠的自动化方案——但采购决策仍需结合具体业务场景做评估,不能只看基准分。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来有几个具体观察点:第一,Grok 4.6 的跑分优势能否在真实长周期任务中稳定复现,尤其是多智能体协作场景下的表现;第二,OpenAI 是否会在短期内推出 GPT-5.6 Sol 的升级版本或调整定价来回应竞争;第三,SpaceX AI 是否会进一步开放开源版本或推出更低价档位,以扩大开发者生态。目前公开信息显示,模型已进入实际产品渠道,后续的开发者采用速度和真实使用反馈,比基准分数更能说明问题。

来源:AIbase

celebrityanime
celebrityanime
文章: 18303

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注