In our latest https://t.co/p9AoezbuGt benchmarks, Grok 4.5 has emerged as the best cybersecurity AI model on price-performance. It’s 10x cheaper than Sol, 5.7x cheaper than Opus 5, and 2.2x cheaper than Kimi K3, yet a…

在最新DeepsecBench网络安全漏洞检测基准测试中,Grok 4.5以最佳性价比胜出:价格仅为Sol的1/10、Opus 5的1/5.7、Kimi K3的1/2.2,而性能与Kimi K3相当。但得分最高的前沿模型仍是Sol(GPT-5.6),领先Opus 5。

一句话看懂:在最新DeepsecBench网络安全漏洞检测基准测试中,Grok 4.5以最佳性价比胜出:价格仅为Sol的1/10、Opus 5的1/5.7、Kimi K3的1/2.2,而性能与Kimi K3相当。但得分最高的前沿模型仍是Sol(GPT-5.6),领先Opus 5。

事件核心:发生了什么

Vercel旗下安全评测平台DeepsecBench发布了最新模型安全能力基准结果。该测试专门评估AI在网络安全漏洞发现上的准确性、成本和速度。在参与评测的模型中,xAI的Grok 4.5在“性价比”维度表现突出:它的推理成本比GPT-5.6(代号Sol)低10倍,比Anthropic的Opus 5低5.7倍,比月之暗面的Kimi K3低2.2倍,同时准确率与Kimi K3接近。不过,总分榜首仍然由Sol占据(Vercel CEO Guillermo Rauch在推文中确认“Sol remains the frontier”),Kimi K3以一半得分、1/5成本位居第二梯队。该评测由Vercel于2026年7月27日发布,数据来源为deepsec.sh网站。

为什么重要

此次基准测试首次将“价格-性能比”作为独立维度在顶级安全模型中量化对比,直接反映AI安全应用的商业化可行性。Grok 4.5的出现,意味着在漏洞检测这一高合规、高成本领域,平价模型已经能够达到一线模型(Kimi K3)的精度,而成本大幅下降。这对AI安全创业公司和依赖安全API的企业是实质性利好——它们不再必须为顶级模型(Sol)支付高昂推理费用。同时,Sol在得分上的持续领先,也说明“前沿性能”与“最优性价比”两条路线还未收敛,不同需求场景仍需要不同选择。

对用户/开发者/创作者的影响

  • 对安全团队和DevOps开发者:可以直接参考DeepsecBench榜单,根据预算和精度需求选择模型。如果日常需要大量扫描代码库或流量中的漏洞,Grok 4.5可能是成本最优解;若需要最高检测精度(例如零日漏洞或关键基础设施),则仍应选Sol或Opus 5。
  • 对AI API采购方:Grok 4.5的定价策略可能倒逼其他模型降价,尤其是Sol和Opus 5。建议密切关注未来几个月的API价格调整。
  • 对AI模型开发方:这一评测强化了“特定领域基准+价格因素”的影响力,后续各家可能会在安全增强语义理解(如CVE关联、上下文分析)上投入更多,而非单纯追求通用能力。

值得关注的后续

  • Grok 4.5是否会在xAI平台上正式开放安全专用API?目前公开信息显示该模型已在deepsec.sh测试中可用,但具体商用套餐尚未明确。
  • Sol在保持性能优势的同时,是否会降低推理定价以应对Grok 4.5的冲击?这取决于OpenAI在安全场景的定价策略。
  • DeepsecBench是否会被更多行业采纳为安全AI选型标准?若成主流,可能推动第三方安全模型评测生态成熟,影响企业安全工具采购决策。
GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

来源:Follow Builders · X · Guillermo Rauch

celebrityanime
celebrityanime
文章: 15558

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注