Mistral Large 4:欧洲用万亿参数回应美国模型拒绝承接安全工作的局面

Mistral 发布万亿参数模型 Mistral Large 4 预览版,主打竞品因安全过滤而拒绝承接的漏洞复现与修复等网络安全任务,权重预计 10 月底开放。它的看点不在综合能力登顶,而在于把“模型政策差异”变成了产品卖点。

一句话看懂:Mistral 发布万亿参数模型 Mistral Large 4 预览版,主打竞品因安全过滤而拒绝承接的漏洞复现与修复等网络安全任务,权重预计 10 月底开放。它的看点不在综合能力登顶,而在于把“模型政策差异”变成了产品卖点。

事件核心:发生了什么

Mistral 放出 Mistral Large 4(ML4)公开预览版,内部代号“le Chonk”,API 现已通过 Mistral Studio 提供,模型权重预计 10 月底释出。这是一个原生多模态模型,总参数 1 万亿,推理时激活约 490 亿,训练在欧洲自有数据中心完成。

在 Artificial Analysis 聚合十项基准的 Intelligence Index 上,ML4 拿到 38 分,比上一代 Mistral Large 3 的 9 分和 Mistral Medium 3.5 的 14 分提升明显,也超过 GLM-5.2,但仍落后 Claude Opus 5.5 Max 的 58 分。在网络安全测试中,ML4 对“复现并修补开源软件真实漏洞”任务的完成率为 82%,据 Mistral 称是所有模型中最高的,而 Claude Opus 5.5 与 GPT-6 Astra 在该任务上接近零分,原因是直接拒绝执行。

为什么重要

这组对比揭示了一个常被忽略的事实:安全基准测的不只是模型能力,还有厂商的内容政策。闭源模型为了降低滥用风险,把漏洞验证这类双用途操作整体挡在门外,而攻击者本来就会用越狱手段绕过限制。Mistral 顺势把“不拒绝合法安全工作”做成差异化定位,并支持私有云与本地部署,避免企业在事件响应中途因供应商策略断供。

同时也要看到它的平衡姿态:Mistral 声称 ML4 在 JailbreakBench、StrongREJECT、AgentHarm 等恶意提示集上的拒答率高于其他开源模型,在 Lakera B3 基准中拦截 93.3% 的攻击。如何区分合法漏洞研究与攻击准备,官方并未给出解释。目前公开信息显示,权重发布前它正与安全公司、审核过的合作伙伴及政府机构进行红队测试。

对用户/开发者/创作者的影响

对安全团队和企业开发者来说,ML4 提供了一个可私有化部署、策略更宽松的备选路线,适合漏洞复现、渗透测试辅助等场景;但若涉及合规审计,仍需自行建立内部使用边界。在编程能力上,ML4 在 Artificial Analysis Coding Agent Index 得 49.8%,领先 Deepseek V4 Pro 和 Qwen3.8 Max;Surge AI 盲评中五个模型里排第二(3.74/5),落后 Claude Opus 5 的 4.22。图像理解与 STEM、CAD 任务据称表现突出,金融与代码场景则与头部模型接近。普通内容创作者短期内受此影响有限。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 10 月底权重是否如期开放,以及开源协议的具体条款;二是独立机构能否复现 82% 的漏洞修复成绩,并验证其拒答率数据;三是 Claude、GPT 系列是否调整安全策略,重新放开合法安全研究类请求。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 27609

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注