Mistral 的 Shieldstral:适用于多模态内容审核的 3B 无权重限制模型

Mistral 于 2026 年 8 月 4 日发布 3B 开源多模态安全分类器 Shieldstral,通过推理时用自然语言定义政策的方式,让内容审核无需为每个新场景重新训练,性能可对标最高 7 倍大小的模型。

一句话看懂:Mistral 于 2026 年 8 月 4 日发布 3B 开源多模态安全分类器 Shieldstral,通过推理时用自然语言定义政策的方式,让内容审核无需为每个新场景重新训练,性能可对标最高 7 倍大小的模型。

事件核心:发生了什么

Shieldstral 是 Mistral 推出的开源权重多模态安全审核模型,参数量 3B,以 Apache 2.0 协议开放下载。它的核心设计是把内容审核重构为二元问答任务:每次请求由三部分组成——Instruct(评估上下文和严格度)、Query(一个“是/否”政策问题,如“该内容是否煽动肢体暴力?”)、Document(待审核的提示词、回复或图像)。推理时模型只读取 yes/no 两个 logits,经 softmax 归一化为连续安全分数,同一套接口同时覆盖文本、图像和图文混合内容,并统一了提示词分类、回复审核、拒答检测和毒性检测。

根据 Mistral 公布的技术报告,Shieldstral 在文本安全、拒答检测、政策适应性、多模态安全四类基准上,

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

celebrityanime
celebrityanime
文章: 16940

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注