一句话看懂:Mistral 于 2026 年 8 月 4 日发布 3B 开源多模态安全分类器 Shieldstral,通过推理时用自然语言定义政策的方式,让内容审核无需为每个新场景重新训练,性能可对标最高 7 倍大小的模型。
事件核心:发生了什么
Shieldstral 是 Mistral 推出的开源权重多模态安全审核模型,参数量 3B,以 Apache 2.0 协议开放下载。它的核心设计是把内容审核重构为二元问答任务:每次请求由三部分组成——Instruct(评估上下文和严格度)、Query(一个“是/否”政策问题,如“该内容是否煽动肢体暴力?”)、Document(待审核的提示词、回复或图像)。推理时模型只读取 yes/no 两个 logits,经 softmax 归一化为连续安全分数,同一套接口同时覆盖文本、图像和图文混合内容,并统一了提示词分类、回复审核、拒答检测和毒性检测。
根据 Mistral 公布的技术报告,Shieldstral 在文本安全、拒答检测、政策适应性、多模态安全四类基准上,



