一句话看懂:蚂蚁集团 AI 安全实验室开源了大模型内生安全技术 SingProbe,复用基座模型推理时的隐藏状态,以不到 0.5% 的额外算力实现 token 级实时风险拦截,并兼容 29 款主流大模型。
事件核心:发生了什么
根据 AIbase 报道,蚂蚁集团 AI 安全实验室近期正式开源了大模型安全产品 SingProbe。与主流做法——在基座模型之外再挂一个独立的安全审核模型——不同,SingProbe 选择复用大模型自身推理过程中的隐藏状态(hidden states),直接在 token 粒度上完成意图分类、安全检测与幻觉识别三类任务。官方数据显示,其额外计算开销不足 0.5%,可在内容输出前完成毫秒级拦截。目前 SingProbe 已兼容 29 款主流大模型,代码与预训练模型同步放出,蚂蚁称这是首个由大型科技公司完整开源的内生安全技术方案。
为什么重要
过去两年,大模型安全主要依赖“外挂式”审核:输入侧过滤、输出侧再跑一个分类模型。这套方案的问题在于延迟高、算力成本叠加,且两个模型之间容易出现语义损耗。SingProbe 把安全能力“长”进模型推理本身,等于把安全从附加模块变成基础设施,这对医疗、金融等对响应速度敏感的高风险场景尤为关键。更现实的意义在于开源:此前内生安全多停留在论文或闭源产品里,代码和权重同时开放,意味着中小团队也能低成本接入 token 级防护,而不必自己从头训练审核模型。目前公开信息显示,这可能会推动安全能力从“每家自建”走向“标准化组件”。
对用户/开发者/创作者的影响
对开发者而言,最直接的价值是部署成本:安全审核不再需要独立推理实例,显存和延迟压力显著下降,尤其是自部署开源模型的团队。兼容 29 款模型这一点,也让迁移和替换基座模型的成本降低。对企业采购方,token 级拦截意味着高风险行业应用(如问诊、投顾)在合规上多了一层可解释的防线。对普通用户和内容创作者,体感可能只是“回答被拦得更快、更少卡顿”,但实际影响在于平台可以更激进地开放大模型能力,而不用因安全顾虑层层限流。需要注意的是,幻觉识别与安全检测共用一个探针,实际准确率目前公开信息尚未给出第三方评测数据。
值得关注的后续
一是 SingProbe 在真实业务中的误拦率和漏拦率,尤其是医疗等场景的落地反馈;二是其他厂商是否跟进开源同类内生安全方案,形成事实标准;三是这 29 款兼容模型的名单与更新节奏,是否覆盖国产开源主力模型。此外,监管层面对“模型内生安全”是否给出合规认定,也会影响企业采购意愿。
来源:AIbase


