Huggingface 很少主动封杀托管的大模型,这次 Huggingface 是真的怒了。起因是 @audn_ai 在 Huggingface 上上传了一个名为 penclaw-GLM-5.3-abliterated-for-offensive-cyber 的模型,把开源 GLM-5.3 的拒答层消除掉,而仓库名和模型卡片页面直接写明面向 offensive cyber(网络攻击),并把漏洞利用、恶意软件、TTP 写成预期能力。 H…

Hugging Face 下架了一个基于开源 GLM-5.3 的“越狱”模型,原因是其仓库命名和模型卡片直接把网络攻击、漏洞利用、恶意软件列为预期能力;该模型随后被发布者重新上传。Hugging Face 很少主动封杀托管模型,这次动作值得关注。

一句话看懂:Hugging Face 下架了一个基于开源 GLM-5.3 的“越狱”模型,原因是其仓库命名和模型卡片直接把网络攻击、漏洞利用、恶意软件列为预期能力;该模型随后被发布者重新上传。Hugging Face 很少主动封杀托管模型,这次动作值得关注。

事件核心:发生了什么

据 @wquguru 转述,用户 @audn_ai 在 Hugging Face 上传了一个名为 penclaw-GLM-5.3-abliterated-for-offensive-cyber 的模型。它针对开源大模型 GLM-5.3 做了“abliterated”处理,即移除或削弱模型的拒答层,使其更少拒绝有害请求。仓库名和模型卡片页面明确写明面向 offensive cyber(网络攻击),并把漏洞利用、恶意软件、TTP(攻击战术、技术与程序)列为模型的预期能力。

Hugging Face 随后下架了该模型,但至今没有公开说明具体原因。结合发布方事后表态以及其账户本身并未被封禁来看,目前公开信息显示,触发处置的更可能是模型命名和介绍过于露骨,而非模型权重本身。该模型现已被重新上传。

为什么重要

开源大模型的“拒答层”通常是一层对齐与安全策略,而非独立模块。通过微调或权重干预将其削弱,技术上并不新鲜,但把攻击性用途直接写进模型卡片,等于把这类模型从灰色地带推到平台规则的正中央。Hugging Face 作为模型托管和分发的基础设施,一直以低干预、开放托管为特征,主动下架属于少见操作。

这件事也暴露一个现实:开源模型一旦发布,权重可以被任意再加工。平台能管住仓库页面和命名,却管不住模型文件被复制、转存到其他站点。安全治理的边界,正在从“管模型”转向“管分发场景和公开描述”。

对用户/开发者/创作者的影响

对普通开发者和研究者而言,这次处理释放的信号是:模型本身的开放程度和模型卡片的表述方式,可能被平台区别对待。上传微调、合并或去对齐版本时,命名、用途描述、能力清单会直接影响审核结果。合规团队在评估开源模型时,也需要把“发布方是否标注攻击性用途”纳入风险判断,而不只是看基座模型。

对企业安全团队,@wquguru 的观点是:越狱大模型已成为内部对抗的新变量,本地部署可绕开平台的托管与下架机制,单纯依赖平台审核无法覆盖这一风险。

值得关注的后续

一是 Hugging Face 是否补充公开处置标准,明确哪些命名或用途描述会触发下架;二是这类去对齐模型是否会在其他托管渠道扩散,形成“此处下架、他处可用”的局面;三是监管和平台是否会要求模型卡片披露用途限制,把合规责任前移到发布环节。

来源:@wquguru

celebrityanime
celebrityanime
文章: 23804

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注