一句话看懂:美国初创公司 Abliteration.ai 把“去除开源大模型安全拒绝机制”做成了按 API 调用的商业服务,公开售卖经过改造的 GLM-5.3 模型。安全测试有真实需求,但“开箱即用”的越狱服务也让滥用门槛大幅降低。
事件核心:发生了什么
8 月底,美国初创公司 Abliteration.ai 推出了一款名为“abliterated-model-large-v2”的模型服务。该服务基于智谱开源模型 GLM-5.3,通过名为“abliteration”的技术,定位并抑制模型内部触发“拒绝回答”的激活模式,从而大幅减少模型对敏感请求的拒答。与普通提示词越狱不同,这种修改直接作用于模型权重本身。
该公司并未公开下载修改后的模型权重,而是以托管 API 的形式提供商业访问,定价为每百万输入或输出 Token 5 美元。Abliteration.ai 声称,修改后的模型在编程、网络与智能体任务上能力基本保留。其内部测试显示,GLM-5.3 修改版在 CyberGym 基准上得分为 84.5%,在 Terminal-Bench 4.0 上为 41.8%,并在两小时内解决了 105 项 ExploitGym 任务。不过,这些成绩并未全面领先,例如 GPT-5.5 在 CyberGym 上得分更高(85.6%),该公司也承认不同基准的测试环境与算力预算存在差异,结果不宜直接对比。
为什么重要
这一事件的核心在于将“安全措施移除”产品化了。此前,类似的模型改造多由开发者在 Hugging Face 等平台自行发布,技术门槛限制了使用者范围。Abliteration.ai 将这一过程打包成按量计费的“开箱即用”服务,意味着不具备模型微调能力的团队,也能以极低成本调用一个“无安全护栏”的强模型。
从市场角度,网络安全测试、红队演练与大模型智能体攻击面评估确实存在真实需求。该创业公司创始人透露,早期客户主要来自大型机构与银行,用于测试其部署的 AI 智能体在遭受提示词注入或越狱攻击时的真实反应。但该服务“零留存、低门槛”的属性构成安全悖论——合法安全人员能用的工具,攻击者同样能直接调用。此外,该商业模式高度依赖开源许可的宽松条款。Z.AI 的 GLM-5.3 采取开放权重且允许商业化衍生与托管服务,正是 Abliteration.ai 能够将其改造并转售的前提。
对用户/开发者/创作者的影响
对于大模型开发者与企业安全团队而言,这类服务可能成为评估自研或第三方智能体安全性的备选工具。特别是在银行等高风险场景中,针对智能体的对抗性测试需要尽可能模拟真实的攻击路径,传统的“拒答型”模型反而限制了测试的深度。普通企业采购方需注意合规边界:使用“去除护栏”模型生成的恶意代码或攻击材料,是否适用于内部安全评估,仍取决于所在地区的法律与行业监管要求。目前公开信息显示,Abliteration.ai 的服务默认拦截涉及儿童性内容的问题,并承诺不存储用户的提示词与模型回复,但对其他危险内容类别仍高度开放,使用方需自行评估业务风险。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
接下来有几个具体观察点值得跟踪。其一,Abliteration.ai 是否会因需求增长而扩大开源模型支持范围,例如将 Qwen、DeepSeek 等同样具备宽松许可的模型纳入改造对象,这将直接影响开源安全生态的走向。其二,Z.AI 是否会针对此类衍生服务调整开源许可条款,或在 GLM-5.x 后续版本的训练中重新设计“拒绝机制”的加固方式。其三,随着 Abliteration 技术逐步走向标准化,面向普通开发者的“可控去护栏”开源工具是否会增加,进而引发开源社区与 AI 安全政策之间更深层的冲突。


