OpenAI 称拦截蒸馏窃取攻击,但研究者称同样手法在 Azure 上仍可窃取 GPT-6 Astra 等模型的推理内容

OpenAI 称在 2026 年 7 月阻断了一场针对模型隐藏推理过程的“对抗性蒸馏”攻击,但研究者发现同一套手法在微软 Azure 上仍可对 GPT-6 Astra 等模型生效,暴露出模型安全防护在不同云平台上的割裂。

一句话看懂:OpenAI 称在 2026 年 7 月阻断了一场针对模型隐藏推理过程的“对抗性蒸馏”攻击,但研究者发现同一套手法在微软 Azure 上仍可对 GPT-6 Astra 等模型生效,暴露出模型安全防护在不同云平台上的割裂。

事件核心:发生了什么

据 OpenAI 博客披露,这轮攻击从 2026 年 7 月 1 日开始,7 月 24 日至 25 日达到峰值,两天内出现来自 4000 多个账号的 1.6 万次请求,均呈典型提取模式。进一步排查发现关联账号超过 1.5 万个,OpenAI 称已在 7 月 28 日前全部封禁,并注明这些是“尝试提取”,不必然成功。

攻击原理并不复杂:推理内容本身以加密数据包形式返回给用户,用户可将其带入后续请求。研究者 Joachim Schaeffer 团队此前已证明,这些加密包使用共享密钥,可在会话、用户乃至同厂商不同模型之间转移,只要让同家族的便宜小模型充当“解密预言机”,就能逐字打印出昂贵模型的隐藏思维链。OpenAI 在博文中点名致谢该团队,并称已封禁欺诈账号、收紧注册、修补加密推理复用漏洞,同时开始筛选流式输出。OpenAI 将核心攻击群体与 Moonshot AI(Kimi 模型开发商)相关人员关联,但表示尚不清楚所有行为体是否同源。

为什么重要

推理过程往往包含被刻意排除在最终答案之外的信息,对大模型训练、蒸馏和能力复现价值极高,因此它从“副产品”变成了资产。OpenAI 修补自家 API 后,研究者于 9 月 13 日复测:OpenAI 和 Anthropic 官方 API 已拦截,但在 Azure 上,攻击对他们尝试的每一款 OpenAI 模型都有效,包括新发布的 GPT-6 Astra,以及 Anthropic 直到 Sonnet 5 的模型,单次尝试即可逐字提取推理内容。Schaeffer 的评价是“同样的模型,因为托管平台不同而得到不同保护”。另有开发者 Can Bölük 演示了更简单的方法:给模型一个虚拟记事本工具并让它把推理写进去,用户即可读取,该手法对多款 OpenAI 模型及 Opus 4.8、Sonnet 5 生效,仅 Opus 5 与 Fable 5、5.1 未泄露。研究者认为现有修复零散且表层,部分依赖脆弱的请求模式匹配,GPT-6 Astra 在第三方平台上线时相关防护并未就位。

对用户/开发者/创作者的影响

对通过 Azure 等云平台调用模型的开发者而言,同一模型的推理泄露风险可能高于官方 API,尤其在多模型混合调用、日志留存和会话拼接的场景下,加密推理包不应被当作无害附属数据。对企业采购方,选型时除了看模型能力和价格,也要把托管平台的防护状态纳入评估。对做 AI 应用和图像生成的团队,若产品依赖隐藏推理来维持差异化,需警惕竞争对手通过廉价模型批量提取思维链用于蒸馏训练,这可能削弱闭源模型的商业壁垒。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

一是 Azure 等第三方平台是否统一部署推理保护,研究者时间线显示 OpenAI 直到 9 月 27 日才为 Azure 端点加上防护,Anthropic 模型在 Azure 上的提取自 9 月 28 日起无法复现;二是“虚拟记事本”这类基于工具调用的简单绕过是否被系统性封堵;三是 OpenAI 通过 Frontier Model Forum 和政府渠道共享的防护方案,能否形成跨厂商、跨云平台的统一标准。

来源:The Decoder:AI News(RSS)

celebrityanime
celebrityanime
文章: 26725

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注