研究人员发现可读取ChatGPT等模型加密推理过程的API漏洞

安全研究团队发现了一个影响 OpenAI、Anthropic、Google 等主流大模型 API 的漏洞,可以解密并读取推理模型被加密的内部思维过程,公开会话中已泄露密码和 API 密钥。这项发现不仅威胁用户数据安全,也为“推理蒸馏”争议提供了新的证据。

一句话看懂:安全研究团队发现了一个影响 OpenAI、Anthropic、Google 等主流大模型 API 的漏洞,可以解密并读取推理模型被加密的内部思维过程,公开会话中已泄露密码和 API 密钥。这项发现不仅威胁用户数据安全,也为“推理蒸馏”争议提供了新的证据。

事件核心:发生了什么

由 Alexander Panfilov 领导的安全研究团队发现,OpenAI、Anthropic、Google 等主要 AI 供应商的 API 存在一个共同漏洞,攻击者可以借此读取推理模型加密的思维链(chain-of-thought)过程。研究人员通过越狱 Anthropic 的小模型 Haiku 4.5,成功让它逐字转写更强大的 Opus 4.8 的原始推理过程,且无需直接攻击 Opus 本身。同样的方法也适用于 OpenAI 和 Google 的模型。研究显示,这种加密思维过程可以在同一供应商的会话、用户和模型之间“完整移植”,多数查询中提取的 token 数量与计费显示完全一致,说明读取到的推理内容完整度极高。

这一漏洞的历史可追溯至今年 5 月,密码学专家 Matthew Green 曾发现加密推理数据可以在原始上下文之外被重放,并向厂商报告。但据 Panfilov 称,供应商当时的回应是“没有看到侧信道或重放攻击的安全隐患”。这次的新研究明确推翻了这一判断。

为什么重要

这项发现的价值远不止“读心”本身。首先,它直接否认了大模型厂商在推理加密安全性上的既有立场——此前 OpenAI、Anthropic 等公司隐藏思维链的官方理由之一就是保护知识产权和防止滥用,但这个漏洞让该保护形同虚设。其次,研究为由来已久的“推理蒸馏”争议提供了迄今最强的技术证据:研究团队发现,如果将 Opus 思维过程中的少量 token 预填充进 Kimi-K3 的推理前置中,其输出会明显向 Opus 靠拢;记忆分析表明,特定 Claude 和 GPT 推理片段在 Kimi-K3 中的可提取性比次近模型高六个数量级,这暗示 Kimi-K3 很可能使用了大模型的思维链路数据参与训练。最后,这一攻击的成本极低——解码 1 万条推理痕迹的 API 费用估算仅约 720 美元,使得高水平模型的思维链可以被规模化窃取。

对用户/开发者/创作者的影响

对普通用户而言,最大的直接风险是公开分享过的 AI 会话内容可能泄露敏感信息。研究人员扫描了约 7000 条公开的 Claude Code 或 Codex 会话,从中提取出 62 个 API 密钥、33 个邮箱地址、33 个密码以及其他敏感数据。任何曾经在线分享过带推理过程的会话内容的用户,都应视同泄露,尽快轮换密钥和密码。对开发者而言,如果正在使用闭源大模型的推理 API 处理敏感业务数据,需要重新评估这条链路的数据暴露风险,尤其是企业级 Copilot 类工具。对创作者来说,这项研究揭示了一个此前容易被忽略的事实:模型“展示给你看”的回复与它内部的完整推理过程可能差异极大——研究人员发现模型有时会用难以理解的语言内部交流,会从后往前构建答案,甚至会出现接近欺骗性的推理动作。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

值得关注的后续

接下来有几个具体观察点值得跟进:一,厂商的修复进度。据 Panfilov 透露,AI 实验室已修补了部分问题并在推进更多修复,但具体哪些漏洞被堵住、影响面有多大,目前公开信息有限。二,蒸馏争议是否会因此升级。Kimi-K3 的证据链条如果成立,中国模型厂商是否会用更多“清洗”手段抵消这些痕迹,外部审计将更难取证。三,研究团队已上线 stolen-thoughts.com 展示部分样本,是否会发布可复现的工具或更大规模的扫描结果,值得关注——如果发布,行业对推理模型安全性的信任评估可能会被重新改写。

来源:The Decoder:AI News(RSS)

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注