新技巧揭秘AI模型的内心想法

德国图宾根大学等机构研究者发现一种“换小模型套话”的方法,可以解开 OpenAI、Anthropic、Google 等前沿模型被隐藏的“思维链”推理过程,甚至读取其中的密码和 API 密钥。相关漏洞已被部分修复,但技术演示让模型蒸馏和隐私泄露问题再次成为焦点。

一句话看懂:德国图宾根大学等机构研究者发现一种“换小模型套话”的方法,可以解开 OpenAI、Anthropic、Google 等前沿模型被隐藏的“思维链”推理过程,甚至读取其中的密码和 API 密钥。相关漏洞已被部分修复,但技术演示让模型蒸馏和隐私泄露问题再次成为焦点。

事件核心:发生了什么

本次研究由德国图宾根大学、马克斯·普朗克研究所、AI 安全机构 MATS Research 和安全公司 Snyk 共同完成。研究者 Alexander Panfilov 等人发现,用户通过 API 访问前沿大模型时,模型会把加密的推理过程发送到本地设备,以分担一部分计算压力。研究人员把这段加密推理内容转交给同一系列中更小、也更便宜的模型,由于小模型使用相同的解密机制、但安全对齐训练更少,它们更容易“说出”隐藏的内部推理内容。

利用这个方法,研究者不仅还原了 OpenAI、Anthropic、Google 部分前沿模型解决复杂问题时的思维链,还从推理痕迹中提取到密码、API 密钥等敏感信息,并将漏洞上报给了三家厂商。目前三家公司的 API 已做出缓解,但研究者表示,某些推理痕迹仍有望通过同类方法获取,彻底修复需要重构 API 的运行机制。

论文还对比了多家开源权重模型,发现月之暗面(Moonshot AI)的 Kimi K3 在某些提示词下,输出的推理过程与 Claude Opus 4.8 和 GPT 5.6 Sol 的隐藏推理痕迹高度相似。但研究者明确表示,这项工作不能证明 Kimi K3 是通过蒸馏方式训练出来的。DeepSeek 和 Thinking Machines 公司的 Inkling 模型则没有表现出这种相似性。

为什么重要

这暴露了当前 API 安全设计中的一个结构性矛盾:为了降低计算成本,模型供应商必须把部分推理过程发送到用户设备端;但这些加密信息并不能真正防止被提取。更关键的是,它把“蒸馏”攻击的可能性提升到了新高度。过去闭源模型厂商靠隐藏思维链来阻止别人复制能力,而这项技术意味着,只要能调用小模型,就可能还原大模型的内部推理逻辑,用于大规模蒸馏训练。

这也会影响中美 AI 竞争中的争议叙事。OpenAI 曾在 2 月向美国立法者表示 DeepSeek 可能复制了其模型,Anthropic 也在 6 月提出类似质疑。虽然目前公开信息不能证明中国公司使用了这种具体方法,但研究者指出,这种技术让从闭源模型中提取训练信息的效率远超以往,蒸馏争议可能会进一步加剧。

对用户/开发者/创作者的影响

对普通用户来说,影响相对间接,但值得注意:如果你在 API 提示词中贴入密码、API 密钥、私人文档或商业数据,这些内容一旦进入模型推理过程,就可能从“隐藏”的思维链中被提取出来。即使本次涉及的漏洞已缓解,开发者仍应避免在请求中直接发送高敏感凭证,并在调用大模型 API 时假设推理内容无法被完全隐藏。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对开发者而言,这项研究也提示:选择更小参数模型时,不能默认“更便宜”等于“更安全”。小模型因为对齐训练较少,可能成为攻击面。对使用闭源 API 的团队来说,应关注服务商对推理链加密和访问控制的实际实现,而不是只看模型最终输出。

值得关注的后续

首先,OpenAI、Anthropic、Google 是否会在新版本中彻底重构 API 计算卸载机制,还是继续采用“短期缓解 + 持续补丁”的方式,值得跟踪。

其次,该技术是否会被用于实际蒸馏攻击,以及能否从相似推理模式中找出更确凿的因果证据,将直接影响行业对模型抄没抄、怎么抄的讨论。

最后,安全社区和 AI 公司之间如何协调漏洞披露、以及各国监管是否会因此对大模型 API 提出更高的数据保护要求,也是未来几个月需要观察的重点。

来源:<a href="https://www.wired.com/story/a-new-trick-reve

celebrityanime
celebrityanime
文章: 18311

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注