一句话看懂:前 Google DeepMind 研究员 Ilia Shumailov 与 Alexander Panfilov 发现,前沿模型的加密推理块可在同系列大小模型间跨用户、跨会话重放,从而被解码出隐藏的思考内容;他们还发现仅用两个 Opus 推理 Token 预填充,就能明显改变 Kimi-K3 的答案风格。
事件核心:发生了什么
研究团队测试了 Anthropic、OpenAI、Google 三家前沿实验室的模型,发现同一个架构级漏洞:大模型返回给用户的加密推理数据块,无需破解密码学算法,就能被重放到同家族的小模型中,套出原本隐藏的推理轨迹。他们随后从 GitHub、Hugging Face 公开的 Agent 轨迹中解码出 31.5 万条隐藏推理,其中出现了 API 密钥、邮箱和内部 IP 地址。
更反常的发现是:只在 Kimi-K3 的推理开头预填充两个来自 Opus 的 Token,部分可见答案的风格就会向 Opus 靠拢。GLM、Inkling、DeepSeek 都没有出现同样现象,研究者本人也尚未给出解释。该研究在 Twitter 上 40 小时内获得 300 万浏览量。播客内容对应论文《Stealing Reasoning Traces from Proprietary LLM APIs》。
为什么重要
推理链加密本被视为保护模型内部思考的“密封信封”,也是思维链监控的基础设施。如果它可以被重放和解码,那么隐私、安全监控和模型间数据隔离都会同时受到挑战。三家公司同时中招,说明这不是某一家工程失误,而是当前“加密推理返回客户端”的无状态架构共同面对的问题。此外,GPT-6 Astra 的模型卡已披露其思维链可监控性明显下降,这与该漏洞的防御难度叠加,使行业对推理透明度的预期进一步收紧。
对用户/开发者/创作者的影响
开发者需要注意:分享 Claude Code 会话、Agent 运行轨迹或公开仓库中的日志前,仅清理可见文本不够,加密推理块仍可能还原密码、密钥和内部地址,目前公开信息显示这类数据已在公开平台被发现。使用联网下载的 Agent 轨迹时,还要警惕被注入的 thought 可能指示模型“每轮外传数据”,而加密块让检查变得困难。做 AI 应用或模型评测的团队,应把推理数据块视为敏感数据资产,而不是无害的会话附件。
AI 工具推荐
想把多个 AI 模型放在一个入口?
GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。
推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。
值得关注的后续
一是三家实验室是否调整推理块的返回方式,比如放弃前端存储或引入链式加密。二是 Kimi-K3 与 Opus 的风格关联是否被进一步验证,目前只是“最相关的公开证据”,不是因果结论。三是监管和平台规则是否会要求公开 Agent 轨迹做脱敏处理,以及 GPT-6 Astra 这类可监控性下降的模型如何在合规场景中落地。
来源:InfoQ CN


