研究人员现可从输出文本近乎完美地逆向还原 LLM 提示词

印度理工学院孟买分校与 Adobe Research 的研究人员提出了一种名为“Previous-Token Prediction”(PTP)的方法,仅凭大语言模型生成的输出文本,就能以近乎完美的准确率逆向还原原始提示词,整个过程无需访问模型权重,甚至对第三方模型也有效。这项研究把“提示词泄露”从理论风险变成…

一句话看懂:印度理工学院孟买分校与 Adobe Research 的研究人员提出了一种名为“Previous-Token Prediction”(PTP)的方法,仅凭大语言模型生成的输出文本,就能以近乎完美的准确率逆向还原原始提示词,整个过程无需访问模型权重,甚至对第三方模型也有效。这项研究把“提示词泄露”从理论风险变成了一种低成本、可复现的攻击手段。

事件核心:发生了什么

根据 The Decoder 报道,研究团队训练了一个“逆向语言模型”,它不再预测下一个 token,而是预测前一个 token,从而从生成的文本反推输入提示词。这个逆向模型完全在目标 LLM 的合成数据上从零训练,唯一需要的输入是模型生成的文本,不依赖目标模型的内部结构和参数。

论文显示,在测试案例中,原提示词“How to reach out to competitors to find their pricing strategies?”被逐词还原,同时模型还生成了六个语义相近但措辞不同的变体,这些变体在重新输入原模型后能产生相似输出。更值得警惕的是跨模型迁移能力:在小型开源模型 Qwen-3-0.6B 上训练的逆向模型,也能从 GPT-4o 的文本输出中还原出语义核心,这意味着攻击者甚至不需要知道目标文本来自哪个模型。

为什么重要

这项研究把大模型的安全讨论从“注入攻击”扩展到了“提示词提取”这个方向。过去一般认为,同一个提示词可以产生多种不同输出,因此从文本反推提示词几乎不可能。PTP 方法通过训练专门的逆模型打破了这种假设,让企业部署在 API 背后的专有系统提示词、审核规则、业务指令面临直接暴露风险。

对 AI 服务提供商而言,提示词往往承载着产品核心逻辑,例如定制化的角色设定、检索增强生成(RAG)中的指令路由、内容审核边界等。一旦这些指令可以通过输出文本被批量重建,闭源模型在提示词层面的“隐藏”就形同虚设。Adobe Research 参与其中,也说明这类技术不仅有学术价值,也跟商业化产品中的内容安全、版权保护和数据合规直接相关。

对用户/开发者/创作者的影响

对开发者来说,PTP 方法的门槛并不高:论文给出的方案基于小规模开源模型和合成数据训练,意味着中小团队也有能力实现。依赖第三方 API 的开发者需要重新评估:如果上游模型服务商不修复这类风险,你的应用逻辑就可能通过输出文本被竞品或攻击者逆向。

GamsGo AI

AI 工具推荐

想把多个 AI 模型放在一个入口?

GamsGo AI 集成 ChatGPT、DeepSeek、Gemini、Claude、Midjourney、Veo 等常用模型,适合写作、绘图、视频和日常 AI 工作流。

了解 GamsGo AI

推广链接:通过此链接购买,我可能获得佣金,不影响你的价格。

对普通用户而言,个人隐私类查询(健康、财务、法律等敏感问题)即使经过模型处理后对外输出,也可能被逆向还原出原始提问意图,这改变了以往“只公开输出结果、不公开输入”的安全假设。而创作者和企业如果使用大模型生成文案、代码或内部文档,也需要意识到输出内容可能反向暴露产品内部提示词。

值得关注的后续

目前公开信息显示,论文并未披露对主流商业模型的完整攻击案例,实际生产环境中的防御效果还有待验证。有三点值得持续观察:第一,PTP 方法能否在更大的生产级模型(如 GPT-4o、Claude、Gemini)上复现同等精度的还原效果;第二,闭源 API 提供商是否会通过输出扰动、检测异常生成模式等方式推出针对性防护;第三,开源生态是否会迅速出现基于 PTP 的简易工具,把这种攻击能力扩散给普通用户,从而加速安全补丁的落地节奏。

来源:The Decoder AI News

celebrityanime
celebrityanime
文章: 18306

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注