IIT Bombay 和 Adobe 联合研究提出「前 token 预测」方法,无需访问模型权重即可从输出重建 prompt,对依赖专有 system prompt 的系统构成安全威胁。
IIT Bombay 和 Adobe Research 的研究人员开发了一种方法,仅使用文本输出就能以近乎完美的准确率重建输入给大语言模型的 Prompt。该方法无需访问模型权重,甚至适用于第三方模型。
大语言模型通过逐 token 预测下一个最可能的词来生成文本。长期以来,从输出反推并重建原始 Prompt 被认为是不切实际的,因为许多不同的 Prompt 可以产生相似的响应。
IIT Bombay 和 Adobe Research 的研究人员在一篇新论文中表明,这一操作可以以惊人的准确率完成。他们的方法叫做"Previous-Token Prediction"(PTP),逆转了语言模型的工作方式。研究人员不再预测下一个 token,而是训练一个逆语言模型来预测之前的 token。
这个逆模型完全从零开始在目标 LLM 合成的生成数据上训练。它只需要生成的文本。
逆模型还可以通过调整解码参数生成多个含义不同的 Prompt 变体。所有这些重建的 Prompt 重新输入原始语言模型时,会产生相似的响应。
论文中的一个例子中,Prompt"How to reach out to competitors to find their pricing strategies?"被逐字重建。该模型还生成了六个额外变体,这些变体捕捉了核心含义但使用了不同的措辞,例如"What tactics can a company looking to reach out to competitors in the market use to find their pricing strategy?"

使用真实用户 Prompt 的测试也显示了准确的重建效果。当研究人员将重建的 Prompt 重新输入前向模型时,响应与原始响应高度匹配。

在一个小型 Qwen-3-0.6B 聊天机器人上训练的逆模型,也能够从 GPT-4o 的响应中重建 Prompt。重建的 Prompt 与原始 Prompt 不完全相同,但根据论文,它们捕捉到了含义和意图。潜在攻击者甚至不需要知道给定输出是由哪个模型生成的。
这造成了一个广泛的安全问题。企业面临暴露专有系统 Prompt 的风险,这些 Prompt 包含商业机密、审核规则或专业指令。个人用户面临类似威胁,因为个人或敏感查询也可能从输出中被提取。一个小型的开源反转模型就足以完成这一操作。
论文本身没有明确声明对商业系统的攻击。但如果该方法适用于当前的生产模型,AI 实验室将需要迅速处理并修补这一问题。
AI News Without the Hype – Curated by Humans
Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.
Read on for the full picture.Subscribe for hype-free coverage.
Full access to every article on THE DECODER
Join the comments and community discussions
A weekly AI news recap via mail
6x/year: "AI Radar" — deep dives on the AI topics that matter most
Daily AI news, always up to date
Our full ten-year archive
Covered by a team with 10+ years in AI