宾州州大研究发现,AI系统在压缩长对话时会丢弃大量用户指令(如审批流程限制),研究团队基于Qwen3.5-9B提出保留超90%规则的附加模块方案。
AI 模型在压缩上下文时会悄悄丢弃用户指令。平均只有 17% 的指令能在压缩后存活。一个小型附加 LLM 可以解决大部分问题。
当用户运行长对话而不开启新聊天时,AI 模型的上下文窗口会成为瓶颈。我们已经讨论过上下文管理对输出质量的重要性,但这对普通用户来说难以触及——他们只是把所有内容都丢进一个聊天窗口然后不断回溯。正因如此,AI 实验室开发了上下文压缩技术,即所谓的"compaction",它通过总结现有对话历史来释放空间。代价是这个过程不可避免地会丢失细节。
宾夕法尼亚州立大学的研究人员如今系统地研究了哪些细节会丢失,以及损失究竟有多严重。
损失最大的是研究人员所谓的"会话约束"(session constraints)。这些规则旨在管理 AI 系统在会话期间的行为,例如"在做出任何更改之前先向我确认"或"不要在你的回复中使用我的名字"。它们不属于实际任务,也不是永久性的系统指令,只适用于当前会话。
这使得它们非常脆弱。压缩系统的设计目的是保持任务连续性——保留目标、当前状态和下一步操作,而用户强加的附带条件则被丢弃。
如果有人说"未经我批准不要发送任何邮件",那么在压缩之后,Agent 很可能就会恰恰相反地发送邮件。这既是质量问题,也是安全问题。Agent 可能会执行未经授权的工具调用、泄露被隐瞒的信息,或跳过用户明确要求的验证步骤。
用户告诉 Agent 在采取任何行动之前先确认(A)。压缩后这条规则被丢弃(B),Agent 在未经询问的情况下修改了日历条目(C)。| 图片来源:Wang et al. (2026)

为了衡量这种损失,研究人员引入了一个名为 COMPINT 的评估套件。平均只有 17% 的注入会话约束在压缩后存活。大多数测试的压缩器配置实际上比不使用压缩时表现更差,不过 GPT-5.4-mini 在某些场景下优于基线。
根据该研究,当 Agent 获得完整的、未压缩的上下文且用户约束得以保留时,规则遵守率在 59% 到 71% 之间。压缩后,大多数测试压缩器的遵守率急剧下降,通常只略高于完全未给出约束时的水平。更具针对性的压缩提示有所帮助,但无法弥合差距。研究人员表示,即使是一个专门为保留用户约束而设计的提示,保留率也不到 40%。
研究人员表示,真正有效的是一个小型附加模块,它与主压缩系统并行运行。它基于紧凑型语言模型 Qwen3.5-9B 构建,读取每个用户输入以检测会话约束,并将它们收集到一个单独的列表中。当上下文稍后被总结时,该模块会将该列表附加到摘要中,从而保留用户的规则。
根据该研究,提取器在所有三个测试场景中的保留率都超过 90%。具体分解为:Agent 轨迹 95.6%、长期研究任务 95.1%、多轮聊天 90.3%。它无需训练,也无需更改压缩系统本身。
COMPINT 评估套件和提取器已在 GitHub 上开源。
AI News Without the Hype – Curated by Humans
Subscribe to THE DECODER for ad-free reading, a weekly AI newsletter, our exclusive "AI Radar" frontier report six times a year, full archive access, and access to our comment section.
Read on for the full picture.Subscribe for hype-free coverage.
Full access to every article on THE DECODER
Join the comments and community discussions
A weekly AI news recap via mail
6x/year: "AI Radar" — deep dives on the AI topics that matter most
Daily AI news, always up to date
Our full ten-year archive
Covered by a team with 10+ years in AI