研究揭示AI Agent在处理敏感信息时存在泄露风险,对构建生产级Agent的程序员具有安全启示。
深度研究 Agent 越来越多地把本地私有文档与网页检索等外部工具结合起来,这带来了一项隐私风险:Agent 发出的外部查询可能泄露敏感信息。MosaicLeaks 提出了一项新的深度研究任务,其中的多跳问题会交错使用公开信息与私有信息。在我们测试的所有模型中,Agent 都频繁泄露私有信息,而只针对任务表现进行训练,反而会让问题变得更严重。我们提出了一种能够感知马赛克泄漏的 RL 训练方法——Privacy-Aware Deep Research(PA-DR)。它将严格链成功率(每一跳都回答正确的推理链占比)从 48.7% 提升到 58.7%,同时把答案泄漏/完整信息泄漏率从 34.0% 降低到 9.9%。
一家医疗保健公司的研究 Agent 正在处理一个常规问题。在这个过程中,它发出了几次看似普通的网页搜索:一次提到了某个云迁移里程碑,一次提到了 2024 年 1 月披露的安全事件,还有一次进一步缩小范围,试图确定究竟是哪家供应商遭到了攻击。单独看任何一条查询,都未必会泄露完整的秘密。但任何能够观察 Agent 出站流量的人,都可以重新拼合这些碎片:截至 2025 年 1 月,MediConn 已将 70% 的基础设施迁移到云端——而这个事实只存在于私有文档中。这就是马赛克效应,也是 MosaicLeaks 所关注的核心失效模式。
MosaicLeaks 把这些网页查询视为泄漏渠道:攻击者永远看不到私有文档,也看不到 Agent 的推理过程,只能看到不断累积的查询日志,并尝试从中推断企业的私有信息。
我们根据攻击者能够从观察到的查询中推断出什么,从三个方面衡量泄漏:
这三种泄漏代表了逐级上升的风险。意图泄漏会暴露 Agent 正在调查什么。答案泄漏意味着,对于攻击者手中已有的某个私有问题,查询日志包含的信息已经足以回答它。完整信息泄漏则是最严重的情况:观察者即使没有被告知要寻找什么,也能自行发现并陈述私有事实。
马赛克效应如何产生 MosaicLeaks 的三种泄漏指标:Intent(预测研究问题)、Answer(回答给定的、与私有文档有关的问题)和 Full-Information(陈述可验证为真的私有事实)。在这里,Agent 先后两次搜索 Lee's Market 在 2020 年的流量增长情况,泄露了自己的意图,随后又发出第三条查询来回答一个后续问题。单独看,每条查询都很正常;但把它们放在一起,观察者就能推断出答案是 15%,进而断言 Lee 的线上流量在 2020 年增长了 15%。
MosaicLeaks 包含 1,001 条多跳研究链,覆盖本地企业文档和一个受控的网页语料库。它的目标是创建这样一类任务:任务很可能诱使 Agent 泄露企业文档中的隐私信息,但又确实存在不泄漏信息的解法。
每条研究链都交错包含本地子问题和网页子问题。一个子问题的答案会成为下一个子问题中的桥接实体,因此 Agent 必须先检索本地信息,才能构造出下一条有用的网页查询。本地文档来自 DRBench 风格的企业任务,网页文档则来自 BrowseComp-Plus。最终的数据划分包含 559 条训练链、98 条验证链,以及 344 条来自未见过公司的测试链。
最后一跳网页查询本身并不天然包含任何私有信息,可以完全根据公开网页文档作答。然而,由于到达这一跳的路径依赖私有的本地事实,如果查询继续携带“MediConn”“70%”和“January”等信息,就会为攻击者提供足够的上下文,使其还原出内部信息。
我们采用了一个改编自 DRBench 的简化 Agent 框架。模型会用简短的答案和理由回答每个子问题,这让我们可以通过标准化字符串匹配,逐跳评估结果。
在每轮迭代中,模型可以使用四种工具。Plan 生成本地搜索查询和网页搜索查询,执行查询后,以文档卡片的形式返回结果。Choose 选择要读取的检索文档。Read 尝试并行读取每一份选中的文档,并据此回答当前这一跳的问题。Resolve 决定是直接回答、读取更多文档,还是规划下一次搜索。
一次 Agent rollout。每一行代表一跳,并标注为本地(L)或网页(W),同时显示该跳被接受的答案。彩色区块展示了这一跳在规划、检索、选择、读取和解析阶段分别消耗的实际时间。
最显而易见的解决办法,就是直接提出要求。在 Plan prompt 中加上一句话,告诉 Agent 不要发出会泄露本地信息的网页查询,然后观察这对任务表现、泄漏情况和查询行为会产生什么影响。
对于某些模型,这条 prompt 会带来轻微改善,但效果并不稳定,而且仍然存在大量泄漏。它也经常对任务表现产生负面影响。对于 Qwen3-4B,这条 prompt 将答案泄漏/完整信息泄漏率从 34.0% 降到了 25.5%,但严格链成功率也从 48.7% 降到了 44.5%。从行为变化来看,主要区别似乎只是模型发出的网页查询变少了,而不是它能够持续构造出更安全的查询。
加入或不加入 prompt,要求模型避免发出可能泄露本地信息的网页查询时,对严格链成功率和隐私泄漏的影响。对于某些模型,这条 prompt 能够小幅降低泄漏,但仍然存在大量泄漏。
在开展隐私训练之前,我们先尝试了最显而易见的做法:只训练 Agent,让它能够正确解决更多研究链。这个办法确实有效。严格链成功率从 48.7% 提升到了 59.3%。但答案泄漏/完整信息泄漏率也随之上升,从 34.0% 增加到了 51.7%。模型学会了在网页查询中塞入更多上下文,这有助于它检索到正确的文档,却损害了隐私,因为每一条信息更丰富的查询,都会向观察者多暴露一块碎片。
这正是 MosaicLeaks 揭示的核心矛盾。信息更丰富的查询,往往更有利于完成任务,却更不利于保护隐私。PA-DR 的目标,就是同时兼顾这两个方面。
PA-DR 结合了两种奖励。
第一种是情境任务奖励。一次研究轨迹可能包含数十次模型调用,因此,如果让所有调用共享同一个最终轨迹分数,所提供的 credit 就会非常微弱:一次成功的运行可能强化了有泄漏风险的搜索,一次失败的运行也可能惩罚某个局部上其实很合理的决策。为此,我们不再对整条轨迹统一评分,而是把每次调用与处于同一阶段、同一跳,并且掌握相同信息的其他调用进行比较。如果一次 Plan 调用搜索了正确的信息源并检索到正确文档,就会获得奖励;如果正确文档已经在手,那么它不再重复搜索也会获得奖励。如果一次 Choose 调用选中了包含答案的文档,它就会获得奖励。我们之所以训练这些阶段,是因为它们的目标行为可以得到直接验证。
第二种是学习得到的隐私奖励。每当 Agent 生成网页查询时,一个 Qwen3-4B 分类器会评估两类风险:当前查询是否直接泄露了私有信息,以及把这些查询添加到现有查询日志之后,是否会产生新的马赛克泄漏。PA-DR 会对两者中较高的风险进行惩罚,从而把隐私代价精确归因到那个使查询日志暴露更多信息的规划决策上。
仅针对任务进行 RL,可以提升研究表现,但也会增加泄漏。PA-DR 在保留几乎全部性能收益的同时,大幅减少了泄漏。
9.9% 甚至低于未经训练的基础模型自身 34.0% 的泄漏率。隐私训练并不只是抵消性能训练额外引入的泄漏。训练完成后,Agent 的泄漏程度比最初还要低。
而且,它并不是单纯通过减少搜索次数来变得更安全。实际上,PA-DR 发出的网页查询比基础模型更多,但这些查询会删去容易暴露信息的细节:比如“15%”或“2024”这样的具体指标,以及能够暗示它正在寻找哪一类答案的线索。Agent 依然能够找到正确的公开文档,只是不再把私有信息碎片一路携带到查询文本中。
情境奖励在训练过程中还会再次发挥作用。由于它比较的是相互匹配的调用,而不是只为整次 rollout 打一次分,因此可以更精确地分配 credit,不需要单独的 value model,也不需要对齐不同 rollout 之间的步骤索引。它的样本效率也高得多:使用情境任务奖励时,只需 outcome-only RL 大约五分之一到六分之一的生成训练样本,就能达到相同的任务表现;而 PA-DR 在加入隐私收益的同时,也保留了这种效率优势。
训练效率。最后一列表示每种方法达到约 55% 的严格链成功率所需的生成样本数量。数值越低越好。
情境奖励只需大约五分之一到六分之一的生成样本,就能达到 outcome reward 级别的任务成功率。PA-DR 在保留样本效率优势的同时,大幅降低了泄漏。
MosaicLeaks 是一个受控 benchmark,并不是对已部署系统中实际泄漏情况的测量。企业文档是合成的,网页语料库是固定的,研究链覆盖三个公司场景,而且所有结果都来自同一个 Agent 框架;这个框架执行的是多跳问答,而不是开放式研究。正是这种可控性,让我们能够逐跳衡量泄漏,但更广泛的任务、真实部署环境以及其他 Agent 设计,仍然需要分别进行研究。
结论很简单:你无法仅靠 prompt 让 Agent 获得隐私保护能力,必须通过训练把这种能力教给它。只是告诉 Agent 要小心,几乎不会带来实质变化;而针对它构造每条查询的方式给予奖励,可以将泄漏降低到原来的三分之一以下,同时基本维持任务成功率不变。马赛克效应源自 Agent 随着时间推移进行搜索的方式,而事实证明,这恰好是一种可以被测量、被分配 credit,并通过训练降低的行为。
@misc{gurung2026mosaicleaks,
title = {MosaicLeaks: Privacy Risks in Querying-in-the-Open for Deep Research Agents},
author = {Alexander Gurung and Spandana Gella and Alexandre Drouin and Issam H. Laradji and Perouz Taslakian and Rafael Pardinas},
year = {2026},
eprint = {2605.30727},
archivePrefix = {arXiv},
url = {https://arxiv.org/abs/2605.30727}
}
关于马赛克效应的研究非常精彩。它让我开始思考,当 Agent 被部署到主动威胁情报或软件审计场景中时,PA-DR 的表现会如何。例如,如果一个企业研究 Agent 的任务是分析潜在的安全攻击面,或者从 https://toemodapk.com 这类存储库中逆向分析第三方移动应用,那么它的网页查询日志很容易向外部观察者泄露专有的内部应用版本,或具体的设备合规标准。在深度网页检索过程中,教会 Agent 清除这些粒度很细的技术标识符,将对运营安全产生极其重要的影响。
我可以在 https://farzaneganehooshmand.com 使用这个吗?还是说它有某种许可证限制?
· 注册或登录后发表评论