学术研究模拟 50 个采购 Agent 各有 5 万美元限额,却因同一价格警报同步买入导致 tenant 级别超支 2.4 倍,千个 Agent 规模可达 48 倍超支,揭示了局部护栏无法约束全局风险的组合失效问题。
MPI-SWS 的 Bardia Mohammadi 和 Laurent Bindschaedler 在 2026 年 8 月 31 日发布了 arXiv 2609.00275,收录于 SOSP 的 Agentic OS workshop。这是一项受控研究,而非生产级运行时。最引人关注的数据是组合失效。
他们模拟了 50 个采购 Agent。每个 Agent 在单 Agent 限额下最多可下达 $50k 的供应商订单。租户在单个交易日内可承受 $250k 的未对冲风险敞口。在平静的日子里,这个额度足够。但当共享的价格飙升警报出现时,"立即买入"成为所有 Agent 同时的理性选择。
每笔采购都通过了本地限额检查。但在 300 次有种子数据的运行中,本地闸门在每一次都导致了超额支举,平均达到 2.4 倍。将 Agent 规模扩展到一千个而保持同样的 $250k 额度,超支达到 48 倍。预算分类账在提交前收取残余损失并拒绝边际效应,在各种规模下都保持在限额内。
我在更小规模中不断看到同样的形态。五个编码 Agent,每个都被允许打开一个 PR、在绿灯时合并或升级依赖。每个都在策略范围内。它们都因同一封 CVE 邮件同时醒来。你想要五次 review。结果得到了五次合并。
计数调用没有帮助。一个已取消的草稿、一笔已完成的订单、一份已签署的合同,退款后的残余损失并不相同。把每次工具调用都当作一个单位来处理的控制,要么在不可逆的操作上不安全,要么过于保守导致日常工作无法进行。
反应式断路器同样姗姗来迟。在论文中,一个在观察到损失达到限额时才跳闸的断路器,在即时观察的情况下最终仍达到 1.03 倍,如果观察滞后 50 个时间单位则达到 2.2 倍。不可逆的影响已经发生。预留必须在工具返回之前完成。
他们还将一笔 $1.5M 的转账拆分成多个子限额订单。本地闸门让全额通过,达到了限额的 3.9 倍。分类账收取的是风险敞口而非调用次数,承认了其中 $459k 的价值。
按残余损失对影响进行类型化才是购买有用工作的方式。当收费诚实时,类型化分类账执行了面额限额的 1.8 倍价值。当串通的 Agent 将转账标记为可退款时,限额重新开放到 $1.0M,并在 77% 的运行中超支。当共享触发器将恢复率从 0.75 降至 0.25 时,按效应累加收费在 59% 的运行中超支,而分类账仍认为自己是安全的。费用必须坐在模型下方。Agent 不能为类型命名。
这不仅仅是金钱的例子。作者查看了 τ-bench 和 AgentDojo 的 38,452 条公开轨迹。外部影响占工具调用的 22%。在共享资源中植入的一条指令平均在 84% 的异构集群中产生相同的外部影响,从不低于 48%。共享上下文是常见情况。
我会在等待 Agent OS 之前就采用这种会计方式。对不可逆工具类别(deploy、delete、pay、email、merge)保持一个持续运行的余额,租户中的每个 Agent 都消耗这个余额。从工具包装器读取类型,绝不从模型读取。如果下一个调用会超支,在包装器处拒绝它,并将拒绝记录为一个一等事件,而不是模型的道歉。
论文留下了硬洞。保守的、依赖感知的定价仍未解决。错误声明的类型和相关的恢复仍能击败一个相信了费用的分类账。模拟器和种子在 GitHub 上,地址是 mpi-dsg/irreversibility-budget。如果你已经运行了多个 Agent 对抗同一个生产表面,把 2.4 倍这个数字放在允许列表旁边。
最初发表于 reidmarlow.com。