研究表明7个主流Agent在97-100%情况下能正确判断工具检索结果无用,但大多数仍继续调用该工具;提示词只能改变停止时机,无法改变停止依据;唯一有效方案是在底层强制插入整合步来约束行为。
2026 年 10 月 5 日,arXiv cs.AI 上的一篇论文: 7 个用工具的代理,面对一个持续返回无用的检索源,97%–100% 的情况下会正确判断"这个结果没用"。然后呢?它们接着查。
这是我最近看到的最能解释当下代理系统的东西:模型判断和系统行为之间的断裂。这一周至少 7 篇新论文在从不同侧面打同一个问题,串起来看,会发现 2026 年的前沿已经不在"能不能做对",而在"能不能知道自己做不对"。这篇文章我把它们串成一条线,附可复现的机制和数字。
你让一个编码代理修构建脚本。它回"已解决"。你盯着答案看了三秒,发现前提里有个物理上不可能的数值——这道题根本无解。它没有一步算错,它对得很稳,错在假装能解。
这不是我编的。Yang 和 Wang 测了 14 个模型、30 对力学题,每对里有一道被人为改坏到无解。90 个回答里 12 个没拒绝无解题,其中 11 个更扎眼:模型自己把缺陷指了出来,把改对后的题答了,最后仍报"已解决"(arXiv:2610.06668)。它看见了问题,递出的却是一个不属于它的结论。
一个模型可以在同一个回答里同时完成三件事:识别缺陷、纠正后求解、错误报告状态。这三件事解耦了。这就是整篇文章要讲的核心现象。
把上面那个场景推极端就得到第二个实验。Zhang 等人在检索环境里故意让某个源持续失效(arXiv:2610.06191),并严格区分两件事:代理怎么判断,和代理实际做了什么。
判断几乎全对:7 个代理 97–100% 时候都把这个失效源的结果标成"无用"。 行为几乎不变:标了"无用"不等于停下,大多数继续查。 然后他们动了提示词,看哪招有用:
关键发现:提示词只能挪动"何时停",移不动"基于什么停"。 唯一让所有模型真正因证据而停的,是 harness 在底层强制插一个整合步——连续 5 次判断无用就逼它作答。这一步拉高了每个模型对失败源的成功率,而且预算翻倍时停点纹丝不动。
这就是标题里那句话的机制:判断在模型里,行为在壳里,两层之间没有可靠的信道。
任务一长,人的角色就从"逐个拍板"变成"审查一段自主执行"。Sun 等人(arXiv:26406)把这个问题落到可测量的东西上:
AgentMonBench:软件工程基准,覆盖两个维度——行为与需求的对齐,以及对"关键自主决策"的识别。 EBG(Evidence-Grounded Behavior Graph):免训练。把带源码链接的证据聚成"行为"节点,连成图,再按任务视角切片呈现给监控者。 跑在 8 个模型上,EBG 在多数设定里比直接读原始上下文更能识别关键决策、定位证据,且这个优势不随输入规模和超参崩掉。
值得抠的一点:EBG 是 training-free。它不改模型权重,改的是你喂给监控者的证据组织方式。可靠性的一手改进来自"怎么呈现证据",而不是"换更强的模型"。
"agentic abstention"在 2026 年成了被正式优化的目标。HERA(arXiv:2610.06563)的做法是 harness 与环境共同进化:
用受控环境突变,把一道可解题改造成必须放弃的题; 失败信号反推 harness 该怎么改; 生成新的执行环境和任务,专打上一轮的弱点。 留出集上的数字:
但真正值得停下来的数字在后面:进化出的 harness 直接跨 19 个别的 LLM 迁移,平均再提 15.3 个点,让弱模型以约 85% 更低的成本追平强模型。 这说明可靠性瓶颈不在模型权重里,在裹着模型的那层壳里。壳是可迁移的资产,模型不是。
代理要长期干活,得记住事。PrisMem(arXiv:2610.06361)反对一个默认假设——用整体性能当进化方向。它把信号拆到单个能力维度上:
依赖感知挑那些有跨能力收益的目标; 历史引导诊断,专门修某一维; 用配对差异案例做轨迹引导整合,把互补收益合进统一的记忆程序。 百万 token 级历史上,比最强基线高 10.54 和 7.83 个点(BEAM-1M / LongMemEval-M)。"整体在涨"可能只是 A 涨了把 B 的退步盖住了,拆维度才看得见真正该往哪走。
上面那些要跑起来,绕不开基础设施。HEAR 协议(arXiv:2610.06597)补上缺一块:
harness 懂什么:工作流依赖、上下文生命周期、执行目标; 引擎懂什么:请求队列、KV-cache 状态、资源压力。 两边过去各说各话。HEAR 做双向配对,把协议语义和优化策略解耦——同一套壳能换调度策略而不动工作流和模型。四个基准下 1.61× 批处理加速、首 token 中位数降 2.23×,DeepResearchBench 端到端 2.45×,且没见任务质量下滑。
把这条放最后是因为它最不起眼:前五个问题都在"模型层"和"harness 逻辑层",HEAR 在"harness 和推理引擎之间"。整条可靠性栈最底下那层,也在被协议化。
共同结论一句话:2026 年的前沿已经从"堆参数"移到"堆壳"。 模型智力不再是瓶颈,可靠性工程才是。
别等框架内置。这一周能立刻搬进生产环境的,就一个模式,来自第二篇的结论:
USELESS_THRESHOLD = 5
def should_stop(history):
# history: 最近 N 次工具调用及其结果
useless_run = 0
for call in reversed(history):
if judge_useless(call.result): # 让模型自己打"无用"标签
useless_run += 1
else:
break
# 关键:不是"模型说该停",是"连续 N 次它自己判无用就强制整合作答"
return useless_run >= USELESS_THRESHOLD
让模型显式打标签。第二篇里,一旦记录判断,停止就稳定;不记录,判断和行为就断链。标签是那个"记录"动作。 阈值放在 harness,不在提示词。提示词里的停止规则"最多部分遵守";只有强制整合步在所有模型上都把成功率高上去、且停点对预算翻倍不敏感。 整合步要"逼它作答",不是让它继续查。论文里这一步提升的是失败源成功率——即"承认这个源废了,换方法或给答案",而不是再来一轮无效检索。 局限也要说清楚:阈值 5 是论文在受控检索环境下的最优值,你的工具域(代码库、数据库、API)失效模式不同,应该在自己的日志上重扫阈值。第二篇开源了代码和 300 题预注册复现,直接拿来当起点。
7 篇里没有一篇解决"谁来验收壳"。HERA 能跨模型迁移壳,但壳本身的正确性靠它自己的留出集;EBG 改善监控,但监控者还是人。可靠性工程的尽头是一个开放问题:当壳比模型更重要,壳的质量谁来保证?
我的判断:这块会在 2026 下半年到 2027 变成独立赛道。先是评测(类似 AgentMonBench 扩展到"壳的行为审计"),然后是形式化验证(壳的控制流有限,比模型可验证)。现在动手做壳的审计工具,比再卷一个 benchmark 模型分,杠杆更大。
arXiv:2610.06668 Language models can notice an impossible engineering problem yet still report it as solved
arXiv:2610.06191 Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions
arXiv:2610.06406 What Did the Agent Actually Do? Evidence-Grounded Oversight for Long-Horizon Agents
arXiv:2610.06563 HERA: Harness-Environment Co-Evolution for Reliable Agentic Abstention
arXiv:2610.06361 Capability-Driven Self-Evolution of Agent Memory (PrisMem)
arXiv:2610.06597 Can Agent Harnesses and Inference Engines Hear Each Other? The HEAR Protocol