判定无用仍照查不误:工具型 Agent 很少把自己的证据判断转化为停止决策

Published · AI Daily — AI-assisted deep research, methodology & disclosure

一项实证研究在带有刻意失效信息源的检索环境中测试了七个 agent。它们把无用结果判为“无用”的比例达 97% 到 100%,但多数仍继续查询,判断并没有变成停止决策。提示词、记忆、推理模式和预算只改变停止的时间点,不改变停止的依据。只有“连续五次无用结果后必须作答”的强制整合步骤让停止行为与证据对齐。作者用 300 道新题做了预注册复现,确认了这一脱节及干预的效果。

论文要解决什么问题

这篇论文来自 Chubin Zhang、Zhenglin Wan、Xingrui Yu、Jingxuan Wu、Yaxin Zhou、Ivor Tsang 与 Bo An,2026 年 10 月 5 日提交到 arXiv(编号 2610.06191)。它只问一个朴素的问题:如果一个工具连续返回没用的结果,agent 是否会停止依赖它?直觉上,答案应当是会。一个会判断“这条结果没用”的 agent,在连续多次得出同一判断之后,理应换个办法,或者直接作答。作者发现,现实并非如此。

研究团队在一个检索环境里测试了七个 agent。环境刻意设置了会失败的信息源,让工具持续返回无用内容。结果显示,agent 把这些结果判为“无用”的比例在 97% 到 100% 之间。也就是说,它们的证据判断几乎没有错。然而,大多数 agent 依然继续查询。论文标题把这种现象概括为:判定无用,照查不误。

核心发现:判断与行动脱节

这里的关键词是“脱节”。以往讨论 agent 的无效循环,常把原因归结为模型看不懂工具输出,或者不会评估结果质量。这篇论文把这个解释排除了:评估能力是够的,97% 到 100% 的判定准确率说明模型清楚地知道结果没用。问题出在下一步,也就是判断没有转化为“停止”这个动作。

为了把判断和行动分开测量,作者比较了两种情形下的停止行为:一种是此前已出现较长的连续无用结果,另一种是较短的连续无用结果。如果 agent 真的在用自己的判断做决定,那么连续无用的次数越多,它越应该停下来。论文报告,多数 agent 并没有表现出这种随证据积累而增强的停止倾向。这个设计的价值在于,它不依赖外部标注告诉我们“该不该停”,而是直接检验 agent 的行为是否与它自己的判断一致。

哪些干预无效,哪些有效

作者测试了几类常见的缓解手段:提示词中的提醒、记忆访问、不同的推理模式,以及预算约束。结论比较克制。这些手段确实会改变 agent 停止的时间点,但没有改变它停止的依据。换句话说,agent 可能更早或更晚停下,但停下的原因并不是“证据已经足够说明此路不通”。预算限制尤其典型:它能强行截断循环,却与证据无关,因此属于外部刹车,而不是 agent 自身的决策。

真正有效的是一个“强制整合步骤”:当 agent 连续看到五条无用结果后,系统要求它必须基于现有信息作答。这一步把停止决策从“agent 自己要不要停”改成了“到了这个节点必须收束”。论文报告,这样做让停止行为与证据对齐了。作者还做了预注册的复现实验,使用 300 个全新问题,结果同时确认了两件事:脱节现象确实存在,强制整合这一干预确实有效。预注册意味着假设和分析方案在看到数据前就已固定,降低了事后挑选结果的风险。

工作机理的合理解读

论文摘要没有给出机理层面的完整解释,以下属于我们基于其结果所做的推断,不是作者的原话。一种可能是,模型在训练中见过大量“多查几次总没坏处”的轨迹,于是把继续调用工具当作默认动作;而“这条结果没用”只是一段文字上的评价,并不会自动改变下一步的概率分布。

另一种可能是,判断发生在逐条结果的局部,而停止需要对整条轨迹做全局的累计推理,后者对小模型更困难。强制整合步骤之所以有效,也许正是因为它把全局累计的工作交给了外部的计数器,模型只需回答问题即可。

对开发者与企业的影响

第一,成本。每一次多余的工具调用都消耗延迟和费用,在检索增强生成、网页浏览、代码搜索等场景里,无效循环是实打实的开销。第二,可靠性。一个在失败信息源上空转的 agent,不仅浪费资源,还可能因为迟迟不作答而超时,或者在最后凑出一个缺乏依据的答案。第三,设计思路。论文的结论提示我们,不要指望“让模型自己想明白什么时候该停”,而应在编排层加入确定性的停止规则,例如连续 N 次无用即强制整合。这类规则实现简单,可以放在任何 agent 框架里,不需要重新训练模型。

对评测也有启发。目前许多 agent 基准只看最终答案是否正确,很少统计工具调用的浪费程度。本文的方法提供了一个可复用的诊断思路:先测判断是否准确,再测行为是否跟随判断。两者分开,才能定位问题到底在“看不懂”还是“不照做”。

局限与待解问题

需要明确几点限制。其一,摘要提到测试对象为 7 到 8B 参数规模的模型,具体型号摘要中未列出,因此结论能否推广到更大的前沿模型,需要读者查阅全文或等待后续工作验证。其二,实验环境是刻意构造的失败信息源,真实世界里的失败往往更含混:结果部分有用、来源时好时坏。

固定的“五次”阈值在那样的环境里可能过早或过晚。其三,强制整合让 agent 在证据不足时被迫作答,答案质量本身是否下降,需要结合具体任务评估。其四,论文显示提示词和预算只改变时机而非标准,但并不意味着没有更好的训练方法;用强化学习直接奖励“因证据而停”,是一个自然的后续方向。

小结

这篇论文的价值在于把一个常被笼统称作“agent 陷入循环”的现象拆开:模型能判断,却不照着判断行动。它给出了一个简单、可复现的修补办法,也提醒工程团队在设计 agent 时,把停止决策当作一等公民来对待,而不是寄望于模型的自觉。

Sources