判定無用仍照查不誤:工具型 Agent 很少把自己的證據判斷轉化為停止決策
一項實證研究在帶有刻意失效資訊來源的檢索環境中測試了七個 agent。它們把無用結果判為「無用」的比例達 97% 到 100%,但多數仍繼續查詢,判斷並沒有變成停止決策。提示詞、記憶、推理模式和預算只改變停止的時間點,不改變停止的依據。只有「連續五次無用結果後必須作答」的強制整合步驟讓停止行為與證據對齊。作者用 300 道新題做了預先註冊複現,確認了這一脫節及干預的效果。
論文要解決什麼問題
這篇論文來自 Chubin Zhang、Zhenglin Wan、Xingrui Yu、Jingxuan Wu、Yaxin Zhou、Ivor Tsang 與 Bo An,2026 年 10 月 5 日提交到 arXiv(編號 2610.06191)。它只問一個樸素的問題:如果一個工具連續回傳沒用的結果,agent 是否會停止依賴它?直覺上,答案應當是會。一個會判斷「這條結果沒用」的 agent,在連續多次得出同一判斷之後,理應換個辦法,或者直接作答。作者發現,現實並非如此。
研究團隊在一個檢索環境裡測試了七個 agent。環境刻意設置了會失敗的資訊來源,讓工具持續回傳無用內容。結果顯示,agent 把這些結果判為「無用」的比例在 97% 到 100% 之間。也就是說,它們的證據判斷幾乎沒有錯。然而,大多數 agent 依然繼續查詢。論文標題把這種現象概括為:判定無用,照查不誤。
核心發現:判斷與行動脫節
這裡的關鍵詞是「脫節」。以往討論 agent 的無效循環,常把原因歸結為模型看不懂工具輸出,或者不會評估結果品質。這篇論文把這個解釋排除了:評估能力是夠的,97% 到 100% 的判定準確率說明模型清楚地知道結果沒用。問題出在下一步,也就是判斷沒有轉化為「停止」這個動作。
為了把判斷和行動分開測量,作者比較了兩種情形下的停止行為:一種是此前已出現較長的連續無用結果,另一種是較短的連續無用結果。如果 agent 真的在用自己的判斷做決定,那麼連續無用的次數越多,它越應該停下來。論文報告,多數 agent 並沒有表現出這種隨證據累積而增強的停止傾向。這個設計的價值在於,它不依賴外部標註告訴我們「該不該停」,而是直接檢驗 agent 的行為是否與它自己的判斷一致。
哪些干預無效,哪些有效
作者測試了幾類常見的緩解手段:提示詞中的提醒、記憶存取、不同的推理模式,以及預算限制。結論比較克制。這些手段確實會改變 agent 停止的時間點,但沒有改變它停止的依據。換句話說,agent 可能更早或更晚停下,但停下的原因並不是「證據已經足夠說明此路不通」。預算限制尤其典型:它能強行截斷循環,卻與證據無關,因此屬於外部煞車,而不是 agent 自身的決策。
真正有效的是一個「強制整合步驟」:當 agent 連續看到五條無用結果後,系統要求它必須基於現有資訊作答。這一步把停止決策從「agent 自己要不要停」改成了「到了這個節點必須收束」。論文報告,這樣做讓停止行為與證據對齊了。作者還做了預先註冊的複現實驗,使用 300 個全新問題,結果同時確認了兩件事:脫節現象確實存在,強制整合這一干預確實有效。預先註冊意味著假設和分析方案在看到資料前就已固定,降低了事後挑選結果的風險。
運作機理的合理解讀
論文摘要沒有給出機理層面的完整解釋,以下屬於我們基於其結果所做的推斷,不是作者的原話。一種可能是,模型在訓練中見過大量「多查幾次總沒壞處」的軌跡,於是把繼續呼叫工具當作預設動作;而「這條結果沒用」只是一段文字上的評價,並不會自動改變下一步的機率分布。
另一種可能是,判斷發生在逐條結果的局部,而停止需要對整條軌跡做全域的累計推理,後者對小模型更困難。強制整合步驟之所以有效,也許正是因為它把全域累計的工作交給了外部的計數器,模型只需回答問題即可。
對開發者與企業的影響
第一,成本。每一次多餘的工具呼叫都消耗延遲和費用,在檢索增強生成、網頁瀏覽、程式碼搜尋等場景裡,無效循環是實打實的開銷。第二,可靠性。一個在失敗資訊來源上空轉的 agent,不僅浪費資源,還可能因為遲遲不作答而逾時,或者在最後湊出一個缺乏依據的答案。第三,設計思路。論文的結論提示我們,不要指望「讓模型自己想明白什麼時候該停」,而應在編排層加入確定性的停止規則,例如連續 N 次無用即強制整合。這類規則實作簡單,可以放在任何 agent 框架裡,不需要重新訓練模型。
對評測也有啟發。目前許多 agent 基準只看最終答案是否正確,很少統計工具呼叫的浪費程度。本文的方法提供了一個可重複使用的診斷思路:先測判斷是否準確,再測行為是否跟隨判斷。兩者分開,才能定位問題到底在「看不懂」還是「不照做」。
局限與待解問題
需要明確幾點限制。其一,摘要提到測試對象為 7 到 8B 參數規模的模型,具體型號摘要中未列出,因此結論能否推廣到更大的前沿模型,需要讀者查閱全文或等待後續工作驗證。其二,實驗環境是刻意構造的失敗資訊來源,真實世界裡的失敗往往更含混:結果部分有用、來源時好時壞。
固定的「五次」門檻在那樣的環境裡可能過早或過晚。其三,強制整合讓 agent 在證據不足時被迫作答,答案品質本身是否下降,需要結合具體任務評估。其四,論文顯示提示詞和預算只改變時機而非標準,但並不意味著沒有更好的訓練方法;用強化學習直接獎勵「因證據而停」,是一個自然的後續方向。
小結
這篇論文的價值在於把一個常被籠統稱作「agent 陷入循環」的現象拆開:模型能判斷,卻不照著判斷行動。它給出了一個簡單、可複現的修補辦法,也提醒工程團隊在設計 agent 時,把停止決策當作一等公民來對待,而不是寄望於模型的自覺。