無用と判定しても問い合わせ続ける:ツール利用エージェントは自らの証拠判断を停止判断に変えない

Published · AI Daily — AI-assisted deep research, methodology & disclosure

意図的に失敗する情報源を含む検索環境で7つのエージェントを試験した実証研究です。エージェントは無用な結果を97〜100%の割合で無用と判定しましたが、多くは問い合わせを続け、判断が停止の決定になりませんでした。プロンプト、メモリ、推論モード、予算は停止の時期を変えるだけで基準は変えません。無用な結果が5回続いたら必ず回答させる統合ステップだけが、停止を証拠と整合させました。300問の事前登録追試で乖離と介入効果が確認されています。

論文が問うこと

本論文は Chubin Zhang、Zhenglin Wan、Xingrui Yu、Jingxuan Wu、Yaxin Zhou、Ivor Tsang、Bo An の各氏によるもので、2026年10月5日に arXiv(2610.06191)へ投稿されました。問いは単純です。ツールが役に立たない結果を返し続けたとき、エージェントはそのツールに頼るのをやめるのか。直感的には「やめる」はずです。「この結果は役に立たない」と判断できるエージェントなら、同じ判断が何度も続けば、方針を変えるか、手元の情報で答えを出すと期待できます。ところが著者らは、多くのエージェントがそうしないことを示しました。

研究チームは検索環境で7つのエージェントを試験しました。環境には意図的に失敗する情報源が仕込まれ、ツールは価値のない内容を返し続けます。エージェントはそれらの結果を97%から100%の割合で「無用」と判定しました。証拠の判断はほぼ正確だったということです。それでも大半のエージェントは問い合わせを続けました。論文の題名は、この現象を「無用と判定しながら、なお問い合わせる」と表現しています。

中心的な発見:判断と行動の乖離

要点は「乖離」です。これまでエージェントの無駄なループは、ツール出力を読み違える、あるいは結果の質を評価できないことが原因だと語られがちでした。本論文は、少なくともこの実験のエージェントについてその説明を退けています。97%から100%という判定率は、モデルが結果の無用さを理解していることを示します。問題は次の段階、つまり判断が「停止する」という行動に結びつかない点にあります。

判断と行動を切り分けて測るため、著者らは、無用と判定された結果が長く続いた後の停止行動と、短く続いた後の停止行動を比較しました。エージェントが自分の判断に基づいて決めているなら、無用な結果が長く続くほど停止しやすくなるはずです。論文は、多くのエージェントでこの証拠に応じた変化が見られなかったと報告しています。この設計の利点は、「いつ止めるのが正しいか」を外部のラベルに頼らず、エージェントの行動が自分自身の判定と整合しているかを直接調べられることです。

効かなかった介入と効いた介入

著者らは一般的な対策を試しました。プロンプトでの注意喚起、メモリへのアクセス、推論モードの変更、予算の制約です。結果は控えめなものでした。これらは停止の「時期」を動かしましたが、停止の「基準」は変えませんでした。早く止まる、遅く止まるといった違いは出ても、証拠が積み上がったから止まるわけではありません。予算の上限は典型例で、ループを強制的に断ち切りますが、証拠とは無関係です。それはエージェント自身の決定ではなく、外側からのブレーキです。

有効だったのは「強制的な統合ステップ」でした。無用な結果が5回連続した時点で、エージェントは手持ちの情報に基づいて必ず回答しなければなりません。停止の判断をエージェントの裁量から、実行基盤側の規則へ移す方法です。論文によれば、これで停止行動が証拠と整合しました。さらに著者らは、300問の新しい質問で事前登録された追試を行い、乖離の存在と介入の有効性の両方を確認しました。事前登録は、仮説と分析計画をデータを見る前に固定するため、都合のよい結果だけを選ぶ危険を下げます。

仕組みについての妥当な解釈

要旨は仕組みを完全には説明していません。以下は報告された結果に基づく私たちの推測であり、著者の主張ではありません。一つの可能性は、学習データに「もう一度調べても害はない」という軌跡が多く含まれ、ツールの再呼び出しが既定の行動になっていることです。

「無用」という評価は単なる文章であり、次の行動の確率を自動的に変えるとは限りません。もう一つの可能性は、判定は個々の結果に対する局所的な作業である一方、停止には軌跡全体の累積を踏まえた判断が必要で、小さなモデルにはそれが難しいことです。統合ステップが効くのは、累積の管理を外部のカウンタに任せ、モデルには回答だけを求めるからかもしれません。

開発者と企業への影響

第一にコストです。不要なツール呼び出しは遅延と費用を増やします。検索拡張生成、ウェブ閲覧、コード検索などでは、無駄なループがそのまま請求に表れます。第二に信頼性です。死んだ情報源で空回りするエージェントは、タイムアウトに陥ったり、最後に根拠の薄い回答を出したりします。第三に設計方針です。モデルが自ら止まり時を理解することを期待せず、オーケストレーション層に決定的な規則、たとえば「無用な結果がN回続いたら回答を強制する」を入れるのが現実的です。実装は簡単で、どのエージェント基盤にも載せられ、再学習も要りません。

評価の面でも示唆があります。多くのエージェント向けベンチマークは最終回答の正誤だけを見ており、ツール呼び出しの無駄はほとんど測られません。本論文の手法は、まず判定が正確かを確かめ、次に行動が判定に従っているかを確かめるという再利用可能な診断になります。二つを分けることで、失敗の原因が「読み違い」なのか「従わないこと」なのかを特定できます。

限界と残る問い

いくつか明確にしておくべき制約があります。要旨によれば対象は7〜8Bパラメータ規模のモデルで、具体名は示されていません。そのため、より大きな最先端モデルへ結論が及ぶかどうかは、全文の確認や今後の研究を待つ必要があります。実験環境は意図的に失敗させた情報源であり、現実の失敗はもっと曖昧です。

部分的に役立つ結果や、時によって質が変わる情報源では、固定の「5回」という閾値は早すぎたり遅すぎたりするでしょう。また、強制的な回答は証拠が乏しいまま答えることを意味するため、回答品質への影響はタスクごとに検討が必要です。最後に、プロンプトや予算が時期しか変えないという結果は、より良い方法が存在しないことを意味しません。証拠に基づく停止を強化学習で直接報酬にするなどの訓練は、自然な次の一歩です。

まとめ

本論文は、「エージェントがループにはまった」というあいまいな不満を二つに分解しました。モデルは判断できるが、その判断に従って行動しない、という点です。

著者らが示した対策は単純で再現可能です。技術者にとっての教訓は、停止の判断をエージェント設計の第一級の要素として扱い、モデルの良識に任せないことです。

Sources