Jugé inutile, interrogé quand même : les agents à outils transforment rarement leurs jugements sur les preuves en décisions d'arrêt
Une étude empirique a testé sept agents dans un environnement de recherche aux sources volontairement défaillantes. Les agents jugeaient les résultats inutiles dans 97 % à 100 % des cas, mais la plupart continuaient à interroger l'outil : le jugement ne devenait pas une décision d'arrêt. Prompts, mémoire, modes de raisonnement et budget changent le moment de l'arrêt, pas son critère. Seule une étape d'intégration obligatoire, imposant une réponse après cinq résultats inutiles consécutifs, aligne l'arrêt sur les preuves. Une réplication préenregistrée sur 300 questions confirme le constat et le correctif.
La question posée par l'article
L'article « Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions » (arXiv 2610.06191) est signé de Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Yaxin Zhou, Ivor Tsang et Bo An. Il a été déposé le 5 octobre 2026. Sa question est simple : lorsqu'un outil ne renvoie plus rien d'utile, l'agent cesse-t-il de s'y fier ? Le bon sens répond oui. Un agent capable de dire « ce résultat est inutile » devrait, après plusieurs verdicts identiques d'affilée, changer de stratégie ou répondre avec ce qu'il possède. Les auteurs constatent que la plupart des agents ne le font pas.
L'équipe a testé sept agents dans un environnement de recherche d'information. Cet environnement comprenait des sources volontairement défaillantes : l'outil renvoyait sans cesse un contenu sans valeur. Les agents ont jugé ces résultats inutiles dans 97 % à 100 % des cas. Leur jugement sur les preuves était donc presque toujours juste. Pourtant, la plupart ont continué à interroger l'outil. Le titre résume l'effet : jugé inutile, interrogé quand même.
Le constat central : le jugement et l'action se séparent
Le mot clé est la déconnexion. On attribue souvent les boucles inutiles des agents à une incapacité à lire la sortie des outils ou à en évaluer la qualité. Cet article écarte cette explication pour les agents étudiés. Un taux de 97 % à 100 % montre que le modèle sait que le résultat est inutile. L'échec se situe une étape plus loin : le jugement ne se transforme pas en décision d'arrêt.
Pour mesurer le jugement et l'action séparément, les auteurs ont comparé le comportement d'arrêt après de longues séries de résultats jugés inutiles et après des séries plus courtes. Si un agent se servait vraiment de ses propres jugements, une série plus longue devrait augmenter la probabilité qu'il s'arrête. L'article rapporte que la plupart des agents n'ont pas montré cette sensibilité aux preuves. L'intérêt du dispositif est de ne pas exiger d'étiquette externe indiquant quand il faut s'arrêter. Il vérifie si le comportement de l'agent concorde avec ses propres verdicts.
Ce qui a échoué et ce qui a fonctionné
Les auteurs ont essayé les remèdes habituels : des rappels dans le prompt, l'accès à une mémoire, différents modes de raisonnement et des contraintes de budget. Le résultat est sobre. Ces leviers déplacent le moment de l'arrêt, mais pas son critère. Un agent peut s'arrêter plus tôt ou plus tard, sans que ce soit parce que les preuves s'accumulent contre l'outil. Le plafond de budget en est le meilleur exemple : il coupe la boucle de force, sans lien avec les preuves. C'est un frein extérieur, non une décision de l'agent.
Ce qui a fonctionné, c'est une étape d'intégration obligatoire. Après cinq résultats inutiles consécutifs, l'agent doit répondre à partir des informations déjà réunies. La décision d'arrêt passe ainsi de la discrétion de l'agent à la structure d'exécution. Selon l'article, cela a aligné le comportement d'arrêt sur les preuves. Les auteurs ont ensuite mené une réplication préenregistrée sur 300 questions nouvelles. Elle a confirmé les deux volets : la déconnexion est réelle et l'étape d'intégration la corrige. Le préenregistrement fixe les hypothèses et le plan d'analyse avant l'observation des données, ce qui réduit le risque de sélection des résultats.
Une lecture plausible du mécanisme
Le résumé ne donne pas d'explication mécaniste complète. Ce qui suit est notre inférence à partir des résultats rapportés, non une affirmation des auteurs. Il se peut que les données d'entraînement contiennent beaucoup de trajectoires où une requête de plus restait sans conséquence, de sorte que rappeler l'outil devient l'action par défaut.
Un verdict écrit comme « inutile » n'est que du texte et ne modifie pas forcément la probabilité de l'action suivante. Autre possibilité : le jugement porte sur un résultat isolé, alors que l'arrêt exige un cumul sur toute la trajectoire, plus difficile pour de petits modèles. L'étape d'intégration marche peut-être parce qu'elle confie ce cumul à un compteur externe et ne demande au modèle que de répondre.
Conséquences pour les équipes de développement
D'abord le coût. Chaque appel superflu ajoute de la latence et de la dépense. Dans la génération augmentée par récupération, la navigation web ou la recherche de code, une boucle inutile se paie réellement. Ensuite la fiabilité : un agent qui tourne à vide sur une source morte peut dépasser le délai imparti ou fournir une réponse fragile au dernier moment. Enfin la conception : il vaut mieux ne pas compter sur le modèle pour savoir quand s'arrêter. Une règle déterministe dans la couche d'orchestration, par exemple « après N résultats inutiles, imposer une réponse », est simple à écrire, fonctionne dans tout cadre d'agents et n'exige aucun réentraînement.
L'évaluation est aussi concernée. De nombreux bancs d'essai ne notent que la réponse finale et mesurent peu le gaspillage d'appels. L'article propose un diagnostic réutilisable : vérifier d'abord que les jugements sont exacts, puis que le comportement les suit. Cette séparation permet de savoir si l'échec vient d'une mauvaise lecture ou d'un défaut d'action.
Limites et questions ouvertes
Plusieurs limites méritent d'être dites sans détour. Le résumé indique que l'étude porte sur des modèles de 7 à 8 milliards de paramètres sans les nommer ; il faut donc lire le texte complet avant de supposer que le résultat vaut pour des modèles de pointe plus grands. L'environnement d'essai utilise des sources défaillantes par construction. Les échecs réels sont plus flous : des résultats partiellement utiles, une source bonne un jour et mauvaise le lendemain.
Un seuil fixe de cinq peut alors déclencher trop tôt ou trop tard. Forcer une réponse revient aussi à répondre avec peu de preuves, et l'effet sur la qualité doit être étudié tâche par tâche. Enfin, le fait que les prompts et les budgets changent le moment mais pas le critère ne prouve pas qu'il n'existe rien de mieux. Un entraînement qui récompense directement l'arrêt fondé sur les preuves, par exemple par apprentissage par renforcement, est une suite naturelle.
À retenir
L'article découpe une plainte vague, « l'agent est resté coincé dans une boucle », en deux parties : le modèle sait juger, mais n'agit pas selon son propre jugement.
Le correctif proposé est simple et reproductible. Pour les ingénieurs, la leçon est de traiter la décision d'arrêt comme un élément de premier rang dans la conception d'un agent, et de ne pas la laisser au bon sens du modèle.