Als nutzlos beurteilt, trotzdem abgefragt: Werkzeugnutzende Agenten setzen ihre Beweisurteile selten in Stoppentscheidungen um
Eine empirische Studie testete sieben Agenten in einer Suchumgebung mit absichtlich ausfallenden Quellen. Die Agenten stuften nutzlose Ergebnisse zu 97 % bis 100 % als nutzlos ein, fragten aber meist weiter an: Das Urteil wurde nicht zur Stoppentscheidung. Prompts, Speicher, Denkmodi und Budgets verschieben nur den Zeitpunkt des Stopps, nicht das Kriterium. Erst ein verpflichtender Integrationsschritt, der nach fünf nutzlosen Ergebnissen in Folge eine Antwort erzwingt, bringt das Stoppen mit der Beweislage in Einklang. Eine vorab registrierte Replikation mit 300 neuen Fragen bestätigt Befund und Abhilfe.
Die Frage der Arbeit
Die Arbeit „Judged Useless, Queried Anyway: Tool-Using Agents Rarely Turn Their Own Evidence Judgments into Stopping Decisions“ (arXiv 2610.06191) stammt von Chubin Zhang, Zhenglin Wan, Xingrui Yu, Jingxuan Wu, Yaxin Zhou, Ivor Tsang und Bo An. Sie wurde am 5. Oktober 2026 eingereicht. Die Frage ist einfach: Wenn ein Werkzeug ständig nichts Brauchbares liefert, hört der Agent dann auf, sich darauf zu verlassen? Der gesunde Menschenverstand sagt ja. Ein Agent, der „dieses Ergebnis ist nutzlos“ sagen kann, sollte nach mehreren gleichen Urteilen in Folge den Kurs wechseln oder mit dem vorhandenen Wissen antworten. Die Autoren stellen fest, dass die meisten Agenten das nicht tun.
Das Team testete sieben Agenten in einer Suchumgebung. Die Umgebung enthielt absichtlich ausfallende Quellen, sodass das Werkzeug fortlaufend wertlose Inhalte lieferte. Die Agenten stuften diese Ergebnisse in 97 % bis 100 % der Fälle als nutzlos ein. Ihre Beweisurteile waren also fast immer richtig. Dennoch fragten die meisten weiter an. Der Titel fasst den Effekt zusammen: als nutzlos beurteilt, trotzdem abgefragt.
Der Kernbefund: Urteil und Handlung driften auseinander
Das Schlüsselwort ist Entkopplung. Endlosschleifen bei Agenten werden oft damit erklärt, dass das Modell die Werkzeugausgabe nicht versteht oder ihre Qualität nicht bewerten kann. Diese Arbeit schließt diese Erklärung für die untersuchten Agenten aus. Eine Quote von 97 % bis 100 % zeigt, dass das Modell die Nutzlosigkeit erkennt. Der Fehler liegt einen Schritt später: Das Urteil wird nicht zur Entscheidung, aufzuhören.
Um Urteil und Handlung getrennt zu messen, verglichen die Autoren das Stoppverhalten nach längeren und nach kürzeren Serien von als nutzlos markierten Ergebnissen. Würde ein Agent seine eigenen Urteile wirklich nutzen, müsste eine längere Serie die Wahrscheinlichkeit erhöhen, dass er aufhört. Die Arbeit berichtet, dass die meisten Agenten dieses evidenzabhängige Muster nicht zeigten. Der Aufbau hat einen praktischen Vorteil: Er braucht keine externe Markierung dafür, wann Aufhören richtig wäre. Er prüft, ob das Verhalten des Agenten mit seinen eigenen Urteilen übereinstimmt.
Was scheiterte und was wirkte
Die Autoren probierten die üblichen Gegenmittel aus: Hinweise im Prompt, Zugriff auf einen Speicher, verschiedene Denkmodi und Budgetgrenzen. Das Ergebnis ist nüchtern. Diese Maßnahmen verschoben den Zeitpunkt des Stopps, aber nicht das Kriterium. Ein Agent hört vielleicht früher oder später auf, aber nicht, weil sich die Belege gegen das Werkzeug häufen. Eine Budgetgrenze ist der klarste Fall: Sie bricht die Schleife gewaltsam ab, ohne Bezug zur Beweislage. Sie ist eine äußere Bremse, keine Entscheidung des Agenten.
Wirksam war ein verpflichtender Integrationsschritt. Nach fünf aufeinanderfolgenden nutzlosen Ergebnissen muss der Agent aus den bereits vorhandenen Informationen antworten. Damit wandert die Stoppentscheidung aus dem Ermessen des Agenten in die Laufzeitumgebung. Laut Arbeit brachte das das Stoppverhalten mit der Beweislage in Einklang. Anschließend führten die Autoren eine vorab registrierte Replikation mit 300 neuen Fragen durch. Sie bestätigte beides: Die Entkopplung ist real, und der Integrationsschritt behebt sie. Die Vorab-Registrierung legt Hypothesen und Analyseplan vor der Datenansicht fest und senkt so das Risiko selektiver Berichterstattung.
Eine plausible Deutung des Mechanismus
Die Zusammenfassung liefert keine vollständige mechanistische Erklärung. Das Folgende ist unsere Schlussfolgerung aus den berichteten Ergebnissen, keine Aussage der Autoren. Möglicherweise enthalten die Trainingsdaten viele Verläufe, in denen eine weitere Anfrage unschädlich war, sodass der erneute Werkzeugaufruf zur Standardaktion wird.
Ein geschriebenes Urteil wie „nutzlos“ ist nur Text und verschiebt nicht zwingend die Wahrscheinlichkeit der nächsten Aktion. Eine zweite Möglichkeit: Das Urteil betrifft ein einzelnes Ergebnis, während das Aufhören eine laufende Bilanz über den gesamten Verlauf verlangt, was kleinen Modellen schwerer fällt. Der Integrationsschritt wirkt vielleicht, weil er diese Bilanz einem externen Zähler überlässt und vom Modell nur eine Antwort verlangt.
Folgen für Entwickler und Unternehmen
Erstens die Kosten. Jeder überflüssige Werkzeugaufruf erhöht Latenz und Ausgaben. Bei retrieval-gestützter Generierung, Websuche und Codesuche ist eine sinnlose Schleife ein echter Posten auf der Rechnung. Zweitens die Zuverlässigkeit: Ein Agent, der an einer toten Quelle hängt, kann in eine Zeitüberschreitung laufen oder im letzten Moment eine dünne Antwort liefern. Drittens der Entwurf: Man sollte sich nicht darauf verlassen, dass das Modell selbst erkennt, wann Schluss ist. Eine deterministische Regel in der Orchestrierungsschicht, etwa „nach N nutzlosen Ergebnissen eine Antwort erzwingen“, ist leicht zu bauen, funktioniert in jedem Agenten-Framework und braucht kein erneutes Training.
Auch für die Bewertung ist die Arbeit relevant. Viele Agenten-Benchmarks werten nur die Endantwort und messen kaum, wie viele Aufrufe verschwendet wurden. Die Arbeit bietet eine wiederverwendbare Diagnose: erst prüfen, ob die Urteile stimmen, dann prüfen, ob das Verhalten ihnen folgt. Diese Trennung zeigt, ob ein Fehler aus Fehllesen oder aus Nichthandeln stammt.
Grenzen und offene Fragen
Einige Grenzen verdienen eine klare Nennung. Laut Zusammenfassung wurden Modelle im Bereich von 7 bis 8 Milliarden Parametern untersucht, ohne dass sie benannt werden. Wer annimmt, das Ergebnis gelte auch für größere Spitzenmodelle, sollte zuerst den Volltext lesen. Die Testumgebung nutzt absichtlich ausfallende Quellen.
Echte Ausfälle sind unschärfer: teilweise nützliche Ergebnisse, eine Quelle, die montags gut und dienstags schlecht ist. Ein fester Schwellenwert von fünf könnte dort zu früh oder zu spät auslösen. Eine erzwungene Antwort bedeutet zudem, mit dünner Beweislage zu antworten; die Folgen für die Antwortqualität müssen aufgabenweise untersucht werden. Schließlich beweist der Befund, dass Prompts und Budgets nur den Zeitpunkt und nicht das Kriterium ändern, nicht, dass es nichts Besseres gibt. Ein Training, das das Aufhören aufgrund von Belegen direkt belohnt, etwa per bestärkendem Lernen, ist ein naheliegender nächster Schritt.
Fazit
Die Arbeit zerlegt die vage Klage „der Agent steckt in einer Schleife“ in zwei Teile: Das Modell kann urteilen, handelt aber nicht nach seinem eigenen Urteil.
Die vorgeschlagene Abhilfe ist einfach und reproduzierbar. Für Ingenieure lautet die Lehre, die Stoppentscheidung als erstklassigen Bestandteil des Agenten-Entwurfs zu behandeln und sie nicht dem guten Willen des Modells zu überlassen.