MARGIN: Laufzeit-Kalibrierung der Modellkonfidenz in Multi-Agenten-Systemen ohne Nachtraining
MARGIN (Multi-Agent Runtime Grading via Incremental Normalisation) ist ein Einzelautor-Paper von Joss Armstrong. Es lernt zur Laufzeit eine modellspezifische Konfidenzkorrektur aus beobachteten Antwortergebnissen. Es braucht weder Nachtraining noch einen separaten Kalibrierdatensatz. Auf BigCodeBench steht die mittlere Konfidenz eines Modells in negativer Beziehung zu seiner Genauigkeit. Wer den selbstsichereren Antwortenden wählt, liegt unter dem Zufall. Die korrigierten Werte gewichten Kandidatenantworten. Getestet wurden 18 Modelle.
In Multi-Agenten-Systemen gibt es eine verbreitete Abkürzung: Man stellt mehreren Modellen dieselbe Frage und übernimmt die Antwort des Modells, das am sichersten klingt. Diese Abkürzung beruht auf einer Annahme. Sie nimmt an, dass die angegebene Konfidenz eines Modells sich in die gleiche Richtung bewegt wie seine tatsächliche Genauigkeit. Das MARGIN-Paper stellt genau diese Annahme in Frage.
Der Name steht für Multi-Agent Runtime Grading via Incremental Normalisation. Autor ist Joss Armstrong, die arXiv-Kennung lautet 2605.22949, Version 1 erschien am 21. Mai 2026, und die jüngste Fassung v4 wurde am 8. Oktober 2026 überarbeitet.
Das Problem: Sicher heißt nicht richtig
Auf BigCodeBench macht der Autor eine schlichte Beobachtung: Die mittlere Konfidenz eines Modells steht in negativer Beziehung zu seiner Genauigkeit. Einfach gesagt liegen Modelle, die mit mehr Gewissheit sprechen, im Mittel häufiger falsch. Betrachtet man Paare, in denen eine Antwort richtig und eine falsch ist, und wählt stets die selbstsicherere, liegt man unter dem Zufall. Für jede Orchestrierungsschicht, die nach gezeigter Sicherheit entscheidet, ist das ein unbequemes Ergebnis.
Die Ursache ist nicht rätselhaft. Verschiedene Modelle teilen keine gemeinsame Skala der Gewissheit. Manche nennen gewohnheitsmäßig hohe Zahlen, andere sind zurückhaltend. Diese Rohwerte nebeneinander zu legen ist, als zöge man einen Celsius-Wert von einem Fahrenheit-Wert ab.
Der Kernmechanismus: inkrementelle Normalisierung zur Laufzeit
Laut Abstract lernt MARGIN zur Laufzeit für jedes Modell eine eigene Konfidenzkorrektur aus bereits beobachteten Antwortergebnissen. Es trainiert kein Modell nach und braucht keinen zurückgehaltenen Kalibrierdatensatz. Praktisch führt das System je Konfidenzband zwei Größen: die jüngste Genauigkeit und die vom Modell angegebene Konfidenz. Ihr Verhältnis wird zum Korrekturfaktor für den berichteten Wert in diesem Band. Die Wörter im Namen entsprechen dem grob. Die Korrektur ist inkrementell, weil sie sich mit jedem neuen Ergebnis aktualisiert. Sie ist eine Normalisierung, weil sie die Werte aller Modelle auf eine vergleichbare Skala zieht.
Die korrigierte Konfidenz gewichtet dann die Kandidatenantworten in einer kollektiven Entscheidung, also einer Abstimmung. MARGIN ändert weder die Modelle noch den Abstimmungsrahmen. Es fügt zwischen beiden eine dünne Umrechnungsschicht ein. Das macht den Einbau in bestehende Orchestrierung einfach. Eine Einschränkung: Die genauen Hyperparameter, etwa Fensterlänge und Bandgrenzen, stehen auf der von uns gelesenen Seite nicht. Dafür muss man das vollständige Paper prüfen.
Versuchsaufbau und berichtete Ergebnisse
Das Paper nutzt einen Pool aus 18 Modellen und verwendet eine Teilmenge von neun Modellen für die Experimente zur Verteilungsverschiebung. Die Aufgaben umfassen Codegenerierung, Frage-Antwort und Mathematik. Der Autor stellt außerdem fünf Online-Kalibrier-Baselines auf und gibt ihnen exakt dasselbe Feedback wie MARGIN, damit der Vergleich fair bleibt.
Bei der erwarteten Kalibrierungsabweichung nach der Verschiebung liegt MARGIN in zwei Code-Übergängen unter allen fünf Baselines. In einem Frage-Antwort-Übergang liegt es unter vier, und der verbleibende Vergleich wird als nicht eindeutig beschrieben. Das ist eine ehrliche Aussage: Die Methode gewinnt nicht überall. Bei der Genauigkeit der Antwortauswahl betragen die Gewinne 4,3 und 14,0 Prozentpunkte auf zwei der drei Benchmarks, verglichen mit unkalibrierter Konfidenzgewichtung. Für den dritten Benchmark nennt das Abstract keine Zahl, und Daten zu Latenz oder Kosten fehlen.
Was das für Entwickler und Unternehmen bedeutet
Erstens zielt die Methode auf kaskadierende Halluzinationen in Toolketten. In einer langen Agenten-Pipeline wird ein selbstsicherer Fehler weiter oben zur Tatsache weiter unten. Ist schon das Entscheidungssignal verzerrt, wächst der Fehler auf dem Weg. Die Konfidenz vor der Nutzung zu kalibrieren, ist eine günstige Verteidigungslinie.
Zweitens hängt sie nicht von Offline-Daten ab. Viele Teams haben keinen fertigen Kalibrierdatensatz, oder ihre Modellversionen wechseln so schnell, dass alte Kalibrierungen veralten. MARGIN korrigiert sich aus Online-Feedback und passt damit zu Pools, die sich oft ändern.
Drittens gibt sie der Enthaltung eine festere Grundlage. Ein kalibrierter Wert kann entscheiden, wann eine Antwort verweigert oder an einen Menschen übergeben wird. Eine Schwelle auf einer verzerrten Zahl leistet das nicht.
Grenzen und Vorsichtspunkte
Erstens braucht die Methode Rückmeldung über Ergebnisse. Das System muss nachträglich erfahren, ob eine Antwort richtig war, etwa ob ein Test bestanden wurde oder eine Referenzantwort existiert. Bei offenem Schreiben oder Aufgaben ohne Prüfweg ist diese Bedingung nicht erfüllt.
Zweitens legt die Seite keine Latenz und keinen Rechenaufwand offen, daher müssen Ingenieurteams selbst messen. Drittens ist es ein Preprint eines einzelnen Autors mit vier Überarbeitungen, und wir sahen keinen Hinweis auf Peer-Review. Viertens räumt der Autor ein, dass ein Frage-Antwort-Vergleich nicht eindeutig ist, die Methode gewinnt also nicht bei jeder Art von Verschiebung. Schließlich sind 18 Modelle und drei Aufgabenfamilien eine ordentliche Breite, decken aber nicht jede Produktionslast ab.
Fazit
Der Wert von MARGIN liegt nicht in einem komplexen neuen Modell. Er liegt darin, eine allgemein vorausgesetzte Annahme offen zu prüfen und eine leichte Reparatur anzubieten.
Für Teams, die Multi-Agenten-Orchestrierung bauen, ist der praktische Schritt einfach: Zuerst auf den eigenen Aufgaben messen, ob Konfidenz und Genauigkeit gemeinsam steigen. Dann entscheiden, ob diese Kalibrierschicht nötig ist. Bewegen sie sich nicht gemeinsam, verdient dieses Paper eine sorgfältige Lektüre.