OmniCapBench: Audio-visuelle Beschreibungen in prüfbare atomare Einheiten zerlegen
OmniCapBench bewertet audio-visuelle Beschreibungen mit atomaren, prüfbaren Einheiten in drei Spuren: Entitäten, Einstellungen, Audioereignisse. 786 annotierte Videos zeigen Identitätsdrift und Fehlausrichtung führender Modelle.
Multimodale große Sprachmodelle entfernen sich von der Zeit, in der man ein Bild ansah und eine Frage beantwortete. Heute sollen sie gleichzeitig hören und sehen, Ton und Bild auf einer gemeinsamen Zeitachse abgleichen und sich über Dutzende Sekunden oder mehrere Minuten an dieselbe Person oder denselben Gegenstand erinnern. Die Fähigkeiten wachsen schnell. Die Evaluation hat nicht Schritt gehalten. Die audio-visuelle Beschreibung ist eine attraktive Diagnoseaufgabe, denn eine gute Beschreibung muss abdecken, wer anwesend ist, wie die Szene geschnitten ist und wann welches Geräusch auftritt. Dennoch lässt sie sich schwer gut messen. Eine Beschreibung ist Freitext, und dieselbe Szene lässt unzählige zulässige Formulierungen zu. Deshalb ist es mühsam, sie Punkt für Punkt zu prüfen, und noch mühsamer, eine Punktzahl zu reproduzieren. OmniCapBench, am 8. Oktober 2026 unter cs.CV auf arXiv veröffentlicht, zielt genau auf diese Lücke.
Die Autoren argumentieren, dass bestehende Benchmarks in einem gekoppelten Zielkonflikt stecken. Die erste Familie bewertet die ganze Beschreibung mit einer einzigen Zahl. Sie bietet breite Abdeckung, sagt aber nicht, wo das Modell falsch lag, weil Auslassungen, Halluzinationen und Fehlausrichtungen in einer Punktzahl verschwimmen. Die zweite Familie nutzt lokale Sonden, die nach einem bestimmten Detail fragen. Die Verortung ist klar, die Abdeckung dünn, und ein anderer Satz von Sonden könnte zu einem anderen Urteil führen. Ein drittes Problem liegt beim Bewerter selbst. Ein unbeschränkter LLM-Richter kann mit dem Prompt, der Länge der Beschreibung und kleinen Änderungen im Wortlaut schwanken. Abdeckung, Verortung und Stabilität gibt es jeweils einzeln. Alle drei zugleich zu erreichen, war bislang ungelöst. Der zentrale Schritt von OmniCapBench besteht darin, das Vorhersageziel zu ändern. Freier Text ist nicht mehr das Endprodukt. Das Bewertungsobjekt wird zu einer Menge atomarer, überprüfbarer Einheiten, gegliedert in drei Spuren: Entitätsbezüge, visuelle Einstellungen und Audioereignisse. Die Entitätsspur fragt, ob das Modell über die Zeit auf dieselbe Person oder denselben Gegenstand verweist. Die Einstellungsspur prüft, wie sich das Bild ändert und was jede Einstellung enthält. Die Audiospur prüft, welche Geräusche wann auftreten. Auch die Bewertung hat zwei Schichten. Randbedingungen, die eine Regel entscheiden kann, etwa ob ein Ereignis vorkommt oder ob zwei Ereignisse in der richtigen Reihenfolge stehen, werden deterministisch geprüft. Teile, die wirklich Bedeutung erfordern, gehen an einen lokalen LLM-Vergleich, der den Richter auf eine kleine Einheit beschränkt. Grundlage sind 786 dicht annotierte Videos.
Dieser tief strukturierte Entwurf hat über die saubere Bewertung hinaus einen technischen Vorteil. Freitext lässt sich schlecht reproduzierbar bewerten, weil der Richter in einem offenen Raum möglicher Formulierungen entscheiden muss. Atomare Einheiten zerschneiden diesen offenen Raum in viele geschlossene Fragen: Taucht diese Person in der zweiten Einstellung wieder auf, erklingt der Explosionsknall vor oder nach dem Moment, in dem sich die Figur umdreht. Eine geschlossene Frage lässt sich oft per Regel klären. Nur was Regeln nicht klären, geht in den semantischen Vergleich, und selbst dann liest der Richter eine kurze Passage mit wenig Kontext, sodass die Streuung von Lauf zu Lauf kleiner sein dürfte. Ein öffentlicher Benchmark braucht genau diese Eigenschaft, denn Teams müssen die Zahlen anderer wiederholen können. Der zweite große Vorteil ist, dass sich Fehler einsortieren lassen. Laut der Arbeit trennt der Benchmark vier Arten von Wahrnehmungsfehlern bei MLLMs. Zeitliche Verankerungsfehler setzen ein Ereignis auf den falschen Zeitpunkt. Identitätsdrift behandelt dieselbe Person später im Clip als jemand anderen. Modalübergreifende Fehlausrichtung ordnet ein Geräusch dem falschen Bild zu. Halluzinierte Beschreibungen erfinden Inhalt, den das Video nicht enthält. In einer Gesamtpunktzahl verschwimmen diese Probleme, und Entwickler erfahren nur, dass ihr Modell etwas schlechter ist als ein Konkurrent. Wenn Einheiten an Spuren gebunden sind, lässt sich jede Fehlerart getrennt verfolgen, und Teams können entscheiden, ob sie Daten, Architektur oder Trainingsziel ändern. Die Auswertung führender Modelle ergibt ein nützliches Bild: starke lokale Wahrnehmung, schwaches audio-visuelles Schließen über lange Zeiträume. Ein Modell kann sagen, was in einer Einstellung zu sehen ist und welches Geräusch in einem Augenblick zu hören ist, tut sich aber schwer, über eine längere Spanne konsistent zu bleiben. Identitätsdrift und modalübergreifende Fehlausrichtung werden als besonders deutliche Schwächen genannt. Das deckt sich mit einer verbreiteten Erfahrung: Man schneidet ein langes Video in Clips, jeder Clip wird gut beschrieben, aber der zusammengesetzte Bericht widerspricht sich. Die Zusammenfassung nennt keine Werte. Wie groß die Abstände zwischen den Modellen sind und welche Fehlerart überwiegt, lässt sich hier daher nicht sagen. Wer das Ergebnis zitiert, sollte die Tabellen der Arbeit heranziehen.
Für Entwickler stellt sich praktisch die Frage, wie man einen solchen Benchmark nutzt. Ein Ansatz ist, die drei Spuren getrennt zu lesen, statt sie zu einem Ranking zu verschmelzen. Liegt ein Modell bei den visuellen Einstellungen vorn, aber bei den Entitätsbezügen hinten, ist der visuelle Encoder vielleicht in Ordnung, und das Problem liegt im Gedächtnis und in der Bindung über die Zeit. Liegt es bei den Audioereignissen hinten, ist womöglich die Audiokodierung oder das Training der Ton-Bild-Ausrichtung zu schwach. Diese Aufschlüsselung gibt Ablationsstudien eine klare Messgröße und erlaubt es getrennten Gruppen, die Schlüsse der anderen an denselben Einheiten nachzuvollziehen. Aus Sicht der Branche liegt der Wert eines solchen Benchmarks in der Wegbeschreibung, die er liefert. Wenn omnimodale Modelle in Videoverständnis, Live-Assistenz, barrierefreie Untertitelung und Roboterwahrnehmung vordringen, zählen Identitätskonsistenz über lange Spannen und die Ausrichtung von Ton und Bild mehr als die Erkennung einzelner Bilder. Strukturierte Evaluation erlaubt es einem Team, ein begrenztes Forschungsbudget auf das schwächste Glied zu lenken. Etwas Vorsicht bleibt geboten. Ein Satz von 786 Videos ist bescheiden. Die Art, Atome zu bilden, kann leicht aufzählbare Inhalte begünstigen. Der lokale LLM-Vergleich kann noch Restverzerrungen tragen. Dennoch ist es eine solide Richtung, eine Gesamtpunktzahl durch Einheiten zu ersetzen, die sich verorten und nachprüfen lassen. Evaluations- und Modellteams sollten sie weiter beobachten.
Sources
FAQ
Was unterscheidet OmniCapBench von früheren Benchmarks für audio-visuelle Beschreibungen?
Der Benchmark bewertet nicht einen Freitext mit einer einzigen Zahl. Das Vorhersageziel wird zu einer Menge atomarer, überprüfbarer Bewertungseinheiten in drei Spuren: Entitätsbezüge, visuelle Einstellungen und Audioereignisse. So bleibt die Abdeckung erhalten, Fehler lassen sich verorten, und die Abhängigkeit von einem unbeschränkten LLM-Richter sinkt.
Welche Fehlerarten lassen sich damit unterscheiden?
Die Zusammenfassung nennt vier: zeitliche Verankerungsfehler, Identitätsdrift, modalübergreifende Fehlausrichtung und halluzinierte Beschreibungen. Führende Modelle nehmen lokal stark wahr, schließen aber über lange audio-visuelle Zeiträume schwach. Identitätsdrift und Fehlausrichtung fallen besonders auf.
Hängt die Bewertung ganz von einem LLM-Richter ab?
Nein. Die Bewertung hat zwei Schichten. Deterministische Prüfungen von Randbedingungen erledigen alles, was eine Regel entscheiden kann. Lokale semantische Vergleiche durch ein LLM übernehmen nur die Teile, die Bedeutung erfordern. Der Richter sieht eine kleine Einheit statt einer ganzen Beschreibung, daher sollten die Ergebnisse stabiler sein.