OmniSeek: Native Werkzeugintegration für mehrstufiges audiovisuelles Reasoning
OmniSeek verwandelt ein Omni-Large-Language-Model in einen aktiven, mehrstufigen Reasoning-Agenten, der nativ Werkzeuge aufruft, um bei Bedarf gezielt zu „schauen“ oder zu „hören“, statt eine gesamte audiovisuelle Sequenz in einem einzigen Durchlauf zu verarbeiten. Es ruft iterativ spärliche Evidenzfenster ab und fügt sie dem Kontext wieder hinzu. Nach einem Kaltstart auf einem synthetischen Korpus von 170.000 mehrstufigen Gedankenketten-Trajektorien wird die Policy durch zweistufiges Reinforcement Learning mit verifizierbaren Belohnungen sowie ein Audiovisuelles-Notwendigkeits-Ziel verfeinert, das Shortcuts über eine einzelne Modalität bestraft und so konsistente Verbesserungen erzielt.
Hintergrund und Problemstellung
Die meisten Omni-LLMs, die Audio, Video und Text gemeinsam verarbeiten, behandeln eine audiovisuelle Sequenz nach wie vor in einem einzigen Vorwärtsdurchlauf: Die gesamte Aufnahme wird einmal kodiert und dem Modell für ein einmaliges Reasoning übergeben. Dieses passive Paradigma stößt bei langen Sequenzen auf zwei strukturelle Probleme. Erstens wird das Signal verdünnt: Die wenigen Sekunden, die die entscheidende Evidenz tragen, sind in Stunden Audio oder Tausenden von Videoframes vergraben, während der Rechenaufwand unabhängig vom Ort der Evidenz mit der gesamten Sequenzlänge wächst.
Zweitens besitzt das Modell keinen Mechanismus, um sich selbst zu überprüfen. Tastet der erste Durchlauf eine Modalität unzureichend ab, oder erfordert die richtige Antwort tatsächlich die Kombination von Audio- und visuellen Hinweisen, muss ein Einzel-Durchlauf-Modell eine Antwort auf Basis unvollständiger Evidenz festlegen, ohne Möglichkeit zur erneuten Prüfung. OmniSeek definiert audiovisuelles Verständnis als Problem der aktiven Evidenzbeschaffung neu: Das Modell soll eine Hypothese bilden, fehlende Evidenz identifizieren, entscheiden, ob es schauen oder hören soll und über welches Zeitfenster, und dies wiederholen, bis die Evidenz ausreicht, statt die gesamte Eingabe passiv in einem Schritt zu konsumieren.
Architektonischer Kern und technische Prinzipien
OmniSeek verpackt ein Omni-LLM als mehrstufigen Reasoning-Agenten mit nativer Werkzeugnutzung. Das Reasoning läuft nicht mehr in einem einzigen Durchlauf ab, sondern als iteratives Protokoll: In jeder Runde schlussfolgert das Modell über den aktuellen Kontext, entscheidet, ob es ein „Schau"- oder „Hör"-Werkzeug aufrufen soll, und spezifiziert das Zeitfenster des gewünschten Segments. Das abgerufene rohe Audio- oder Videosegment wird dem Kontext erneut hinzugefügt, und der Zyklus wiederholt sich, bis das Modell die Evidenz als ausreichend einschätzt.
Um dieses mehrstufige Werkzeugnutzungsverhalten kaltzustarten, bauten die Autoren eine Daten-Engine, die OmniTraj-170K synthetisiert, ein umfangreiches Korpus aus Mehrfach-Hop-Gedankenketten-Trajektorien, in denen Evidenzabruf- und Reasoning-Schritte über Modalitäten hinweg verschränkt sind. Das Training erfolgt zweistufig: Überwachtes Fine-Tuning auf diesen synthetischen Trajektorien prägt zunächst das Muster „schlussfolgern, entscheiden was abzurufen ist, Evidenz wieder einfügen, erneut schlussfolgern" ein, danach verfeinert eine zweistufige Reinforcement-Learning-Phase mit verifizierbaren Belohnungen die Abruf- und Reasoning-Policy anhand aufgabenbezogener Korrektheitssignale statt reiner Imitation. Die markanteste Designentscheidung ist das Audiovisuelle-Notwendigkeits-Ziel, das explizit Trajektorien belohnt, deren korrekte Schlussfolgerung tatsächlich von Evidenz beider Modalitäten abhängt, und damit gezielt davon abschreckt, Shortcuts über eine einzelne Modalität auszunutzen, die zufällig die richtige Antwort liefern, ohne das eigentlich geforderte modalitätsübergreifende Reasoning durchzuführen.
Praktische Evaluation und Anwendungen
Die resultierende Fähigkeit ist eine adaptive, modalitätsübergreifende Evidenzsuche: Statt die gesamte Eingabe gleich zu behandeln, entscheidet das Modell je nach Schwierigkeit und Evidenzverteilung der konkreten Frage, wie viele Abrufrunden es durchführt, welche Zeitfenster es ansteuert und ob Audio- oder visuelle Prüfung Vorrang hat.
Über eine breite Suite von audiovisuellen Reasoning-Benchmarks hinweg übertrifft OmniSeek durchgängig Baselines, die die gesamte Sequenz in einem Durchlauf aufnehmen. Entscheidend ist, dass die Gewinne kein Artefakt der isolierten Verbesserung einer einzelnen Modalität sind: Sie konzentrieren sich auf Fälle, die tatsächlich die Kombination von Audio- und Videoevidenz erfordern, genau die empirische Signatur, die das Audiovisuelle-Notwendigkeits-Ziel erzeugen sollte, und das belegt, dass das Modell eine echte abrufbasierte Reasoning-Fähigkeit erlernt hat statt eines Shortcuts über eine einzelne Modalität.
Branchenwirkung und Ausblick
OmniSeek markiert eine bedeutende Richtungsänderung im Engineering multimodaler Agenten: Es importiert das native Werkzeugnutzungs-Paradigma, das bei reinen Text-Agenten bereits ausgereift ist, in das audiovisuelle Verständnis und lässt das Modell selbst entscheiden, wann es zusätzliche perzeptuelle Eingaben benötigt, statt sich auf eine feste externe Vorverarbeitungspipeline zum Vorab-Zuschneiden oder Zusammenfassen langer Aufnahmen zu verlassen.
Das ist direkt relevant für das Verständnis langer Videos, die Analyse von Besprechungsprotokollen, die Überwachungs- und Sicherheitsprüfung sowie Faktenprüfungs-Workflows, die modalitätsübergreifende Bestätigung erfordern, allesamt Szenarien mit spärlicher Evidenz eingebettet in langen Kontext, genau das Regime, auf das OmniSeek zielt. Für die Zukunft sind plausible Erweiterungen eine Verbreiterung der Werkzeugpalette über Schauen/Hören hinaus auf reichhaltigere Wahrnehmungs- und Abrufoperationen sowie die Kopplung dieser mehrstufigen Evidenzsuchschleife mit längeren, echtzeitfähigen Streaming-Eingaben für Online-Reasoning.
Sources
FAQ
Was unterscheidet OmniSeek grundlegend von passiven Omni-LLMs mit einem einzigen Durchlauf?
OmniSeek verwandelt das Reasoning in ein iteratives mehrstufiges Protokoll, in dem das Modell nativ 'Schau'- oder 'Hör'-Werkzeuge aufruft, um bestimmte Zeitfenster von Audio- oder Videoevidenz abzurufen und wieder in den Kontext einzufügen, statt die gesamte Sequenz einmal für einen einzigen Durchlauf zu kodieren.
Wie wird das Modell für mehrstufige Werkzeugnutzung kaltgestartet?
Die Autoren bauen eine Daten-Engine, die OmniTraj-170K synthetisiert, ein Korpus aus Mehrfach-Hop-Gedankenketten-Trajektorien mit verschränkten Evidenzabruf- und Reasoning-Schritten über Modalitäten, das für überwachtes Fine-Tuning vor dem Reinforcement Learning genutzt wird.
Was verhindert das Audiovisuelle-Notwendigkeits-Ziel?
Es verhindert, dass das Modell Shortcuts über eine einzelne Modalität ausnutzt: Trajektorien, die die richtige Antwort allein mit Hinweisen einer Modalität erreichen, ohne das tatsächlich geforderte modalitätsübergreifende Reasoning durchzuführen, werden nicht belohnt.