WOVEN: Visuelle Weltmodellierung in multimodale LLMs einweben

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WOVEN bietet 36.076 Beispiele zu visuellen Übergängen (20 Szenen, 5 Aktionen, 8 Schlussfolgerungstypen). Alle 38 getesteten MLLMs bleiben zurück. Etwa 2.000 Trainingsbeispiele verbessern 22 von 26 externen Benchmarks um bis zu 27,3 Punkte.

Multimodale große Sprachmodelle haben in den letzten zwei Jahren bei Bildbeschreibung, Dokumentverständnis und visueller Fragebeantwortung rasch Fortschritte gemacht. Sobald eine Frage jedoch von räumlichen Beziehungen, verkörperter Interaktion, physikalischen Regeln oder dem Lauf der Zeit abhängt, fällt ihre Leistung zurück. Was passiert, wenn ein Roboter eine Tasse zur Tischkante schiebt? Was geschieht mit einem Klotzturm, wenn man den untersten Klotz herauszieht? Wo befindet sich ein Gegenstand im Bild eine Sekunde später? Diese Fragen wirken verschieden, und lange galten sie als getrennte Schwächen, jede mit eigenem Benchmark gemessen und mit eigenen Daten behoben. Die Arbeit WOVEN, am 8. Oktober 2026 als 2610.12417 auf arXiv erschienen, verfasst unter anderem von Zheyu Fan, Yue Zhang, Mingkai Deng, Kangrui Wang und Qineng Wang, bietet eine einfachere Lesart: Diese Fehler haben eine gemeinsame Wurzel, ein Defizit im visuellen Übergangsdenken, also in der Fähigkeit, intern zu simulieren, wie eine Szene aussieht, nachdem eine Aktion auf sie angewendet wurde.

Der Wert dieser Hypothese liegt weniger darin, eine neue Fähigkeit zu benennen, als darin, das Problem anders zu ordnen. Wenn Fehler im räumlichen, verkörperten, physikalischen und zeitlichen Denken tatsächlich dieselbe Quelle haben, müssen Teams nicht für jede Folgeaufgabe teure Annotationen sammeln. Visuelles Übergangsdenken kann dann als gemeinsames Trainingsprimitiv dienen: Verschiedene Modelle lernen es aus verschiedenen Supervisionsquellen und nutzen es für verschiedene Aufgaben wieder. Die Autoren wollen genau diese Behauptung prüfen und daraus ein systematisches Trainingsrezept ableiten. Sie weisen darauf hin, dass bestehende Benchmarks die Defizite getrennt dokumentieren und keine kontrollierten Vergleiche über Szenen, Aktionen und Schlussfolgerungsoperationen erlauben. Bewertung allein genügt daher nicht. Es braucht eine Datenquelle, die entlang dieser drei Achsen organisiert ist.

WOVEN ist diese Datenquelle und dient zugleich als Benchmark. Der Datensatz enthält 36.076 Beispiele aus 20 Szenentypen, 5 Aktionstypen und 8 Schlussfolgerungstypen. Das Material stammt aus vielfältigen, realistischen Rollouts videovortrainierter Generativmodelle: Man gibt dem Generativmodell ein Anfangsbild und eine Aktion, es entfaltet die Folgen, und um die entstandenen Bilder herum werden Fragen gebaut. Diese Struktur hat einen praktischen Vorteil. Forschende können zwei Achsen festhalten und nur die dritte variieren. So lassen sich Fragen stellen, die früher schwer zu beantworten waren, etwa ob die Szene, die Aktion oder die Schlussfolgerungsoperation selbst bestimmt, wie gut das Training übertragen wird. Die saubere Trennung der Variablen ist aus unserer Sicht die lehrreichste methodische Entscheidung der Arbeit.

Die Evaluationsergebnisse zeigen ein Defizit, das erheblich, systematisch und hartnäckig ist. Die Autoren testeten 38 führende multimodale Modelle, darunter GPT-5.4 und Qwen3-VL-235B-A22B. Selbst die stärksten Modelle bleiben weit hinter Menschen zurück. Dieselben Fehler wiederholen sich über Modellfamilien hinweg, es sind also keine Eigenheiten einer einzelnen Trainingspipeline. Und die Fehler bleiben mit wachsender Größe bestehen, was am wichtigsten ist: Mehr Parameter und generische Daten allein erzeugen offenbar nicht die Fähigkeit, über Änderungen des visuellen Zustands zu schließen. Das passt zu einer wachsenden Zahl von Arbeiten zu physikalischem Alltagswissen und räumlichem Denken und stützt die Forderung nach einem eigenen Supervisionssignal.

Die Trainingsexperimente liefern das nützlichere positive Ergebnis. Die Autoren trainierten multimodale Modelle in mehreren Größen auf WOVEN und stellten fest, dass sie eine gemeinsame Fähigkeit lernen, die breit übertragbar ist. Trainingsteilmengen von jeweils nur etwa 2.000 Beispielen verbessern zusammen 22 von 26 externen Benchmarks, um bis zu 27,3 Prozentpunkte. Eine zweite Zahl ist für Engineering-Teams noch wichtiger: WOVEN-Daten können 30 bis 50 Prozent der aufgabeneigenen Trainingsdaten bei vergleichbarer Genauigkeit ersetzen. Bei verkörperten oder räumlichen Aufgaben mit teuren Labels könnte ein Teil der Supervision also aus allgemeinen Daten zum Übergangsdenken kommen. Eine Warnung ist angebracht: Diese Zahlen berichten die Autoren selbst, vier der 26 Benchmarks verbesserten sich nicht, und jedes Team sollte vor dem Verlass auf die Werte mit eigenen Aufgaben nachtesten.

Schließlich leitet die Arbeit ein Trainingsrezept ab, das die Autoren prospektiv auf zurückgehaltenen Benchmarks validiert haben. Die erste Regel lautet, Supervision nach der Schlussfolgerungsoperation auszuwählen, die sie lehrt, und nicht nach den gezeigten Aktionen, Szenen oder Domänen. Das widerspricht der Gewohnheit: Viele Teams nehmen an, dass sie für bessere Robotikaufgaben Daten aus Robotikszenen sammeln müssen, während WOVEN nahelegt, dass die geübte Schlussfolgerungsoperation den Transfer bestimmt. Die zweite Regel lautet, größere Änderungen des visuellen Zustands zu bevorzugen, weil sie robustere Fähigkeiten ergeben. Für die Branche heißt das, dass die Einheit der Datenkuratierung von der Domäne zur Schlussfolgerungsoperation wandern sollte. Das Training von Weltmodellen muss sich auch nicht allein auf Videogenerierung stützen: Ein multimodales Sprachmodell direkt im Übergangsdenken zu schulen, ist ein weiterer förderwürdiger Weg. Eine Grenze bleibt: Da die Daten aus generativen Rollouts stammen, setzt die physikalische Treue dieser Generatoren der Supervisionsqualität eine Obergrenze, die Folgearbeiten weiter prüfen müssen.

Sources

FAQ

Was ist visuelles Übergangsdenken?

Es ist die Fähigkeit, aus einer Szene und einer Aktion abzuleiten, wie sich die Szene danach verändert, etwa wohin ein angestoßener Gegenstand rollt oder ob ein Turm fällt, wenn ein Klotz fehlt. WOVEN nimmt an, dass Fehler im räumlichen, verkörperten, physikalischen und zeitlichen Denken diesen gemeinsamen Mangel teilen.

Was sind die Kernpunkte des Trainingsrezepts?

Zwei Prinzipien, prospektiv auf zurückgehaltenen Benchmarks validiert. Erstens: Supervision nach der gelehrten Schlussfolgerungsoperation auswählen, nicht nach gezeigten Aktionen, Szenen oder Domänen. Zweitens: Beispiele mit größeren Änderungen des visuellen Zustands bevorzugen, das macht die Gewinne robuster.

Welche Grenzen sollte man beachten?

Die Daten stammen aus Rollouts videovortrainierter Generativmodelle, deren physikalische Treue die Qualität der Supervision begrenzt. Die Gewinne sind von den Autoren berichtet: 22 von 26 Benchmarks verbessern sich, nicht alle. Vor dem Einsatz sollte man auf eigenen Aufgaben nachtesten.