WorldAlign: Eine entkoppelte 4D-Belohnung für weltkonsistente Videogenerierung
WorldAlign teilt die Belohnung. Statische Bereiche gleicht es per maskierter Reprojektion an einen geometrischen Prior an, plus Kamerabewegungs-Reward. Ein VLM bewertet dynamische Subjekte per Checkliste. Ohne Labels gewinnen Wan2.1 und Wan2.2.
Die Videogenerierung hat sich vor allem auf einer Achse verbessert: realistisch auszusehen. Texturen sind feiner, Licht ist weicher, Kamerafahrten sind ruhiger. Doch die Frage ändert sich, sobald man diese Modelle als Weltsimulatoren einsetzt, etwa zum Proben von Roboteraufgaben, für Spielszenen oder als Trainingsumgebung für verkörperte Agenten. Ein Simulator muss nicht nur gut aussehen. Er muss seine eigenen Regeln einhalten. Eine Wand, die von einer Seite gesehen wurde, darf ihre Form nicht ändern, wenn die Kamera zurückkehrt. Eine Person, die zehn Sekunden lang geht, darf nicht unbemerkt Gesicht oder Kleidung wechseln. Das Paper WorldAlign von Jing He, Kaixin Ding, Xingye Tian, Guibao Shen, Wenhang Ge und Kollegen nennt diese Anforderung 4D-Weltkonsistenz. Die drei Raumdimensionen müssen kohärent bleiben, ebenso Bewegung und Aussehen entlang der Zeitachse. Der erste Teil ist die statische, der zweite die dynamische Konsistenz. Das Paper erschien am 8. Oktober 2026 in der Kategorie cs.CV.
Ein naheliegender Weg zu mehr Konsistenz ist geometriebewusstes Post-Training. Der Generator erzeugt ein Video. Ein Geometriemodell schätzt Tiefe und Kameraposition, projiziert ein Bild in ein anderes und misst den Fehler. Dieser Fehler dient als Belohnung, um den Generator zu justieren. Der Weg hat zwei bekannte Schwächen. Erstens setzt er meist eine statische Szene voraus. Geht eine Person oder fährt ein Auto, deutet die Reprojektion echte Bewegung als geometrischen Fehler, und die Belohnung bestraft genau die Dynamik, die ein gutes Video braucht. Zweitens liefern auch Methoden, die dynamische Szenen dulden, unzuverlässiges Feedback zur statischen Konsistenz, weil bewegte und ruhende Pixel in einen Fehler eingehen. Dynamische Konsistenz, also plausible Bewegung und stabiles Aussehen über die Zeit, wird oft ignoriert oder nur grob gemessen.
Die Kernidee von WorldAlign ist einfach. Statischer und dynamischer Inhalt folgen unterschiedlichen Annahmen, deshalb sollte man sie nicht mit demselben Maßstab messen. Das Framework trennt das Bild zunächst semantisch in statische Bereiche und dynamische Subjekte. Jeder Teil wird dann an den Weltprior angeglichen, der zu seinen Annahmen passt. Für statische Bereiche ist der Prior geometrisch. Eine semantisch geführte, maskierte Reprojektion berechnet die geometrische Angleichung zwischen Blickwinkeln nur auf Pixeln, die als statisch gelten. Bewegte Subjekte bleiben außen vor, das Feedback wird sauberer und verlässlicher. Die Autoren ergänzen einen praktischen Kniff. Ein reiner Geometrie-Reward hat eine Abkürzung: Bewegt sich das Video kaum, bleibt der Reprojektionsfehler klein. Der Optimierer findet das. Ein zusätzlicher Kamerabewegungs-Reward bestraft daher nahezu statische Lösungen und erzwingt echten Blickwechsel bei gleichbleibender Geometrie. Das ist eine typische Abwehr gegen Reward Hacking und zugleich eine Mahnung: Jede einzelne berechenbare Metrik wird von einem starken Optimierer ausgetrickst.
Für dynamische Subjekte hilft Geometrie nicht. Ob eine Bewegung plausibel ist, ist eine Frage von Alltagswissen und Physik, nicht von Geometrie. Die Autoren nutzen ein starkes Vision-Language-Modell als dynamischen Weltprior und lassen es als Richter arbeiten. Die zentrale Entscheidung ist die probenspezifische Checkliste. Für jedes erzeugte Video baut das System konkrete Fragen und bewertet sie einzeln nach vier Aspekten: Dynamik, physikalische Plausibilität, Formkonsistenz und Texturkonsistenz. Die Dynamik fragt, ob sich bewegt, was sich bewegen soll. Die physikalische Plausibilität fragt, ob Handlungen Schwerkraft, Kontakt und Trägheit respektieren. Form und Textur prüfen, ob ein Subjekt sich verformt oder im Lauf der Zeit sein Aussehen wechselt. Eine Checkliste ist besser als eine vage Gesamtnote. Sie bindet den Richter an konkrete Belege und macht den Reward leichter prüfbar. Ebenso wichtig: Das alles braucht keine menschlichen Präferenzlabels. Beide Rewards stammen aus Priors, daher ist Online-Post-Training möglich und die Datenkosten sinken.
Das Paper testet die Methode an zwei vortrainierten Bild-zu-Video-Generatoren, Wan2.1 und Wan2.2. Es berichtet, dass WorldAlign statische und dynamische Konsistenz gemeinsam verbessert, ohne die Gesamtbewegung oder die Subjektbewegung zu unterdrücken. Dieser letzte Punkt zählt. In der Literatur stammen viele Konsistenzgewinne daher, dass Videos langweiliger werden, und eine Methode, die durch Einfrieren der Szene gewinnt, hat nichts gewonnen. Aus der Zusammenfassung allein sind genaue Zahlen, Ablationsdetails und Rechenkosten nicht ersichtlich. Dafür muss man das ganze Paper und die Projektseite worldalign.github.io lesen. Aus dem Methodendesign bleiben mehrere offene Fragen. Ein VLM-Richter hat eigene Verzerrungen und Instabilitäten, und der Reward kann nicht besser sein als er. Verwechselt die semantische Segmentierung statische und dynamische Bereiche, bringt die maskierte Reprojektion Rauschen ein. Geometrische Priors können auch bei spiegelnden oder transparenten Flächen und extremen Blickwinkeln versagen.
Dennoch ist das Prinzip wertvoll. Besteht eine Welt aus Teilen unterschiedlicher Natur, sollte der Reward entlang derselben Linien geteilt werden, und jeder Teil an einen passenden Prior angeglichen. Die Idee könnte sich auf längere Videos, Interaktionen mehrerer Subjekte und schließlich auf visuelle Weltsimulation ausdehnen, auf die sich Ingenieure verlassen können. Für Teams, die Videomodelle bauen, lautet die praktische Lehre: den Reward auf versteckte Annahmen wie die einer statischen Szene prüfen und jeden Reward-Term gegen den billigsten Weg schützen, ihn zu erfüllen.
Sources
FAQ
Was bedeutet „entkoppelt“ bei WorldAlign?
Das Bild wird semantisch in statische Bereiche und dynamische Subjekte geteilt, jedes mit eigenem Weltprior. Statische Bereiche werden gegen einen geometrischen Prior auf 3D-Struktur über Blickwinkel geprüft. Dynamische Subjekte bewertet ein Vision-Language-Modell nach Bewegung, Physik, Form und Textur.
Warum wird ein Kamerabewegungs-Reward ergänzt?
Ein Reward für statische Konsistenz hat eine Abkürzung. Bewegt sich das Video kaum, bleibt der Reprojektionsfehler klein. Ein Modell kann lernen, fast statische Clips zu erzeugen. Der zusätzliche Reward bestraft diese Lösung und zwingt das Modell, den Blickwinkel zu ändern und dabei geometrisch konsistent zu bleiben.
Warum braucht das Verfahren keine menschlichen Präferenzlabels?
Der statische Reward stammt aus einem geometrischen Prior durch berechenbare Reprojektionsangleichung. Der dynamische Reward stammt von einem starken VLM, das probenspezifische Checklisten bewertet. Beides braucht keine von Menschen gelabelten Paare. Die Qualität hängt aber davon ab, wie verlässlich diese Priors sind.