LEGO: Egozentrische Videogenerierung aus einer Außenansicht ohne Lifting, der Synthesizer liefert die Struktur und die Diffusion das Detail
LEGO (arXiv 2610.12442) erzeugt aus einem Außenvideo ein egozentrisches Video ohne Tiefe oder Punktwolke. Ein Transformer im LVSM-Stil liefert die Struktur, die Diffusion das Detail, und die Konfidenz lenkt das Entrauschen.
Aus einer einzigen exozentrischen Aufnahme ein egozentrisches Video zu erzeugen, gehört zu den schwierigsten Fällen der Synthese neuer Ansichten. Der Grund ist einfach: Die beiden Kameras teilen kaum Bildinhalt, und der größte Teil der Zielansicht kommt in der Eingabe nie vor. Der Nutzen ist dennoch groß. Imitationslernen in der Robotik braucht Demonstrationen aus der Sicht des Handelnden. AR, VR und Fertigkeitstraining brauchen Aufnahmen aus der Ich-Perspektive. Solches Material in großem Umfang zu sammeln ist teuer und mühsam, während Videos aus der Außensicht fast überall vorliegen. Am 8. Oktober 2026 veröffentlichten Suhwan Cho und vier Koautoren LEGO auf arXiv (2610.12442, cs.CV) und schlagen darin einen Weg vor, der vom Mainstream abweicht. Zunächst zur stärksten bisherigen Methode. Laut Abstract rekonstruiert der Stand der Technik die Szene explizit. Er schätzt die Tiefe, hebt das Video in eine Punktwolke, rendert diese Wolke aus der egozentrischen Kamera neu und reicht das Ergebnis als Bedingung an ein Video-Diffusionsmodell weiter. Das ist eine deterministische Abbildung, denn jedes Pixel landet auf genau einer reprojizierten Position. Der Vorteil: Die Textur bleibt gut erhalten. Der Nachteil ist ebenso klar: Jeder Fehler der Tiefenschätzung wird in der Bedingung zu falsch platziertem Inhalt. Wenn sich zwei Kameras kaum überlappen, sind Tiefenfehler fast unvermeidlich, und die Qualität der gesamten Pipeline ist durch die Qualität ihrer Geometrie nach oben begrenzt. LEGO stellt eine andere Frage: Was soll ein Video-Diffusionsmodell als Bedingung überhaupt erhalten? Die Antwort lautet: ohne Lifting. Die Autoren stimmen einen Transformer im LVSM-Stil fein ab, den sie gelernten View-Synthesizer nennen, und lassen ihn die egozentrische Ansicht direkt rendern. Er verwendet weder Tiefe noch Punktwolke noch Reprojektion. Das Netz löst die Zuordnung zwischen den Ansichten selbst. Wo die explizite Pipeline deterministisch arbeitet, ist diese Abbildung probabilistisch. Für jede Region mittelt der Synthesizer über mehrere mögliche Quellpositionen, gewichtet mit einer gelernten Zuordnungsverteilung. Das Ergebnis behält die Struktur und verliert die feine Textur, weil die Mittelung Details glättet. Das Bild wirkt weicher als eine Reprojektion, doch sein Inhalt liegt ungefähr an der richtigen Stelle.
Die Autoren verbergen diesen Preis nicht, sondern machen ihn zur Entwurfsbegründung. Ihr Argument: Der Kompromiss passt zu einem Diffusionsgenerator, dessen Entrauschungstraining Details hervorragend wiederherstellt. Eine wirksame Bedingung sollte deshalb die strukturelle Ausrichtung über die Schärfe stellen. Anders gesagt: Die Bedingung sagt, wo die Dinge sind und wie die Szene insgesamt aussieht, während der Generator Haare, Körnung und Oberflächen selbst ergänzt. Der letzte Satz des Abstracts fasst die Arbeitsteilung zusammen: Der Synthesizer liefert die Ansichtsstruktur, das Diffusionsmodell das Detail. Viele Systeme gehen von grob zu fein vor. Neu ist hier, dass die grobe Stufe keine von Hand gebaute geometrische Pipeline mehr ist, sondern ein für die Aufgabe durchgängig gelerntes Modul.
LEGO gewinnt außerdem mehr aus der Verteilung selbst. Eine konzentrierte Zuordnungsverteilung bedeutet, dass der Synthesizer die Herkunft einer Region sicher kennt. Eine breite Verteilung bedeutet, dass viele Kandidatenpositionen konkurrieren und das Ergebnis unzuverlässiger ist. Das Papier wandelt diese Konzentration in eine Konfidenz je Region um und nutzt sie zweifach. Erstens maskiert es Regionen mit geringer Konfidenz, damit dem Generator kein unsicheres Signal aufgezwungen wird. Zweitens lenkt es den Generator in den frühen Entrauschungsschritten, die das globale Layout bilden, auf Bereiche mit hoher Konfidenz. Die Gesamtkomposition festigt sich so auf sicherem Grund, der Rest folgt. Die Logik liegt nahe: Der Bedingung dort stärker folgen, wo sie sicher ist, und dort schwächer, wo nicht.
Zu den Ergebnissen sagt das Abstract, LEGO übertreffe die explizite Pipeline des Stands der Technik durchgängig und generalisiere ohne Neutraining auf andere Datensätze. Das Abstract nennt keine Messwerte, deshalb lässt sich die Größe des Gewinns erst anhand des Experimentteils im Volltext beurteilen. Zwei Vorbehalte sind sinnvoll. Erstens müssen verdeckte oder nie beobachtete Regionen am Ende doch vom Generator erfunden werden. Ein Konfidenzwert macht das System ehrlicher darüber, wo es verlässlich ist, schafft aber keine Information, die in der Eingabe fehlte. Zweitens hängt die Reichweite der Generalisierung davon ab, welche Datensätze die Autoren getestet haben, und das ist im Originaltext zu prüfen. Trotz dieser Vorbehalte reicht der Wert von LEGO über diese eine Aufgabe hinaus. Die Arbeit formuliert ein wiederverwendbares Entwurfsprinzip: die Bedingung auf die Stärken des Generators zuschneiden, statt eine scharfe, physikalisch exakte Eingabe anzustreben. Aufgaben, bei denen Diffusionsmodelle über geometrische Bedingungen gesteuert werden, etwa Videobearbeitung, monokulares Neu-Rendering und Weltmodelle in der Robotik, kennen dieselbe Spannung zwischen exakter, aber brüchiger Geometrie und weicher, aber robuster Struktur. Für Praktiker ist die Lehre konkret: Scheitert eine Pipeline, weil ein vorgelagerter Schätzer selbstsicher irrt, kann man die harte Abbildung durch eine probabilistische ersetzen, ihre Unsicherheit behalten und das Detail dem Diffusionsmodell überlassen. LEGO zeigt, dass dieser Tausch bei einem der am wenigsten eingeschränkten Probleme der Ansichtssynthese im Video funktionieren kann.
Sources
FAQ
Was bedeutet „ohne Lifting“ bei LEGO?
LEGO schätzt keine Tiefe, baut keine Punktwolke und reprojiziert keine Pixel. Ein feinabgestimmter Transformer im LVSM-Stil rendert die egozentrische Ansicht direkt und löst die Zuordnung zwischen den Ansichten intern. Dieses Rendering dient danach als Bedingung für das Video-Diffusionsmodell.
Warum kann eine unschärfere Bedingung einem Diffusionsmodell helfen?
Die Autoren argumentieren, dass das Entrauschungstraining Details gut wiederherstellt. Die Bedingung sollte deshalb die strukturelle Ausrichtung über die Schärfe stellen. Die probabilistische Zuordnung mittelt jede Region über mögliche Quellpositionen, behält die Struktur und verliert feine Textur. Die explizite Pipeline behält die Textur, macht aus Tiefenfehlern aber falsch platzierte Inhalte.
Wie wird die Konfidenz je Region bestimmt und genutzt?
Der Synthesizer lernt für jede Region eine Zuordnungsverteilung. Je konzentrierter sie ist, desto sicherer ist das Modell über die Herkunft des Inhalts. Das Papier nutzt diese Konzentration als Konfidenzwert: erst zum Maskieren unsicherer Regionen, dann zum Lenken des Generators auf sichere Bereiche in den frühen Entrauschungsschritten, die das Layout bilden.