LEGO : générer une vidéo égocentrique à partir d'une vue externe sans « lifting », le synthétiseur fournit la structure et la diffusion le détail
LEGO (arXiv 2610.12442) génère une vidéo égocentrique depuis une vue externe sans profondeur ni nuage de points. Un transformeur de type LVSM fournit la structure, la diffusion restaure le détail, et la confiance guide le débruitage.
Générer une vidéo égocentrique à partir d'un seul enregistrement exocentrique est l'un des cas les plus difficiles de la synthèse de nouvelles vues. La raison est simple : les deux caméras partagent très peu de champ commun, et la plus grande partie de la vue cible n'apparaît jamais dans l'entrée. L'enjeu est pourtant considérable. L'apprentissage par imitation en robotique demande des démonstrations vues depuis le point de vue de l'acteur. La réalité augmentée, la réalité virtuelle et l'enseignement de gestes techniques réclament des images à la première personne. Or collecter de telles images à grande échelle coûte cher, alors que les vidéos à la troisième personne existent partout. Le 8 octobre 2026, Suhwan Cho et quatre coauteurs ont publié LEGO sur arXiv (2610.12442, cs.CV), qui propose une voie différente de celle du courant dominant.
Voyons d'abord ce que font les meilleures méthodes actuelles. Selon le résumé de l'article, l'état de l'art reconstruit la scène de façon explicite. Il estime la profondeur, projette la vidéo dans un nuage de points, rend ce nuage depuis la caméra égocentrique, puis transmet le résultat à un modèle de diffusion vidéo comme condition. Il s'agit d'une application déterministe : chaque pixel tombe sur un seul emplacement reprojeté. L'avantage est que la texture se conserve bien. L'inconvénient est tout aussi net : toute erreur d'estimation de profondeur devient du contenu mal placé dans la condition. Quand les deux caméras se recouvrent à peine, les erreurs de profondeur sont presque inévitables, et la qualité de tout le pipeline est plafonnée par celle de sa géométrie. LEGO pose une autre question : que doit réellement recevoir un modèle de diffusion vidéo comme condition ? Sa réponse est « sans lifting ». Les auteurs affinent un transformeur de type LVSM, appelé synthétiseur de vues appris, pour rendre directement la vue égocentrique. Il n'utilise ni profondeur, ni nuage de points, ni reprojection, et le réseau résout lui-même la correspondance entre vues. Là où le pipeline explicite est déterministe, cette application est probabiliste. Pour chaque région, le synthétiseur calcule une moyenne sur plusieurs positions sources candidates, pondérée par une distribution de correspondance apprise. Le résultat garde la structure et perd la texture fine, car la moyenne lisse le détail. L'image paraît plus douce qu'une reprojection, mais son contenu se trouve à peu près au bon endroit.
Les auteurs ne cachent pas ce coût : ils en font l'argument de conception. Selon eux, ce compromis convient à un générateur par diffusion, dont l'entraînement par débruitage excelle à restaurer le détail. Une condition efficace doit donc privilégier l'alignement structurel plutôt que la netteté. Autrement dit, la condition indique où sont les choses et à quoi ressemble la scène, tandis que le générateur ajoute seul les poils, le grain et les surfaces. La dernière phrase du résumé énonce ce partage du travail : le synthétiseur fournit la structure de la vue, le modèle de diffusion fournit le détail. D'autres systèmes procèdent du grossier au fin, mais ici l'étape grossière n'est plus un pipeline géométrique conçu à la main : c'est un module appris de bout en bout pour la tâche. LEGO tire aussi parti de la distribution elle-même. Une distribution de correspondance concentrée signifie que le synthétiseur est sûr de l'origine d'une région. Une distribution diffuse signifie que plusieurs positions candidates se disputent la place et que le résultat est moins fiable. L'article convertit cette concentration en confiance par région et l'emploie à deux reprises. D'abord, il masque les régions peu sûres, pour ne pas imposer au générateur un signal douteux. Ensuite, pendant les premières étapes de débruitage, celles qui forment la mise en page globale, il guide le générateur vers les zones à forte confiance. La composition d'ensemble se fixe ainsi sur un terrain solide, et le reste suit. La logique est naturelle : écouter davantage la condition là où elle est sûre, moins là où elle ne l'est pas.
Côté résultats, le résumé affirme que LEGO surpasse de façon constante le pipeline explicite de l'état de l'art et se généralise à d'autres jeux de données sans réentraînement. Le résumé ne donne aucune valeur chiffrée, et l'ampleur du gain ne peut se juger qu'avec la section expérimentale de l'article complet. Deux réserves s'imposent. Premièrement, les régions occultées ou jamais observées restent imaginées par le générateur. Un score de confiance rend le système plus honnête sur ce qui est fiable, mais il ne crée pas d'information absente de l'entrée. Deuxièmement, la portée de la généralisation entre jeux de données dépend de ceux que les auteurs ont testés, ce qu'il faut vérifier dans le texte. Même avec ces réserves, l'intérêt de LEGO dépasse cette seule tâche. Le travail énonce un principe réutilisable : adapter la condition aux points forts du générateur plutôt que de viser une entrée nette et physiquement exacte. Les tâches qui pilotent un modèle de diffusion par des conditions géométriques, comme le montage vidéo, le rendu monoculaire ou les modèles du monde en robotique, connaissent la même tension entre une géométrie exacte mais fragile et une structure floue mais robuste. Pour les praticiens, la leçon est concrète : si un pipeline échoue parce qu'un estimateur en amont se trompe avec assurance, on peut remplacer l'application rigide par une application probabiliste, conserver son incertitude et laisser la diffusion s'occuper du détail. LEGO montre que cet échange peut fonctionner sur l'un des problèmes de synthèse de vues les moins contraints en vidéo.
Sources
FAQ
Que signifie « sans lifting » dans LEGO ?
LEGO n'estime pas de profondeur, ne construit pas de nuage de points et ne reprojette aucun pixel. Un transformeur de type LVSM, affiné pour la tâche, rend directement la vue égocentrique et résout la correspondance entre vues en interne. Ce rendu sert ensuite de condition au modèle de diffusion vidéo.
Pourquoi une condition plus floue peut-elle aider un modèle de diffusion ?
Les auteurs soutiennent que l'entraînement par débruitage excelle à restaurer le détail. La condition doit donc privilégier l'alignement structurel plutôt que la netteté. La correspondance probabiliste moyenne chaque région sur plusieurs positions sources candidates : elle garde la structure et perd la texture fine. Le pipeline explicite garde la texture, mais transforme les erreurs de profondeur en contenu mal placé.
Comment la confiance par région est-elle obtenue et utilisée ?
Le synthétiseur apprend une distribution de correspondance pour chaque région. Plus elle est concentrée, plus le modèle est sûr de l'origine du contenu. L'article utilise cette concentration comme score de confiance, d'abord pour masquer les régions peu sûres, ensuite pour guider le générateur vers les zones fiables pendant les premières étapes de débruitage, celles qui forment la mise en page.