WOVEN : tisser la modélisation du monde visuel dans les LLM multimodaux
WOVEN propose 36 076 exemples de transitions visuelles (20 scènes, 5 actions, 8 raisonnements). Les 38 MLLM testés restent loin des humains. Environ 2 000 items d'entraînement améliorent 22 benchmarks externes sur 26, jusqu'à 27,3 points.
Les grands modèles de langage multimodaux ont beaucoup progressé ces deux dernières années en description d'images, en compréhension de documents et en questions-réponses visuelles. Pourtant, dès qu'une question porte sur les relations spatiales, l'interaction incarnée, les régularités physiques ou l'écoulement du temps, leurs performances décrochent. Que se passe-t-il lorsqu'un robot pousse une tasse vers le bord d'une table ? Que devient une tour de cubes quand on retire le cube du bas ? Où sera un objet de l'image une seconde plus tard ? Ces questions paraissent différentes. On les a longtemps traitées comme des faiblesses indépendantes, chacune mesurée par son propre benchmark et comblée par ses propres données. L'article WOVEN, publié sur arXiv le 8 octobre 2026 sous la référence 2610.12417 par Zheyu Fan, Yue Zhang, Mingkai Deng, Kangrui Wang, Qineng Wang et leurs collègues, propose une lecture plus simple : ces échecs ont une racine commune, un déficit de raisonnement sur les transitions visuelles, c'est-à-dire la capacité à simuler en interne à quoi ressemblera une scène après qu'une action lui a été appliquée.
L'intérêt de cette hypothèse tient moins à la création d'un nom pour une nouvelle capacité qu'au changement dans l'organisation du problème. Si les échecs en raisonnement spatial, incarné, physique et temporel ont vraiment la même origine, il devient inutile de collecter des annotations coûteuses pour chaque tâche aval. Le raisonnement sur les transitions visuelles peut servir de primitive d'entraînement partagée : des modèles différents l'apprennent à partir de sources de supervision différentes, puis la réutilisent sur des tâches différentes. Les auteurs veulent tester précisément cette affirmation et en tirer une recette d'entraînement systématique. Ils notent que les benchmarks existants documentent les déficits séparément et ne permettent pas de comparaisons contrôlées entre scènes, actions et opérations de raisonnement. L'évaluation seule ne suffit donc pas : il faut une source de données organisée selon ces trois axes.
WOVEN est cette source de données, et elle sert aussi de benchmark. Elle contient 36 076 exemples répartis sur 20 types de scènes, 5 types d'actions et 8 types de raisonnement. Le matériau provient de déroulés variés et réalistes de modèles génératifs pré-entraînés sur vidéo : on fournit au modèle génératif une image initiale et une action, il déroule les conséquences, puis on construit des questions autour des images obtenues. Cette structure offre un avantage pratique. Les chercheurs peuvent fixer deux axes et ne faire varier que le troisième, ce qui permet de poser des questions auparavant difficiles, par exemple si c'est la scène, l'action ou l'opération de raisonnement elle-même qui détermine la qualité du transfert. Séparer proprement les variables est, à notre avis, le choix méthodologique le plus instructif de l'article. Les résultats d'évaluation révèlent un déficit substantiel, systématique et tenace. Les auteurs ont testé 38 modèles multimodaux de pointe, dont GPT-5.4 et Qwen3-VL-235B-A22B. Même les plus performants restent très en dessous des humains. Les mêmes échecs reviennent d'une famille de modèles à l'autre : ce ne sont donc pas les travers d'une chaîne d'entraînement particulière. Enfin, ils persistent avec l'échelle, ce qui compte le plus : ajouter des paramètres et des données génériques ne suffit pas à faire émerger la capacité de raisonner sur les changements d'état visuel. Ce constat rejoint un ensemble croissant de travaux sur le sens commun physique et le raisonnement spatial, et il soutient l'idée d'un signal de supervision dédié. Les expériences d'entraînement apportent le résultat positif le plus utile. Les auteurs ont entraîné des modèles multimodaux de plusieurs tailles sur WOVEN et constaté qu'ils apprennent une capacité partagée qui se transfère largement. Des sous-ensembles d'environ 2 000 items chacun améliorent collectivement 22 des 26 benchmarks externes, jusqu'à 27,3 points de pourcentage. Un second chiffre importe encore plus aux équipes d'ingénierie : les données WOVEN peuvent remplacer 30 à 50 % des données d'entraînement propres à une tâche, à précision comparable. Pour les tâches incarnées ou spatiales où les étiquettes coûtent cher, une partie de la supervision pourrait donc venir de données générales de raisonnement sur les transitions. Une réserve s'impose : ces chiffres sont rapportés par les auteurs eux-mêmes, quatre des 26 benchmarks ne s'améliorent pas, et chaque équipe doit retester sur ses propres tâches.
Enfin, l'article tire une recette d'entraînement que les auteurs ont validée de manière prospective sur des benchmarks tenus à l'écart. La première règle consiste à choisir la supervision selon l'opération de raisonnement qu'elle enseigne, et non selon les actions, scènes ou domaines qu'elle montre. Cela va contre l'habitude : beaucoup d'équipes pensent qu'améliorer une tâche de robotique exige des données de scènes robotiques, alors que WOVEN suggère que le transfert dépend de l'opération de raisonnement sollicitée. La seconde règle est de préférer les changements plus importants de l'état visuel, qui donnent une capacité plus robuste. Pour l'industrie, l'unité de curation des données devrait passer du domaine à l'opération de raisonnement. L'entraînement des modèles du monde n'a pas non plus à reposer uniquement sur la génération vidéo : apprendre directement à un modèle de langage multimodal à raisonner sur les transitions est une autre voie à financer. Une limite demeure : les données venant de déroulés génératifs, la fidélité physique de ces générateurs plafonne la qualité de la supervision, et les travaux suivants devront continuer à tester ce plafond.
Sources
FAQ
Qu'est-ce que le raisonnement sur les transitions visuelles ?
C'est la capacité à déduire comment une scène change après une action, par exemple où roule un objet poussé ou si une tour tombe quand on retire un bloc. WOVEN suppose que les échecs en raisonnement spatial, incarné, physique et temporel partagent ce déficit unique.
Quels sont les points clés de la recette d'entraînement ?
Deux principes, validés de façon prospective sur des benchmarks tenus à l'écart. D'abord, choisir la supervision selon l'opération de raisonnement enseignée, et non selon les actions, scènes ou domaines montrés. Ensuite, préférer les exemples où l'état visuel change davantage, pour plus de robustesse.
Quelles limites faut-il garder en tête ?
Les données viennent de déroulés de modèles génératifs pré-entraînés sur vidéo, dont la fidélité physique borne la qualité de la supervision. Les gains annoncés sont rapportés par les auteurs : 22 benchmarks sur 26 s'améliorent, pas tous. Il faut retester sur ses propres tâches.