RuleMaze : un benchmark pour la planification spatiale visuelle conforme aux règles dans les grands modèles multimodaux
Cet article se concentre sur la capacité de planification spatiale visuelle des grands modèles de langage multimodaux (MLLM) dans des contraintes explicites ou invisibles, soulignant que cette capacité reste peu explorée. Les auteurs proposent RuleMaze, un benchmark contrôlable qui exige que les modèles naviguent dans un labyrinthe tout en suivant des règles de complexité lingu naturelle variable, isolant ainsi trois capacités fondamentales : la perception, l'interprétation des règles et la planification d'actions contraintes. Pour construire systématiquement des règles, les auteurs introduisent une approche d'hybridation Langage-Logique-Fonction qui génère automatiquement des règles en langage naturel et les traduit en représentations logiques et en vérificateurs exécutables, éliminant ainsi le travail manuel d'ingénierie des règles. Pour améliorer le respect des règles et la généralisation, les auteurs proposent en outre la Planification Multimodale Découplée (DMP), qui sépare la perception, l'exécution et la vérification des règles à l'aide de primitives de raisonnement interprétables, permettant une généralisation systématique à des règles plus complexes et invisibles tout en offrant des trajectoires de planification intermédiaires transparentes. Les expériences montrent que la DMP dépasse nettement les lignes de base de planification textuelle de bout en bout en matière de conformité aux règles et de taux de succès de la planification. RuleMaze fournit un benchmark fondé sur des principes pour étudier la planification spatiale ancrée et interpréable pilotée par des règles.
Contexte
Les grands modèles multimodaux (MLLM) combinent le raisonnement linguistique et la perception visuelle, mais leur capacité à planifier dans l'espace sous des contraintes de règles explicites ou jusqu'alors invisibles reste largement inexplorée. Une telle situation oblige un modèle à comprendre simultanément une disposition spatiale, à interpréter des règles formulées en langage naturel et à concevoir une séquence d'actions légales qui les respectent. Pour combler ce vide, les chercheurs proposent RuleMaze, un benchmark contrôlable de navigation en labyrinthe qui isole la planification conforme aux règles des tâches visuelles ordinaires.
En faisant varier systématiquement la complexité des règles, la référence sépare trois capacités fondamentales : la perception, l'interprétation des règles et la planification d'actions contraintes. Ce dispositif transforme la question vague de savoir si un modèle « suit les règles » en un problème scientifique quantifiable, décomposable et reproductible. Le travail apporte à la fois une base d'évaluation rigoureuse et un cadre méthodologique correspondant.
Plutôt que de s'arrêter aux taux de réussite, il encourage l'examen de la structure et de l'interpréabilité du processus de planification lui-même. Cette ouverture ouvre une entrée claire pour étudier un raisonnement spatial ancré et piloté par des règles, en reliant directement la théorie à des scénarios concrets de navigation.
Analyse approfondie
La première contribution technique repose sur l'hybridation Langage-Logique-Fonction, une méthode pour construire les règles de façon systématique et évolutive. Elle génère automatiquement des règles en langage naturel et les traduit en représentations logiques et en vérificateurs exécutables, éliminant ainsi le travail manuel d'ingénierie. Ce mélange permet aux règles d'être exprimées en langage humain tout en étant strictement validées par la logique machine, préservant à la fois l'évolutivité et la cohérence.
Pour renforcer le respect des règles et la généralisation, les auteurs proposent la Planification Multimodale Découplée (DMP). À l'aide de primitives de raisonnement interprétables, DMP sépare explicitement la perception, l'exécution et la vérification des règles. Au lieu de tout fondre dans un seul flux textuel de bout en bout, le modèle traite indépendamment la perception spatiale, l'exécution des actions et le contrôle des règles.
Cette décomposition structurée permet à DMP de généraliser systématiquement vers des règles plus complexes et inédites, tout en offrant des trajectoires intermédiaires transparentes. Chaque étape de décision devient traçable et explicable. Comparée aux approches de bout en bout qui compressent perception, raisonnement et action dans une seule génération textuelle, DMP offre des avantages nets en contrôlabilité et en interpréabilité.
Impact sur l'industrie
Sur le benchmark RuleMaze, les auteurs évaluent systématiquement plusieurs méthodes, en comparant principalement les lignes de base de planification textuelle de bout en bout à DMP. Les résultats montrent que DMP dépasse nettement ces lignes de base sur la conformité aux règles et le taux de succès, validant l'aide réelle de la structure découplée. Les études d'ablation convergent vers la même conclusion : séparer perception, exécution et vérification produit une planification plus stable et plus explicable que leur modélisation implicite regroupée.
Pour la communauté开源, le papier publie son code, réduisant la barrière à la reproductibilité. Pour le déploiement industriel, des tâches exigeant un respect strict des règles — robotique de navigation, automatisation, jeu vidéo et intelligence incarnée — reposent précisément sur ce type de planification vérifiable. Les trajectoires intermédiaires transparentes de DMP offrent des preuves de décision auditables pour ces scénarios à haut risque.
RuleMaze traite la complexité des règles comme une variable contrôlable, permettant d'observer comment les modèles se dégradent et s'adaptent sous des règles plus complexes et inédites. Cette capacité fournit un cadre d'analyse quantitatif pour comprendre la conformité des MLLM, reliant directement la recherche fondamentale aux exigences opérationnelles réelles.
Perspectives
RuleMaze reformule la planification conforme aux règles d'une description de capacité vague vers un problème scientifique décomposable et quantifiable, encourageant l'exploration de l'interaction entre perception, raisonnement et vérification. Les résultats suggèrent que l'amélioration de la planification ne dépend pas seulement de l'échelle des modèles, mais aussi d'une décomposition sensée de la structure de tâche.
Globalement, ce travail signale à l'industrie que l'évaluation des grands modèles multimodaux doit dépasser les taux de réussite pour s'enfoncer dans la structure et l'interpréabilité des processus de planification. Ce déplacement pousse les modèles à passer du simple « résoudre des exercices » à l'action fiable et conforme aux règles.
RuleMaze fournit ainsi une base rigoureuse pour étudier une planification spatiale ancrée et interpréable pilotée par des règles, posant les fondations d'une prise de décision multimodale de confiance et vérifiable. Les travaux futurs pourront explorer comment ces primitives explicites renforcent la robustesse dans des environnements réels complexes, en ouvrant la voie à des systèmes multimodaux réellement responsables et auditables.