MoRAL : Inférence BEV VLM compacte ancrée aux capteurs pour la conduite autonome périphérique

Cet article présente MoRAL, un cadre d'inférence de modèle de langage visuel (VLM) compact conçu pour les plateformes de conduite autonome à ressources limitées. En affinant en deux étapes le modèle Cosmos-Reason2-2B, il peut interpréter des représentations d'oiseau (BEV) physiquement encodées pour prendre des décisions de conduite. L'image BEV encode la distance LiDAR, les catégories d'objets et la vitesse radar en caractéristiques visuelles, éliminant le besoin de réseaux de base 3D lors de l'inférence. La première étape affine l'encodeur visuel sur 60 000 enregistrements ancrés ; la deuxième étape affine 2,4 % des paramètres du modèle sur 57 000 enregistrements de chaîne de pensée. Sur le jeu de données nuScenes, MoRAL surpasse la ligne de base 8B zéro-shot dans sept des huit tâches de conduite, améliorant le rappel du freinage d'urgence de 10,8 % à 47,8 % et réduisant la dégradation de la sortie de 94,1 % à 20,8 %, tout en fonctionnant à 42 tok/s sur un GPU grand public de 8 Go.

Contexte

Le déploiement de modèles de langage visuel (VLM) dans des applications de conduite autonome critiques pour la sécurité a longtemps été entravé par une contradiction fondamentale entre la taille du modèle et la fiabilité de la perception spatiale. Les systèmes traditionnels s'appuient sur des réseaux de base 3D massifs pour interpréter l'environnement, une exigence computationally prohibitif pour les dispositifs périphériques aux ressources limitées. Cette dépendance crée un goulot d'étranglement majeur, empêchant l'adoption généralisée de l'intelligence artificielle avancée sur le matériel grand public. La nécessité d'architectures capables de fournir une prise de décision robuste sans la surcharge des pipelines de reconstruction 3D explicites est devenue urgente pour l'industrie automobile.

Pour répondre à ce défi, les chercheurs ont introduit MoRAL, un cadre d'inférence compact conçu spécifiquement pour les plateformes de conduite autonome. MoRAL exploite le modèle Cosmos-Reason2-2B, un VLM relativement léger, mais l'augmente avec une stratégie novatrice d'ancrage aux capteurs. Cette approche redéfinit la manière dont les données environnementales sont présentées au modèle. Au lieu de traiter des flux de capteurs bruts à travers des réseaux neuronaux complexes, MoRAL encode les informations de l'espace physique directement en caractéristiques visuelles. Cela permet au VLM compact de lire l'environnement de conduite comme s'il interprétait une image structurée, contournant ainsi le besoin de réseaux de base 3D pendant la phase d'inférence.

Analyse approfondie

Le cœur technique de MoRAL réside dans sa représentation innovante des données de vue de dessus (BEV) et son pipeline d'ajustement fin en deux étapes. L'image BEV est conçue comme une représentation physiquement codée où la distance LiDAR est mappée sur des bandes de couleur spécifiques, les catégories d'objets sont encodées par des morphologies groupées, et la vitesse Doppler radar est visualisée sous forme de superpositions en forme de coin directionnel. Cette transformation convertit des données spatiales 3D complexes en caractéristiques visuelles 2D qu'un VLM standard peut traiter nativement. En externalisant la perception spatiale dans l'image d'entrée elle-même, le modèle élimine la charge computationnelle de l'extraction de caractéristiques 3D.

Le processus d'entraînement est rigoureusement divisé en deux étapes distinctes pour garantir à la fois la compréhension visuelle et les capacités de raisonnement logique. Dans la première étape, l'encodeur visuel est ajusté finement sur 60 000 enregistrements ancrés. Cette phase est critique pour apprendre au modèle à interpréter le langage visuel spécifique des images BEV encodées. Des études d'ablation confirment que sans cet entraînement explicite, les lignes de base zéro-shot échouent à analyser les sorties BEV, indiquant que le modèle doit être explicitement enseigné à associer ces motifs visuels à des entités physiques. Cette étape ancre efficacement la compréhension visuelle du modèle dans la réalité physique de l'environnement de conduite.

La deuxième étape se concentre sur l'amélioration des capacités de raisonnement en utilisant une approche de distillation professeur-élève. Le modèle Cosmos-Reason2-8B sert de professeur, générant 57 696 enregistrements de chaîne de pensée couvrant huit types distincts de questions de conduite. Lors de cette phase, seulement 2,4 % des paramètres du modèle Cosmos-Reason2-2B (environ 52 millions) sont ajustés. Cette stratégie efficace en paramètres permet au petit modèle d'hériter de capacités de raisonnement physique multi-étapes complexes du modèle professeur plus grand, tout en conservant ses capacités linguistiques pré-entraînées. Le résultat est un modèle capable d'effectuer des déductions logiques structurées basées sur l'entrée visuelle.

Impact sur l'industrie

Les évaluations empiriques menées sur le jeu de données nuScenes démontrent l'efficacité du cadre MoRAL. En utilisant un sous-ensemble de 2 304 images, le modèle a été évalué par un évaluateur Gemma 4 (31B) et calibré par un examen humain. MoRAL a surpassé la ligne de base zéro-shot 8B dans sept des huit catégories de tâches de conduite, bien qu'il ne possède qu'un quart des paramètres. Les améliorations les plus significatives ont été observées dans les tâches nécessitant un raisonnement physique structuré multi-étapes. Spécifiquement, le taux de rappel pour les scénarios de freinage d'urgence est passé de 10,8 % dans la ligne de base à 47,8 % dans MoRAL. De plus, le taux de dégradation de la sortie, qui indique des réponses incohérentes, a chuté de manière drastique de 94,1 % à 20,8 %.

Au-delà de la précision, MoRAL offre des avantages d'efficacité convaincants pour le déploiement périphérique. L'ensemble du pipeline d'inférence fonctionne sans nécessiter de quantification, tournant à 42 tokens par seconde sur un GPU grand public avec seulement 8 Go de VRAM. Cette métrique de performance est particulièrement significative pour l'industrie automobile, car elle prouve que des décisions de conduite autonome de haute fidélité peuvent être prises sur un matériel abordable et largement disponible. Cela abaisse la barrière à l'entrée pour le développement de systèmes avancés d'aide à la conduite, accélérant potentiellement l'adoption des fonctionnalités autonomes L2+/L3 dans les véhicules du marché de masse.

Les implications pour la communauté open-source de la conduite autonome et la R&D industrielle sont profondes. MoRAL démontre qu'un raisonnement physique sophistiqué ne nécessite pas strictement une mise à l'échelle massive des modèles. En se concentrant sur une représentation intelligente des données et un ajustement fin efficace en paramètres, les chercheurs peuvent débloquer des gains de performance importants dans les modèles compacts. Ce changement de paradigme encourage la communauté à explorer des moyens plus efficaces d'intégrer des priorités physiques dans les VLM. Il suggère que les avancées futures pourraient provenir non pas d'une simple augmentation du nombre de paramètres, mais d'une meilleure structuration des données d'entrée.

Perspectives

Le succès de MoRAL pointe vers un avenir où les systèmes de conduite autonome seront plus modulaires, efficaces et accessibles. En découplant la perception spatiale du moteur de raisonnement, cette architecture offre une fondation flexible pour les itérations futures. À mesure que les technologies de capteurs évoluent, la couche d'encodage BEV peut être adaptée pour incorporer de nouveaux types de données sans nécessiter une refonte complète du backbone du VLM. Cette modularité pourrait conduire à des cycles de développement plus rapides et à une intégration plus facile de nouvelles modalités de détection dans les piles autonomes existantes.

De plus, l'accent mis sur l'efficacité périphérique s'aligne avec la focalisation croissante de l'industrie sur la confidentialité et la latence. Le traitement des données localement sur le véhicule réduit la dépendance à la connectivité cloud, ce qui est crucial pour les applications de sécurité en temps réel. Alors que les contraintes computationnelles restent un goulot d'étranglement principal pour l'adoption généralisée de l'autonomie, des cadres comme MoRAL fournissent une voie viable pour surmonter ces limites. L'industrie pourrait voir un passage vers des architectures hybrides combinant des VLM légers ancrés aux capteurs pour la prise de décision immédiate avec des modèles plus grands basés sur le cloud pour la planification à long terme.

Enfin, la méthodologie d'évaluation rigoureuse employée dans cette étude établit une nouvelle norme pour le benchmarking des modèles de conduite autonome compacts. L'utilisation d'évaluateurs automatisés calibrés par un examen humain garantit que les métriques de performance reflètent la véritable sécurité de conduite plutôt qu'une simple correspondance de motifs superficiels. À mesure que le domaine mûrit, de telles normes rigoureuses seront essentielles pour valider la sécurité des systèmes de plus en plus autonomes. MoRAL sert de témoignage du potentiel de combiner l'ingénierie de données spécifique au domaine avec les techniques modernes de grands modèles de langage pour résoudre efficacement des problèmes d'ingénierie complexes.

Sources