Quand les mots sont sûrs mais les actions mortelles : explorer les risques physiques dans l'espace des représentations cachées

Les grands modèles de langage sont de plus en plus déployés comme planificateurs de haut niveau pour les agents incarnés, mais des instructions linguistiquement banales peuvent devenir dangereuses lorsqu'elles se concrétisent dans le monde physique. Cet article examine si le danger issu du contexte physique peut être dissocié du risque textuel ordinaire. Grâce à une analyse des directions d'états cachés et à des tests zéro-shot à partition aléatoire sur des modèles tels que Qwen2.5, Phi-3.5 et SmolLM2, nous montrons que les risques liés au contenu et ceux ancrés dans le physique forment des signaux séparables dans les représentations du modèle. Sur cette base, nous proposons PRISM, un sonde logistique à couche unique avec régularisation L2 fonctionnant sur l'ensemble des états cachés. PRISM atteint 86,2 % à 87,7 % de précision sur SafeAgentBench avec un taux de faux positifs de seulement 11,7 % à 13,7 %, surpassant nettement les évaluateurs LLM de taille équivalente. Nous présentons également PhysicalSafetyBench-1K, un benchmark de 1 000 paires de risques physiques, démontrant que notre approche détecte les dangers physiques dépendants du contexte plutôt que de se fier à la simple correspondance de mots-clés non sécurisés.

Contexte

L'intégration rapide des grands modèles de langage (LMM) dans le domaine de l'intelligence artificielle incarnée marque un changement de paradigme significatif dans la manière dont les systèmes autonomes interagissent avec le monde physique. Ces modèles ne se limitent plus à la génération de texte ou à la réponse aux requêtes ; ils sont de plus en plus déployés en tant que planificateurs de haut niveau dirigeant les actions de robots et d'autres agents physiques. Cette évolution introduit un défi de sécurité critique : des instructions qui semblent bénignes, voire utiles, dans un contexte purement textuel peuvent devenir dangereuses lorsqu'elles sont exécutées dans la réalité. Par exemple, une commande visant à « ranger le bureau » peut paraître inoffensive dans une interface de chat, mais si le bureau contient des composants électroniques fragiles ou des piles instables de livres lourds, l'exécution physique de cette instruction pourrait entraîner des dommages matériels importants ou des blessures.

Cette disparité met en lumière un vide fondamental dans les mécanismes actuels d'alignement de la sécurité, qui se concentrent principalement sur la prévention de la génération de textes toxiques, illégaux ou offensifs, tout en ignorant largement les conséquences physiques des actions que ces textes peuvent déclencher. Les cadres de sécurité existants s'appuient souvent sur le filtrage de mots-clés non sécurisés ou la détection d'une intention nuisible dans le texte de sortie. Cependant, cette approche est insuffisante pour les agents incarnés, car le danger réside souvent non pas dans les mots eux-mêmes, mais dans le contexte physique dans lequel ils sont appliqués. Un robot peut recevoir une commande parfaitement sûre qui, en raison de facteurs environnementaux tels que la présence de matériaux inflammables ou de surfaces glissantes, conduit à un résultat dangereux. Ce phénomène suggère que le risque associé à l'exécution physique est distinct des risques traditionnels basés sur le contenu.

Analyse approfondie

Afin d'investiguer la séparabilité des risques basés sur le contenu et ceux ancrés dans le physique, les chercheurs ont mené une analyse complète des représentations d'états cachés à travers plusieurs modèles open-source de premier plan, notamment la série Qwen2.5 (dans les tailles de 3B, 7B, 14B et 32B de paramètres), Phi-3.5 et SmolLM2. En utilisant une analyse des directions d'états cachés et des tests zéro-shot à partition aléatoire, l'étude visait à déterminer si les représentations internes des modèles codent des signaux distincts pour les dangers physiques. Les résultats ont démontré que les risques liés au contenu et les risques physiques forment des signaux séparables au sein de l'espace de représentation du modèle, indépendamment de la taille de celui-ci. Cette découverte implique que le modèle ne confond pas toutes les formes de danger en une seule catégorie sémantique ; il maintient plutôt des voies neurales ou des directions vectorielles distinctes associées aux conséquences physiques par rapport à la toxicité textuelle.

Sur la base de cette insight, l'équipe de recherche a introduit PRISM, une sonde logistique légère à couche unique avec régularisation L2, conçue pour opérer directement sur les états cachés complets du modèle de langage. Contrairement aux évaluateurs de sécurité traditionnels qui analysent le texte final généré, PRISM intercepte les représentations internes du modèle avant que l'action ne soit finalisée. Cette architecture permet la détection des dangers physiques potentiels à un stade précoce, offrant un mécanisme pour signaler les instructions risquées sans s'appuyer sur la correspondance de mots-clés. L'utilisation de la régularisation L2 garantit que la sonde reste simple et efficace, minimisant la surcharge computationnelle tout en maximisant sa capacité à extraire des signaux spécifiques de risque physique de l'espace de haute dimension complexe des états cachés du modèle. Cette approche représente un changement de paradigme, passant du filtrage a posteriori du texte à la surveillance proactive des états internes.

L'efficacité de PRISM a été rigoureusement évaluée à l'aide de deux benchmarks principaux : SafeAgentBench et le nouveau PhysicalSafetyBench-1K. SafeAgentBench, qui teste la performance générale en matière de sécurité, a montré que PRISM atteignait un taux de précision compris entre 86,2 % et 87,7 %, avec un taux de faux positifs de seulement 11,7 % à 13,7 %. En revanche, les évaluateurs basés sur des LMM de taille équivalente ont beaucoup plus de mal, affichant des taux de faux positifs allant jusqu'à 24,7 % à 39,0 %. Cette disparité souligne les limites de l'utilisation des grands modèles de langage eux-mêmes comme juges de sécurité, car ils ont tendance à être excessivement conservateurs et à rejeter de nombreuses tâches sûres. L'introduction de PhysicalSafetyBench-1K, un benchmark composé de 1 000 paires de scénarios de risque physique soigneusement sélectionnées, a validé davantage les capacités de PRISM. Ces scénarios ont été conçus pour impliquer des dangers physiques sans contenir de mots-clés non sécurisés explicites, testant ainsi la capacité du modèle à comprendre les risques dépendants du contexte.

Impact sur l'industrie

La performance de PRISM sur PhysicalSafetyBench-1K a été particulièrement frappante, atteignant une précision de 99,6 % avec un taux de faux positifs de seulement 0,7 %. Ce résultat contraste fortement avec un évaluateur de base basé sur Qwen2.5-3B, qui a rejeté incorrectement 67,8 % des tâches sûres dans le même benchmark. Cette haute précision et ce faible taux de faux positifs sont critiques pour le déploiement pratique des systèmes d'IA incarnée. Dans les environnements industriels et domestiques, les fausses alertes fréquentes peuvent entraîner une frustration des utilisateurs et une inefficacité du système, car les agents peuvent refuser d'effectuer des tâches valides en raison de risques perçus mais infondés. En distinguant avec précision entre les dangers physiques réels et les opérations sûres, PRISM permet une couche de sécurité plus nuancée et fiable qui peut soutenir une planification complexe à long terme sans interruptions inutiles.

De plus, l'étude remet en question la notion prévalente selon laquelle la sécurité textuelle est synonyme de sécurité physique. En démontrant que ces risques sont séparables dans les représentations internes du modèle, la recherche ouvre de nouvelles voies pour le développement d'outils de sécurité spécialisés qui ne nécessitent pas de réentraîner le modèle de langage de base. Pour la communauté open-source, PRISM offre une solution légère et efficace pour améliorer la sécurité des modèles existants, facilitant ainsi le déploiement d'agents incarnés dans des environnements sensibles. Cette approche modulaire permet une itération rapide et une amélioration des mécanismes de sécurité sans le coût computationnel associé au réglage fin complet du modèle. Elle fournit également un cadre standardisé pour l'évaluation de la sécurité physique, comblant un manque significatif dans la recherche actuelle sur la sécurité de l'IA.

La publication de PhysicalSafetyBench-1K sert de ressource précieuse pour la communauté de recherche plus large, fournissant une plateforme standardisée pour tester et comparer les méthodes de détection de la sécurité physique. Ce benchmark encourage une exploration plus approfondie de la manière dont les modèles représentent et raisonnent sur les conséquences physiques, favorisant une approche plus rigoureuse de la sécurité de l'IA incarnée. À mesure que le domaine évolue vers des systèmes multi-agents plus complexes et des applications réelles, avoir une méthode fiable et précise pour détecter les risques physiques sera indispensable. Le succès de PRISM suggère que des techniques similaires pourraient être adaptées pour d'autres types de risques, tels que ceux liés à l'interaction sociale ou à la prise de décision éthique, élargissant ainsi la boîte à outils disponible pour l'alignement de l'IA.

Perspectives

À l'avenir, les implications de cette recherche s'étendent au-delà de la portée immédiate de la sécurité du texte à l'action. La capacité à détecter les risques physiques dans les états cachés jette les bases de mécanismes de sécurité plus sophistiqués dans les grands modèles de langage multimodaux. À mesure que ces modèles commenceront à intégrer des entrées visuelles et tactiles, les principes sous-jacents à PRISM pourraient être étendus pour analyser les représentations inter-modales, permettant la détection de dangers qui découlent de l'interaction entre les indices visuels et les actions physiques. Par exemple, un modèle pourrait devoir reconnaître qu'un objet apparemment stable est en réalité instable en se basant sur la texture visuelle et la distribution du poids, une tâche qui nécessite d'intégrer plusieurs modalités sensorielles.

De plus, le faible taux de faux positifs atteint par PRISM met en évidence l'importance de la précision dans les systèmes de sécurité pour l'IA incarnée. Les travaux futurs pourraient se concentrer sur l'intégration de ces sondes dans des boucles de contrôle en temps réel, permettant aux robots d'ajuster dynamiquement leurs actions en fonction des signaux de risque détectés dans leurs états internes. Cela pourrait conduire au développement de systèmes de sécurité adaptatifs qui apprennent des expériences passées et améliorent leurs capacités d'évaluation des risques au fil du temps. À mesure que l'IA incarnée devient plus courante dans les infrastructures critiques, la santé et l'assistance à domicile, la demande pour de telles mesures de sécurité avancées ne fera que croître.

Enfin, cette recherche souligne la nécessité d'une approche holistique de la sécurité de l'IA qui englobe à la fois les dimensions textuelles et physiques. En reconnaissant et en adressant les défis uniques posés par les agents incarnés, les chercheurs et les développeurs peuvent créer des systèmes d'IA plus robustes et dignes de confiance. La séparation des risques de contenu et des risques physiques, comme le démontre PRISM, constitue une étape fondamentale vers cet objectif. À mesure que la technologie mûrit, nous pouvons nous attendre à voir émerger davantage d'outils et de benchmarks spécialisés pour répondre aux exigences de sécurité complexes de la prochaine génération d'agents intelligents, garantissant qu'ils opèrent en toute sécurité et efficacité dans notre monde physique.

Sources