Apprendre à piloter, piloter pour voir : la géométrie du RLVR dans les LLM et le stabilisateur Alpha-Stabler
Cet article traite le RLVR comme un problème d'intervention dans l'espace des activations. Avec le modèle de base gelé et un seul vecteur entraînable par couche, il récupère plus de 85 % du gain de l'entraînement complet sur la plupart des tâches. Les auteurs dégagent deux propriétés : la capacité effective est faible mais pas infiniment compressible, et les directions de contrôle se trouvent dans le complément à faible variance du sous-espace principal. Ils proposent Alpha-Stabler, qui alerte de l'effondrement grâce au PSI et projette hors du sous-espace principal les gradients d'activation. L'entraînement reste stable sur 2 000 pas. L'étude porte sur des LLM textuels.
L'apprentissage par renforcement est devenu un outil central pour améliorer le raisonnement des grands modèles de langage, mais personne ne sait vraiment ce qu'il modifie à l'intérieur du réseau. Les mises à jour de paramètres sont de très haute dimension, et le bruit d'optimisation comme les différences de configuration masquent les changements utiles. Une équipe de l'USTC, de Tencent Hunyuan et de la BUPT adopte un autre angle dans un article soumis le 28 septembre 2026 (arXiv 2609.34344, cs.LG). Elle délaisse l'espace des paramètres et traite l'apprentissage par renforcement à récompenses vérifiables (RLVR) comme un problème d'intervention dans l'espace des activations.
Une précision d'abord. La note de contexte fournie avec cet article parlait de raisonnement vision-langage. Le titre officiel sur arXiv est « Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors ». Les expériences portent sur des LLM textuels, avec quatre familles de tâches : raisonnement mathématique, raisonnement scientifique, génération de code et suivi d'instructions. Aucun benchmark multimodal n'apparaît. Ce qui suit suit le texte de l'article.
La méthode : un vecteur entraînable comme sonde
Les auteurs gèlent le modèle de base et ajoutent un vecteur entraînable à la sortie de couches choisies : h'_l = h_l + delta_l. Ce vecteur ne dépend pas de l'entrée. Il est partagé par tous les échantillons et toutes les positions de jetons. Chaque couche contrôlée n'ajoute donc qu'un seul vecteur de dimension d, la taille cachée. L'entraînement n'est pas du RL direct mais de la distillation. Un enseignant est d'abord entraîné avec GRPO ou DAPO. L'élève, « base gelée plus vecteurs », apprend ensuite à l'imiter. L'étude couvre la distillation on-policy et off-policy, et compare trois formes de mise à jour : entraînement complet, LoRA et pilotage par vecteur.
Cette conception transforme une intuition en hypothèse testable. Si les gains du RL sont vraiment de faible dimension, quelques paramètres doivent suffire à les reproduire. Les modèles sont DeepSeek-R1-Distill-Qwen 1,5B et 7B, ainsi que Qwen3 4B, 8B et 14B : 5 LLM et 6 tâches à récompense vérifiable.
Propriété 1 : la capacité de la variété effective est faible, mais pas infiniment compressible
En distillation on-policy, LoRA et l'entraînement complet donnent des résultats comparables. Un seul vecteur par couche contrôlée récupère pourtant plus de 85 % du gain de l'entraînement complet sur la plupart des tâches évaluées. En distillation off-policy, avec des trajectoires générées par l'enseignant, le taux de récupération reste élevé sur les jeux d'évaluation. La compressibilité ne dépend donc pas des trajectoires propres à l'élève.
Les limites sont la partie la plus instructive. L'article en donne deux. La première est l'écart de distribution entre enseignant et élève : proche, un vecteur suffit ; plus large, il faut une paramétrisation plus souple. La seconde est la profondeur d'insertion : les vecteurs fixes fonctionnent bien dans les couches basses et moyennes, puis se dégradent près de la sortie. Une analyse non linéaire montre que ce n'est pas faute de signal d'optimisation en profondeur. C'est un goulot d'expressivité : un décalage de faible dimension, indépendant de l'entrée, ne peut pas exprimer la correction dépendante de l'entrée que demandent les couches hautes.
Propriété 2 : la variété de contrôle est séparée du sous-espace principal
Les auteurs étendent ensuite un vecteur par couche à plusieurs vecteurs mutuellement orthogonaux. Les vecteurs extraits plus tard sont moins performants seuls, mais chacun peut encore soutenir le comportement visé. La direction principale domine sans être la seule efficace. Pour une même tâche et un même modèle de base, des entraînements aux paramètres très différents convergent, après compression, vers un ensemble reproductible de directions liées à la tâche. D'une tâche à l'autre, l'alignement entre ces directions suit le transfert de capacités.
Le résultat clé concerne leur position. Ces directions se situent surtout dans le complément à faible variance du sous-espace principal des activations. Le RL ne pousse pas les directions à forte variance qui dominent la représentation. Il ajuste finement des directions discrètes. L'article nomme cela la séparation de la variété de contrôle.
Alpha-Stabler : de la géométrie à un outil d'entraînement
Les auteurs en tirent Alpha-Stabler, un cadre enfichable à deux modules.
Le Predictor surveille l'intrusion dans le sous-espace principal (PSI). Un sous-espace principal fixe est estimé une fois sur le modèle de base gelé. Pendant l'entraînement, le PSI mesure la part de l'énergie des différences d'activation, par jeton, qui tombe dans ce sous-espace. Dans les entraînements réussis, les décalages restent dans le complément à faible variance. Une hausse du PSI accompagne la baisse de performance et l'effondrement : c'est un signal d'alerte précoce.
Le Controller n'agit qu'à la rétropropagation. Il retire des gradients d'activation leur composante dans le sous-espace principal et garde celle du complément orthogonal. Il n'ajoute aucun paramètre entraînable et ne demande aucun changement d'optimiseur, de fonction de récompense ou d'architecture.
Résultats et coût
L'article indique qu'Alpha-Stabler stabilise l'entraînement sur 2 000 pas et améliore de façon constante les gains du RL. La croissance de la récompense est plus régulière qu'avec l'écrêtage de gradient et d'autres méthodes de projection.
Les auteurs insistent : le gain vient du retrait de composantes dans un sous-espace précis, pas d'une suppression générale des gradients. Côté coût, une figure en annexe montre des courbes quasi identiques avec et sans Alpha-Stabler à temps réel égal, donc un surcoût très faible. Précaution : nous n'avons pas trouvé de tableau unique de scores absolus dans le matériel lu, et cet article n'en cite pas.
Ce que cela change pour les équipes
La surveillance est le gain le plus simple. Le PSI est une mesure peu coûteuse, à afficher dans un tableau de bord d'entraînement pour déclencher un retour en arrière ou une baisse du taux d'apprentissage avant l'effondrement.
Ensuite, l'adaptation par tâche : si un gain de RL tient dans un vecteur par couche, stocker et changer de comportement spécifique devient bien moins cher. Enfin, la prédiction du transfert : l'alignement des directions corrèle avec le transfert, ce qui peut guider un premier tri avant un gros entraînement. Le code est public sur GitHub (caiyuchen-ustc/On_Policy_Vector_Training).
Limites et suite
Les auteurs listent leurs propres limites. La théorie repose sur des hypothèses motivées par l'expérience, non dérivées de principes premiers. L'étude se limite au RLVR sur des tâches comme les mathématiques et le code. Elle ne teste ni le RLHF, ni la décision agentique multi-tours, ni la génération ouverte. Les pistes futures incluent l'attribution de neurones et le traçage causal, l'extension au RLHF et aux agents, et l'usage de la localisation hors sous-espace principal comme principe de conception, par exemple avec des régularisateurs dans le complément ou le PSI comme signal adaptatif.
En somme, c'est un article d'analyse. Sa valeur tient à une vue géométrique exploitable du RLVR et à un stabilisateur peu coûteux. Il faut lire ses conclusions comme valables pour des LLM textuels. L'article ne dit pas si elles tiennent pour les modèles multimodaux.