Lernen zu steuern, steuern um zu sehen: Die Geometrie von RLVR in LLMs und der Alpha-Stabler

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Das Paper behandelt RLVR als Interventionsproblem im Aktivierungsraum. Bei eingefrorenem Basismodell und einem trainierbaren Vektor pro Schicht holt es auf den meisten Aufgaben über 85 % des Gewinns des vollen Fine-Tunings zurück. Die Autoren finden zwei Eigenschaften: Die wirksame Kapazität ist klein, aber nicht beliebig komprimierbar, und die Steuerrichtungen liegen im varianzarmen Komplement des Hauptunterraums der Aktivierungen. Darauf baut Alpha-Stabler auf: Ein PSI-Monitor warnt frühzeitig vor dem Kollaps, und die Hauptunterraum-Anteile der Aktivierungsgradienten werden im Rückwärtsdurchlauf entfernt. Das Training bleibt so 2.000 Schritte stabil, ohne zusätzliche Parameter. Untersucht werden ausschließlich reine Text-LLMs, keine multimodalen Modelle. Der Code ist öffentlich auf GitHub verfügbar.

Verstärkendes Lernen ist heute ein zentrales Werkzeug, um das Schlussfolgern großer Sprachmodelle zu verbessern. Was es im Inneren des Netzes tatsächlich verändert, ist aber kaum verstanden. Parameter-Updates sind extrem hochdimensional, und Optimierungsrauschen sowie Konfigurationsunterschiede verdecken die relevanten Änderungen. Ein Team der USTC, von Tencent Hunyuan und der BUPT geht in einem Paper vom 28. September 2026 (arXiv 2609.34344, cs.LG) einen anderen Weg. Es schaut nicht auf den Parameterraum, sondern behandelt Reinforcement Learning mit überprüfbaren Belohnungen (RLVR) als Interventionsproblem im Aktivierungsraum.

Vorab eine Korrektur. Die mitgelieferte Hintergrundnotiz nannte Vision-Language-Reasoning. Der offizielle arXiv-Titel lautet „Learning to Steer, Steering to See: Unveiling the Geometry of RLVR in Large Language Models via Trainable Vectors“. Die Experimente laufen mit reinen Text-LLMs auf vier Aufgabenfamilien: mathematisches Schließen, wissenschaftliches Schließen, Codegenerierung und Befolgen von Anweisungen. Ein multimodaler Benchmark kommt nicht vor. Alles Weitere folgt dem Paper.

Die Methode: ein trainierbarer Vektor als Sonde

Die Autoren frieren das Basismodell ein und addieren zur Ausgabe ausgewählter Schichten einen trainierbaren Vektor: h'_l = h_l + delta_l. Der Vektor ist eingabeunabhängig. Er gilt für alle Beispiele und alle Token-Positionen. Jede gesteuerte Schicht erhält also nur einen einzigen Vektor der Dimension d, der verborgenen Größe. Trainiert wird nicht direkt per RL, sondern per Destillation. Zuerst entsteht ein Lehrer mit GRPO oder DAPO. Dann lernt der Schüler, „eingefrorene Basis plus Vektoren“, den Lehrer nachzubilden. Die Studie nutzt On-Policy- und Off-Policy-Destillation und vergleicht drei Update-Formen: Vollparameter-Training, LoRA und Vektorsteuerung.

So wird eine vage Idee zu einer prüfbaren Hypothese. Sind die RL-Gewinne wirklich niedrigdimensional, müssten wenige Parameter genügen, um sie nachzubilden. Die Modelle sind DeepSeek-R1-Distill-Qwen 1,5B und 7B sowie Qwen3 4B, 8B und 14B. Insgesamt sind es 5 LLMs und 6 Aufgaben mit überprüfbarer Belohnung.

Eigenschaft 1: Die Kapazität der wirksamen Mannigfaltigkeit ist klein, aber nicht beliebig komprimierbar

Bei On-Policy-Destillation liegen LoRA und Vollparameter-Training etwa gleichauf. Ein einziger Vektor pro gesteuerter Schicht holt dennoch über 85 % des Gewinns des vollen Fine-Tunings zurück, auf den meisten untersuchten Aufgaben. Bei Off-Policy-Destillation mit Trajektorien des Lehrers bleibt die Rückgewinnung auf den Evaluationsdaten ähnlich hoch. Die Komprimierbarkeit hängt also nicht von den eigenen Rollouts des Schülers ab.

Aufschlussreich sind die Grenzen. Das Paper nennt zwei. Erstens die Verteilungslücke zwischen Lehrer und Schüler: Liegen beide nah beieinander, reicht ein Vektor; wächst die Lücke, braucht es eine flexiblere Parametrisierung. Zweitens die Einfügetiefe: Feste Vektoren wirken in unteren und mittleren Schichten gut und werden nahe der Ausgabe schlechter. Eine nichtlineare Analyse zeigt, dass dies nicht an einem schwachen Optimierungssignal in der Tiefe liegt. Es ist ein Ausdrucksengpass: Eine niedrigdimensionale, eingabeunabhängige Verschiebung kann die eingabeabhängige Korrektur nicht ausdrücken, die hohe Schichten brauchen.

Eigenschaft 2: Die Steuerungs-Mannigfaltigkeit ist vom Hauptunterraum getrennt

Als Nächstes erweitern die Autoren einen Vektor pro Schicht auf mehrere zueinander orthogonale Vektoren. Spätere Vektoren schneiden allein schlechter ab, tragen das Zielverhalten aber weiterhin allein. Die führende Richtung dominiert, ist aber nicht die einzig wirksame. Für dieselbe Aufgabe und dasselbe Basismodell laufen Trainings mit sehr unterschiedlichen Parametern nach der Kompression auf eine reproduzierbare Menge aufgabenbezogener Richtungen zusammen. Über Aufgaben hinweg folgt die Ausrichtung dieser Richtungen dem Fähigkeitstransfer.

Entscheidend ist, wo diese Richtungen liegen. Sie liegen überwiegend im varianzarmen Komplement des Hauptunterraums der Aktivierungen. RL drückt nicht auf die varianzstarken Richtungen, die die Repräsentation dominieren. Es justiert fein entlang unauffälliger Richtungen. Das Paper nennt dies Trennung der Steuerungs-Mannigfaltigkeit.

Alpha-Stabler: Geometrie als Trainingswerkzeug

Daraus bauen die Autoren Alpha-Stabler, ein steckbares Framework mit zwei Modulen.

Der Predictor überwacht das Eindringen in den Hauptunterraum (PSI). Ein fester Hauptunterraum wird einmal am eingefrorenen Basismodell geschätzt. Im Training misst der PSI den Anteil der Energie der tokenweisen Aktivierungsdifferenzen, der in diesen Unterraum fällt. In erfolgreichen Läufen bleiben die Verschiebungen im varianzarmen Komplement. Ein steigender PSI geht mit Leistungsverlust und Kollaps einher und taugt daher als Frühwarnung.

Der Controller wirkt nur im Rückwärtsdurchlauf. Er entfernt aus dem Aktivierungsgradienten den Anteil im Hauptunterraum und behält den Anteil im orthogonalen Komplement. Er fügt keine trainierbaren Parameter hinzu und verlangt keine Änderung an Optimierer, Belohnungsfunktion oder Architektur.

Ergebnisse und Kosten

Laut Paper hält Alpha-Stabler das Training über 2.000 Schritte stabil und steigert die RL-Gewinne durchgehend. Das Belohnungswachstum ist gleichmäßiger als mit Gradient Clipping und anderen Projektionsverfahren.

Die Autoren betonen, der Gewinn komme vom Entfernen von Gradientenanteilen in einem bestimmten Unterraum, nicht von allgemeiner Dämpfung. Zu den Kosten zeigt eine Abbildung im Anhang nahezu identische Punktzahlkurven mit und ohne Alpha-Stabler bei gleicher Laufzeit, also sehr wenig Mehraufwand. Einschränkung: In dem von uns gelesenen Material fand sich keine einzelne Tabelle mit absoluten Punktzahlen, und dieser Artikel nennt keine.

Folgen für Entwickler und Unternehmen

Der einfachste Gewinn ist das Monitoring. Der PSI ist eine billige Kennzahl für das Trainings-Dashboard und kann einen Rollback oder eine kleinere Lernrate auslösen, bevor die Belohnungskurve einbricht.

Zweitens die Aufgabenanpassung: Lässt sich ein RL-Gewinn mit einem Vektor pro Schicht nachbilden, wird das Speichern und Wechseln aufgabenspezifischen Verhaltens deutlich billiger. Drittens die Transfer-Vorhersage: Weil die Richtungsausrichtung mit dem Transfer korreliert, lässt sich vor einem großen Lauf grob abschätzen, ob zwei Aufgaben einander helfen. Der Code ist auf GitHub öffentlich (caiyuchen-ustc/On_Policy_Vector_Training).

Grenzen und Ausblick

Die Autoren nennen ihre Grenzen selbst. Die Theorie stützt sich auf empirisch motivierte Annahmen, nicht auf Herleitungen aus ersten Prinzipien. Die Studie beschränkt sich auf RLVR bei Aufgaben wie Mathematik und Code. RLHF, mehrstufige agentische Entscheidungen und offene Generierung sind nicht geprüft. Als Nächstes nennen sie Neuronen-Attribution und kausale Verfolgung, die Ausweitung auf RLHF und Agenten sowie die Lokalisierung außerhalb des Hauptunterraums als Designprinzip, etwa mit Regularisierern im Komplement oder dem PSI als adaptivem Signal.

Insgesamt ist es ein Analyse-Paper. Sein Wert liegt in einer nutzbaren geometrischen Sicht auf RLVR und einem günstigen Stabilisator. Die Ergebnisse gelten für reine Text-LLMs. Ob sie für multimodale Modelle halten, beantwortet das Paper nicht.

Sources