UniSkill: Am Akteur ausgerichtete Skill-Vorschläge erreichen 98,4 % auf ALFWorld
UniSkill trainiert eine gemeinsame Policy, die in der Umgebung handelt und Änderungen an der Skillbank vorschlägt: Add, Update oder No Edit. Der Akteur lernt aus der Umgebungsbelohnung. Der Vorschlagsteil lernt aus kontrastivem Aktionsfeedback: Es misst, wie der Austausch des abgerufenen Skills gegen den vorgeschlagenen die Differenz der Aktions-Log-Likelihood zwischen erfolgreichen und gescheiterten Trajektorien derselben Aufgabe verändert. Pro Vorschlag ist kein zusätzlicher Rollout nötig. Die Arbeit berichtet 98,4 % Erfolg auf ALFWorld und 84,7 % auf WebShop. Die Autoren testen es auf ALFWorld und WebShop mit Qwen2.5-Modellen, und die Ablation zeigt, dass gemeinsames Training und ausgerichtetes Feedback beide nötig sind. Das Ziel ist ein stabileres gemeinsames Training.
UniSkill ist eine Arbeit, die am 7. Oktober 2026 von Yifei Lu und Koautoren auf arXiv (cs.AI) eingereicht wurde. Zuerst eine Klarstellung: Sie behandelt, wie ein LLM-Agent eine Skillbank pflegt und verbessert.
Es geht nicht um Manipulation mit Roboterarmen. Ein LLM-Agent kann wiederverwendbare Fertigkeiten, die er aus früheren Interaktionen gewonnen hat, in einer Skillbank speichern und bei neuen Aufgaben abrufen. Schwierig ist es, „die Aufgabe lösen“ und „den Skill schreiben“ gemeinsam zu trainieren, sodass sich beides stärkt und nicht stört.
Das Problem: Skill-Nutzen und Fortschritt des Akteurs vermischen sich
Jüngere Methoden optimieren Aufgabenausführung und Skill-Extraktion gemeinsam. Naheliegend ist es, einen Skill-Vorschlag mit dem Nutzen zu belohnen, den er bei späterer Wiederverwendung bringt. Die Arbeit nennt zwei Schwierigkeiten.
Erstens vermischt sich der Nutzen des Skills mit dem Lernfortschritt des Akteurs. Steigt die Erfolgsrate, kann der Skill besser geworden sein, oder die Policy ist einfach stärker geworden. Der Beitrag lässt sich nicht trennen. Zweitens braucht ein direkter Test jedes Vorschlags einen zusätzlichen Satz Rollouts, und die Kosten wachsen mit der Zahl der Vorschläge.
Kernidee: eine gemeinsame Policy, zwei Rollen
UniSkill lässt eine gemeinsame Policy zwei Aufgaben übernehmen: in der Umgebung handeln und aus den entstandenen Trajektorien Änderungen an der Skillbank vorschlagen. Es gibt nur drei Änderungen: Add, Update und No Edit. Im Aufbau der Arbeit startet die Skillbank in jedem Lauf leer und wächst nur durch Vorschläge während des Trainings. Der Retriever ist Qwen3-Embedding-0.6B und liefert den besten Skill. Die gemeinsame Policy basiert auf Qwen2.5-7B-Instruct, dazu gibt es eine kleinere Variante mit Qwen2.5-3B-Instruct.
Die beiden Rollen lernen aus verschiedenen Signalen. Der Akteur lernt aus der Umgebungsbelohnung mit einem GRPO-artigen, geclippten Verlust, wobei der Vorteil innerhalb der Rollout-Gruppe derselben Aufgabe normalisiert wird. Der Skill-Vorschlagsteil wird durch kontrastives Aktionsfeedback geleitet und mit REINFORCE++ trainiert.
Mechanismus: eine Ausrichtungsbelohnung ohne neuen Rollout
Das ist der entscheidende Schritt. Für einen Vorschlag führt UniSkill die Umgebung nicht erneut aus. Es vergleicht kontrafaktisch auf bereits vorhandenen Trajektorien. Dazu nimmt es erfolgreiche und gescheiterte Referenztrajektorien derselben Aufgabe. Für beide berechnet es, wie sich die token-normalisierte Log-Likelihood der Aktionen des Akteurs ändert, wenn der abgerufene Skill durch den vorgeschlagenen ersetzt wird.
Diese Änderungen heißen Delta+ (erfolgreiche Trajektorien) und Delta- (gescheiterte Trajektorien). Die Ausrichtungsbelohnung ist R_align = Delta+ minus Delta-. Die Intuition ist einfach: Ein guter Skill soll den Akteur zu Aktionen aus erfolgreichen Trajektorien hinziehen, nicht aber zu Aktionen aus gescheiterten. Da nur Vorwärtsdurchläufe über gespeicherte Trajektorien nötig sind, braucht jeder Vorschlag keine neue Umgebungsinteraktion. Die Arbeit nutzt außerdem ein eingefrorenes Skill-Kritikmodell (DeepSeek-V4-Pro). Die Empfindlichkeit gegenüber dem Kritiker wurde mit drei Kritikern verglichen, aber nur auf WebShop.
Kollaps der Exploration verhindern: Support-Regularisierung für Edits
Feedback auf Vorschlagsebene hat eine Nebenwirkung. Es kann die Wahrscheinlichkeit einzelner Edit-Operationen immer weiter senken, etwa bis No Edit oder Update kaum noch gezogen werden, und die Exploration bricht ein.
Die Arbeit ergänzt L_sup, eine quadratische Hinge-Strafe für jede Operation, deren Wahrscheinlichkeit unter die Untergrenze p_min von 0,1 fällt. Der Vorschlagsverlust ist L_proposer = L_R++ + lambda_sup * L_sup. Das gemeinsame Ziel lautet L_UniSkill = L_actor + lambda_prop * L_proposer, mit lambda_prop gleich 0,5 und lambda_sup gleich 0,01.
Trainingsaufbau
Der Optimierer ist AdamW mit konstanter Lernrate 1e-6 und Clip-Bereich epsilon von 0,2. Jeder Schritt zieht 16 Aufgaben mit G = 8 Rollouts je Aufgabe, insgesamt 250 Schritte, nach 3 Aufwärmschritten, in denen nur das Ausgabeformat gelernt wird.
Die Temperatur beträgt 1,0 beim Training und 0,4 bei der Auswertung. Episoden haben höchstens 50 Schritte auf ALFWorld und 15 auf WebShop.
Ergebnisse
Auf ALFWorld erreicht UniSkill eine Gesamterfolgsrate von 98,4 % (plus/minus 0,8, drei Läufe). Auf WebShop erzielt es einen Score von 90,5 (plus/minus 1,4) und eine Erfolgsrate von 84,7 % (plus/minus 0,5). Zum Vergleich nennt Tabelle 1 der Arbeit auf ALFWorld GRPO mit 77,6 %, GiGPO mit 90,8 %, Skill1 mit 97,5 %, RetroAgent mit 94,9 % und Evolving-RL mit 93,0 %.
Bei der WebShop-Erfolgsrate liegen SkillRL bei 72,7 %, Skill1 bei 82,9 % und RetroAgent bei 82,3 %. Der Text nennt Zugewinne von 20,8 Punkten gegenüber GRPO und 7,6 Punkten gegenüber GiGPO auf ALFWorld sowie 12,0 Punkten gegenüber SkillRL auf WebShop. Mit Qwen2.5-3B-Instruct übersteigt die Validierungserfolgsrate auf ALFWorld weiterhin 90 % und endet über GRPO mit dem 7B-Modell, doch einen genauen Endwert für das 3B-Modell nennt die Arbeit nicht.
Ablation: Beitrag von Feedback und gemeinsamem Training
Tabelle 2 (ALFWorld-Erfolg) zeigt eine klare Aufschlüsselung. Wird nur der Akteur trainiert und der Vorschlagsteil eingefroren, liegt der Erfolg bei 84,4 % ohne Retrieval und 87,5 % mit Retrieval. Wird nur der Vorschlagsteil trainiert und der Akteur eingefroren, sind es nur 34,4 % und 32,8 %.
UniSkill ohne R_align-Belohnung erreicht 84,4 % und 89,1 %. Das vollständige UniSkill erreicht 96,1 % und 98,4 %. Die Lehre: Gemeinsames Training und ausgerichtetes Feedback sind beide nötig, und den Vorschlagsteil allein zu trainieren, bringt fast nichts.
Bedeutung für Entwickler und Ökosystem
Für Teams, die LLM-Agenten bauen, bietet die Arbeit eine wiederverwendbare Idee: „Gedächtnis oder Skills aktualisieren“ als Aktion der Policy behandeln, nicht als externen Nachbearbeitungsschritt, und diese Aktionen mit einem billigen kontrafaktischen Signal bewerten.
Das vermeidet die Kosten eines zusätzlichen Rollouts pro Vorschlag, was vor allem in teuren Umgebungen zählt. Eine Skillbank ist zudem lesbarer Text und lässt sich leichter prüfen und von Hand korrigieren als Erfahrung, die in Gewichte gepresst wurde.
Grenzen und Vorsicht
Die Arbeit hat keinen eigenen Abschnitt zu Grenzen, aber mehrere Punkte fallen auf. Erstens ist das Ausrichtungssignal verrauscht: Unter den Vorschlägen mit positivem R_align hatten 24,5 % (13/53) bei Schritt 25 und 15,6 % (10/64) bei Schritt 75 einen negativen beobachteten Rollout-Gewinn. Zweitens brach die Nachbildung von Evolving-RL im verlängerten Training zusammen, was auf ein Stabilitätsrisiko beim gemeinsamen Training hinweist.
Drittens stammen die meisten Basiswerte aus früheren Arbeiten und wurden nicht unter identischen Bedingungen neu gemessen. Viertens sind manche Abstände klein: Der Vorsprung vor Skill1 auf ALFWorld beträgt nur 0,9 Punkte, bei Standardabweichungen von 0,8 bis 1,4. Fünftens beruht die Analyse der Edit-Verteilung auf einem Lauf je Einstellung, und die Kritiker-Empfindlichkeit wurde nur auf WebShop getestet. Diese Ergebnisse sind als starkes Signal zu lesen, nicht als endgültiges Urteil.