UniSkill : des propositions de compétences alignées sur l'acteur, 98,4 % de réussite sur ALFWorld

Published · AI Daily — AI-assisted deep research, methodology & disclosure

UniSkill entraîne une seule politique partagée qui agit dans l'environnement et propose des modifications de la banque de compétences : Add, Update ou No Edit. L'acteur apprend grâce à la récompense de l'environnement. Le proposeur apprend grâce à un retour d'action contrastif : on mesure comment le remplacement de la compétence récupérée par la compétence proposée modifie l'écart de log-vraisemblance entre trajectoires réussies et échouées d'une même tâche. Aucun nouveau déploiement n'est nécessaire par proposition. L'article rapporte 98,4 % de réussite sur ALFWorld et 84,7 % sur WebShop. Les auteurs l'évaluent sur ALFWorld et WebShop avec des modèles Qwen2.5, et l'ablation montre que l'entraînement conjoint et le retour aligné sont tous deux nécessaires.

UniSkill est un article soumis sur arXiv (cs.AI) le 7 octobre 2026 par Yifei Lu et ses coauteurs. Une précision d'abord : il traite de la façon dont un agent LLM entretient et améliore une banque de compétences.

Il ne s'agit pas de manipulation par bras robotique. Un agent LLM peut ranger dans une banque de compétences des savoir-faire réutilisables, tirés d'interactions passées, puis les récupérer pour de nouvelles tâches. La difficulté est d'entraîner ensemble « réaliser la tâche » et « écrire la compétence », pour que les deux se renforcent au lieu de se gêner.

Le problème : bénéfice de la compétence et progrès de l'acteur se mélangent

Les méthodes récentes optimisent ensemble l'exécution des tâches et l'extraction de compétences. Une façon naturelle de procéder consiste à récompenser une proposition par le gain qu'elle apporte lorsqu'elle est réutilisée plus tard. L'article y voit deux difficultés.

D'abord, le bénéfice de la compétence se confond avec la progression de l'acteur : si le taux de réussite monte, la compétence s'est peut-être améliorée, ou bien la politique est simplement devenue plus forte. Le mérite ne peut pas être séparé. Ensuite, tester chaque proposition directement exige un lot de déploiements supplémentaires, et le coût croît avec le nombre de propositions.

Conception centrale : une politique partagée, deux rôles

UniSkill confie deux tâches à une seule politique partagée : agir dans l'environnement, et proposer des modifications de la banque de compétences à partir des trajectoires obtenues. Il n'existe que trois modifications : Add, Update et No Edit. Dans le protocole de l'article, la banque démarre vide à chaque exécution et ne grandit que grâce aux propositions faites pendant l'entraînement. Le récupérateur est Qwen3-Embedding-0.6B et renvoie la meilleure compétence. La politique partagée repose sur Qwen2.5-7B-Instruct, avec une variante plus petite, Qwen2.5-3B-Instruct.

Les deux rôles apprennent à partir de signaux différents. L'acteur apprend de la récompense de l'environnement avec une perte écrêtée de type GRPO, et l'avantage est normalisé dans le groupe de déploiements d'une même tâche. Le proposeur de compétences est guidé par un retour d'action contrastif et entraîné avec REINFORCE++.

Mécanisme : une récompense d'alignement sans nouveau déploiement

C'est l'étape clé. Pour une proposition, UniSkill ne relance pas l'environnement. Il fait une comparaison contrefactuelle sur des trajectoires déjà disponibles. Il prend des trajectoires de référence réussies et échouées d'une même tâche. Pour chacune, il calcule comment la log-vraisemblance des actions de l'acteur, normalisée par token, change quand la compétence récupérée est remplacée par la compétence proposée.

On note ces variations Delta+ (trajectoires réussies) et Delta- (trajectoires échouées). La récompense d'alignement est R_align = Delta+ moins Delta-. L'intuition est simple : une bonne compétence doit pousser l'acteur vers les actions des trajectoires réussies, sans le pousser vers celles des trajectoires échouées. Comme il suffit de passes avant sur des trajectoires stockées, aucune nouvelle interaction avec l'environnement n'est nécessaire par proposition. L'article utilise aussi un modèle critique de compétences figé (DeepSeek-V4-Pro). La sensibilité au critique a été comparée sur trois critiques, mais seulement sur WebShop.

Éviter l'effondrement de l'exploration : régularisation de support des éditions

Le retour au niveau de la proposition a un effet secondaire. Il peut faire baisser la probabilité de certaines opérations, par exemple jusqu'à ce que No Edit ou Update ne soient presque plus tirées, et l'exploration s'effondre.

L'article ajoute L_sup, une pénalité de type charnière quadratique sur toute opération dont la probabilité passe sous un plancher p_min de 0,1. La perte du proposeur est L_proposer = L_R++ + lambda_sup * L_sup. L'objectif joint est L_UniSkill = L_actor + lambda_prop * L_proposer, avec lambda_prop égal à 0,5 et lambda_sup égal à 0,01.

Configuration d'entraînement

L'optimiseur est AdamW, avec un taux d'apprentissage constant de 1e-6 et un seuil d'écrêtage epsilon de 0,2. Chaque étape tire 16 tâches avec G = 8 déploiements par tâche, pour 250 étapes, après 3 étapes d'échauffement qui n'apprennent que le format de sortie.

La température vaut 1,0 à l'entraînement et 0,4 à l'évaluation. Les épisodes comptent au plus 50 pas sur ALFWorld et 15 sur WebShop.

Résultats

Sur ALFWorld, UniSkill atteint un taux de réussite global de 98,4 % (plus ou moins 0,8, trois exécutions). Sur WebShop, il obtient un score de 90,5 (plus ou moins 1,4) et un taux de réussite de 84,7 % (plus ou moins 0,5). À titre de comparaison, le tableau 1 de l'article donne sur ALFWorld GRPO à 77,6 %, GiGPO à 90,8 %, Skill1 à 97,5 %, RetroAgent à 94,9 % et Evolving-RL à 93,0 %.

Sur la réussite WebShop, SkillRL est à 72,7 %, Skill1 à 82,9 % et RetroAgent à 82,3 %. Le texte annonce un gain de 20,8 points sur GRPO et de 7,6 points sur GiGPO pour ALFWorld, et de 12,0 points sur SkillRL pour WebShop. Avec Qwen2.5-3B-Instruct, la réussite en validation sur ALFWorld dépasse encore 90 % et finit au-dessus de GRPO avec le modèle 7B, mais l'article ne donne pas de valeur finale exacte pour le 3B.

Ablation : ce qui vient du retour et de l'entraînement conjoint

Le tableau 2 (réussite ALFWorld) donne une décomposition claire. En n'entraînant que l'acteur avec un proposeur figé, la réussite est de 84,4 % sans récupération et de 87,5 % avec. En n'entraînant que le proposeur avec un acteur figé, elle tombe à 34,4 % et 32,8 %.

UniSkill sans la récompense R_align obtient 84,4 % et 89,1 %. UniSkill complet obtient 96,1 % et 98,4 %. La leçon : l'entraînement conjoint et le retour aligné sont tous deux nécessaires, et entraîner le proposeur seul ne sert presque à rien.

Impact pour les développeurs et l'écosystème

Pour les équipes qui construisent des agents LLM, l'article offre une idée réutilisable : traiter « mettre à jour la mémoire ou les compétences » comme une action de la politique, et non comme un post-traitement externe, puis noter ces actions avec un signal contrefactuel bon marché.

Cela évite le coût d'un déploiement supplémentaire par proposition, ce qui compte surtout dans les environnements coûteux. Une banque de compétences est aussi du texte lisible, donc plus simple à auditer et à corriger à la main que de l'expérience comprimée dans des poids.

Limites et précautions

L'article n'a pas de section dédiée aux limites, mais plusieurs points ressortent. Premièrement, le signal d'alignement est bruité : parmi les propositions à R_align positif, 24,5 % (13/53) à l'étape 25 et 15,6 % (10/64) à l'étape 75 avaient un gain négatif en déploiement réel. Deuxièmement, la reproduction d'Evolving-RL s'est effondrée en entraînement prolongé, ce qui montre un risque d'instabilité de l'entraînement conjoint.

Troisièmement, la plupart des chiffres des méthodes de référence sont repris d'articles antérieurs et n'ont pas été relancés dans des conditions identiques. Quatrièmement, certains écarts sont faibles : la marge sur Skill1 pour ALFWorld n'est que de 0,9 point, alors que les écarts types vont de 0,8 à 1,4. Cinquièmement, l'analyse de la distribution des éditions repose sur une exécution par réglage, et la sensibilité au critique n'a été testée que sur WebShop. Il faut lire ces résultats comme un signal fort, pas comme un verdict final.

Sources