UniSkill:アクターに整合したスキル提案でALFWorld成功率98.4%を達成
UniSkillは、単一の共有ポリシーが環境で行動し、同時にスキルバンクへの編集(Add、Update、No Edit)を提案する手法です。アクターは環境報酬で学習し、提案は対比的な行動フィードバックで学習します。これは検索スキルを提案スキルに差し替えたとき、同一タスクの成功軌跡と失敗軌跡の行動対数尤度差がどう変わるかを測るもので、提案ごとの追加ロールアウトは不要です。ALFWorldで98.4%、WebShopで84.7%の成功率を報告しています。
UniSkillは、2026年10月7日にarXiv(cs.AI)へ投稿された論文で、著者はYifei Lu氏らです。最初に断っておくと、扱う対象はロボットアームの操作ではなく、LLMエージェントが「スキルバンク」をどう維持し改善するかです。
LLMエージェントは、過去のやり取りから抽出した再利用可能なスキルをスキルバンクに保存し、新しいタスクで検索して使えます。難しいのは、「タスクをこなす」ことと「スキルを書く」ことを同時に学習させ、両者が干渉せずに高め合うようにする点です。
課題:スキルの効果とアクターの上達が混ざる
最近の手法は、タスク実行とスキル抽出を合わせて最適化します。自然なやり方は、スキル提案が後で再利用されたときの利益で報酬を与えることです。論文はここに二つの問題があると指摘します。
第一に、スキルの効果がアクター自身の上達と混ざります。成功率が上がっても、スキルが良くなったのか、方策が強くなっただけなのか区別できません。第二に、提案を一つずつ直接検証するには、そのたびに追加のロールアウトが要り、提案数に比例してコストが増えます。
中核設計:一つの共有ポリシー、二つの役割
UniSkillは、一つの共有ポリシーに二つの仕事をさせます。環境で行動すること、そして得られた軌跡からスキルバンクへの編集を提案することです。編集はAdd(追加)、Update(更新)、No Edit(変更なし)の3種類だけです。論文の設定では、スキルバンクは毎回空の状態から始まり、学習中の提案だけで育ちます。検索器にはQwen3-Embedding-0.6Bを使い、上位1件のスキルを返します。共有ポリシーの基盤はQwen2.5-7B-Instructで、小型のQwen2.5-3B-Instruct版もあります。
二つの役割は異なる信号で学習します。アクターは環境報酬で、GRPO型のクリップ損失を使って学びます。優位性は同一タスクのロールアウト群の中で正規化されます。スキル提案は対比的な行動フィードバックで導かれ、REINFORCE++で学習します。
仕組み:新しいロールアウトが不要な整合報酬
ここが最も重要な点です。ある提案に対し、UniSkillは環境を再実行せず、既存の軌跡上で反事実的な比較を行います。同一タスクの成功参照軌跡と失敗参照軌跡を取り、それぞれで「検索したスキルを提案スキルに差し替えたとき」のアクターの行動のトークン正規化対数尤度がどれだけ変わるかを計算します。これをΔ⁺(成功軌跡)とΔ⁻(失敗軌跡)と呼びます。
整合報酬はR_align = Δ⁺ − Δ⁻と定義されます。直感は明快で、良いスキルなら、アクターは成功軌跡の行動を選びやすくなり、失敗軌跡の行動は選びやすくならないはずです。保存済みの軌跡に対する順伝播だけで済むため、提案ごとの環境操作は不要になります。論文は凍結したスキル批評モデル(DeepSeek-V4-Pro)も使っています。批評モデルへの感度は3種類で比べられましたが、WebShopだけです。
探索崩壊の防止:スキル編集サポート正則化
提案単位のフィードバックには副作用があります。一部の編集操作の確率を下げ続け、たとえばNo EditやUpdateがほぼ選ばれなくなり、探索が崩れる恐れがあります。
論文はL_supを加え、確率が下限p_min(0.1)を下回る編集操作に二乗ヒンジの罰則を課します。提案側の損失はL_proposer = L_R++ + λ_sup·L_sup、全体の目的関数はL_UniSkill = L_actor + λ_prop·L_proposerで、λ_propは0.5、λ_supは0.01です。
学習設定
最適化にはAdamWを使い、学習率は1×10⁻⁶で一定、クリップ幅εは0.2です。1ステップで16タスクをサンプルし、各タスクG = 8本のロールアウトを取り、合計250ステップ学習します。
その前に、出力形式だけを学ぶ3ステップのウォームアップがあります。学習時の温度は1.0、評価時は0.4です。1エピソードの最大ステップ数はALFWorldで50、WebShopで15です。
結果
ALFWorldでは、UniSkillの全体成功率は98.4%(±0.8、3回の実行)です。WebShopではスコア90.5(±1.4)、成功率84.7%(±0.5)です。比較として、論文の表1ではALFWorldでGRPOが77.6%、GiGPOが90.8%、Skill1が97.5%、RetroAgentが94.9%、Evolving-RLが93.0%です。
WebShopの成功率はSkillRLが72.7%、Skill1が82.9%、RetroAgentが82.3%です。本文は、ALFWorldでGRPOを20.8ポイント、GiGPOを7.6ポイント上回り、WebShopでSkillRLを12.0ポイント上回ると述べています。Qwen2.5-3B-Instructに替えても、ALFWorldの検証成功率は90%を超え、最終的に7BのGRPOを上回りますが、3B版の正確な最終値は論文に示されていません。
アブレーション:フィードバックと同時学習の寄与
表2(ALFWorld成功率)が内訳を示します。アクターのみ学習し提案器を凍結した場合、検索なしで84.4%、検索ありで87.5%です。
提案器のみ学習しアクターを凍結すると、34.4%と32.8%にとどまります。R_align報酬を外したUniSkillは84.4%と89.1%、完全なUniSkillは96.1%と98.4%です。結論として、同時学習と整合フィードバックはどちらも必要で、提案器だけの学習はほとんど役に立ちません。
開発者とエコシステムへの意味
LLMエージェントを作るチームにとって、この論文は再利用しやすい考え方を示します。「記憶やスキルの更新」を外付けの後処理ではなく方策の行動として扱い、その行動を安価な反事実信号で採点するのです。
提案ごとの追加ロールアウトを避けられるため、環境が高価な場面ほど効果があります。スキルバンクは読めるテキストなので、経験を重みに押し込む方式より、監査や手作業での修正もしやすくなります。
限界と注意点
論文に独立した限界の章はありませんが、注意すべき点がいくつかあります。第一に、整合信号にはノイズがあります。R_alignが正の提案のうち、ステップ25で24.5%(13/53)、ステップ75で15.6%(10/64)が、実際のロールアウトでは利得が負でした。第二に、Evolving-RLの再現実験は長時間の学習で崩壊しており、同時学習自体に不安定さのリスクがあることを示します。
第三に、基線の数値の多くは過去の論文からの引用で、同一条件で再実行したものではありません。第四に、差が小さい箇所があります。ALFWorldでのSkill1との差は0.9ポイントで、標準偏差は±0.8から±1.4です。第五に、スキル編集の分布の分析は設定ごとに1回の実行に基づき、批評モデルの感度もWebShopでしか試されていません。これらの結果は、最終結論ではなく、有力なシグナルとして読むのが妥当です。