UniSkill:讓技能提案與執行者對齊,ALFWorld 成功率達 98.4%
UniSkill 讓同一個策略既在環境中行動,又對技能庫提出 Add、Update、No Edit 三類編輯。執行者靠環境獎勵學習,技能提案靠對比式動作回饋學習:比較替換檢索技能後,成功與失敗軌跡上動作對數似然差的變化。這樣每條提案無需額外 rollout。論文報告 ALFWorld 成功率 98.4%,WebShop 成功率 84.7%。
UniSkill 是 2026 年 10 月 7 日提交到 arXiv(cs.AI)的論文,作者為 Yifei Lu 等人。需要先澄清一點:它研究的是 LLM 智慧體如何維護並改進「技能庫」,不是機械臂操作。
LLM 智慧體可以把過去互動中提煉出的可複用技能存入技能庫,在新任務中檢索使用。難點在於,如何同時訓練「做任務」和「寫技能」,讓兩者互相促進而不是互相干擾。
問題:技能收益與執行者進步混在一起
近期方法把任務執行和技能提取放在一起優化。一個自然的做法,是用技能日後被複用時帶來的收益去獎勵技能提案。
論文指出這有兩個麻煩。第一,技能的收益與執行者(actor)自身的進步混在一起:成功率上升,可能是技能變好了,也可能只是策略變強了,功勞無法分清。第二,如果想直接檢驗每條提案,就必須為它額外跑一批 rollout,開銷隨提案數量線性增長。
核心設計:一個共享策略,兩種角色
UniSkill 讓同一個共享策略做兩件事:在環境中行動,以及根據產生的軌跡對技能庫提出編輯。編輯只有三種:Add(新增技能)、Update(更新技能)、No Edit(不改動)。在論文的設定中,技能庫在每次執行開始時為空,完全靠訓練過程中的提案逐步長出來。檢索器使用 Qwen3-Embedding-0.6B,每次取 top-1 技能。共享策略的主幹為 Qwen2.5-7B-Instruct,另有 Qwen2.5-3B-Instruct 的小模型版本。
兩種角色的學習訊號不同。執行者用環境獎勵學習,採用 GRPO 風格的裁剪損失,優勢按同一任務的一組 rollout 做組內標準化。技能提案則用對比式動作回饋引導,並用 REINFORCE++ 訓練。
機制:不需要新 rollout 的對齊獎勵
這是全文最關鍵的一步。對一條技能提案,UniSkill 並不去環境裡重新跑,而是只在已有的軌跡上做反事實比較。具體地,取同一任務裡成功與失敗的參考軌跡,分別計算「把檢索到的技能換成提案技能」之後,執行者動作的 token 歸一化對數似然的變化量,記作 Δ⁺(成功軌跡)和 Δ⁻(失敗軌跡)。
對齊獎勵定義為 R_align = Δ⁺ − Δ⁻。直覺很清楚:好的技能應當讓執行者更傾向成功軌跡裡的動作,同時不更傾向失敗軌跡裡的動作。因為只需要對已有軌跡做前向計算,每條提案不再需要新的環境互動。論文還使用一個凍結的技能評審模型(DeepSeek-V4-Pro);對評審模型的敏感性只在 WebShop 上比較過三種。
防止探索塌縮:技能編輯支持正則項
提案級回饋有一個副作用:它可能把某些編輯操作的機率一路壓低,比如 No Edit 或 Update 幾乎不再被取樣,探索隨之塌縮。
論文加入 L_sup,對機率低於下限 p_min(0.1)的編輯操作施加平方鉸鏈懲罰。提案端總損失為 L_proposer = L_R++ + λ_sup·L_sup,聯合目標為 L_UniSkill = L_actor + λ_prop·L_proposer,其中 λ_prop 取 0.5,λ_sup 取 0.01。
訓練配置
優化器為 AdamW,學習率恆定 1×10⁻⁶,裁剪係數 ε 為 0.2。每步取樣 16 個任務,每個任務 G = 8 條 rollout,共訓練 250 步,先做 3 步僅學格式的熱身。
訓練溫度 1.0,評測溫度 0.4。ALFWorld 每回合最多 50 步,WebShop 最多 15 步。
結果
ALFWorld 上,UniSkill 的整體成功率為 98.4%(±0.8,三次執行)。WebShop 上,得分 90.5(±1.4),成功率 84.7%(±0.5)。作為對照,論文表 1 中 GRPO 在 ALFWorld 為 77.6%,GiGPO 為 90.8%,Skill1 為 97.5%,RetroAgent 為 94.9%,Evolving-RL 為 93.0%。
WebShop 成功率上,SkillRL 為 72.7%,Skill1 為 82.9%,RetroAgent 為 82.3%。論文文字稱在 ALFWorld 上比 GRPO 高 20.8 個百分點,比 GiGPO 高 7.6 個百分點,在 WebShop 上比 SkillRL 高 12.0 個百分點。換用 Qwen2.5-3B-Instruct 後,ALFWorld 驗證成功率仍超過 90%,並且最終高於 GRPO-7B,但論文沒有給出 3B 的確切終值。
消融:回饋與聯合訓練各占多少
表 2(ALFWorld 成功率)給出了清晰的拆解。只訓練執行者、凍結提案器時,無檢索 84.4%,有檢索 87.5%。只訓練提案器、凍結執行者時,僅 34.4% 和 32.8%。
去掉 R_align 獎勵的 UniSkill 為 84.4% 和 89.1%。完整 UniSkill 為 96.1% 和 98.4%。結論是:聯合訓練和對齊回饋缺一不可,單練提案器幾乎無用。
對開發者與生態的意義
對做 LLM 智慧體的團隊,這篇論文給出一條可複用的思路:把「更新記憶或技能」當作策略的動作,而不是外掛的後處理,並用廉價的反事實訊號給這些動作打分。
它避開了為每條提案額外 rollout 的成本,這在昂貴環境裡尤其有價值。同時,技能庫是可讀的文字,比起把經驗壓進權重,更便於稽核和人工修訂。
局限與需要謹慎之處
論文沒有單獨的局限章節,但內容裡有幾處值得注意。第一,對齊訊號有雜訊:在第 25 步和第 75 步,R_align 為正的提案中分別有 24.5%(13/53)和 15.6%(10/64)在實際 rollout 中收益為負。第二,Evolving-RL 的復現在長時間訓練中發生崩潰,說明聯合訓練本身存在不穩定風險。
第三,多數基線數字引自既往論文,並非在同一條件下重跑。第四,部分差距很小,例如對 Skill1 在 ALFWorld 上只高 0.9 個百分點,而標準差為 ±0.8 到 ±1.4。第五,技能編輯分布的分析每個設定只有一次執行,評審模型敏感性也只在 WebShop 上測試過。因此,應把這些結果視為強有力的訊號,而不是定論。
如何理解這套設計的取捨
把三種編輯做成策略的離散動作,好處是技能庫的每一次改動都可以被記錄、被打分、被回放。No Edit 看似什麼也沒做,其實很重要:多數軌跡並不值得沉澱成新技能,學會「不寫」與學會「寫」同樣關鍵,這也是支持正則項要保住 No Edit 取樣機會的原因。檢索只取 top-1,意味著技能庫要靠品質而不是數量取勝,一條含糊的技能會直接干擾執行者的動作分布。對齊獎勵恰好在這裡發揮作用:它直接度量技能對動作分布的影響,而不是等到任務結束後再看成敗。
另一方面,這套方法依賴已有的成功與失敗軌跡對照。如果某個任務幾乎沒有成功樣本,或者幾乎全部成功,對比訊號就會變弱。讀者在把思路遷移到自己的智慧體系統時,應先確認任務分布裡同時存在成功與失敗的軌跡。