UniSkill:让技能提案与执行者对齐,ALFWorld 成功率达 98.4%

Published · AI Daily — AI-assisted deep research, methodology & disclosure

UniSkill 让同一个策略既在环境中行动,又对技能库提出 Add、Update、No Edit 三类编辑。执行者靠环境奖励学习,技能提案靠对比式动作反馈学习:比较替换检索技能后,成功与失败轨迹上动作对数似然差的变化。这样每条提案无需额外 rollout。论文报告 ALFWorld 成功率 98.4%,WebShop 成功率 84.7%。

UniSkill 是 2026 年 10 月 7 日提交到 arXiv(cs.AI)的论文,作者为 Yifei Lu 等人。需要先澄清一点:它研究的是 LLM 智能体如何维护并改进「技能库」,不是机械臂操作。

LLM 智能体可以把过去交互中提炼出的可复用技能存入技能库,在新任务中检索使用。难点在于,如何同时训练「做任务」和「写技能」,让两者互相促进而不是互相干扰。

问题:技能收益与执行者进步混在一起

近期方法把任务执行和技能提取放在一起优化。一个自然的做法,是用技能日后被复用时带来的收益去奖励技能提案。

论文指出这有两个麻烦。第一,技能的收益与执行者(actor)自身的进步混在一起:成功率上升,可能是技能变好了,也可能只是策略变强了,功劳无法分清。第二,如果想直接检验每条提案,就必须为它额外跑一批 rollout,开销随提案数量线性增长。

核心设计:一个共享策略,两种角色

UniSkill 让同一个共享策略做两件事:在环境中行动,以及根据产生的轨迹对技能库提出编辑。编辑只有三种:Add(新增技能)、Update(更新技能)、No Edit(不改动)。在论文的设置中,技能库在每次运行开始时为空,完全靠训练过程中的提案逐步长出来。检索器使用 Qwen3-Embedding-0.6B,每次取 top-1 技能。共享策略的主干为 Qwen2.5-7B-Instruct,另有 Qwen2.5-3B-Instruct 的小模型版本。

两种角色的学习信号不同。执行者用环境奖励学习,采用 GRPO 风格的裁剪损失,优势按同一任务的一组 rollout 做组内标准化。技能提案则用对比式动作反馈引导,并用 REINFORCE++ 训练。

机制:不需要新 rollout 的对齐奖励

这是全文最关键的一步。对一条技能提案,UniSkill 并不去环境里重新跑,而是只在已有的轨迹上做反事实比较。具体地,取同一任务里成功与失败的参考轨迹,分别计算「把检索到的技能换成提案技能」之后,执行者动作的 token 归一化对数似然的变化量,记作 Δ⁺(成功轨迹)和 Δ⁻(失败轨迹)。

对齐奖励定义为 R_align = Δ⁺ − Δ⁻。直觉很清楚:好的技能应当让执行者更倾向成功轨迹里的动作,同时不更倾向失败轨迹里的动作。因为只需要对已有轨迹做前向计算,每条提案不再需要新的环境交互。论文还使用一个冻结的技能评审模型(DeepSeek-V4-Pro);对评审模型的敏感性只在 WebShop 上比较过三种。

防止探索塌缩:技能编辑支持正则项

提案级反馈有一个副作用:它可能把某些编辑操作的概率一路压低,比如 No Edit 或 Update 几乎不再被采样,探索随之塌缩。

论文加入 L_sup,对概率低于下限 p_min(0.1)的编辑操作施加平方铰链惩罚。提案端总损失为 L_proposer = L_R++ + λ_sup·L_sup,联合目标为 L_UniSkill = L_actor + λ_prop·L_proposer,其中 λ_prop 取 0.5,λ_sup 取 0.01。

训练配置

优化器为 AdamW,学习率恒定 1×10⁻⁶,裁剪系数 ε 为 0.2。每步采样 16 个任务,每个任务 G = 8 条 rollout,共训练 250 步,先做 3 步仅学格式的热身。

训练温度 1.0,评测温度 0.4。ALFWorld 每回合最多 50 步,WebShop 最多 15 步。

结果

ALFWorld 上,UniSkill 的整体成功率为 98.4%(±0.8,三次运行)。WebShop 上,得分 90.5(±1.4),成功率 84.7%(±0.5)。作为对照,论文表 1 中 GRPO 在 ALFWorld 为 77.6%,GiGPO 为 90.8%,Skill1 为 97.5%,RetroAgent 为 94.9%,Evolving-RL 为 93.0%。

WebShop 成功率上,SkillRL 为 72.7%,Skill1 为 82.9%,RetroAgent 为 82.3%。论文文字称在 ALFWorld 上比 GRPO 高 20.8 个百分点,比 GiGPO 高 7.6 个百分点,在 WebShop 上比 SkillRL 高 12.0 个百分点。换用 Qwen2.5-3B-Instruct 后,ALFWorld 验证成功率仍超过 90%,并且最终高于 GRPO-7B,但论文没有给出 3B 的确切终值。

消融:反馈与联合训练各占多少

表 2(ALFWorld 成功率)给出了清晰的拆解。只训练执行者、冻结提案器时,无检索 84.4%,有检索 87.5%。只训练提案器、冻结执行者时,仅 34.4% 和 32.8%。

去掉 R_align 奖励的 UniSkill 为 84.4% 和 89.1%。完整 UniSkill 为 96.1% 和 98.4%。结论是:联合训练和对齐反馈缺一不可,单练提案器几乎无用。

对开发者与生态的意义

对做 LLM 智能体的团队,这篇论文给出一条可复用的思路:把「更新记忆或技能」当作策略的动作,而不是外挂的后处理,并用廉价的反事实信号给这些动作打分。

它避开了为每条提案额外 rollout 的成本,这在昂贵环境里尤其有价值。同时,技能库是可读的文本,比起把经验压进权重,更便于审计和人工修订。

局限与需要谨慎之处

论文没有单独的局限章节,但内容里有几处值得注意。第一,对齐信号有噪声:在第 25 步和第 75 步,R_align 为正的提案中分别有 24.5%(13/53)和 15.6%(10/64)在实际 rollout 中收益为负。第二,Evolving-RL 的复现在长时间训练中发生崩溃,说明联合训练本身存在不稳定风险。

第三,多数基线数字引自既往论文,并非在同一条件下重跑。第四,部分差距很小,例如对 Skill1 在 ALFWorld 上只高 0.9 个百分点,而标准差为 ±0.8 到 ±1.4。第五,技能编辑分布的分析每个设置只有一次运行,评审模型敏感性也只在 WebShop 上测试过。因此,应把这些结果视为强有力的信号,而不是定论。

如何理解这套设计的取舍

把三种编辑做成策略的离散动作,好处是技能库的每一次改动都可以被记录、被打分、被回放。No Edit 看似什么也没做,其实很重要:多数轨迹并不值得沉淀成新技能,学会「不写」与学会「写」同样关键,这也是支持正则项要保住 No Edit 采样机会的原因。检索只取 top-1,意味着技能库要靠质量而不是数量取胜,一条含糊的技能会直接干扰执行者的动作分布。对齐奖励恰好在这里发挥作用:它直接度量技能对动作分布的影响,而不是等到任务结束后再看成败。

另一方面,这套方法依赖已有的成功与失败轨迹对照。如果某个任务几乎没有成功样本,或者几乎全部成功,对比信号就会变弱。读者在把思路迁移到自己的智能体系统时,应先确认任务分布里同时存在成功与失败的轨迹。

Sources