UniSkill: 액터에 정렬된 스킬 제안으로 ALFWorld 성공률 98.4% 달성

Published · AI Daily — AI-assisted deep research, methodology & disclosure

UniSkill은 하나의 공유 정책이 환경에서 행동하고 스킬뱅크 편집(Add, Update, No Edit)을 제안하도록 학습시킵니다. 액터는 환경 보상으로, 제안은 대조적 행동 피드백으로 학습합니다. 검색된 스킬을 제안 스킬로 바꿨을 때 같은 과제의 성공·실패 궤적 사이 행동 로그우도 차이가 어떻게 달라지는지 측정하므로 제안마다 추가 롤아웃이 필요 없습니다. 논문은 ALFWorld 98.4%, WebShop 84.7% 성공률을 보고합니다.

UniSkill은 2026년 10월 7일 Yifei Lu 등이 arXiv(cs.AI)에 제출한 논문입니다. 먼저 짚어 둘 점이 있습니다. 이 논문은 로봇 팔 조작이 아니라, LLM 에이전트가 스킬뱅크를 어떻게 유지하고 개선하는지를 다룹니다. LLM 에이전트는 과거 상호작용에서 추출한 재사용 가능한 스킬을 스킬뱅크에 저장해 두었다가 새로운 과제에서 검색해 쓸 수 있습니다. 어려운 점은 「과제 수행」과 「스킬 작성」을 함께 학습시키면서 둘이 서로 방해하지 않고 서로 돕게 만드는 것입니다.

문제: 스킬의 효과와 액터의 향상이 뒤섞인다

최근 방법들은 과제 수행과 스킬 추출을 함께 최적화합니다. 자연스러운 방법은 스킬 제안이 나중에 재사용될 때 가져오는 이득으로 보상하는 것입니다. 논문은 여기에 두 가지 문제가 있다고 지적합니다. 첫째, 스킬의 효과가 액터 자신의 향상과 뒤섞입니다. 성공률이 올라도 스킬이 좋아진 것인지 정책이 강해진 것인지 구분할 수 없습니다. 둘째, 제안을 하나씩 직접 검증하려면 제안마다 추가 롤아웃이 필요해 제안 수에 비례해 비용이 늘어납니다.

핵심 설계: 하나의 공유 정책, 두 가지 역할

UniSkill은 하나의 공유 정책에 두 가지 일을 맡깁니다. 환경에서 행동하는 것, 그리고 그 결과 궤적을 바탕으로 스킬뱅크 편집을 제안하는 것입니다. 편집은 Add(추가), Update(갱신), No Edit(변경 없음) 세 가지뿐입니다. 논문의 설정에서 스킬뱅크는 매 실행마다 빈 상태로 시작하며, 학습 중의 제안만으로 자라납니다. 검색기는 Qwen3-Embedding-0.6B이고 상위 1개 스킬을 반환합니다. 공유 정책의 기반은 Qwen2.5-7B-Instruct이며, 더 작은 Qwen2.5-3B-Instruct 버전도 있습니다.

두 역할은 서로 다른 신호로 학습합니다. 액터는 환경 보상으로 GRPO 방식의 클리핑 손실을 써서 학습하고, 이점은 같은 과제의 롤아웃 그룹 안에서 정규화됩니다. 스킬 제안은 대조적 행동 피드백의 안내를 받으며 REINFORCE++로 학습합니다.

메커니즘: 새 롤아웃이 필요 없는 정렬 보상

이 부분이 가장 중요합니다. 제안 하나에 대해 UniSkill은 환경을 다시 실행하지 않고, 이미 있는 궤적 위에서 반사실적 비교를 합니다. 같은 과제의 성공 참조 궤적과 실패 참조 궤적을 가져와, 각각에서 검색된 스킬을 제안 스킬로 바꿨을 때 액터 행동의 토큰 정규화 로그우도가 얼마나 변하는지 계산합니다. 이를 Δ⁺(성공 궤적)와 Δ⁻(실패 궤적)라 부릅니다. 정렬 보상은 R_align = Δ⁺ − Δ⁻로 정의됩니다. 직관은 분명합니다. 좋은 스킬이라면 액터가 성공 궤적의 행동을 더 선호하게 하고, 실패 궤적의 행동은 더 선호하지 않게 해야 합니다. 저장된 궤적에 대한 순전파만 필요하므로 제안마다 새로운 환경 상호작용이 필요 없습니다. 논문은 고정된 스킬 비평 모델(DeepSeek-V4-Pro)도 씁니다. 비평 모델에 대한 민감도는 세 가지로 비교했지만 WebShop에서만 했습니다.

탐색 붕괴 방지: 스킬 편집 지지 정규화

제안 단위 피드백에는 부작용이 있습니다. 일부 편집 연산의 확률을 계속 낮춰 No Edit나 Update가 거의 뽑히지 않게 되면 탐색이 무너질 수 있습니다. 논문은 L_sup을 더해, 확률이 하한 p_min(0.1) 아래로 내려가는 편집 연산에 제곱 힌지 벌점을 줍니다. 제안 쪽 손실은 L_proposer = L_R++ + λ_sup·L_sup이고, 전체 목적은 L_UniSkill = L_actor + λ_prop·L_proposer이며 λ_prop는 0.5, λ_sup는 0.01입니다.

학습 설정

옵티마이저는 AdamW이고 학습률은 1×10⁻⁶로 고정, 클리핑 범위 ε은 0.2입니다. 한 단계에서 16개 과제를 뽑아 과제당 G = 8개 롤아웃을 만들며, 총 250단계를 학습합니다. 그 앞에 출력 형식만 배우는 3단계 워밍업이 있습니다. 학습 온도는 1.0, 평가 온도는 0.4입니다. 에피소드 최대 길이는 ALFWorld 50단계, WebShop 15단계입니다.

결과

ALFWorld에서 UniSkill의 전체 성공률은 98.4%(±0.8, 세 번 실행)입니다. WebShop에서는 점수 90.5(±1.4), 성공률 84.7%(±0.5)입니다. 비교를 위해 논문 표 1에서 ALFWorld의 GRPO는 77.6%, GiGPO는 90.8%, Skill1은 97.5%, RetroAgent는 94.9%, Evolving-RL은 93.0%입니다. WebShop 성공률은 SkillRL 72.7%, Skill1 82.9%, RetroAgent 82.3%입니다. 본문은 ALFWorld에서 GRPO보다 20.8%p, GiGPO보다 7.6%p 높고, WebShop에서 SkillRL보다 12.0%p 높다고 밝힙니다. Qwen2.5-3B-Instruct로 바꿔도 ALFWorld 검증 성공률이 90%를 넘고 최종적으로 7B GRPO보다 높지만, 3B의 정확한 최종 수치는 논문에 없습니다.

소거 실험: 피드백과 공동 학습의 기여

표 2(ALFWorld 성공률)가 구성 요소별 기여를 보여 줍니다. 액터만 학습하고 제안기를 고정하면 검색 없음 84.4%, 검색 있음 87.5%입니다. 제안기만 학습하고 액터를 고정하면 34.4%와 32.8%에 그칩니다. R_align 보상을 뺀 UniSkill은 84.4%와 89.1%, 완전한 UniSkill은 96.1%와 98.4%입니다. 결론은 공동 학습과 정렬 피드백이 모두 필요하며, 제안기만 학습하는 것은 거의 쓸모가 없다는 것입니다.

개발자와 생태계에 주는 의미

LLM 에이전트를 만드는 팀에게 이 논문은 재사용하기 쉬운 발상을 줍니다. 「기억이나 스킬 갱신」을 외부 후처리가 아니라 정책의 행동으로 다루고, 그 행동을 값싼 반사실 신호로 채점하는 것입니다. 제안마다 추가 롤아웃을 피할 수 있어 환경이 비쌀수록 이점이 큽니다. 스킬뱅크는 읽을 수 있는 텍스트이므로, 경험을 가중치에 압축하는 방식보다 감사와 수동 수정이 쉽습니다.

한계와 주의점

논문에 별도의 한계 절은 없지만 눈여겨볼 점이 여럿 있습니다. 첫째, 정렬 신호에는 잡음이 있습니다. R_align이 양수인 제안 가운데 25단계에서 24.5%(13/53), 75단계에서 15.6%(10/64)가 실제 롤아웃에서는 이득이 음수였습니다. 둘째, Evolving-RL 재현 실험은 장시간 학습에서 붕괴했고, 이는 공동 학습 자체에 불안정 위험이 있음을 보여 줍니다. 셋째, 기준선 수치 대부분은 이전 논문에서 인용한 것이며 동일 조건에서 다시 돌린 것이 아닙니다. 넷째, 차이가 작은 곳이 있습니다. ALFWorld에서 Skill1과의 차이는 0.9%p인데 표준편차는 ±0.8에서 ±1.4입니다. 다섯째, 스킬 편집 분포 분석은 설정당 한 번의 실행에 근거하고, 비평 모델 민감도도 WebShop에서만 시험했습니다. 이 결과는 최종 판결이 아니라 강한 신호로 읽는 것이 맞습니다.

Sources