SPADE:讓大模型同時扮演環境設計師與推理智能體的自博弈學習

Published 2026-08-19 · AI Daily — AI-assisted deep research, methodology & disclosure

本文針對語言智能體持續自我改進需要不斷擴大的多樣化、自適應目標這一問題,指出既有訓練環境池——無論是人工挑選、靜態合成還是凍結驗證器——都會在學習者擴展時保持目標分布固定。為此作者提出 SPADE(Self-Play in Adaptive Synthetic Executable Environments),一個自博弈強化學習框架,其中單個大語言模型同時擔任兩個角色:環境設計師用可執行代碼編寫完整、長視野的訓練環境,採用 OpenAI Gym 風格的 reset()/step() 介面;推理智能體則在其中學習行動。兩者都是帶狀態的多輪環境,單一介面即可涵蓋推理問題與多步智能體工具呼叫。推理智能體的後悔值透過帶不帶特權提示時的獎勵差來估計,環境設計師據此學會把目標對準智能體能力的邊緣同時保持可行性。擴展到 30B 參數模型時,SPADE 在八個數學、科學、代碼與推理基準上平均比最強固定環境基線提升 5.3,在工具呼叫場景上 BFCL-v4 多輪提升 5.7、ACEBench-Agent 提升 13.9,遊戲場景中領先優勢隨模型規模增長。

这篇论文解决的核心问题是语言智能体如何实现持续的自我改进。自我改进的关键在于需要一个不断扩大的目标池,这些目标必须由智能体自主生成,同时具备多样性与自适应能力。作者指出,现有的训练环境池存在根本局限:无论是人工挑选的环境、静态合成的环境,还是使用冻结验证器的环境,都会在学习者能力扩展时保持目标分布固定不变,从而无法跟随智能体的成长而演化。为了解决这一瓶颈,作者提出 SPADE 框架,其核心思想是让单个大语言模型同时扮演两个角色——环境设计师与推理智能体,通过自博弈的方式驱动双方共同进化。环境设计师负责用可执行代码编写完整、长视野的训练环境,推理智能体则在这些环境中学习如何行动。这一设计的关键突破在于把环境设计本身变成了一个可学习的组件,从而为开放式的自我改进迈出了具体的一步。论文的主要贡献包括:提出单一接口同时覆盖推理问题与多步智能体工具调用的统一框架,用后悔信号而非绝对奖励来引导环境设计,以及通过大量实验揭示出环境设计可成功所需的关键组件。这些发现为后续研究如何构建自适应训练环境提供了明确方向。 在技术方法上,SPADE 将大语言模型部署为两个相互协作的角色。环境设计师使用可执行代码来构建训练环境,并遵循 OpenAI Gym 风格的 reset() 与 step() 接口,使得环境可以被程序化地初始化与推进。每个环境都是有状态的多轮环境,内部包含状态转移规则、奖励函数以及验证代码,因此一个统一的接口就能同时处理需要逐步推理的问题和需要多步工具调用的智能体任务。推理智能体的学习目标通过后悔信号来估计,具体做法是比较智能体在带有特权提示与不带特权提示两种情况下的奖励差。当环境设计师针对这一后悔信号进行优化时,它会逐渐学会把环境对准智能体能力的边缘地带——既足够有挑战性,又保持可行性。论文通过大量实验发现,两个组件对成功至关重要:一是让环境设计师基于从大型预训练语料中采样的文档进行 grounding,二是为其提供累积的环境记忆。前者为环境设计提供了丰富的先验知识与语义基础,后者使环境设计师能够记住已经生成过的环境,从而避免重复并推动目标分布持续演化。这些训练策略共同保证了自博弈过程的稳定性与有效性。 在实验设置与关键结果方面,作者进行了大量实验来验证框架的有效性。论文报告了在八个保留基准上的表现,覆盖数学、科学、代码与推理四大领域,SPADE 相比最强固定环境基线平均提升了 5.3 分。在工具调用场景中,框架在 BFCL-v4 多轮评测上提升了 5.7 分,在 ACEBench-Agent 上则大幅提升了 13.9 分,显示出对多步智能体任务的显著增益。论文还将模型扩展到 30B 参数规模,并观察游戏场景下的表现,发现领先最强基线的边际会随着模型规模的增大而持续增长,这为框架的可扩展性提供了有力证据。消融实验进一步确认了前文提到的两个关键组件的作用,即基于预训练语料文档的 grounding 与累积环境记忆,二者缺一不可。这些结果共同表明,将环境设计纳入可学习框架后,智能体能够获得比固定环境更高质量、更匹配自身能力的训练信号,从而在多个任务领域实现一致的提升。 在行业意义与潜在影响方面,SPADE 的价值在于把环境设计从固定的人工环节转变为一个可学习的组件,这为开放式自我改进提供了具体可行的路径。对开源社区而言,这种让单一模型同时承担环境生成与行动学习的框架,降低了构建自适应训练环境的门槛,为后续研究提供了可复用的范式。对工业落地而言,统一接口同时覆盖推理与多步工具调用的设计,使得同一套框架能够服务于从数学解题到智能体操作的广泛场景,具有较强的通用性。对后续研究而言,论文揭示的 grounding 与累积环境记忆等关键组件,为如何维持目标分布的多样性与适应性提供了明确指引。随着模型规模扩大而持续增长的领先优势,也暗示这一方向具备进一步扩展的潜力。整体而言,SPADE 通过让环境设计本身变得可学习,为突破固定环境带来的性能天花板提供了新的思路,推动语言智能体向更自主、更持续的学习能力迈进。

Sources