環境演化:面向終端智能體的離線難度自適應生成與持續學習框架
針對終端智能體訓練中環境難度停滯導致的信號衰減問題,本文提出「環境演化」方法,通過離線方式增量提升環境難度,突破現有協同演化對在線策略的依賴。研究從多輪學習目標推導三個演化方向,利用多智能體循環引擎實現環境生成的自動化迭代。在Terminal-Bench 2.1基準測試中,該方法顯著提升了Qwen3.6系列模型的效能,27B參數模型提升14.4個百分點,35B-A3B模型提升18.0個百分點,驗證了其在長週期強化學習中的有效性。
随着基础大模型能力的飞速提升,终端智能体(Terminal Agents)在复杂交互环境中的表现日益受到关注。然而,训练这些智能体的核心挑战在于如何持续提供具有挑战性的学习信号。传统的合成环境往往基于固定规则,随着模型能力的增强,这些环境迅速变得过于简单,导致智能体无法获得足够的梯度信号进行进一步学习。现有的协同演化(Co-evolution)方法虽然尝试通过模型在 rollout 过程中暴露的弱点来动态生成新环境,但这种高度依赖在线策略(on-policy)的方法不仅计算成本高昂,还限制了模型的泛化能力,且难以保证在模型变强后仍能持续提供高质量的学习信号。
本文的核心贡献在于提出了一种名为"环境演化"(Environment Evolution)的新范式,旨在通过离线(off-policy)的方式,增量地增加环境难度,并在训练过程中按代际调度生成的环境,从而为智能体提供持续且稳定的学习动力。这一方法从根本上解决了环境难度与模型能力之间的动态匹配问题,为终端智能体的长期进化提供了新的技术路径。在技术实现层面,作者深入分析了多轮交互的学习目标,从中推导出了三个能够直接影响环境难度的演化方向。这三个方向构成了环境复杂度的核心维度,确保了演化过程的方向性和有效性。
为了具体实现沿这些方向的环境生成,研究设计并实现了一个基于循环工程(loop-engineered)的多智能体 harness。该 harness 作为一个自动化引擎,能够在没有人类干预的情况下,根据当前模型的表现和环境状态,自动生成更具挑战性的新环境实例。这种离线演化的机制允许系统在训练间隙或独立于模型更新步骤时,对环境的难度进行精细调整,避免了在线策略带来的高昂开销和不稳定性。通过这种结构化的多智能体协作,环境生成的效率和质量得到了显著提升,确保了演化后的环境既具有足够的难度,又保持在模型可学习的范围内,从而实现了难度与能力的动态平衡。
为了验证环境演化方法的有效性,研究团队在 Terminal-Bench 2.1 这一权威基准上进行了广泛的定量实验。实验涵盖了多种前沿模型,包括 Hy4 preview、Claude Opus 5 和 GPT-5.6 Sol,结果显示环境演化方法能够 consistently 地生成更具挑战性的环境,证明了其在难度控制上的可靠性。更重要的是,在长周期强化学习(long-horizon RL training)的设置下,该方法被应用于 Qwen3.6-27B 和 Qwen3.6-35B-A3B 两个模型的训练中。实验结果表明,经过环境演化增强的训练流程,Qwen3.6-27B 在 Terminal-Bench 2.1 上的性能提升了 14.4 个百分点,而 Qwen3.6-35B-A3B 则提升了 18.0 个百分点。
这一显著的性能飞跃不仅证明了环境演化方法在提升终端智能体任务完成率和鲁棒性方面的巨大潜力,也揭示了通过优化训练环境而非仅仅优化模型架构,同样能带来突破性的性能增益。消融实验进一步确认了三个演化方向和多智能体 harness 在维持环境难度梯度中的关键作用。从行业意义来看,环境演化方法为开源社区和工业界提供了一种低成本、高效率的智能体训练优化方案。它摆脱了对昂贵在线策略的依赖,使得在资源受限的环境下训练高性能终端智能体成为可能。对于工业落地而言,该方法有助于加速智能体在复杂真实场景(如自动化运维、代码生成与调试)中的适应过程,缩短从实验室到生产环境的周期。此外,这种基于离线演化的思路也为后续研究提供了新的方向,例如探索更多样的环境演化维度、结合人类反馈进一步优化难度调度策略,以及将环境演化扩展到其他类型的智能体任务中。随着基础模型能力的不断突破,如何构建与之匹配的动态训练环境将成为智能体研究的关键议题,而本文提出的环境演化框架无疑为这一领域奠定了重要的基础,推动了智能体从"静态能力"向"动态进化"的转变。
Sources
FAQ
什么是“环境演化”框架?它解决了什么问题?
“环境演化”是一个离线自适应框架,通过增量提升环境难度来训练终端智能体。它解决了传统方法中环境难度停滞导致学习信号衰减的问题,避免了对在线策略的依赖。
“环境演化”方法有何重要性或影响?
该方法显著提升了Qwen3.6系列模型在Terminal-Bench 2.1上的性能(如27B模型提升14.4%),为终端智能体的长期强化学习提供了稳定且高质量的学习信号。
未来“环境演化”框架有哪些值得关注的发展方向?
未来可以探索更多样化的环境演化维度、结合人类反馈优化难度调度策略,并将其扩展到其他智能体任务中,以加速智能体在复杂真实场景中的应用。