TASPO:彌合過程監督與結果信用在智能體策略優化中的鴻溝
本文針對基於結果的強化學習在長週期互動中信用分配粗糙的問題,提出了一種名為TASPO的新框架。現有方法將軌跡級優勢均勻分配給所有決策,導致細粒度監督與結果信用之間存在鴻溝。TASPO通過將訓練時可用的特權資訊(PI)轉化為基於結果的行動信用,解決了這一監督不匹配問題。該方法從驗證成功的經驗中構建適用於決策的PI,在可執行行動層面聚合PI引發的似然變化,並將其轉化為對原始軌跡優勢的加權分配。實驗表明,TASPO在三個智能體基準測試中比GRPO提升了10.6%,且在未見任務上具有更好的泛化能力。分析顯示,該方法有效減少了監督錯配,並通過行動層面的信用分配穩定了策略優化過程,為智能體訓練提供了新的視角。
在基于大语言模型的智能体(Agentic)研究中,如何利用强化学习提升模型在复杂任务中的表现是一个核心挑战。尽管基于结果的强化学习(Outcome-based Reinforcement Learning)能够为智能体提供经过验证的反馈信号,但其固有的局限性在于将轨迹级别的总体优势均匀地分配给序列中的每一个决策步骤。这种粗粒度的信用分配方式在长周期交互中尤为致命,因为它无法区分哪些具体动作对最终成功起到了关键作用,哪些则是无关甚至负面的。与此同时,基于策略的自蒸馏方法试图通过引入训练时独有的特权信息(Privileged Information, PI)来进行更细粒度的监督,即重新评估采样行为。然而,这种细粒度的监督并不等同于细粒度的信用分配。
特权信息引发的似然变化仅描述了额外信息如何改变策略偏好,却未能直接决定一个可执行动作应当如何继承最终的任务结果。这种监督信号与信用分配之间的脱节,被称为"监督-信用鸿沟"。本文的核心贡献在于提出了TASPO框架,旨在将基于特权信息的细粒度监督转化为基于最终结果的行动信用,从而弥合这一鸿沟,使智能体能够更精准地从成功经验中学习。TASPO的技术实现核心在于重构信用分配机制,使其既保留结果导向的稳定性,又融入过程监督的精细度。具体而言,TASPO首先从经过验证的成功经验中提取特权信息,并构建出适用于当前决策阶段的PI表示。
接着,算法在可执行行动(Executable Action)的粒度上,聚合由特权信息引发的策略似然变化。这一步骤至关重要,因为它将原本可能处于token级别或与当前状态无关的信号,映射到了智能体实际执行的操作层面。随后,TASPO将这些相对的行动支持度转换为正数、有界且保持均值不变的权重,应用于原始的轨迹优势上。这种设计确保了验证后的最终结果决定了策略更新的方向和平均尺度,而特权信息的作用仅限于在不同行动之间重新分配信用权重。通过这种方式,TASPO避免了特权信号因粒度不匹配或缺乏结果语义而导致的误导,使得策略优化过程能够同时受益于宏观的结果反馈和微观的过程指导,从而在数学上保证了信用分配的合理性与稳定性。
为了验证TASPO的有效性,研究团队在三个主流的智能体基准测试(Agentic Benchmarks)上进行了广泛的实验,并将其性能与当前先进的GRPO(Group Relative Policy Optimization)方法进行了对比。实验结果显示,TASPO在各项基准上的平均性能提升了10.6%,显著优于基线模型。更为重要的是,TASPO在未见过的任务上展现出了更强的泛化能力,表明其学到的策略具有更好的鲁棒性而非简单的过拟合。进一步的消融分析和深入探究揭示,TASPO的成功主要归因于其有效减少了监督信号与信用分配之间的错配(Supervision Mismatch)。通过行动层面的信用分配,算法避免了将无关的PI信号错误地赋予关键决策,从而稳定了策略优化的收敛过程。
这些实验结果不仅证明了TASPO在性能上的优势,也验证了其在解决长周期信用分配问题上的理论正确性,为后续研究提供了坚实的实证基础。从行业意义与潜在影响来看,TASPO的提出为开源社区和工业界在智能体训练方面提供了新的思路。随着大模型智能体在代码生成、自动化工作流等复杂场景中的应用日益深入,如何高效、稳定地优化其策略成为关键瓶颈。TASPO通过解耦结果导向与过程监督,提供了一种兼顾稳定性与精细度的优化范式,有助于降低智能体训练中的资源消耗并提升最终效果。对于工业落地而言,这种能够更好泛化到未见任务的模型,意味着在实际部署中具备更强的适应性和可靠性。此外,该研究揭示的监督-信用鸿沟问题,可能启发后续研究探索更多类型的特权信息利用方式,以及如何更自然地融合过程监督与结果反馈。这不仅丰富了强化学习在智能体领域的应用工具箱,也为构建更聪明、更可靠的AI智能体奠定了重要的方法论基础。
Sources
FAQ
TASPO是什么?
TASPO是解决大语言模型智能体策略优化中信用分配问题的新框架。它通过将训练时可用的特权信息转化为基于结果的动作信用,弥合了细粒度监督与最终结果之间的鸿沟,使智能体能更精准地从成功经验中学习。
为什么TASPO对智能体开发很重要?
现有强化学习方法将奖励均匀分配给所有决策,导致长周期任务中关键动作的贡献无法被准确识别。TASPO通过动作级别的信用分配稳定了策略优化收敛,为代码生成和自动化工作流等复杂场景提供了更高效的训练范式。
未来值得关注的发展方向是什么?
研究揭示的监督-信用鸿沟问题可能启发更多类型的特权信息利用方式。后续工作可探索过程监督与结果反馈的更自然融合,以及该框架在更多样化的智能体任务中的应用潜力。