AREX架构深度解析:递归自改进机制如何重塑深度研究智能体

本文介绍了名为AREX的新型深度研究智能体家族,旨在解决复杂约束下的高成本答案发现难题。针对"发现-验证不对称性"痛点,AREX引入递归自改进(RSI)机制,通过内外双层循环交替工作:内层收集证据构建暂定答案,外层审计约束并发起针对性后续研究。为支持长周期任务,AREX创新性地学习了自主上下文更新工具,将交互历史压缩为保留已验证证据和未决约束的紧凑状态,无需依赖外部模型。通过在合成任务及高质量轨迹上进行智能体中间训练与长周期强化学习,AREX实例化了4B密集模型和122B-MoE模型。在BrowseComp、WideSearch、DeepSearchQA及HLE等基准测试中,AREX显著优于同等规模基线,并在与激活参数更多模型的竞争中保持领先,展现了强大的自主研究与自我优化能力,为复杂推理任务提供了新的技术范式。

深度研究任务的核心挑战在于,智能体必须找到能够同时满足多个复杂约束条件的答案。传统的搜索方法往往依赖于延长搜索时间或增加计算资源,但这带来了高昂的成本。本文指出,发现满足所有约束的答案极其困难,但验证一个候选答案是否满足特定约束却可以分解为一系列可处理的检查步骤。这种发现与验证之间的不对称性揭示了一个关键洞察:优秀的研究智能体不应仅仅延长搜索过程,而应递归地改进其当前的答案。基于此,作者提出了AREX(Recursively Self-Improving Agent for Deep Research),这是一种具备递归自改进能力的深度研究智能体家族。AREX的核心贡献在于它不再被动地扩展搜索空间,而是主动地通过验证中间结果来指导后续的优化,从而在有限的资源下实现更精准的答案构建。这一机制使得智能体能够从简单的信息检索者进化为能够自我反思和修正的研究者,解决了传统方法在复杂约束下效率低下的问题。

在技术实现上,AREX采用了一种独特的双层循环架构。内层研究循环负责广泛地收集证据并构建暂定答案,而外层自改进循环则扮演审计者的角色,按约束条件逐一审查答案,识别出尚未解决或存疑的声明,并据此发起有针对性的后续研究。为了在长周期的自改进过程中维持上下文的一致性,AREX学习了一种自主的上下文更新工具。该工具能够将不断增长的历史交互信息压缩为一个紧凑的"改进状态",该状态保留了已验证的证据和未决的约束条件,从而避免了上下文窗口的无限膨胀。这一过程完全由模型内部完成,不依赖外部模型进行总结。在训练策略上,AREX通过智能体中间训练和长周期强化学习,在验证过的合成任务和高质量的人类轨迹数据进行优化。鉴于长周期强化学习中最终奖励稀疏的问题,训练过程特别强调那些获取决定性证据或纠正错误研究方向的关键步骤,通过强化这些关键节点的学习信号,提升了模型在长程任务中的稳定性和准确性。

实验评估涵盖了BrowseComp、WideSearch、DeepSearchQA、Humanity's Last Exam (HLE) 以及其他推理和工具使用基准测试。AREX实例化了两种规模的模型:一个4B参数的密集模型和一个122B参数、激活10B参数的混合专家(MoE)模型。结果显示,AREX在这些基准测试中显著优于同等规模的基线模型。特别是在处理需要多步推理和工具使用的复杂任务时,AREX的表现尤为突出。消融实验进一步证实了递归自改进机制的有效性,表明外层审计循环对于识别和解决未决约束至关重要。此外,自主上下文更新工具的使用不仅提高了效率,还保持了答案的连贯性和准确性。与那些激活参数更多的大型模型相比,AREX依然保持了竞争力,证明了其通过智能的递归优化而非单纯增加算力来解决问题的有效性。

这些结果展示了AREX在深度研究任务中的强大潜力和泛化能力。AREX的提出对开源社区和工业落地具有深远意义。首先,它提供了一种无需依赖外部大模型即可实现上下文压缩和状态管理的内部机制,降低了部署成本并提高了隐私安全性。其次,递归自改进机制为构建能够自我进化的AI智能体提供了新的范式,可能推动智能体在科学研究、法律分析、医疗诊断等需要高度准确性和多约束满足领域的广泛应用。对于后续研究而言,AREX证明了长周期强化学习与关键步骤奖励聚焦相结合的有效性,为优化稀疏奖励环境下的智能体学习提供了宝贵经验。此外,其紧凑的改进状态表示方法也为处理长上下文任务提供了新的思路。AREX的成功表明,通过模拟人类研究中的"假设-验证-修正"循环,AI智能体可以在复杂任务中实现超越简单搜索的智力表现,为通用人工智能的发展迈出了重要一步。

Sources