RoMeRL:降阶效用状态破解自进化智能体记忆膨胀与奖励陷阱难题

针对自进化大语言模型智能体在长期交互中面临的记忆空间无限扩张导致反馈分散,以及协同检索引发的误导性效用更新等核心痛点,研究团队提出降阶记忆强化学习(RoMeRL)框架。该框架通过结果极性与记忆动力学因子化,构建固定维度的任务记忆状态,将动态增长的轨迹索引映射至有界语义坐标。理论证明该方法能显著提升单坐标反馈密度,并在ALFWorld等基准测试中实现冷启动率降低80%、反馈密度提升6倍、记忆规模压缩84.4%及LLM调用减少21.1%的显著成效,为构建高效可持续的智能体记忆系统提供了新范式。

自进化大语言模型智能体在复杂任务环境中展现出强大的适应能力,但其核心瓶颈在于如何高效地维护和更新记忆系统。当前基于学习的记忆机制主要面临两个相互交织的严峻挑战。首先,随着智能体与环境的交互历史不断延长,基于轨迹索引的效用空间呈线性甚至指数级增长。这种无限扩张的状态空间使得有限的反馈信号被极度分散,导致智能体难以从海量历史数据中提取出具有统计显著性的价值信号。其次,现有的奖励分配机制往往将轨迹级别的奖励共同分配给在检索过程中被共同命中的所有记忆片段。这种粗粒度的分配方式极易导致不相关或低相关性的经验接收到误导性的效用更新,进而使这些错误记忆固化在系统中,形成所谓的"记忆-奖励陷阱"。这一现象不仅降低了智能体的决策准确性,还导致了记忆库的迅速膨胀和噪声累积,严重制约了智能体的长期自进化能力。因此,如何在一个有界的状态空间内集中反馈信号,同时避免错误奖励的污染,成为提升自进化智能体记忆效率的关键科学问题。本文的核心贡献在于提出了一种全新的降阶记忆强化学习框架,旨在从根本上重构效用空间的表示方式,实现反馈覆盖与记忆纯净度的动态平衡。为解决上述难题,作者提出了降阶记忆强化学习(RoMeRL)方法,其核心思想是通过降维技术将无限扩张的轨迹索引效用空间映射到一个固定维度的任务记忆状态中。

具体而言,RoMeRL 利用结果极性和记忆动力学两个关键因子对记忆状态进行因子化解耦,从而构建出一个结构紧凑且语义明确的固定维度表示空间。在机制设计上,RoMeRL 引入了一组固定的语义坐标作为记忆存储的基本单元。每当新经验产生时,系统并非简单地将其追加到历史末尾,而是将其映射到这组固定的语义坐标中。这些坐标的内容会根据新信息的到来进行动态更新或完全替换,从而确保记忆库始终保持在有界的效用支持范围内。这种设计使得有限的反馈信号不再分散在无限的历史轨迹中,而是高度集中在少数几个关键的语义坐标上,极大地提升了每个坐标接收到的平均反馈密度。从理论层面分析,作者证明了这种降阶参数化不仅有效限制了状态空间的爆炸,还通过数学推导刻画了在通用坐标转换模型下,错误坐标在稳态下的占据概率。理论结果表明,通过优化坐标转换策略,可以显著降低错误记忆在长期运行中的留存率,从而从机理上抑制了记忆-奖励陷阱的形成。为了验证 RoMeRL 的有效性,作者在 ALFWorld 和 LifelongAgentBench 两个具有代表性的长期交互基准上进行了广泛的实验评估。ALFWorld 侧重于考察智能体在结构化环境中的多步推理与记忆检索能力,而 LifelongAgentBench 则关注智能体在持续学习场景下的知识积累与遗忘平衡。实验结果显示,RoMeRL 在各项关键指标上均显著优于现有的基线方法。

在任务性能方面,RoMeRL 实现了更高的任务成功率,证明了其记忆机制能够有效支持复杂的决策过程。特别是在记忆效率方面,RoMeRL 将冷启动比例(Cold-Q ratio)大幅降低了 80.0%,这意味着智能体能够更快地从历史经验中恢复有效知识,减少了重复探索的成本。此外,反馈密度提升了约 6.0 倍,表明单位记忆单元所承载的有效信息量显著增加。在资源消耗方面,RoMeRL 将维持的记忆规模减少了 84.4%,并减少了 21.1% 的大语言模型调用次数,这极大地降低了计算开销和延迟,为智能体的实时部署提供了可能。消融实验进一步揭示了降阶参数化和固定语义坐标设计对抑制错误奖励污染的关键作用,验证了理论分析的准确性。RoMeRL 的提出对自进化智能体领域具有重要的行业意义和潜在影响。首先,在开源社区层面,该方法为构建高效、低成本的长期记忆模块提供了新的范式,其代码已开源,有助于推动相关研究的复现与迭代。其次,在工业落地方面,RoMeRL 显著降低的 LLM 调用次数和记忆存储需求,使得智能体在资源受限的边缘设备或大规模并发场景中部署成为可能,极大地提升了商业应用的可行性。最后,在后续研究方面,RoMeRL 所提出的降阶效用状态概念为理解强化学习中的记忆机制提供了新的理论视角,未来可进一步探索其在多智能体协作、具身智能等更复杂场景中的应用。通过平衡反馈覆盖与记忆纯净度,RoMeRL 为构建真正具备长期记忆和自进化能力的通用人工智能系统奠定了坚实基础,有望推动智能体从短期任务执行向长期自主进化迈进。

Sources