RoMeRL:透過降階效用狀態平衡自進化智能體記憶的回饋覆蓋與獎勵陷阱
本文針對自進化大型語言模型智能體在學習型記憶系統中面臨的兩個緊密耦合挑戰:隨著交互歷史增長,基於軌跡索引的效用空間不斷擴張導致有限回饋分散;以及由於軌跡級獎勵被共同分配給協同檢索的記憶,導致不相關經驗接收誤導性效用更新從而陷入記憶-獎勵陷阱。為此,作者提出了降階記憶強化學習(RoMeRL)框架。該方法利用由結果極性和記憶動力學因子化的固定維度任務記憶狀態,來表示不斷增長的軌跡索引效用空間。RoMeRL 通過一組固定的語義座標引入新經驗,其內容隨時間更新或替換,從而將回饋集中在有界的效用支持範圍內。理論分析表明,這種降階參數化增加了每個效用座標接收的平均回饋,並刻畫了通用座標轉換模型下錯誤座標的穩態佔據率。在 ALFWorld 和 LifelongAgentBench 基準上的實驗顯示,RoMeRL 顯著提升了任務性能,將冷啟動比例降低 80.0%,回饋密度提高約 6.0 倍,維持的記憶規模減少 84.4%,並減少 21.1% 的 LLM 呼叫次數。
自进化大语言模型智能体在复杂任务环境中展现出强大的适应能力,但其核心瓶颈在于如何高效地维护和更新记忆系统。当前基于学习的记忆机制主要面临两个相互交织的严峻挑战。首先,随着智能体与环境的交互历史不断延长,基于轨迹索引的效用空间呈线性甚至指数级增长。这种无限扩张的状态空间使得有限的反馈信号被极度分散,导致智能体难以从海量历史数据中提取出具有统计显著性的价值信号。其次,现有的奖励分配机制往往将轨迹级别的奖励共同分配给在检索过程中被共同命中的所有记忆片段。这种粗粒度的分配方式极易导致不相关或低相关性的经验接收到误导性的效用更新,进而使这些错误记忆固化在系统中,形成所谓的"记忆-奖励陷阱"。这一现象不仅降低了智能体的决策准确性,还导致了记忆库的迅速膨胀和噪声累积,严重制约了智能体的长期自进化能力。因此,如何在一个有界的状态空间内集中反馈信号,同时避免错误奖励的污染,成为提升自进化智能体记忆效率的关键科学问题。本文的核心贡献在于提出了一种全新的降阶记忆强化学习框架,旨在从根本上重构效用空间的表示方式,实现反馈覆盖与记忆纯净度的动态平衡。为解决上述难题,作者提出了降阶记忆强化学习(RoMeRL)方法,其核心思想是通过降维技术将无限扩张的轨迹索引效用空间映射到一个固定维度的任务记忆状态中。
具体而言,RoMeRL 利用结果极性和记忆动力学两个关键因子对记忆状态进行因子化解耦,从而构建出一个结构紧凑且语义明确的固定维度表示空间。在机制设计上,RoMeRL 引入了一组固定的语义坐标作为记忆存储的基本单元。每当新经验产生时,系统并非简单地将其追加到历史末尾,而是将其映射到这组固定的语义坐标中。这些坐标的内容会根据新信息的到来进行动态更新或完全替换,从而确保记忆库始终保持在有界的效用支持范围内。这种设计使得有限的反馈信号不再分散在无限的历史轨迹中,而是高度集中在少数几个关键的语义坐标上,极大地提升了每个坐标接收到的平均反馈密度。从理论层面分析,作者证明了这种降阶参数化不仅有效限制了状态空间的爆炸,还通过数学推导刻画了在通用坐标转换模型下,错误坐标在稳态下的占据概率。理论结果表明,通过优化坐标转换策略,可以显著降低错误记忆在长期运行中的留存率,从而从机理上抑制了记忆-奖励陷阱的形成。为了验证 RoMeRL 的有效性,作者在 ALFWorld 和 LifelongAgentBench 两个具有代表性的长期交互基准上进行了广泛的实验评估。ALFWorld 侧重于考察智能体在结构化环境中的多步推理与记忆检索能力,而 LifelongAgentBench 则关注智能体在持续学习场景下的知识积累与遗忘平衡。实验结果显示,RoMeRL 在各项关键指标上均显著优于现有的基线方法。
在任务性能方面,RoMeRL 实现了更高的任务成功率,证明了其记忆机制能够有效支持复杂的决策过程。特别是在记忆效率方面,RoMeRL 将冷启动比例(Cold-Q ratio)大幅降低了 80.0%,这意味着智能体能够更快地从历史经验中恢复有效知识,减少了重复探索的成本。此外,反馈密度提升了约 6.0 倍,表明单位记忆单元所承载的有效信息量显著增加。在资源消耗方面,RoMeRL 将维持的记忆规模减少了 84.4%,并减少了 21.1% 的大语言模型调用次数,这极大地降低了计算开销和延迟,为智能体的实时部署提供了可能。消融实验进一步揭示了降阶参数化和固定语义坐标设计对抑制错误奖励污染的关键作用,验证了理论分析的准确性。RoMeRL 的提出对自进化智能体领域具有重要的行业意义和潜在影响。首先,在开源社区层面,该方法为构建高效、低成本的长期记忆模块提供了新的范式,其代码已开源,有助于推动相关研究的复现与迭代。其次,在工业落地方面,RoMeRL 显著降低的 LLM 调用次数和记忆存储需求,使得智能体在资源受限的边缘设备或大规模并发场景中部署成为可能,极大地提升了商业应用的可行性。最后,在后续研究方面,RoMeRL 所提出的降阶效用状态概念为理解强化学习中的记忆机制提供了新的理论视角,未来可进一步探索其在多智能体协作、具身智能等更复杂场景中的应用。通过平衡反馈覆盖与记忆纯净度,RoMeRL 为构建真正具备长期记忆和自进化能力的通用人工智能系统奠定了坚实基础,有望推动智能体从短期任务执行向长期自主进化迈进。