AgentRewind:長程 LLM 智能體的可恢復執行框架
針對長程 LLM 智能體執行中早期錯誤難以逆轉的問題,本文提出 AgentRewind 運行時恢復框架。該框架通過記錄智能體上下文與環境狀態的對齊檢查點,允許智能體在出錯時回滾至先前狀態並攜帶歷史嘗試信息繼續執行。同時構建了 MettleBench 基準,用於評估長程工程任務中的任務完成度與部分進度。實驗表明,在多種模型、執行策略及智能體框架下,AgentRewind 顯著提升了任務成功率及平均檢查單進度,優於現有基線方法。
在现实世界的复杂任务场景中,大语言模型智能体往往需要在漫长的执行周期内与环境进行持续交互。然而,这种长程执行模式带来了一个严峻的挑战:早期发生的微小错误可能会通过智能体自身的上下文记忆以及外部环境的状态变化不断传播和放大。一旦错误发生,其影响往往难以通过后续的动作简单抵消或逆转,导致整个任务失败。现有的主流方法大多侧重于通过优化规划流程或增加安全检查来预防错误的发生,但对于错误已经发生后的补救措施支持不足。为了解决这一痛点,本文提出了 AgentRewind,这是一个旨在实现长程执行中实时恢复的框架。其核心贡献在于引入了一种机制,能够记录智能体上下文与受控环境状态之间精确对齐的检查点。这使得智能体在检测到执行偏差或失败时,可以安全地回退到之前的某个稳定状态,并在此基础上,结合之前尝试中积累的信息重新规划并继续执行,从而实现了从"被动预防"到"主动恢复"的范式转变。 AgentRewind 的技术实现依赖于对智能体状态和环境状态的精细化同步记录。在智能体运行过程中,框架会定期捕获智能体的内部上下文(如历史对话、中间推理结果)以及外部环境的关键状态变量,并将它们打包成一个对齐的检查点。这种对齐机制确保了当智能体回滚时,其内部认知与外部世界的一致性,避免了因状态不同步导致的逻辑混乱。与传统的简单回滚不同,AgentRewind 允许智能体在恢复执行时保留之前尝试中的部分有效信息或教训。这意味着智能体不是完全"失忆"地重新开始,而是带着对之前错误路径的认知去探索新的解决方案。这种设计不仅提高了恢复的效率,还增强了智能体在复杂环境中的适应能力。通过这种运行时恢复机制,AgentRewind 为长程任务提供了一种更鲁棒的执行策略,使得智能体在面对不确定性时能够更灵活地调整路径,而不是因为一次早期错误而彻底失败。 为了全面评估 AgentRewind 的有效性,研究团队构建了 MettleBench,一个专门针对长程工程任务设计的基准测试集。该基准包含了一系列具有相关性的工程需求,旨在模拟真实世界中复杂的、多步骤的任务场景。评估指标不仅关注最终的任务完成成功率,还引入了"部分进度"这一维度,以衡量智能体在未能完全完成任务时所能达到的中间成果。实验覆盖了多种主流大语言模型、不同的执行策略以及多种智能体框架(agent harnesses),以确保结果的普适性。实验结果显示,AgentRewind 在任务成功率和平均检查单进度两项关键指标上均显著优于对比的基线方法。特别是在那些容易因早期错误导致连锁反应的任务中,AgentRewind 的优势更为明显。消融实验进一步证实,检查点机制和携带历史信息恢复这两个核心组件对性能提升均有重要贡献,缺一不可。这表明,仅仅回滚状态而不利用历史经验,或者仅仅利用经验而不进行状态对齐,都无法达到最佳效果。 AgentRewind 的提出对于长程 LLM 智能体的研究和应用具有重要的行业意义。首先,它填补了现有智能体框架在错误恢复机制上的空白,为构建更鲁棒、更可靠的自主智能体系统提供了新的技术路径。在工业落地方面,许多高风险或高成本的任务(如自动化代码生成、复杂系统运维)对智能体的可靠性要求极高,AgentRewind 的恢复机制可以显著降低因单次错误导致的整体任务失败率,从而降低重试成本。其次,MettleBench 的发布为社区提供了一个评估长程任务部分进度的新标准,有助于推动相关研究从单纯的"全有或全无"评估向更细致的过程评估转变。未来,随着智能体在更复杂环境中的应用,如何优化检查点的粒度、如何更智能地决定何时回滚以及如何利用历史信息进行更高效的规划,将成为重要的研究方向。AgentRewind 为这些后续研究奠定了坚实的基础,有望成为长程智能体执行框架中的标准组件之一。