CAFE:自我进化的搜索代理,为何必须依赖协同进化的反馈

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

本文针对基于结果监督的搜索代理在强化学习中面临的根本困境展开研究:代理需要学会何时、如何检索证据,但终端奖励既无法定位中间环节的误差,也无法在误差累积前纠正正在进行的轨迹。作者提出CAFE(耦合代理-反馈进化)框架,用共享参数模型在搜索代理与评论家角色之间交替,将纠正性反馈视为轨迹内干预。实验显示CAFE在七个agentic搜索基准上平均优于被评估的强化学习搜索代理,六个域外基准保持增益,并减少答案级幻觉。单侧消融表明仅改进代理或评论家会趋于停滞,交替更新才能持续改进。

这篇论文聚焦于一个被长期忽视的问题:基于结果监督的搜索代理虽然学会了何时、如何检索证据,但其训练信号存在结构性缺陷。终端奖励只能对最终结果打分,既无法定位中间检索环节的误差,也无法在误差累积成致命错误之前,对正在进行的推理轨迹进行纠正。作者指出,若把纠正性反馈当作一种学习到的轨迹内干预,就会把代理与评论家两个角色的学习耦合在一起:代理需要自己判断何时请求、如何使用反馈,而评论家则必须从结果被混淆、且失败模式随代理能力变化而漂移的轨迹中,推断出真正有用的纠正内容。针对这一难题,论文提出了 CAFE(Coupled Agent-Feedback Evolution,耦合代理-反馈进化)框架,其核心思想是用一个共享参数的模型在搜索代理与评论家角色之间交替扮演,从而让反馈与策略共同进化。这一设计的核心贡献在于,它把自我改进的搜索代理与支撑它的反馈机制绑定为协同进化的整体,而非各自独立优化。

论文认为,一个能够自我进化的搜索代理,其反馈必须与所引导的策略同步演化,否则任何单侧改进都会触及天花板。在技术方法上,CAFE 采用共享参数模型在代理与评论家角色间交替,从围绕基座代理自身失败构建的轨迹中初始化反馈条件恢复,使反馈信号直接对准代理真实的失败模式。在线强化学习阶段,作者提出一种比较性反馈估计,利用提示级调用与跳过之间的成功差距来塑造请求回报,即通过对比"请求反馈"与"不请求反馈"的成功差异来判断反馈请求的价值;同时采用反馈优势塑造,在反馈出现前后对 token 层面的优势进行再权重,从而更精细地分配信用。离线阶段则通过派生自 rollouts 的偏好优化,从匹配的成功与失败轨迹中学习反馈,让模型从正反对照中提炼出有效的纠正信号。在线与离线优化由此被耦合为一个闭环:在线探索产生轨迹,离线从轨迹中提炼偏好,二者共同推动代理与反馈的协同进化。

这种设计避免了传统方法中终端奖励稀疏、中间误差无法定位的困境,使纠正能够提前介入。在实验设置上,论文在七个 agentic 搜索基准上评估了 CAFE,并与已被评估的基于强化学习的搜索代理进行对比。关键结果显示,CAFE 在这些基准上平均表现最优,且在六个域外(out-of-domain)基准上依然保持增益,说明其改进并非过拟合于特定任务分布,而具有跨域泛化能力;同时,CAFE 还减少了答案级幻觉,意味着检索与推理的一致性得到提升。消融实验进一步揭示了耦合机制的必要性:单侧改进实验表明,仅改进代理或仅改进评论家都会 eventually 趋于停滞,而交替更新二者则能持续带来性能提升。这一发现直接支撑了论文的核心论点,即反馈与策略必须协同进化,任何单点优化都无法突破自我改进的瓶颈。

这些结果共同表明,CAFE 不仅在性能上超越既有方法,更在机制上验证了协同进化的有效性。在行业意义与潜在影响方面,CAFE 为 agentic 搜索这一当前落地方向提供了新的范式。随着基于检索与推理的智能体在问答、研究、代码等场景中广泛应用,如何让这类代理实现自我改进成为一个关键挑战。CAFE 通过共享参数模型与耦合优化,为构建可持续进化的搜索代理提供了可复用的框架,其反馈条件恢复与比较性反馈估计的思想也可迁移到其他需要在线决策的强化学习场景。对开源社区而言,这一框架为自我改进智能体的训练提供了新的思路,即反馈不应是静态的外部信号,而应与策略共同进化。对工业落地而言,CAFE 在域外基准上的稳定性与幻觉减少,增强了此类系统在真实场景中的可信度。对后续研究而言,论文揭示的单侧改进会停滞、交替更新才能持续改进的规律,提示研究者应重视代理与评论家之间的动态耦合关系,而非孤立地优化单一组件。这些发现为构建真正自我进化的智能体奠定了方法论基础。

Sources

FAQ

CAFE是什么?它要解决什么问题?

CAFE是「耦合代理-反馈进化」框架,用共享参数模型在搜索代理与评论家角色间交替,使反馈与策略协同进化,而非各自独立优化,核心是让自我改进的反馈与策略同步演化。

为什么反馈必须与策略协同进化?

因为代理变强后犯错模式会改变,静态评论家会与其真实需求错位。实验表明只改进代理或只改进评论家都会停滞,只有交替更新两者才能持续改进。

CAFE的效果如何?未来可应用到哪些场景?

CAFE在七个agentic搜索基准上平均优于被评估的强化学习搜索代理,六个域外基准保持增益并减少答案级幻觉,具备跨域泛化能力,其思想可迁移到其他在线决策的强化学习场景。