SafeEvolve:基于智能体经验的安全Harness与策略协同进化框架
针对大型语言模型智能体在复杂环境交互中面临的双重安全风险,现有机制常因孤立依赖外部控制或内部优化而难以兼顾运行时安全与内在能力。为此,研究提出SafeEvolve框架,利用已完成策略轨迹中的安全经验,驱动安全Harness与策略的持续协同进化。该框架将轨迹级证据转化为可审计的组件级更新,并采用两阶段SFT-RL范式引导策略主动利用进化后的Harness。实验表明,SafeEvolve在AgentDojo等基准上显著优化了安全与效用的权衡,使Qwen3.5-4B模型的攻击成功率降低三倍,同时良性任务效用提升至61.86%,为AI安全对齐提供了新的自进化路径。
大型语言模型驱动的智能体在自主执行复杂任务时,其表现不仅取决于基础模型的能力,更深受交互环境所依赖的Harness(即提示词、工具调用规则及技能库等运行时环境配置)的影响。这种双重依赖性使得智能体极易暴露于安全风险之中,既包括直接生成的有害最终响应,也涵盖在多步执行轨迹中可能产生的违规操作。现有的安全对齐机制通常采取割裂的视角,要么仅依赖外部对Harness的静态更新,要么仅关注内部策略模型的优化。这种孤立的方法往往无法有效弥合运行时动态控制与模型内在安全认知之间的鸿沟,导致智能体在面对动态环境时缺乏灵活且持久的安全防护。针对这一痛点,本研究提出SafeEvolve框架,旨在通过挖掘智能体在运行过程中积累的安全经验,实现Harness与策略模型的协同进化。其核心贡献在于构建了一个闭环的自我进化系统,将静态的安全规则转化为动态的、可随经验持续优化的运行时资产,从而在提升模型安全性的同时,最大限度地保留其在良性任务中的效用表现,为构建真正可靠且高效的自主智能体提供了新的技术路径。
SafeEvolve的技术核心在于其独特的Harness-策略协同进化机制,该机制将安全经验的利用分解为两个紧密耦合的维度。在Harness侧,框架不再采用简单的提示词拼接,而是将轨迹级别的安全证据转化为组件级别的精细化更新。具体而言,系统会分析智能体在完成任务过程中的交互日志,识别出导致安全风险的具体环节,进而对安全提示词和分层技能库进行有界、可逆且可审计的修改。这种更新方式确保了Harness的演化是透明且可控的,避免了黑盒式的规则堆砌。在策略侧,SafeEvolve采用了两阶段监督微调结合强化学习(SFT-RL)的训练范式。第一阶段,利用进化后的Harness数据进行监督微调,旨在引导策略模型主动学习如何识别并利用这些进化后的Harness资产,从而建立起对安全环境的敏感度。
第二阶段,引入Harness增强的强化学习,通过验证器分解奖励机制,在智能体进行多步探索的过程中,对每一步动作的安全性进行细粒度评估和奖励塑造。这种设计使得策略模型能够在动态交互中逐步内化安全行为,而非仅仅依赖外部规则的约束,从而实现了从被动防御到主动安全决策的转变。为了验证SafeEvolve的有效性,研究团队在多个主流的智能体安全基准测试上进行了广泛的实验评估,重点考察了模型在面临恶意诱导时的防御能力以及在正常任务中的执行效率。实验结果显示,SafeEvolve在安全与效用之间取得了显著优于现有基线方法的平衡。特别值得注意的是,在AgentDojo这一高难度的智能体安全基准上,基于Qwen3.5-4B模型的SafeEvolve实现了攻击成功率(ASR)的大幅降低,降幅达到3倍之多,这表明其防御机制具有极强的鲁棒性。更为关键的是,这种安全性的提升并未以牺牲任务效能为代价,相反,模型在良性任务上的效用指标从59.79%稳步提升至61.86%。
这一结果有力地证明了协同进化机制的优势:通过让策略模型主动适应进化后的安全Harness,模型不仅学会了"不做什么",更学会了"如何更安全地做",从而在保持甚至提升任务完成质量的同时,有效遏制了安全风险。消融实验进一步证实了Harness更新与策略优化两者缺一不可,单独使用任一模块均无法达到协同进化所带来的综合性能增益。SafeEvolve的提出对开源社区、工业落地及后续研究具有深远的意义。对于开源社区而言,该框架提供了一套可复用、可审计的安全进化范式,使得开发者能够基于历史交互数据持续优化智能体的安全配置,而无需重新训练庞大的基础模型,极大地降低了安全维护的成本。在工业落地方面,随着智能体在金融、医疗等高敏感领域的应用日益广泛,SafeEvolve所强调的"可逆、可审计"的Harness更新机制,为企业提供了满足合规要求的安全保障手段,使得智能体的行为更加透明可控。此外,该研究揭示了运行时环境与模型策略之间的深层互动关系,为后续研究指明了方向,即未来的智能体安全不应仅局限于模型权重的调整,更应关注动态交互环境的自适应优化。SafeEvolve不仅是一个技术框架,更是一种新的安全治理理念,它推动了智能体安全从静态规则防御向动态经验进化的范式转变,为构建更加可信、自主的人工智能系统奠定了坚实基础。
Sources
FAQ
SafeEvolve是什么?它解决了AI智能体安全中的什么问题?
SafeEvolve是一个经验驱动的自进化安全对齐框架,针对LLM智能体在复杂环境中面临的安全响应与多步执行轨迹的双重安全风险,通过协同进化Harness与策略模型来持续提升安全性。
SafeEvolve框架的核心创新在哪里?
它首次将智能体运行中的安全经验转化为可审计、可逆的Harness组件级更新,并采用两阶段SFT-RL范式训练策略模型主动利用进化后的安全配置,实现从被动防御到主动安全决策的转变。
SafeEvolve的实验效果如何?未来值得关注哪些方向?
在AgentDojo基准上,基于Qwen3.5-4B的SafeEvolve将攻击成功率降低3倍,良性任务效用提升至61.86%。未来方向包括动态交互环境的自适应优化及高敏感行业合规落地。