SafeEvolve:エージェント経験に基づく安全ハーネスとポリシーの共進化フレームワーク

Published 2026-09-02 · AI Daily — AI-assisted deep research, methodology & disclosure

大規模言語モデルエージェントは、複雑な環境との相互作用において、有害な最終応答と多ステップ実行軌跡という二重のセキュリティリスクに直面しています。既存のセキュリティアライメントメカニズムは、外部ハーネスの更新または内部ポリシーの最適化のいずれかに孤立して依存することが多く、ランタイム制御と内在的なセキュリティ能力の両立が困難です。そこで本論文では、経験駆動型の自己進化セキュリティアライメントフレームワークであるSafeEvolveを提案します。このフレームワークは、完了したポリシー軌跡からのセキュリティ経験を活用し、ハーネスとポリシーの継続的な共進化を促進します。ハーネス側では、軌跡レベルのセキュリティ証拠を監査可能で可逆なコンポーネントレベルの更新に変換します。ポリシー側では、2段階のSFT-RLパラダイムを採用し、ハーネス補助の教師ありファインチューニングを通じてポリシーが進化後のハーネスを積極的に活用するように誘導し、検証器による報酬分解により多ステップ探索における自律的なセキュリティ行動を強化します。実験により、SafeEvolveはAgentDojoなどのベンチマークでより優れたセキュリティ-ユーティリティのトレードオフを実現し、Qwen3.5-4Bモデルの攻撃成功率を3分の1に低減しつつ、良性タスクのユーティリティを61.86%まで向上させることが示されました。

背景と概要

大規模言語モデルエージェントは、複雑な環境との相互作用において、有害な最終応答と多ステップ実行軌跡という二重のセキュリティリスクに直面しています。既存のセキュリティアライメントメカニズムは、外部ハーネスの更新または内部ポリシーの最適化のいずれかに孤立して依存することが多く、ランタイム制御と内在的なセキュリティ能力の両立が困難です。この断片的なアプローチは、動的な環境変化に対して柔軟かつ持続可能な防護体制を構築することを阻害しています。

本研究では、経験駆動型の自己進化セキュリティアライメントフレームワークであるSafeEvolveを提案します。このフレームワークは、完了したポリシー軌跡からのセキュリティ経験を活用し、ハーネスとポリシーの継続的な共進化を促進します。これにより、静的な安全ルールを動的な資産へと変換し、モデルの安全性を高めつつ、良性タスクにおけるユーティリティを最大限に維持する新しい技術的パスを提供します。

深掘り分析

SafeEvolveの技術的核心は、ハーネス側とポリシー側の二つの次元における緊密な連動にあります。ハーネス側では、軌跡レベルのセキュリティ証拠を監査可能で可逆なコンポーネントレベルの更新に変換します。これにより、安全プロンプトや階層型スキルライブラリへの介入が透明かつ制御可能になり、ブラックボックス的なルール蓄積を回避します。

ポリシー側では、2段階のSFT-RLパラダイムを採用します。まずハーネス補助の教師ありファインチューニングを通じて、ポリシーが進化後のハーネスを積極的に活用するように誘導します。次に検証器による報酬分解を用いて、多ステップ探索における各ステップの安全性を細粒度に評価し、自律的なセキュリティ行動を強化します。これにより、外部制約への依存から、能動的な安全意思決定への転換が図られます。

業界への影響

AgentDojoなどのベンチマークにおける実験結果は、SafeEvolveがセキュリティとユーティリティの優れたトレードオフを実現することを示しています。Qwen3.5-4Bモデルを用いたテストでは、攻撃成功率が3分の1に低減されました。この防御性能の向上は、良性タスクのユーティリティを59.79%から61.86%へと向上させることで補完され、安全性が運用効率を損なわないことが実証されました。

このフレームワークは、大規模基礎モデルの再学習コストなしに、履歴データに基づいて安全設定を継続的に最適化できるため、開発コストの削減に貢献します。特に金融や医療といった高感度分野では、更新の追跡可能性がコンプライアンス要件を満たし、自律エージェントの信頼性を高める基盤となります。

今後の展望

SafeEvolveは、静的なルール防御から動的な経験進化へのパラダイムシフトを示唆しています。今後は、モデルの重み調整だけでなく、動的相互作用環境の適応的最適化に研究焦点が移る可能性があります。

安全性と能力が相互に強化し合うことを示した本手法は、次世代AIシステムの設計指針となるでしょう。さらに、ロボット工学や自律運転など、不確実性下での多段階意思決定が重要な他分野への拡張も期待されます。

Sources

FAQ

SafeEvolveとは何か、どのような問題を解決するのか?

SafeEvolveは、LLMエージェントの有害応答と多ステップ実行軌跡という二重のセキュリティリスクに対処する、経験駆動型の自進化セキュリティアライメントフレームワークです。

ハーネスとポリシーの共進化メカニズムはどのように機能するか?

ハーネス側では軌跡レベルのセキュリティ証拠を監査可能で可逆なコンポーネント更新に変換し、ポリシー側では2段階SFT-RLで進化した安全設定を積極的に活用するように学習させます。

実験結果と今後の展望は何か?

AgentDojoベンチマークでQwen3.5-4Bの攻撃成功率を3分の1に低減し、良性タスクのユーティリティを61.86%に向上。今後は動的環境での適応的最適化と高感度業界でのコンプライアンス応用が注目されます。