SafeEvolve: 에이전트 경험 기반 안전 Harness와 정책의协同 진화 프레임워크

Published 2026-09-02 · AI Daily — AI-assisted deep research, methodology & disclosure

대규모 언어 모델 에이전트는 복잡한 환경 상호작용에서 해로운 최종 응답과 다단계 실행 궤적이라는 이중 보안 위험에 직면합니다. 기존 보안 정렬 메커니즘은 종종 외부 Harness 업데이트 또는 내부 정책 최적화에 고립되어 의존하여 런타임 제어와 내재적 보안 능력을 모두 잡기 어렵습니다. 이를 해결하기 위해 본 논문에서는 경험 기반 자가 진화 보안 정렬 프레임워크인 SafeEvolve를 제안합니다. 이 프레임워크는 완료된 정책 궤적의 보안 경험을 활용하여 Harness와 정책의 지속적协同 진화를 주도합니다. Harness 측면에서는 궤적 수준의 보안 증거를 감사 가능하고 역versible한 컴포넌트 수준 업데이트로 변환합니다. 정책 측면에서는 2단계 SFT-RL 패러다임을 채택하여, Harness 보조 감독 미세 조정을 통해 정책이 진화한 Harness를 능동적으로 활용하도록 유도하고, 검증기 분해 보상을 통해 다단계 탐색 중인 자율 보안 행동을 강화합니다. 실험 결과, SafeEvolve는 AgentDojo 등의 벤치마크에서 더 우수한 보안-효용 트레이드오프를 달성하여 Qwen3.5-4B 모델의 공격 성공률을 3배 낮추고 동시에 양호한 작업 효용을 61.86%로 향상시켰습니다.

배경

대규모 언어 모델 기반 에이전트가 복잡한 동적 환경에서 자율적으로 작업을 수행할 때, 그 성능은 단순히 기본 모델의 능력에만 의존하는 것이 아니라 상호작용 환경에 사용되는 하네스(Harness)의 질에 크게 좌우됩니다. 하네스에는 프롬프트 구조, 도구 호출 규칙, 기술 라이브러리 등 런타임 환경 구성 요소가 포함됩니다. 이러한 이중적 의존성으로 인해 에이전트는 유해한 최종 응답 생성이나 다단계 실행 궤적 내에서의 안전하지 않은 행동과 같은 이중 보안 위험에 노출되기 쉽습니다. 기존 보안 정렬 메커니즘은 외부 하네스의 정적 업데이트와 내부 정책 모델 최적화를 분리된 접근법으로 처리하여, 런타임 제어와 모델의 내재적 보안 능력 간의 격차를 해소하지 못했습니다. 이로 인해 에이전트는 새로운 적대적 시나리오에 직면했을 때 정적 규칙만으로는 완화할 수 없는 취약점을 드러냈습니다. 이러한 한계를 극복하기 위해 SafeEvolve 프레임워크가 제안되었으며, 이는 완료된 정책 궤적에서 축적된 보안 경험을 활용하여 하네스와 정책 모델이 지속적으로 공진화하도록 설계되었습니다.

심층 분석

SafeEvolve의 기술적 핵심은 하네스와 정책이라는 두 차원에서 긴밀하게 결합된 공진화 메커니즘에 있습니다. 하네스 측면에서 프레임워크는 단순한 프롬프트 결합을 넘어, 궤적 수준의 보안 증거를 감사 가능하고 가역적인 컴포넌트 수준의 세분화된 업데이트로 변환합니다. 시스템은 상호작용 로그를 분석하여 보안 위반이 발생한 정확한 단계를 식별한 후, 안전 프롬프트나 계층적 기술 라이브러리의 특정 요소를 수정합니다. 이러한 세분화된 접근 방식은 하네스의 진화가 투명하고 통제 가능하도록 보장하며, 블랙박스식 규칙 축적의 불투명성을 피합니다. 정책 측면에서는 2단계 SFT-RL(지도 미세 조정 및 강화 학습) 패러다임이 적용됩니다. 첫 번째 단계에서는 진화된 하네스 데이터를 사용하여 정책을 지도 미세 조정함으로써 모델이 업데이트된 보안 자산을 능동적으로 인식하고 활용하도록 유도합니다. 두 번째 단계에서는 검증기 분해 보상 메커니즘을 도입하여 다단계 탐색 중 각 행동의 안전성을 세밀하게 평가하고 보상 형성을 수행합니다.

이러한 두 구성 요소 간의 시너지는 아블레이션 실험을 통해 입증되었습니다. 하네스 업데이트나 정책 최적화 중 하나만으로는 전체 프레임워크에서 관찰된 포괄적인 성능 향상을 달성할 수 없었으며, 하네스는 구조화된 보안 컨텍스트를 제공하고 정책은 그 컨텍스트 내에서 탐색하는 방법을 학습함으로써 상호 보완적인 역할을 합니다. 결과적으로 에이전트는 단순히 무엇을 하지 말아야 하는지뿐만 아니라, 어떻게 더 안전하게 작업을 실행할 수 있는지를 학습하여 의사 결정 과정의 핵심에 안전을 통합하게 됩니다. 이는 수동적인 방어에서 능동적인 보안 추론으로의 패러다임 전환을 의미하며, 에이전트가 내재화된 보안 스키마를 개발하도록 돕습니다.

산업 영향

AgentDojo와 같은 벤치마크 데이터셋에 대한 SafeEvolve의 실증적 평가는 보안과 유틸리티 간의 균형을 최적화하는 뛰어난 능력을 보여줍니다. Qwen3.5-4B 모델을 대상으로 한 테스트에서 SafeEvolve는 공격 성공률(ASR)을 3배 감소시켰으며, 이는 적대적 입력에 대한 exceptional한 강건성을 입증합니다. 이러한 취약성 감소는 에이전트의 정당한 작업 수행 능력을 희생시키지 않으면서 달성되었으며, 오히려 양호한 작업의 유틸리티 점수는 59.79%에서 61.86%로 상승했습니다. 이는 더 엄격한 보안 통제가 에이전트 능력을 저하시킨다는 기존 관념에 도전하며, 공진화가 보안과 성능 지표 모두에서 순positive한 결과를 가져올 수 있음을 증명합니다. 오픈소스 커뮤니티를 위해 SafeEvolve는 재사용 가능하고 감사 가능한 보안 진화 프레임워크를 제공하여, 대규모 기초 모델의 재학습 비용 없이도 에이전트 보안 구성을 지속적으로 정제할 수 있게 합니다.

금융 및 의료와 같은 고위험 산업 분야에서는 SafeEvolve가 규제 준수와 투명성을 보장하는 방법을 제시합니다. 특정 궤적 증거로 추적 가능한 보안 업데이트 기능은 설명 가능성과 책임성에 대한 규제 요구사항을 충족시킵니다. 에이전트 행위가 정의된 보안 경계 내에서 유지되면서 새로운 운영 컨텍스트에 적응하도록 보장함으로써, SafeEvolve는 오류가 용납되지 않는 환경에서 자율 에이전트의 배포를 가능하게 합니다. 이는 AI 에이전트를 실험용 프로토타입에서 핵심 인프라 구성 요소로 확장하는 데 필수적인 능력으로, 안전이 성능의 제약이 아니라 촉진제가 될 수 있음을 보여줍니다.

전망

SafeEvolve의 도입은 AI 안전 거버넌스에서 정적 규칙 기반 방어에서 동적 경험 기반 진화로의 패러다임 전환을 의미합니다. 이는 미래 연구가 고립된 모델 가중치 조정보다 동적 상호작용 환경의 적응적 최적화에 더 초점을 맞춰야 함을 시사합니다. 프레임워크는 안전이 고정된 상태가 아니라 에이전트와 환경이 새로운 도전에 대응하기 위해 공진화하는 지속적인 적응 과정임을 보여줍니다. 이는 에이전트가 실시간으로 자신의 실패로부터 학습할 수 있는 자가 개선형 보안 시스템 연구에 새로운 길을 열었습니다. 또한, SafeEvolve가 양호한 작업 유틸리티를 향상시킨 성공은 안전과 능력이 상호 배타적이 아니라 상호 강화될 수 있음을 시사합니다.

AI 에이전트가 더욱 자율적으로 복잡한 워크플로우에 통합됨에 따라, 강건한 보안을 유지하면서 높은 유틸리티를 유지하는 능력이 주요 차별화 요소가 될 것입니다. SafeEvolve는 이러한 균형을 달성하기 위한 청사진을 제공하며, 안전이 학습 루트의 시작부터 임베딩되어야 함을 보여줍니다. 앞으로 SafeEvolve의 원칙은 로봇공학, 자율 주행 등 불확실성 하에서의 다단계 의사 결정이 중요한 다른 도메인으로 확장될 수 있습니다. 궤적 수준 증거 분석과 컴포넌트 수준 하네스 업데이트 메커니즘은 새로운 세대의 신뢰할 수 있고 탄력적인 AI 에이전트를 위한 기반을 마련하며, 예측 불가능한 현실 세계에서 안전하게 운영될 수 있는 시스템을 가능하게 할 것입니다.

Sources

FAQ

SafeEvolve란 무엇이며 어떤 문제를 해결하는가?

SafeEvolve는 LLM 에이전트의 해로운 응답과 다단계 실행 궤적이라는 이중 보안 위험을 해결하는 경험 기반 자가 진화 보안 정렬 프레임워크로, Harness와 정책 모델의 지속적 공진화를 통해 보안을 강화합니다.

Harness-정책 공진화 메커니즘은 어떻게 작동하는가?

Harness 측면에서는 궤적 수준 보안 증거를 감사 가능하고 역versible한 컴포넌트 업데이트로 변환하고, 정책 측면에서는 2단계 SFT-RL로 진화된 보안 설정을 능동적으로 활용하도록 학습시킵니다.

실험 결과와 향후 전망은 무엇인가?

AgentDojo 벤치마크에서 Qwen3.5-4B의 공격 성공률을 3배 낮추고 양호한 작업 효용을 61.86%로 향상시켰습니다. 향후 동적 환경 적응적 최적화와 고민감 분야 컴플라이언스 구현이 주목됩니다.