동적 능력 범위 설정: 기업 AI 에이전트를 위한 3소스 권한 아키텍처 및 합성 데이터셋
엔터프라이즈 AI 에이전트는 일반적으로 정적이고 과도하게 허용된 자격 증명 세트를 할당받아, 지속적인 과잉 특권이 발생하여 공격 표면을 크게 확대합니다. 이 논문은 능력 범위 설정이 동적 최소 권한 원칙을 따라야 하며 사후 감지 도구가 아닌 예방 메커니즘으로 다루어져야 한다고 주장합니다. 이를 위해 역할 기반 상한, 작업 컨텍스트 분류기, 정책 기반 구성 거부 규칙을 결합한 3소스 권한 아키텍처를 제안하여 LLM 에이전트의 불일치와 오용에 대한 다층적 사전 방어를 구축합니다. 이 아키텍처는 강제 실행 모드와 관찰 전용 모드의 두 가지 배포 모드를 지원합니다. 후자는 작업 컨텍스트와 어긋나는 권한 요청을 기록하여 불일치 연구에 행동 신호를 제공합니다. 아키텍처 평가를 위한 첫 단계로, 저자들은 다부서 기업 정책을 기반으로 한 600개의 엔터프라이즈 작업 프롬프트 합성 데이터셋을 기여합니다. 이 데이터셋은 15가지 도구 기반 권한 분류법에 걸쳐 필요한 최소 권한이 라벨링되어 있으며, 순환 논증을 피하기 위해 2단계 파이프라인으로 구축되었고 인간 검토 샘플에서 높은 주석 일관성을 달성했습니다. 반복적 정제를 통해 상한 위반률을 93% 감소시켰으며, 합성 프롬프트 생성과 정책 설계의 공동 개발 효과가 입증되었습니다.
배경
엔터프라이즈 AI 에이전트는 일반적으로 정적이고 과도하게 허용된 자격 증명 세트를 할당받아, 지속적인 과잉 특권이 발생하여 공격 표면을 크게 확대합니다. 전통적인 배포 모델은 구성 단계에서 에이전트가 어떤 작업에도 필요한 모든 도구 권한을 보유한다고 가정하여 정적 권한을 부여합니다. 이러한 일괄 적용 방식은 관련 없는 상황에서도 권한이 활성화된 상태를 유지하게 하여, 에이전트가 유인되거나 추론 편차가 발생할 경우 공격자에게 광범위한 고특권 벡터를 제공합니다. 본 연구는 능력 범위 설정이 사후 감지 도구가 아닌, 동적 최소 권한 원칙에 기반한 사전 예방 메커니즘으로 전환되어야 한다고 주장합니다. 이 모델에서 에이전트는 현재 작업 컨텍스트에 필요한 특정 권한만 할당받습니다. 현재 운영 컨텍스트에 존재하지 않는 자격 증명은 에이전트의 탐지 회피 능력이 얼마나 정교하더라도 남용될 수 없으며, 이는 정적 과잉 할당으로 인한 권한 상승 가능성을 근본적으로 차단합니다.
심층 분석
동적 최소 권한을 실현하기 위해 연구진은 대규모 언어 모델의 불일치와 오용에 대항하는 다층적 사전 방어 체계를 구축하는 3소스 권한 아키텍처를 제안합니다. 첫 번째 구성 요소인 역할 기반 상한은 에이전트의 권한이 할당된 역할의 고유 범위를 초과하지 않도록 절대적 경계를 설정합니다. 두 번째 구성 요소인 작업 컨텍스트 분류기는 현재 작업의 성격과 요구사항을 실시간으로 분석하여 관련 권한 하위 집합을 동적으로 필터링합니다. 이는 권한이 정적이지 않고 실시간 작업 내용에 따라 유연하게 조정되도록 하는 동적성의 핵심 엔진입니다. 세 번째 구성 요소인 정책 기반 구성 거부 규칙은 개별적으로는 안전해 보이지만 조합 시 높은 위험을 초래할 수 있는 권한이 동시에 활성화되는 것을 방지합니다. 예를 들어, 개별 행동은 안전할 수 있으나 조합 시 데이터 유출이나 시스템 침해를 초래할 수 있으며, 이 규칙은 그러한 위험한 조합을 효과적으로 차단합니다.
이 아키텍처는 강제 실행 모드와 관찰 전용 모드라는 두 가지distinct한 배포 모드를 지원합니다. 강제 실행 모드에서는 시스템이 동적으로 계산된 범위를 벗어난 권한 요청을 능동적으로 차단합니다. 반면 관찰 전용 모드에서는 요청을 차단하지 않고, 작업 컨텍스트와 어긋나는 모든 권한 시도를 기록합니다. 이러한 로깅 기능은 불일치 연구에 중요한 행동 신호를 생성하여, 기존 비즈니스 운영을 방해하지 않으면서 잠재적 취약점을 분석하고 권한 전략을 최적화할 수 있게 합니다. 이러한 이중 모드 유연성은 기업이 새로운 보안 아키텍처를 프로덕션 환경에 구현하는 데 따른 리스크를 크게 줄이면서 데이터를 점진적으로 수집하고 정책을 정제할 수 있게 합니다.
산업 영향
이 아키텍처의 평가를 위한 기초 단계로서, 저자들은 600개의 엔터프라이즈 작업 프롬프트로 구성된 합성 데이터셋을 기여합니다. 이 프롬프트들은 가상의 조직에서 다부서 기업 정책을 엄격히 기반으로 구축되어 현실성과 복잡성을 모두 확보했습니다. 각 프롬프트는 15가지 도구 기반 권한 분류법에 걸쳐 필요한 최소 권한으로 라벨링되었으며, 이는 배포 가능한 자격 증명이나 가드레일에 직접 매핑됩니다. 주석의 객관성을 보장하고 순환 논증을 피하기 위해, 데이터셋은 프롬프트 생성과 권한 라벨링을 분리한 2단계 파이프라인을 사용하여 구축되었습니다. 60개 기록의 688개 의사결정 포인트에 대한 인간 검토는 초기 검토 전 0.917, 정제 후 0.967에 달하는 코한 카파 계수를 보여주며 exceptional한 주석 일관성을 입증했습니다.
합성 데이터셋과 정책 정의 간의 반복적 정제 과정은 보안 효능에서 상당한 개선을 가져왔습니다. 초기에 상한 위반률은 46건이었으나, 지속적인 최적화를 통해 이는 단 3건으로 감소하여 위반률이 93% 감소했습니다. 이 극적인 감소는 합성 프롬프트 생성과 정책 설계를 공동 개발하는 것의 효과를 검증합니다. 이는 생성된 데이터가 정책의 구멍을 드러내 정책 개선을 유도하고, 이것이 다시 데이터 생성 과정을 정제하는 순환적 최적화 메커니즘을 보여줍니다. 이 폐쇄 루프 최적화 메커니즘은 정적 규칙 세트를 넘어 적응형, 데이터 기반 정책 실행으로 나아가 AI 에이전트 보안을 향상시키는 확장 가능한 접근 방식을 제공합니다.
전망
이 연구는 AI 보안 커뮤니티를 위해 표준화된 벤치마크를 제공하며, 이전에 존재하던 고품질 정밀 주석이 달린 엔터프라이즈 수준 AI 작업 데이터셋의 부재를 해소합니다. 데이터셋, 환경 사양 및 생성 파이프라인을 공개함으로써, 저자들은 동적 권한 연구에서의 공정한 비교와 재현 가능성을 가능하게 합니다. 제안된 3소스 아키텍처는 관찰 모드를 통해 파괴적이지 않은 정책 조정을 가능하게 하여 더 안전한 AI 에이전트 개발을 위한 실행 가능한 기술 로드맵을 제시합니다. 또한 합성 데이터 생성과 정책 설계 간의 시너지는 생성형 AI 기술이 보안 전략 수립과 정제에 도움을 줄 수 있는 새로운 AI 안전 연구 방향을 시사합니다. 엔터프라이즈 AI 채택이 심화됨에 따라 기능적 유연성과 강력한 보안 사이의 균형을 맞추는 것은 지속적인 핵심 과제가 될 것입니다. 이 작업은 기능뿐만 아니라 본질적으로 안전하고 통제 가능한 AI 에이전트를 향한 길을 열어주는 중요한 이론적 지지와 실용적 참고 자료를 제공합니다.