ARMOR++: 에이전트 오케스트레이션 기반 딥페이크 검출기 간 도메인 공격 프레임워크

본 논문은 블랙박스 적대적 전송 시 딥페이크 검출기의 신뢰성 저하 문제를 해결하기 위해 멀티에이전트 오케스트레이션을 활용하는 새로운 프레임워크인 ARMOR++를 제시합니다. 기존 방법들은 의미 인식 능력이 부족하며, 특히 합성곱 대리 모델에서 트랜스포머 기반 목표 모델로의 전송 시 엄격한 무쿼리 제약 하에서 유효성을 유지하기 어렵습니다. ARMOR++는 Qwen2.5-VL을 활용해 공간 의미 사전 지식을 제공하고, Qwen3 대형 언어 모델이 원시 연산 선택, 적응형 하이퍼파라미터 재파라미터화 및 엔트로피 정규화 교란 혼합을 조정합니다. 본 프레임워크는 밀집 최적화, 강조 기반 방법, 공간 변환, 주파수 영역 교란, 블록 구조 수정이라는 5가지 상호보완적 공격 원시를 통합하여 이종적 귀납 편향을 표적으로 합니다. AADD-2025 벤치마크 실험 결과, ARMOR++는 저화질 및 고화질 이미지 영역 모두에서 에이전트 기반 및 비에이전트 기준선을 크게 상회하며, 특히 블라인드 목표 공격 성공률에서 현저한 개선을 달성하여 현재 배포된 검출 시스템의 중요한 신뢰성 격차를 드러냈습니다.

배경

생성형 인공지능 기술의 급속한 진화는 디지털 콘텐츠의 무결성에 심각한 위기를 초래하고 있으며, 딥페이크 기술은 정보 보안과 사회적 신뢰에 전례 없는 위협으로 대두되고 있습니다. 합성 미디어가 실제 영상과 구별하기 어려워짐에 따라, 온라인 정보 생태계의 진위성을 유지하기 위해 자동화된 딥페이크 검출 시스템의 역할은 그 어느 때보다 중요해졌습니다. 그러나 이러한 검출 모델의 운영적 강건성은 블랙박스 환경에서의 적대적 공격에 직면했을 때 종종 심각하게 훼손됩니다. 현재 많은 검출 아키텍처가 미묘한 텍스처 불일치나 압축 아티팩트와 같이 취약하고 아키텍처에 특화된 수사학적 단서에 과도하게 의존한다는 것이 근본적인 취약점으로 작용합니다. 이러한 단서는 표적화된 교란에 의해 쉽게 교란될 수 있으며, 결과적으로 다른 소스에서 생성되거나 다른 합성 방법을 사용한 적대적 예제를 마주했을 때 검출기들은 일반화하는 데 실패하여 신뢰성의 현저한 하락을 초래합니다.

기존의 적대적 전송 공격은 대리 모델을 사용하여 알려지지 않은 목표 모델에 효과적인 교란을 생성하는 것을 목표로 하지만, 엄격한 무쿼리 제약 조건 하에서 높은 효용성을 유지하는 데 어려움을 겪어 왔습니다. 이러한 한계는 특히 합성곱 신경망(CNN) 대리 모델에서 트랜스포머 기반 목표 모델로의 공격 전송 시 두드러집니다. 이 두 아키텍처 패밀리에 존재하는 이종적 귀납 편차로 인해, CNN에 최적화된 교란은 종종 트랜스포머에서 오분류를 유발하지 못하여 전송 과정에서 급격한 성능 감소를 초래합니다. 기존 방법들은 대부분 의미 인식 능력이 부족하여 이미지를 의미 있는 공간적 관계를 가진 복잡한 구조가 아닌 단순한 픽셀 그리드로 취급합니다. 이러한 고차원적 이해의 부재는 인간 관찰자에게 보이지 않으면서도 다양한 모델 아키텍처에 걸쳐 강건한 교란을 생성하는 것을 방해하며, 현실 세계의 검출 보안 평가에서 중요한 격차를 남기고 있습니다.

이러한 체계적 약점을 해결하기 위해 ARMOR++ 프레임워크는 높은 전송성을 갖춘 딥페이크 회피를 위해 특별히 설계된 새로운 강건한 멀티에이전트 오케스트레이션 시스템으로 소개되었습니다. 이전 접근 방식이 정적 최적화 절차에 의존하는 것과 달리, ARMOR++는 대형 언어 모델(LLM)의 추론 능력과 비전-언어 모델(VLM)의 지각 강점을 활용하여 적대적 공격을 동적으로 구성하고 정교화합니다. 의미 사전 지식과 적응형 최적화 전략을 통합함으로써, 이 프레임워크는 기존 방법들이 내재한 의미 맹목성과 낮은 전송 효율성의 한계를 극복하려 합니다. 이 접근 방식은 검출 시스템의 진정한 강건성을 평가하기 위한 더 엄격한 벤치마크를 제공할 뿐만 아니라, 정교하고 다중 도메인적인 적대적 전략에 견딜 수 있는 방어 메커니즘의 시급한 필요성을 강조합니다.

심층 분석

ARMOR++의 핵심은 다양한 공격 원시의 시너지 조합을 통해 공격 전송 능력을 최대화하는 협업 멀티에이전트 시스템으로 작동한다는 점입니다. 프로세스는 Qwen2.5-VL 비전-언어 모델을 사용하여 공간적 의미 사전 지식을 추출하는 단계로 시작됩니다. 이 단계는 생성된 적대적 노이즈가 입력의 자연스러운 속성과 의미 구조를 존중하도록 보장하므로 매우 중요합니다. 교란 프로세스를 의미적 문맥에 기반시킴으로써, 프레임워크는 자연 이미지 분포로 학습된 검출기에 의해 쉽게 필터링될 수 있는 아티팩트를 생성하는 것을 피합니다. 이러한 의미적 가이드는 더 복잡한 적대적 전략이 구축되는 기초 층으로 작용하며, 시스템이 의미 있는 콘텐츠와 안전하게 조작될 수 있는 노이즈를 구분할 수 있게 합니다.

의미 추출 단계 이후, Qwen3 대형 언어 모델은 중앙 오케스트레이터로서 다양한 하위 에이전트의 행동을 조정하여 공격 전략을 최적화합니다. LLM은 원시 선택, 적응형 하이퍼파라미터 재파라미터화, 엔트로피 정규화 교란 혼합을 담당합니다. 이러한 동적 조정 메커니즘은 시스템이 현재 샘플의 특정 특성에 따라 공격의 강도와 방향을 유연하게 조정할 수 있게 합니다. 예를 들어, 특정 교란 유형이 이미지 품질을 저하시키면서도 공격 성공률을 높이지 않으면, LLM은 하이퍼파라미터를 재파라미터화하여 더 효과적인 원시로 초점을 이동시킬 수 있습니다. 이러한 지능적 조정은 공격이 효율적이고 효과적으로 유지되도록 하며, 대리 모델로부터의 피드백에 실시간으로 적응합니다.

이 프레임워크는 검출 모델의 의사결정 과정의 서로 다른 측면을 표적으로 하는 다섯 가지 상호 보완적인 공격 원시를 통합합니다. 여기에는 미세한 픽셀 수준의 조정을 위한 밀집 최적화, 검출기에 가장 영향력 있는 영역에 집중하기 위한 강조 기반 방법, 기하학적 일관성을 방해하기 위한 공간 변환, 스펙트럼 취약점을 활용하기 위한 주파수 영역 교란, 그리고 전역 이미지 속성을 변경하기 위한 블록 구조 수정이 포함됩니다. 이러한 다양한 기술을 결합함으로써 ARMOR++은 다양한 검출 아키텍처의 이종적 귀납 편차에 도전하는 포괄적인 공격 표면을 생성합니다. 이 다각적인 접근 방식은 검출기가 한 유형의 교란에 강건하더라도 다른 유형에는 취약할 가능성이 높으므로, 공격의 전체적인 전송성을 크게 향상시킵니다.

산업 영향

ARMOR++의 실증적 검증은 이미지의 품질과 복잡도가 다양한 조건에서 딥페이크 검출 시스템을 테스트하도록 설계된 포괄적인 데이터셋인 AADD-2025 벤치마크에서 수행되었습니다. 결과는 ARMOR++이 저화질 및 고화질 이미지 영역 모두에서 에이전트 기반 및 비에이전트 기준선을 모두 크게 상회한다는 것을 보여줍니다. 특히, 프레임워크는 내부 파라미터에 대한 사전 지식이 없이도 검출기를 효과적으로 우회할 수 있는 능력을 나타내는 블라인드 목표 공격 성공률(ASR)에서 현저한 개선을 달성했습니다. 이러한 성능의 상당한 증가는 고급 멀티에이전트 구동 적대적 공격에 직면했을 때 현재 배포된 검출 시스템의 부적절함을 강조합니다. 이 발견들은 널리 사용되는 많은 검출 시스템이 통제된 화이트박스 설정에서 보고된 강건성이 실제 세계의 블랙박스 시나리오에서 회복력으로 이어지지 않기 때문에, 잘못된 안전감을 제공할 수 있음을 시사합니다.

아블레이션 연구는 ARMOR++ 프레임워크 내 각 구성 요소의 특정 기여를 더욱 명확히 합니다. 의미 사전 추출 모듈이나 LLM 조정 메커니즘을 제거하면 공격 효용성이 현저히 감소하며, 이는 의미 인식과 지능형 오케스트레이션이 높은 전송성 공격에 모두 필수적임을 확인합니다. 통계 분석은 ARMOR++가 더 높은 평균 성능을 달성할 뿐만 아니라 서로 다른 검출기 유형 간에도 더 낮은 분산을 보인다는 것을 나타내며, 이는 높은 안정성과 일반화의 정도를 나타냅니다. 이러한 일관성은 산업 이해관계자들에게 특히 우려될 만한데, 이는 프레임워크가 기본 아키텍처나 학습 데이터에 관계없이 광범위한 검출 시스템을 신뢰적으로 침해할 수 있음을 의미하기 때문입니다.

이러한 발견들은 산업 설정에서 딥페이크 검출 기술의 배포에 지대한 영향을 미칩니다. ARMOR++가 노출한 취약성은 전통적인 화이트박스 또는 단순 블랙박스 테스트를 넘어선 더 포괄적인 강건성 평가의 시급한 필요성을 강조합니다. 산업 리더들은 정적 방어가 동적이고 적응적인 공격에 충분하지 않다는 것을 인식해야 합니다. 이 프레임워크는 AI 기반 콘텐츠 모더레이션에 의존하는 조직들에게 경고를 보내며, 보안 아키텍처에 다중 도메인 및 다중 원시 방어 메커니즘을 통합할 필요성을 강조합니다. 이러한 취약점을 해결하지 못하면 콘텐츠 무결성이 금융, 저널리즘, 국가 안보와 같은 분야에서 가장 중요한 분야에서 명성 손상과 법적 책임으로 이어질 수 있습니다.

전망

ARMOR++의 개발은 정적, 단일 원시 공격에서 동적, 멀티에이전트 오케스트레이션으로의 패러다임 전환을 표시하며, 적대적 머신러닝 분야에서 중요한 이정표를 세웁니다. 이 진전은 연구 커뮤니티가 의미적 특징과 모델 강건성 사이의 더 깊은 연결을 탐구하도록 장려합니다. 향후 연구는 쉽게 우회될 수 있는 사후 방어에 의존하는 대신, 의미 인식 교란에 본질적으로 저항하는 검출 아키텍처를 개발하는 데 집중해야 합니다. 이는 검출 파이프라인에 의미적 일관성 검사를 통합하거나, 진정한 콘텐츠의 더 강건한 표현을 포착하기 위해 자기 지도 학습 기술을 사용하는 것을 포함할 수 있습니다. 또한, 방어 오케스트레이션을 위한 대형 언어 모델의 사용은 방어자들도 적대적 패턴을 감지하고 완화하기 위해 AI 기반 추론을 활용하는 대결 구도를 생성할 수 있는 잠재력을 열어줄 수 있습니다.

오픈 소스 커뮤니티를 위해, ARMOR++는 멀티에이전트 협력을 위한 새로운 패러다임을 제공하며, LLM의 추론 능력을 활용하여 복잡한 적대적 생성 과정을 최적화할 수 있는 방법을 보여줍니다. 이 접근 방식은 네트워크 침입 감지나 악성 코드 분석과 같은 다른 보안 도메인들에게 유용한 통찰력을 제공하며, 여기서 자동화된 적응형 공격 생성은 방어 시스템을 스트레스 테스트하는 데 사용될 수 있습니다. 투명하고 재생산 가능한 프레임워크를 제공함으로써, ARMOR++는 더 엄격한 평가 기준의 개발을 촉진하며 산업을 보안에 대한 더 능동적인 태도로 밀어붙입니다. 연구자들은 LLM 구동 적대적 전략의 한계를 조사하고 향상된 강건성을 위해 여러 AI 모달리티를 결합하는 하이브리드 접근 방식을 탐구함으로써 이 작업을 기반으로 구축하도록 장려됩니다.

궁극적으로, ARMOR++의 함의는 기술적 지표를 넘어 AI 안전성과 신뢰성에 대한 더 넓은 담론에 영향을 미칩니다. 이 프레임워크는 보안을 사후 고려사항이 아닌 기초 원칙으로 설계하는 AI 시스템의 중요성을 강조합니다. 딥페이크 기술이 계속 진화함에 따라, 그에 대한 방어 또한 진화해야 합니다. 수동적 검출에서 능동적 강건성 설계로의 전환은 신뢰할 수 있는 AI 콘텐츠 생태계를 구축하는 데 필수적입니다. 이해관계들은 업계 전반의 적대적 강건성에 대한 기준을 확립하기 위해 협력해야 하며, 이는 내일의 정교한 공격에도 견딜 수 있는 검출 시스템을 보장합니다. 이러한 능동적이고 포괄적인 노력只有通过하여야만 생성 기술의 발전에 직면하여 디지털 정보의 무결성을 보존할 수 있습니다.

Sources