ARMOR++:多智能体编排重构深度伪造检测器的黑盒对抗边界
针对当前深度伪造检测器在黑盒对抗迁移中因过度依赖脆弱架构线索而失效的问题,研究提出ARMOR++多智能体框架。该框架利用Qwen2.5-VL提取空间语义先验,并由Qwen3大语言模型智能编排原语选择、超参数自适应重参数化及熵正则化扰动混合。通过整合密集优化、显著性方法、空间变换、频域扰动和块结构修改五种互补原语,ARMOR++有效针对异构归纳偏置。在AADD-2025基准测试中,其在低质量和高质量图像场景下均显著优于现有基线,证实了智能体编排技术在挖掘检测器潜在漏洞方面的有效性,凸显了现有部署的可靠性差距。
深度伪造检测技术的安全性与可靠性一直是人工智能安全领域的核心议题,然而,现有的检测模型在面对黑盒环境下的对抗性迁移攻击时,往往表现出脆弱性。这种脆弱性主要源于检测器过度依赖特定架构的、易碎的取证线索,导致攻击扰动难以从卷积神经网络等代理模型有效迁移到基于Transformer的目标模型上。此外,现有方法普遍缺乏语义感知能力,在严格的无查询约束下难以维持攻击的有效性。针对这一严峻挑战,本研究提出了ARMOR++框架,旨在通过多智能体协作机制实现高迁移性的深度伪造逃逸。该研究的核心贡献在于构建了一个能够理解图像空间语义并动态调整攻击策略的自动化系统,不仅解决了传统方法在跨架构迁移中的失效问题,还通过引入大语言模型的推理能力,实现了攻击原语的智能化选择与组合,从而显著提升了攻击的鲁棒性和通用性,揭示了当前检测体系在应对高级对抗攻击时的深层缺陷。 在技术实现层面,ARMOR++采用了一种创新的多智能体编排架构,深度融合了视觉语言模型与大型语言模型的优势。具体而言,框架利用Qwen2.5-VL视觉语言模型来提取图像的空间语义先验,这一步骤至关重要,因为它使攻击过程能够理解图像内容的语义结构,而非仅仅关注像素级的噪声。随后,Qwen3大型语言模型作为中央编排器,负责智能体间的协调工作,包括选择最合适的攻击原语、进行超参数的自适应重参数化以及执行熵正则化的扰动混合。为了覆盖不同的检测盲区,ARMOR++整合了五种互补的攻击原语:密集优化、基于显著性的方法、空间变换、频域扰动以及块结构修改。这种多域原语集的设计使得框架能够针对检测器不同的归纳偏置进行攻击,例如,频域扰动针对频域特征提取器,而空间变换则针对空间不变性假设。通过这种精细化的编排,ARMOR++能够在无查询条件下,动态生成难以被检测器识别的对抗样本,实现了从语义理解到攻击执行的全链路优化。 实验评估在权威的AADD-2025基准上进行,涵盖了低质量和高质量图像等多种场景,以全面验证框架的泛化能力。结果表明,ARMOR++在攻击成功率(ASR)上显著优于现有的代理基线和非代理基线方法。特别是在盲目标攻击设置下,即攻击者完全不知道目标检测器的架构和参数时,ARMOR++展现出了巨大的性能优势,证实了其在黑盒环境下的强大迁移能力。消融实验进一步揭示了各组件的贡献,证明了Qwen2.5-VL提供的语义先验和Qwen3的编排策略对于提升攻击效果至关重要。此外,在引入鲁棒防御配置的情况下,ARMOR++依然保持了较高的攻击成功率,这表明其生成的对抗样本具有极强的隐蔽性和鲁棒性。统计分析与可视化结果一致显示,ARMOR++能够有效绕过多种先进的检测机制,且在低质量图像(如经过压缩或裁剪的伪造图像)上表现尤为突出,填补了现有研究在这一领域的空白。 从行业意义与潜在影响来看,ARMOR++的研究成果对深度伪造检测技术的未来部署具有深远的影响。首先,它揭示了当前主流深度伪造检测器在应对高级对抗攻击时存在的显著可靠性差距,警示业界不能仅依赖单一架构或特征的检测模型。其次,ARMOR++所提出的多智能体编排框架为对抗性机器学习领域提供了新的研究范式,证明了结合大语言模型的语义理解能力与视觉模型的感知能力,可以极大地提升攻击的智能化水平。这对于推动更鲁棒的检测算法开发具有积极的促进作用,迫使研究人员从语义和结构层面重新思考检测器的设计。最后,该框架的开源潜力和可扩展性为后续研究提供了坚实的基础,有助于社区共同探索更安全的AI生成内容检测机制,从而在日益复杂的数字媒体环境中维护信息的真实性与可信度。