ARMOR++:多智能体编排破解深度伪造检测的黑盒迁移难题
针对深度伪造检测器在黑盒对抗迁移中可靠性显著下降的问题,研究提出ARMOR++框架。该框架利用Qwen2.5-VL提取空间语义先验,并由Qwen3大语言模型智能编排五种互补攻击原语,包括密集优化、显著性方法及频域扰动等,以应对异构归纳偏置。在AADD-2025基准测试中,ARMOR++在低质量与高质量图像场景下均大幅超越现有基线,特别是在盲目攻击成功率上取得突破,揭示了当前检测系统在面对多模态大模型驱动的复杂对抗攻击时存在严重的安全漏洞,为构建更具鲁棒性的防御体系提供了新的研究视角。
深度伪造技术的快速演进对内容安全构成了严峻挑战,而现有的深度伪造检测器在面对黑盒环境下的对抗性攻击时,其鲁棒性往往大打折扣。这一现象的核心原因在于,许多检测模型过度依赖于脆弱且与特定架构相关的取证线索,导致其在面对来源不同的对抗样本时容易失效。传统的对抗迁移攻击方法通常缺乏对图像语义的深层理解,且在严格的无查询约束条件下,难以维持攻击的有效性,尤其是在将扰动从卷积神经网络代理模型迁移至基于Transformer的目标模型时,性能衰减尤为明显。针对这些局限性,本研究提出了ARMOR++,这是一个专为高迁移性深度伪造规避设计的鲁棒多智能体框架。该框架的核心贡献在于引入了一种智能体编排机制,通过结合视觉语言模型与大语言模型的能力,实现了对抗扰动的精细化生成与优化,从而有效克服了现有方法在语义感知和迁移效率上的不足,为评估检测器的真实鲁棒性提供了新的视角。在技术实现层面,ARMOR++构建了一个协同工作的多智能体系统,旨在通过多领域原语的组合来最大化攻击的迁移能力。
框架首先利用Qwen2.5-VL视觉语言模型提取图像的空间语义先验,这一步骤至关重要,因为它为后续的扰动生成提供了高层级的语义指导,确保对抗噪声不会破坏图像的自然属性。随后,Qwen3大语言模型作为中央协调器,负责智能体间的任务分配与决策优化。具体而言,LLM执行原语选择、自适应超参数重参数化以及熵正则化的扰动混合策略。这种动态调整机制使得系统能够根据当前样本的特征,灵活调整攻击强度与方向。ARMOR++整合了五种互补的攻击原语,包括密集优化、基于显著性的方法、空间变换、频域扰动以及块结构修改。这些原语分别针对图像的不同特性进行干扰,从像素级到频率域,从局部显著区域到全局结构,全方位地针对检测模型的异构归纳偏置进行攻击,从而在无需查询目标模型梯度的情况下,实现高效的对抗样本生成。
为了验证ARMOR++的有效性,研究团队在AADD-2025基准上进行了严格的评估,该基准涵盖了不同质量和复杂度的深度伪造图像。实验结果显示,ARMOR++在低质量和高质量图像 regime 下均显著优于现有的智能体和非智能体基线方法。特别是在盲目标攻击成功率(ASR)这一关键指标上,ARMOR++相较于最先进(SOTA)的智能体基线取得了实质性的提升,证明了其在未知检测器上的强大迁移能力。此外,针对非智能体基准和鲁棒防御配置的攻击测试也进一步证实了其性能优势。消融实验进一步揭示了各组件的贡献,表明语义先验的引入和LLM的协调优化是提升攻击效果的关键因素。统计分析显示,ARMOR++不仅在平均性能上领先,其在不同检测器类型间的性能方差也较小,体现了其高度的稳定性和泛化能力。
这些结果有力地证明了当前深度伪造检测器在面对高级对抗攻击时仍存在显著的可靠性缺口。ARMOR++的研究成果对开源社区、工业落地及后续研究具有深远的影响。在工业落地方面,该框架揭示了现有深度伪造检测系统在面对高级多智能体攻击时的脆弱性,提醒业界在部署检测模型时必须考虑更全面的鲁棒性评估,不能仅依赖传统的白盒或简单黑盒测试。对于开源社区而言,ARMOR++提供了一个新的多智能体协作范式,展示了如何利用大语言模型的推理能力来优化复杂的对抗生成过程,这为其他安全领域的自动化攻击或防御研究提供了有益参考。在后续研究方面,该工作指出了语义感知在对抗迁移中的重要性,鼓励研究者探索更深层的语义特征与模型鲁棒性之间的关系。同时,它也强调了开发能够抵抗此类多域、多原语组合攻击的新型检测架构的紧迫性,推动了从被动防御向主动鲁棒性设计的转变,为构建更可信的AI内容生态系统奠定了理论基础。