擴散大模型的安全機制漏洞與對抗攻擊研究

Published 2026-08-07 · AI Daily — AI-assisted deep research, methodology & disclosure

本文深入探討擴散大語言模型(DLLMs)內部安全機制的脆弱性,揭示了基於擴散的對齊方法在機制層面的固有缺陷。研究發現,DLLMs 的安全對齊具有稀疏性且可跨架構遷移,其從自回歸模型繼承的安全神經元特徵使得直接轉移攻擊成為可能。通過自剪枝和跨模型剪枝技術,攻擊成功率顯著提升。在此基礎上,作者提出了 SN-Guided Diffusion,一種完全離線的黑盒越獄框架,利用加權安全神經元損失引導擴散過程避開安全觸發區域。該框架在多個開源及專有模型上實現了極高的轉移攻擊成功率,且生成成本極低,為理解大模型安全對齊機制提供了新的視角。

随着扩散大语言模型(DLLMs)逐渐取代传统的自回归下一个词预测范式,其通过迭代并行去噪生成文本的能力引起了广泛关注。然而,这类模型内部的安全对齐机制究竟如何运作,目前仍处于黑盒状态,缺乏深入的理论理解。本研究的核心贡献在于首次系统性地调查了 DLLMs 作为被攻击目标以及作为攻击工具时的双重角色,暴露了基于扩散的对齐方法在机制层面的深层脆弱性。研究指出,DLLMs 的安全对齐并非紧密耦合,而是呈现出稀疏分布的特性,并且这种安全特征具有跨架构的可迁移性。这意味着,即使模型架构发生变化,其潜在的安全弱点依然可以通过特定的机制路径被利用。这一发现挑战了当前对于扩散模型安全性更为稳固的假设,为后续的安全评估和防御机制设计提出了严峻的挑战,同时也为理解大模型内部知识表示与安全约束的相互作用提供了重要的实证依据。在技术方法层面,本研究详细剖析了 DLLMs 从自回归预训练模型继承而来的安全神经元足迹。

研究发现,DLLMs 在初始化阶段保留了源模型(即自回归模型)的安全机制特征,这为跨模型的转移攻击提供了理论基础。具体而言,研究者通过直接映射安全神经元并执行剪枝操作,成功破坏了模型的安全对齐能力。实验展示了两种主要的剪枝策略:自剪枝和转移剪枝。自剪枝针对单个模型内部的安全神经元进行剔除,而转移剪枝则利用从其他模型(如 Qwen2.5)学到的安全神经元映射关系,对目标 DLLM 进行攻击。此外,为了进一步利用这些机制漏洞,作者提出了 SN-Guided Diffusion 框架。这是一种完全离线的黑盒越狱方法,其核心创新在于引入了一种加权安全神经元损失函数。该损失函数在扩散过程中动态引导生成轨迹,使其远离那些会触发安全拒绝机制的潜在区域。

通过这种方式,模型能够在不直接修改权重或访问内部梯度的情况下,生成原本被安全过滤器拦截的内容,实现了高效且隐蔽的攻击路径。实验设置涵盖了多个主流的开源和专有 DLLM 基准,包括 LLaDA、Dream、Fast-dLLM 以及 Llama-3-8B-Instruct、Qwen2.5-7B-Instruct 和 Gemini-2.5-Flash-Lite 等。关键结果显示,安全剪枝操作极大地提高了攻击成功率(ASR)。例如,在 LLaDA 模型上,自剪枝将 ASR 从 2.6% 激增至 73.8%;在 Dream 模型上,自剪枝使 ASR 从 1.9% 提升至 86.6%。转移剪枝同样表现出强大的攻击能力,从 Qwen2.5 转移的剪枝策略在 Dream 上使 ASR 达到 73.2%,在 Fast-dLLM 上达到 86.3%。在 SN-Guided Diffusion 框架的评估中,该方法展现了近乎完美的提示可分性,良性提示与越狱提示的 AUROC 达到 1.0。在转移攻击测试中,该方法在 Llama-3-8B-Instruct 上达到 77.1% 的 ASR,在 Qwen2.5-7B-Instruct 上达到 86.9%,在 Gemini-2.5-Flash-Lite 上达到 74.3%,且每个提示仅需 20 次生成 episode。

与之前的越狱框架相比,SN-Guided Diffusion 在保持高转移性的同时,将生成成本降低了数个数量级,证明了机制层面攻击的高效性。这项研究对大语言模型的安全领域具有深远的行业意义。首先,它揭示了当前基于扩散的对齐方法在机制层面的不稳定性,表明简单地替换生成范式并不能自动解决安全对齐问题。对于开源社区而言,这促使研究者重新审视 DLLMs 的安全评估标准,从单纯的结果测试转向更深入的机制分析。在工业落地方面,开发者需要意识到,基于神经元的剪枝和转移攻击可能成为新的威胁向量,现有的基于输入过滤或输出监控的安全层可能不足以抵御此类底层机制攻击。此外,SN-Guided Diffusion 的高效性意味着攻击者可以以极低的成本大规模生成有害内容,这对内容安全平台提出了更高的实时检测需求。最后,本研究为后续研究指明了方向,即如何设计更具鲁棒性的安全对齐机制,使其不易受到神经元级别的干扰,以及如何开发针对机制漏洞的自动化检测和防御工具,从而构建更可信的下一代生成式 AI 系统。

Sources

FAQ

什么是SN-Guided Diffusion框架?

SN-Guided Diffusion是一种完全离线的黑盒越狱框架,利用加权安全神经元损失引导扩散过程,使其远离安全触发区域,从而绕过扩散大模型的安全过滤机制。

为什么这项研究对模型安全很重要?

研究发现扩散大模型的安全对齐具有稀疏性且能跨架构迁移,攻击成本极低,可大规模生成有害内容,对内容安全构成严峻挑战。

未来需要关注哪些安全方向?

需设计不易受神经元级别干扰的鲁棒安全机制,开发针对机制漏洞的自动化检测与防御工具,构建更可信的生成式AI系统。