TILDE:基於傾斜分佈的文本圖像擴散模型概念遺忘方法

Published 2026-07-07 · AI Daily — AI-assisted deep research, methodology & disclosure

隨著隱私保護與版權合規要求的提升,文本到圖像擴散模型的概念遺忘技術變得以至關重要。現有方法雖能有效移除特定概念,但往往忽視了模型在良性生成任務中的質量、多樣性及語義覆蓋率的保持。本文提出TILDE(TILt-based Distributional Erasure),將概念遺忘形式化為分布對齊問題,旨在最小化預訓練模型在遺忘約束下的偏差。該方法通過能量傾斜機制,在不依賴錨點的情況下抑制目標概念圖像,同時保留良性提示的相對概率質量。實驗表明,TILDE在對象、藝術風格及人物角色等多個基準上,實現了強大的遺忘效果,同時在保留能力和分佈保真度上優於現有基線方法,為安全部署提供了新的理論框架與解決方案。

在文本到图像生成模型日益普及的今天,如何安全、合规地移除特定概念成为行业面临的严峻挑战。随着隐私泄露风险、版权纠纷以及商标限制的增加,部署后的系统必须具备在训练后抑制 unwanted concepts 的能力。然而,现有的概念遗忘技术往往陷入两难境地:虽然能有效去除目标概念,却常常牺牲模型在良性生成任务中的表现,导致输出质量下降、多样性减少或语义覆盖范围缩小。理想的遗忘模型应如同从未接触过有害数据一样,仅保留对良性内容的生成能力。

但现有方法多将遗忘视为更新规则的副产品,缺乏对遗忘后分布与理想"仅保留"模型之间对齐的明确约束,导致模型在遗忘过程中难以兼顾保留性能。TILDE的提出正是为了解决这一核心矛盾,它不仅仅关注"删除",更强调在删除过程中的"分布对齐",确保模型在剔除特定概念的同时,最大程度地维持原有模型的良性生成能力与语义完整性,为构建负责任的人工智能生成系统提供了关键的技术路径。从技术实现的角度来看,TILDE创新性地提出了基于倾斜分布的遗忘机制。该方法将概念遗忘重新定义为一个分布对齐问题,其核心目标是在满足遗忘约束的前提下,找到与预训练模型偏差最小的条件分布。

具体而言,TILDE采用能量倾斜(energy-tilted)策略,构建了一个无锚点(anchor-free)的目标分布。这一机制通过引入遗忘能量函数,动态调整生成空间的概率质量,从而有效抑制表达目标概念的图像生成。为了实例化这一理论原则,TILDE引入了残差梯度流网络(residual \nabla-GFlowNet)训练框架。该框架通过学习和校正由遗忘能量相对于预训练扩散模型所产生的分数修正项,实现了精细化的分布调整。

这种基于流网络的训练策略不仅确保了梯度的稳定性,还使得模型能够在高维图像空间中精确地重塑概率分布,从而在去除特定概念特征的同时,保持其他良性特征的相对质量不变,避免了传统方法中常见的分布坍塌或语义漂移问题。在实验评估方面,TILDE在多个具有挑战性的基准上进行了全面验证,涵盖了对象、艺术风格及虚构人物角色等多种类型的概念遗忘任务。研究团队将其性能与现有的主流基线方法进行了详细对比,结果显示TILDE在遗忘强度上表现优异,能够彻底移除目标概念的特征。更为重要的是,在衡量模型保留能力的指标上,TILDE显著优于对比方法。

通过计算遗忘后分布与理想仅保留模型之间的分布距离,研究发现TILDE生成的图像在分布保真度上更接近理论最优解。消融实验进一步证实了能量倾斜机制和残差梯度流网络训练策略的有效性,表明这两者共同作用是实现高质量遗忘与高保留率平衡的关键。实验数据表明,TILDE不仅在视觉上保持了图像的高质量和多样性,还在语义一致性上表现出色,证明了其在复杂生成任务中的鲁棒性。TILDE的研究成果对开源社区、工业落地及后续研究具有深远的意义。在工业落地方面,该方法为生成式AI平台提供了合规且高效的概念移除工具,有助于企业应对日益严格的隐私保护法规和内容安全审查,降低法律风险。对于开源社区而言,TILDE提供了一种可复现且高效的遗忘范式,促进了负责任AI技术的共享与发展。在学术研究领域,TILDE将概念遗忘形式化为分布对齐问题,为后续研究开辟了新的理论方向,激发了更多关于如何平衡遗忘与保留的深入探讨。随着生成式AI应用的不断扩展,如何在不损害模型通用能力的情况下精准移除特定概念,将成为未来研究的核心议题之一,而TILDE为此提供了重要的参考基准和技术启示。

Sources

FAQ

TILDE是什么?它如何解决扩散模型中的概念遗忘问题?

TILDE(基于倾斜分布的遗忘方法)将概念遗忘形式化为分布对齐问题,通过能量倾斜机制在不依赖锚点样本的情况下抑制目标概念,同时用残差梯度流网络精细调整概率分布。

TILDE与传统概念遗忘方法有什么区别?为什么更重要?

传统方法在删除目标概念时常牺牲良性内容质量。TILDE通过分布对齐约束,在彻底移除概念的同时保持生成质量和多样性,解决了遗忘与保留的两难困境。

TILDE在哪些基准上验证?后续研究方向是什么?

TILDE在对象、艺术风格、人物角色三类基准上均超越现有基线。未来需探索其在更多语言模型、更大规模数据上的适用性,以及实时在线遗忘的可能。