FOM-UL:逐层选择性遗忘,让大模型在量化后依然「记不住」
大语言模型会记忆并复现敏感或受版权保护的训练内容,带来隐私、安全与监管风险。机器学习遗忘技术为完整再训练提供了实用替代,但现有方法多采用宽泛或固定参数的更新,既可能损害模型效用,又在后训练量化等部署环境下表现脆弱。研究提出 FOM-UL 框架,通过「遗忘-保留」显著性分数选择 transformer 层,优先更新对遗忘集影响高、对保留集敏感度低的层,将更新集中在最有效区域,同时保持模型其余部分基本不变。该策略改善了遗忘与效用的权衡,并凭借局部集中更新降低了被量化抹除的概率。在 TOFU、KnowUnDo 与 MUSE 风格评测中,FOM-UL 显著降低残留记忆,同时把保留集效用维持在接近原始模型水平,且在 8-bit 与 4-bit 量化下仍保持更强的记忆抑制与效用保留。
大语言模型在海量数据上训练后,往往会记忆甚至直接复现敏感、受版权保护或作者本不愿保留的训练内容,由此产生隐私泄露、安全与合规监管等一系列现实风险。在完整重新训练成本高昂的背景下,机器学习遗忘技术提供了一种更轻量的替代路径:让模型"忘记"特定内容,而不必从头训练。然而,当前主流遗忘方法大多对模型施加宽泛或固定的参数更新,这类做法不仅容易损害模型在其它任务上的可用性,还在部署环境发生变化时显得脆弱——尤其是引入后训练量化后,被遗忘的知识可能因量化扰动而部分"复活"。本文针对这一痛点提出 FOM-UL,即"只遗忘真正重要的内容"的逐层遗忘框架,其核心思想是通过逐层粒度选择需要更新的 transformer 层,把有限的更新集中在真正起作用的参数区域。
这一思路的出发点是:遗忘不应是均匀撒网式的整体改动,而应是有的放矢的精准干预,从而在"忘得干净"与"用得还好"之间取得更好的平衡。在技术方法上,FOM-UL 的关键创新在于一个名为"遗忘-保留"显著性分数的评估机制。该分数同时衡量每一层对遗忘集的影响程度以及对保留集的敏感度:一层如果对遗忘集具有高影响力,同时对保留集具有低敏感度,就会被判定为值得重点更新的层。换言之,框架优先挑选那些"对要忘的东西作用大、对要保留的东西作用小"的层,集中资源在这些层上施加更新,而让模型其余大部分参数保持不变。
这种选择性更新策略带来两层好处:一方面,更新被集中在最有效的区域,提升了遗忘与效用之间的权衡;另一方面,由于改动是局部而集中的,而非分散在整个模型中的微小扰动,它在面对低位数量化时更不容易被抹除——因为量化过程中的低位舍入往往更容易摧毁那些弥散、细微的参数变化。正是这一点,使 FOM-UL 为"抗量化"的遗忘提供了一条可操作的实证路径,缓解了此前遗忘效果在量化部署后迅速退化的难题。在实验设置与关键结果方面,作者使用 TOFU、KnowUnDo 以及 MUSE 风格评测对方法进行全面检验,并与 GA、NPO、KLD、SURE、ReLearn 以及基于 LUNAR 的一系列强基线进行对比。结果显示,FOM-UL 能够显著降低残留记忆,即模型对被遗忘内容的不完整复现程度,同时把保留集上的效用维持在接近原始未遗忘模型的水平,实现了"忘得掉"又"留得住"的双重目标。
更为重要的是其在部署鲁棒性上的表现:在 8-bit 与 4-bit 后训练量化条件下,FOM-UL 相比 competing methods 仍能保持更强的记忆抑制能力与效用保留能力,说明其逐层集中更新的策略确实更能抵御量化带来的副作用。此外,对抗性提示评估进一步表明,经过 FOM-UL 遗忘的模型在被刻意诱导时,复现被遗忘内容的概率更低,进一步印证了遗忘效果的稳固性。消融层面的发现则指向同一结论:将更新集中在高显著性层,比均匀更新更能兼顾遗忘强度与效用保持。在行业意义与潜在影响上,FOM-UL 提供了一种高效且可落地的遗忘策略,它在不承诺"彻底抹除"这一难以严格形式化保证的前提下,切实提升了目标遗忘的针对性、效用的保留度以及部署阶段的鲁棒性。对开源社区而言,这种逐层选择机制为遗忘研究提供了一个新的、可解释的建模视角,即把注意力从"更新多少参数"转向"更新哪些层";对工业落地而言,考虑到部署中几乎不可避免地会引入量化等压缩手段,FOM-UL 所展现的量化韧性直接回应了遗忘技术在真实场景中的可靠性担忧;对后续研究而言,本文也提示研究者关注遗忘效果在部署环境变化下的稳定性问题,并鼓励在形式化遗忘保证与实用性能之间寻找更务实的平衡。整体而言,这项工作把遗忘从实验室里的理想化假设,推向了一个更贴近真实部署、更能经受量化与对抗考验的工程可行方案。
Sources
FAQ
FOM-UL 框架的主要创新点是什么?
FOM-UL 通过“遗忘-保留”显著性分数选择 Transformer 层进行更新,优先处理对遗忘内容影响高但对保留内容敏感度低的层。
为什么 FOM-UL 在大模型部署中具有重要意义?
FOM-UL 的层选择性更新策略使其在 8-bit 和 4-bit 量化等部署环境下仍能有效抑制记忆,并保持模型效用,解决了传统遗忘方法在量化后效果退化的问题。
未来该研究方向有哪些值得关注的进展?
这项工作鼓励研究者关注遗忘效果在部署环境变化下的稳定性,并在形式化遗忘保证与实用性能之间寻找更务实的平衡。