FOM-UL:逐層选择性遗忘构建抗量化魯棒大語言模型
大語言模型會記憶並復現敏感或受版權保護的訓練內容,帶來隱私與安全監管風險。機器學習遺忘技術為完整重訓練提供實用替代,但現有方法多採用寬泛或固定參數更新,既可能損害模型效用,又在後訓練量化等部署環境變化下表現脆弱。本文提出 FOM-UL 框架,通过「遺忘-保留」顯著性分數選擇 transformer 層:優先更新對遺忘集影響高、對保留集敏感度低的層,將更新集中在最有效區域,同時保持模型其餘部分基本不變。該策略改善遺忘與效用權衡,並憑局部集中更新降低被量化抹除的概率。在 TOFU、KnowUnDo 與 MUSE 風格評測中,FOM-UL 顯著降低殘留記憶,同時把保留集效用維持在接近原始模型水平;在 8-bit 與 4-bit 量化下仍保持更強記憶抑制與效用保留。
大语言模型在海量数据上训练后,往往会记忆甚至直接复现敏感、受版权保护或作者本不愿保留的训练内容,由此产生隐私泄露、安全与合规监管等一系列现实风险。在完整重新训练成本高昂的背景下,机器学习遗忘技术提供了一种更轻量的替代路径:让模型"忘记"特定内容,而不必从头训练。然而,当前主流遗忘方法大多对模型施加宽泛或固定的参数更新,这类做法不仅容易损害模型在其它任务上的可用性,还在部署环境发生变化时显得脆弱——尤其是引入后训练量化后,被遗忘的知识可能因量化扰动而部分"复活"。本文针对这一痛点提出 FOM-UL,即"只遗忘真正重要的内容"的逐层遗忘框架,其核心思想是通过逐层粒度选择需要更新的 transformer 层,把有限的更新集中在真正起作用的参数区域。
这一思路的出发点是:遗忘不应是均匀撒网式的整体改动,而应是有的放矢的精准干预,从而在"忘得干净"与"用得还好"之间取得更好的平衡。在技术方法上,FOM-UL 的关键创新在于一个名为"遗忘-保留"显著性分数的评估机制。该分数同时衡量每一层对遗忘集的影响程度以及对保留集的敏感度:一层如果对遗忘集具有高影响力,同时对保留集具有低敏感度,就会被判定为值得重点更新的层。换言之,框架优先挑选那些"对要忘的东西作用大、对要保留的东西作用小"的层,集中资源在这些层上施加更新,而让模型其余大部分参数保持不变。
这种选择性更新策略带来两层好处:一方面,更新被集中在最有效的区域,提升了遗忘与效用之间的权衡;另一方面,由于改动是局部而集中的,而非分散在整个模型中的微小扰动,它在面对低位数量化时更不容易被抹除——因为量化过程中的低位舍入往往更容易摧毁那些弥散、细微的参数变化。正是这一点,使 FOM-UL 为"抗量化"的遗忘提供了一条可操作的实证路径,缓解了此前遗忘效果在量化部署后迅速退化的难题。在实验设置与关键结果方面,作者使用 TOFU、KnowUnDo 以及 MUSE 风格评测对方法进行全面检验,并与 GA、NPO、KLD、SURE、ReLearn 以及基于 LUNAR 的一系列强基线进行对比。结果显示,FOM-UL 能够显著降低残留记忆,即模型对被遗忘内容的不完整复现程度,同时把保留集上的效用维持在接近原始未遗忘模型的水平,实现了"忘得掉"又"留得住"的双重目标。
更为重要的是其在部署鲁棒性上的表现:在 8-bit 与 4-bit 后训练量化条件下,FOM-UL 相比 competing methods 仍能保持更强的记忆抑制能力与效用保留能力,说明其逐层集中更新的策略确实更能抵御量化带来的副作用。此外,对抗性提示评估进一步表明,经过 FOM-UL 遗忘的模型在被刻意诱导时,复现被遗忘内容的概率更低,进一步印证了遗忘效果的稳固性。消融层面的发现则指向同一结论:将更新集中在高显著性层,比均匀更新更能兼顾遗忘强度与效用保持。在行业意义与潜在影响上,FOM-UL 提供了一种高效且可落地的遗忘策略,它在不承诺"彻底抹除"这一难以严格形式化保证的前提下,切实提升了目标遗忘的针对性、效用的保留度以及部署阶段的鲁棒性。对开源社区而言,这种逐层选择机制为遗忘研究提供了一个新的、可解释的建模视角,即把注意力从"更新多少参数"转向"更新哪些层";对工业落地而言,考虑到部署中几乎不可避免地会引入量化等压缩手段,FOM-UL 所展现的量化韧性直接回应了遗忘技术在真实场景中的可靠性担忧;对后续研究而言,本文也提示研究者关注遗忘效果在部署环境变化下的稳定性问题,并鼓励在形式化遗忘保证与实用性能之间寻找更务实的平衡。整体而言,这项工作把遗忘从实验室里的理想化假设,推向了一个更贴近真实部署、更能经受量化与对抗考验的工程可行方案。
Sources
FAQ
FOM-UL 框架的主要创新点是什么?
FOM-UL 通过“遗忘-保留”显著性分数选择 Transformer 层进行更新,优先处理对遗忘内容影响高但对保留内容敏感度低的层。
为什么 FOM-UL 在大模型部署中具有重要意义?
FOM-UL 的层选择性更新策略使其在 8-bit 和 4-bit 量化等部署环境下仍能有效抑制记忆,并保持模型效用,解决了传统遗忘方法在量化后效果退化的问题。
未来该研究方向有哪些值得关注的进展?
这项工作鼓励研究者关注遗忘效果在部署环境变化下的稳定性,并在形式化遗忘保证与实用性能之间寻找更务实的平衡。