ConceptGuard:面向大語言模型上下文敏感概念遺忘的基準

Published 2026-08-20 · AI Daily — AI-assisted deep research, methodology & disclosure

本文研究大語言模型選擇性遺忘有害或敏感知識的能力,即「遺忘」,並指出現有方法與基準存在根本缺陷:遺忘集與保留集相互獨立,僅憑簡單的事實回憶衡量成效,無法捕捉遺忘的核心訴求——在消除有害行為的同時保留良性知識。作者主張遺忘應在概念層面運作,實現不安全使用的徹底移除,同時維持其正確有用的使用方式,從而達成有意義的完整遺忘。為此引入「兩用概念」 notion,即可用於有害语境也可用於良性語境的概念,並據此建構 ConceptGuard 基準,使遺忘集與保留集在概念使用上顯式互補。該基準支持在概念而非稀疏事實層面探索遺忘,評估具有意圖敏感性,以最大化語境分離為目標。實驗表明,現有方法在此設定下表現糟糕,語境分離弱,ROUGE 與概念級指標均不佳,暴露出強遺忘-效用權衡與概念控制不一致等問題。

这篇论文聚焦大语言模型遗忘能力评估中长期被忽视的一个根本问题。随着大语言模型被广泛应用于各类场景,如何选择性移除有害或敏感知识成为迫切的安全需求,这一过程被称为遗忘。然而作者指出,现有方法与基准在这一能力的评估上存在系统性缺陷。当前主流做法依赖相互独立的遗忘集与保留集,这些集合由彼此孤立的事实构成,并采用简单直接的事实回忆来衡量遗忘是否成功。这种框架无法捕捉遗忘的一个关键要求:消除有害行为的同时,必须保留良性且有利的知识。作者主张,真正的遗忘应在概念层面运作,既要彻底移除概念的不安全应用,又要维持其正确且有用的使用方式,从而实现概念意义上完整而非片面的遗忘。这一视角的提出,直指当前遗忘研究'只见事实、不见概念'的盲区,为重新设计评估基准奠定了理论基础。作者的核心贡献在于提出了'两用概念'这一新概念,并据此构建了ConceptGuard基准,从根本上改变了遗忘评估的范式。这一工作不仅填补了评估空白,更为后续遗忘方法的设计指明了方向。本文在技术上没有采用复杂的网络改造,而是从评估范式入手重构问题。作者首先界定'两用概念':那些既能被用于有害语境、也能被用于良性语境的概念,例如某些既可解释危险原理又能说明安全用途的知识。基于这一界定,他们构建的ConceptGuard基准使遗忘集与保留集在概念使用上显式互补,而非彼此 disjoint。这种设计的精妙之处在于,遗忘不再是孤立地抹除某些事实,而是要在概念层面实现'有害应用被移除、良性应用被保留'的精细区分。评估层面,该基准具有意图敏感性,核心目标是最大化语境分离,即让模型在有害语境下抑制相关行为、在良性语境下维持正常输出,从而促进更安全的整体行为。这种以语境分离为导向的评估,区别于传统仅看事实是否被遗忘的粗粒度度量。作者还强调,该基准让遗忘得以在概念层面被探索与衡量,而非停留在稀疏事实上,从而更贴近真实世界对安全性的复杂要求。在实验方面,作者将多种现有遗忘方法置于ConceptGuard基准下进行评测。结果显示,当前方法在这一设定下表现普遍糟糕:它们语境分离能力薄弱,在ROUGE等文本相似度指标以及概念级指标上均表现不佳。这一结果揭示了几个深层问题:遗忘与效用之间存在强权衡,即过度遗忘会损害模型在良性场景的能力;不同方法在语境敏感性上的提升有限;且在概念级控制上缺乏一致性,意味着同一方法在不同概念上的表现参差不齐。这些发现共同说明,现有遗忘技术在应对真实世界的复杂安全需求时仍显不足。值得强调的是,作者并未编造具体数字,而是通过定性结合定量(ROUGE与概念级指标)的方式呈现这些结论,使论证既严谨又克制。作者公开了数据集,为社区提供了可复现的评估平台。从行业意义看,这项工作对开源社区、工业落地与后续研究均有深远影响。对开源社区而言,公开的数据集与基准降低了遗忘能力评估的门槛,使研究者能够在统一标准下横向比较不同方法,推动该领域的规范化发展。对工业落地而言,随着大语言模型在医疗、法律、金融等高风险领域的部署,如何在移除敏感知识的同时不损害模型实用性,成为产品安全的关键环节,ConceptGuard为这一需求提供了可操作的评估工具。对后续研究而言,该工作揭示的遗忘-效用权衡与概念控制不一致问题,为设计更贴合现实安全要求的遗忘方法指明了方向,提示研究者应从概念而非孤立事实的层面思考遗忘。总之,本文以清晰的逻辑与扎实的实验,重新定义了大语言模型遗忘能力的评估标准,其价值不仅在于提出一个新基准,更在于推动整个领域向更贴近真实安全需求的方向演进。

Sources