GUARD:让大型推理模型"自然遗忘"敏感内容,而非生硬拒答
一篇新论文提出GUARD方法,通过引导式问答蒸馏让大型推理模型在思维链中自然地遗忘敏感信息,避免生硬拒答或编造内容,同时保持整体推理能力。
随着大型推理模型(large reasoning models)的普及,一个此前较少被讨论的安全问题正在浮出水面:这类模型在给出最终答案之前,会生成一段可见的"思维链"(chain-of-thought),用来展示逐步推理过程。问题在于,敏感或受保护的信息完全可能在这个中间推理阶段泄露出来,即便模型最终呈现的答案看起来完全合规、毫无破绽。这意味着传统只审查最终答案的做法,在推理模型面前出现了明显的盲区:一个模型可以在"思考"里把不该说的内容说一遍,然后在"回答"里假装什么都没发生。
由Zeyu Yan、Guanghao Zhou、Minghui Qiu、Ming Gao和Cen Chen五位作者提出的新论文《GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation》(arXiv:2609.21677),正是针对这一问题给出的系统性回应。论文指出,现有的机器遗忘(machine unlearning)方法大多直接压制目标内容或改动模型内部表征,但它们有一个共同缺陷:只管"删掉什么",却不管"删掉之后该怎么办"。这种粗暴的干预方式容易导致两类副作用,一是编造替代内容(confabulation,即模型为填补被删除的信息而虚构新说法),二是输出变得不稳定、不连贯,读起来支离破碎。
什么是"自然遗忘轨迹"
GUARD的核心主张是:有效的遗忘不应止步于"不说",而应该产生一条连贯的、不泄密的推理路径,并自然地导向一个稳定一致的拒答式回应,而不是一个突兀或语无伦次的非答案。
为实现这一点,GUARD把原本会导向泄露的"不安全披露轨迹",转化为安全的"退出轨迹"(exit trajectory)。具体做法是引入引导性提示词(guidance tokens),先让一个保持冻结、参数不变的模型学会沿着这些安全退出路径走,再把这种行为通过蒸馏方式内化进模型自身的参数中,使模型无需依赖运行时的额外干预或过滤器,就能原生地表现出这种"自然遗忘"行为。
为何要蒸馏进参数,而非运行时过滤
这一设计选择本身值得关注。如果遗忘只是靠一层运行时的安全过滤器实现,那么这层过滤器本身就成了新的攻击面:只要能绕过或移除这层过滤(例如通过越狱提示词、修改推理路径、或直接操纵中间输出),被"遗忘"的内容就可能重新暴露。而将安全退出行为直接蒸馏进模型参数,意味着这种行为成为模型自身能力的一部分,不依赖外部补丁,对抗各种提取式攻击时天然更稳固。
为了衡量这种"遗忘之后"的表现质量,论文还提出了一项新指标——自然遗忘推理分数(Natural Forgetting Reasoning Score)。这一指标的意义在于,它不只关心"有没有泄露"这一个维度,还进一步评估替代内容本身的质量:结构是否连贯、语气是否自然、是否存在编造和幻觉的风险。换句话说,一个模型即便成功"守口如瓶",如果给出的替代说辞前后矛盾或明显是编的,仍然算不上一次高质量的遗忘。这弥补了以往仅用"泄露率"这一单一指标评估遗忘效果的局限。
根据论文描述,团队在已有基准测试上验证了GUARD,结果显示该方法能大幅减少有害信息的披露,同时保持模型整体推理性能基本不受影响。这一结果如果能被后续研究广泛复现,将为如何在保留模型能力的同时安全地"删除"特定知识,提供一条兼顾安全与实用性的新路径。
为什么思维链泄露是一个"新"问题
值得强调的是,思维链泄露与最终答案泄露在性质上并不相同,这也是GUARD这类工作出现的背景所在。传统语言模型只输出一段简短回答,安全审查只需盯住这一个出口。但推理模型会"把想法说出来",中间那段思考文字往往比最终答案更长、更细节化,也更少被当作需要过滤的对象——很多现有的安全流水线甚至根本不检查思维链内容,只检查最后呈现给用户的那句话。这就造成了一种结构性错配:攻击者只需要设法看到或诱导出模型的中间推理,就可能绕开专门针对最终答案设计的防护措施。GUARD把这个中间阶段本身当作需要治理的对象,而不是把它当成可以忽略的"草稿",这个视角上的转变本身就具有方法论意义。
同样重要的是拒答方式本身带来的信息量问题。如果一个模型在被问及敏感话题时,前一秒还在流畅地展开推理,下一秒突然卡壳、跳转到一句生硬的"我不能回答",这种行为模式的落差本身就是一种信号:它告诉一个有心的观察者,这里恰好触碰到了某个被特别设防的边界。反复试探这种"卡壳点",攻击者甚至可以反推出哪些内容属于被保护范围。GUARD追求的"自然遗忘轨迹",本质上是让拒答本身也具备与正常回答相似的语言学特征,从而不给攻击者留下可利用的行为指纹,这一点是仅仅关注"是否泄露"的传统评估方式容易忽略的。
Sources
FAQ
GUARD方法解决了什么问题?
GUARD针对大型推理模型在思维链中泄露敏感信息的问题,让模型学会自然地遗忘并平稳过渡到拒答,而不是生硬中断或编造内容。
为什么把安全行为蒸馏进模型参数比运行时过滤更好?
运行时过滤器本身可能被绕过或移除,成为新的攻击面;而蒸馏进参数使安全退出成为模型自身能力,更能抵御各种提取式攻击。
自然遗忘推理分数(Natural Forgetting Reasoning Score)衡量什么?
它不仅衡量是否发生泄露,还评估替代内容的结构连贯性、语气自然度和编造/幻觉风险,是对传统泄露率指标的补充。