GUARD:大型推論モデルに「自然な忘却」を教える新手法

Published · AI Daily — AI-assisted deep research, methodology & disclosure

新論文はGUARD手法を提案し、大型推論モデルが思考の連鎖の中で機密情報を自然に忘却し、唐突な拒否や捏造を避けつつ推論性能を維持する方法を示した。

大型推論モデルの普及が進むにつれ、これまであまり注目されてこなかった安全上の課題が浮かび上がってきた。これらのモデルは最終的な答えを出す前に、段階的な推論過程を示す可視化された「思考の連鎖」(chain-of-thought)を生成する。問題は、この中間の推論段階で機密情報や保護対象の情報が漏洩し得るという点にある。しかも、モデルが最終的に提示する答え自体は完全にクリーンで問題なく見えることさえある。つまり、最終的な答えだけを審査する従来の手法には、推論モデルに対する明確な死角があるということだ。モデルは「考えている」段階で言ってはいけないことを言い、「答える」段階では何事もなかったかのように振る舞うことができてしまう。

Zeyu Yan、Guanghao Zhou、Minghui Qiu、Ming Gao、Cen Chenの5名による新論文「GUARD: Natural Forgetting in Large Reasoning Models via Guided Answer-Reasoning Distillation」(arXiv:2609.21677)は、まさにこの問題に対する体系的な回答を提示している。論文は、既存の機械アンラーニング(machine unlearning)手法の多くが、対象コンテンツを直接抑制するか、モデル内部の表現を書き換えるかのいずれかに終始していると指摘する。しかしこれらの手法には共通の欠陥がある。「何を削除するか」にしか焦点を当てておらず、「削除した後にモデルがどう振る舞うべきか」を考慮していないのだ。この乱暴な介入方式は、二種類の副作用を生みやすい。一つは、削除された情報の穴を埋めるためにモデルが新たな内容を捏造してしまう「作話」(confabulation)、もう一つは、出力が不安定で支離滅裂になってしまう現象である。

「自然な忘却軌跡」とは何か

GUARDの中心的な主張は、効果的なアンラーニングは単に沈黙することで終わってはならない、というものだ。それは、一貫性があり情報を漏らさない推論経路を生み出し、それが自然に一貫した拒否スタイルの応答へとつながっていくべきであり、唐突であったり支離滅裂な非応答であってはならない。

これを実現するため、GUARDは本来であれば安全でない開示につながる軌跡を、安全な「退出軌跡」(exit trajectory)へと変換する。具体的には、ガイダンストークンを導入し、パラメータを変更していない凍結状態のモデルをこれらの安全な退出経路へと誘導し、その振る舞いをモデル自身のパラメータへと蒸留する。これにより、モデルは実行時の介入やフィルタリング層に頼ることなく、自然な忘却をネイティブに示すようになる。

なぜパラメータへの蒸留が実行時フィルタリングより重要なのか

この設計選択には注目する価値がある。もしアンラーニングが実行時の安全フィルタのみに依存しているなら、そのフィルタ自体が新たな攻撃対象になってしまう。ジェイルブレイク的なプロンプト、推論経路の操作、中間出力への直接的な干渉などによってこのフィルタリング層を回避または除去できれば、「忘れたはずの」コンテンツが再び表面化する可能性がある。これに対し、安全な退出の振る舞いをモデルのパラメータに直接蒸留することは、その振る舞いを外部パッチではなくモデル自身の能力の一部にすることを意味し、様々な種類の敵対的抽出攻撃に対して本質的により堅牢である。

忘却後の状態の質を測るため、論文は自然遺忘推理スコア(Natural Forgetting Reasoning Score)という新たな指標も導入している。この指標の意義は、漏洩の有無という一点だけを問うのではなく、代替コンテンツ自体の質、すなわち構造の一貫性、語調の自然さ、捏造や幻覚のリスクをさらに評価する点にある。つまり、沈黙を守ることに成功したモデルであっても、その代替の言い回しが矛盾していたり明らかに作り話であったりすれば、この枠組みの下では質の高い忘却とは見なされない。これは、従来の研究が漏洩率という単一の指標だけでアンラーニングの成果を評価しがちだったという実質的なギャップに対応するものだ。

論文によれば、研究チームは既存のベンチマークでGUARDを検証し、有害な開示の大幅な削減を確認しつつ、全体的な推論性能はおおむね維持されたという。この結果が今後より広範な追試によって裏付けられれば、この手法は、モデルの有用性を支える推論能力を犠牲にすることなく、特定の知識を安全に取り除く道筋を示すことになるだろう。これは、より粗雑なアンラーニング手法がこれまで達成しづらかったバランスである。

Sources

FAQ

GUARD手法はどのような問題を解決するのか?

GUARDは推論モデルの思考連鎖を通じた機密情報の漏洩に対処し、唐突な打ち切りや捏造ではなく自然な忘却と拒否への滑らかな移行をモデルに教える。

安全な振る舞いをパラメータに蒸留する方が実行時フィルタリングより優れているのはなぜか?

実行時フィルタ自体が回避や除去の対象となり新たな攻撃面になり得るが、パラメータへの蒸留は安全な退出をモデル固有の能力にし、抽出攻撃への耐性を高める。

自然遺忘推理スコアは何を測定するのか?

漏洩の有無だけでなく、代替コンテンツの構造的一貫性、自然さ、捏造や幻覚のリスクも評価し、従来の漏洩率指標を補完する。