言葉は安全だが行動は致命的:隠れ状態表現空間における物理的リスクの探求
大規模言語モデルは身体を持ったエージェントの上位プランナーとして利用されつつあるが、言語的に無害な指示が物理世界で実行されると危険を招く可能性がある。本研究は、物理的文脈に起因する危険が通常のテキストコンテンツのリスクと独立して捉えられるかを調査する。Qwen2.5、Phi-3.5、SmolLM2 などのモデルに対し、隠れ状態の方向分析とランダム分割ゼロショットテストを実施した結果、コンテンツ由来の危険と物理に根ざした危険はモデル表現において分離可能な信号を形成することが明らかになった。この知見に基づき、全隠れ状態を扱う単層 L2 正則化ロジスティック回帰プローブ PRISM を提案する。PRISM は SafeAgentBench で精度 86.2%〜87.7%、偽陽性率 11.7%〜13.7% を達成し、同等規模の LLM 判定器を大きく上回った。さらに、1,000 組の物理リスクペアからなる PhysicalSafetyBench-1K ベンチマークを導入し、本手法が unsafe キーワードの単純な一致に頼らず文脈依存の物理的危険を検出できることを示した。
背景と概要
大規模言語モデルがテキスト生成の枠を超え、具身エージェントの上位プランナーとして物理世界での操作を直接指示する役割を担うようになっている。この技術的転換は、純粋な言語的コンテキストでは無害甚至是積極的な指示が、実際の物理環境で実行された際に重大な事故を招くという新たな安全課題を浮上させた。例えば、「机を片付ける」という命令は文面上では問題ないが、机の下に壊れやすい物品や危険な物が置かれている場合、その物理的実行は深刻な損害を引き起こす可能性がある。本研究は、従来のテキストコンテンツリスクと、環境に依存する物理的危険がモデル内部でどのように処理されているかを解明することを目的としている。
従来の安全アライメント手法は、有害な言葉や違法なコンテンツの生成を抑制することに重点を置いており、指示が物理世界でどのような結果をもたらすかについてはほとんど考慮されてこなかった。本研究の核心的な問いは、モデルの内部表現において、テキスト上の安全性と物理的な危険性が独立して符号化されているかどうかという点にある。もしこれらが分離可能であれば、テキストの内容を監視するだけでなく、エージェントの行動が物理的に安全であるかを事前に検出する仕組みが構築できる。この発見は、誤検知を減らしつつ物理的なリスクを正確に捉えるための理論的基盤を提供するものである。
深掘り分析
研究チームは、Qwen2.5シリーズ(3B、7B、14B、32B)、Phi-3.5、SmolLM2といった主要なオープンソースモデルを対象に、隠れ状態の方向分析とランダム分割ゼロショットテストを実施した。その結果、モデルの規模に関わらず、コンテンツ由来の危険と物理に根ざした危険は、モデルの表現空間において明確に分離可能な信号を形成することが示された。これは、モデルがすべての危険を単一の意味カテゴリーに混同しているわけではなく、物理的な結果とテキスト上の毒性に関連する独立したニューラル経路やベクトル方向を維持していることを意味する。
この知見に基づき、本研究ではPRISMという軽量な単層ロジスティックプローブが提案された。PRISMはモデルの全隠れ状態を直接入力とし、L2正則化を用いて訓練される。従来のLLM判定器が生成されたテキストの最終出力を検査するのに対し、PRISMはアクションが確定する前の内部状態を監視することで、潜在的な物理的危険を早期に検出する。このアーキテクチャにより、計算オーバーヘッドを最小限に抑えつつ、複雑な高次元空間から特定の物理リスク信号を抽出することが可能になっている。これは事後のテキストフィルタリングから、能動的な内部状態モニタリングへのパラダイムシフトを示している。
評価はSafeAgentBenchと新たに導入されたPhysicalSafetyBench-1Kの2つのベンチマークで行われた。SafeAgentBenchにおいて、PRISMは86.2%から87.7%の精度を達成し、偽陽性率は11.7%から13.7%に抑えられた。一方、同等規模のLLM判定器は24.7%から39.0%という高い偽陽性率を示し、安全なタスクを過剰に拒否する傾向があった。さらに、PhysicalSafetyBench-1Kでは、1,000組の物理リスクペアを用いたテストで、PRISMは99.6%の精度と0.7%の誤報率を記録した。これは、Qwen2.5-3Bベースの判定器が67.8%の安全タスクを誤って拒否した結果と比較すると、その優位性は顕著である。
業界への影響
PRISMの高い精度と低い誤報率は、具身AIの産業実装において極めて重要な意味を持つ。家庭用サービスロボットや工業用マニピュレーターなど、現実世界で動作するエージェントにとって、頻繁な誤警報はユーザーの信頼を損ない、システムの非効率を招く。PRISMは、真の物理的危険と安全な操作を正確に見分けることで、不要な中断なしに複雑な長期計画をサポートできる、より洗練された安全レイヤーを実現する。これにより、エージェントは安全を理由に正当なタスクを拒否することがなくなり、運用の信頼性が大幅に向上する。
また、本研究は「テキストの安全性=物理的安全性」という従来の概念を打破し、オープンソースコミュニティに対して、基盤モデルの再学習なしに安全性を強化できる軽量なツールを提供した。PRISMのようなモジュラーなアプローチは、フルモデルのファインチューニングに伴う計算コストを回避しつつ、安全メカニズムの迅速な反復と改善を可能にする。これにより、開発者は敏感な環境での具身エージェントの展開をより容易に行えるようになり、AI安全研究における物理的安全の評価基準が整備されることにつながる。
PhysicalSafetyBench-1Kの公開は、学界全体にとって標準化されたテストプラットフォームとして価値がある。このベンチマークは、モデルが物理的結果をどのように表現し推論するかを探求するよう促し、具身AIの安全性に対するより厳格なアプローチを促進する。多様なシナリオを含む1,000組のペアは、単なるキーワードマッチングではなく、文脈依存の物理的危険を検出する能力を評価する上で不可欠なリソースとなっている。
今後の展望
今後は、この研究の知見がマルチモーダル大規模言語モデルへと拡張されることが期待される。視覚や触覚などの入力を統合するモデルにおいて、PRISMの原理はクロスモーダル表現の分析に応用可能だ。例えば、モデルが視覚的な質感や重量分布に基づき、一見安定しているように見える物体が実際には不安定であることを認識するような、複数の感覚モダリティを統合した危険検出が可能になる。これにより、視覚手がかりと物理的アクションの相互作用から生じる危険をより正確に捉えられるようになる。
また、PRISMが達成した低い偽陽性率は、具身AIにおける安全システムの精度の重要性を強調している。今後の研究では、これらのプローブをリアルタイムの制御ループに統合し、エージェントが内部状態から検出されたリスク信号に基づいて行動を動的に調整できるようにする取り組みが進むだろう。これにより、過去の経験から学習し、時間とともにリスク評価能力を向上させる適応型安全システムの開発が進むことが予想される。
究極的に、この研究はテキスト的次元と物理的次元の両方を包含する包括的なAI安全アプローチの必要性を浮き彫りにしている。PRISMによって示されたコンテンツと物理的リスクの分離は、この目標に向けた基盤的な一歩である。技術が成熟するにつれ、次世代のインテリジェントエージェントが物理世界で安全かつ効果的に動作することを保証するため、より専門的なツールやベンチマークが登場し、具身AIの安全基準がさらに高度化していくと見られる。