말은 안전하지만 행동은 치명적: 숨겨진 상태 표현 공간에서의 물리적 위험 탐색
대규모 언어 모델은 신체화된 에이전트의 상위 레벨 계획기로 점점 더 활용되고 있으나, 언어적으로 무해한 지시문이 물리 세계에서 실행될 때 위험을 초래할 수 있습니다. 본 논문은 물리적 문맥에서 기인한 위험이 일반적인 텍스트 콘텐츠 위험과 분리되어捉えられる지 탐구합니다. Qwen2.5, Phi-3.5, SmolLM2 등 여러 모델에 대해 숨겨진 상태 방향 분석과 무작위 분할 제로샷 테스트를 수행한 결과, 콘텐츠 기반 위험과 물리적 기반 위험이 모델 표현에서 분리 가능한 신호를 형성함을 발견했습니다. 이러한 통찰을 바탕으로, 전체 숨겨진 상태에서 작동하는 단일 레이어 L2 정규화 로지스틱 프로브 PRISM을 제안합니다. PRISM은 SafeAgentBench에서 86.2%~87.7%의 정확도와 11.7%~13.7%의 낮은 오경보율을 기록하며 동급 LLM 기반 평가기보다 월등한 성능을 보였습니다. 또한 1,000개의 물리적 위험 쌍으로 구성된 PhysicalSafetyBench-1K 벤치마크를 도입하여, 본 방법이 부적절 단어 매칭에 의존하지 않고 문맥 의존적 물리적 위험을 효과적으로 감지함을 입증했습니다.
배경
대규모 언어 모델이 단순한 텍스트 생성 도구를 넘어, 로봇과 같은 물리적 에이전트의 고수준 계획자로 진화하고 있습니다. 이러한 기술적 전환은 새로운 형태의 안전 위협을 초래합니다. 텍스트 상으로는 전혀 해롭지 않아 보이는 지시문이 물리적 환경에서 실행될 때 치명적인 결과를 낳을 수 있기 때문입니다. 예를 들어, 로봇에게 "책상을 정리하라"는 명령은 언어적으로는 중립적이지만, 책상 위에 불안정한 물체가 놓여 있거나 바닥에 미끄러운 물질이 있다면 이는 심각한 사고로 이어질 수 있습니다. 현재 대부분의 AI 안전 정렬 메커니즘은 유해한 텍스트 생성을 차단하는 데 집중하고 있어, 이러한 물리적 실행의 결과에 대한 위험을 간과하고 있는 실정입니다. 따라서 모델 내부가 물리적 위험에 대한 정보를 어떻게 인코딩하는지, 그리고 그것이 일반적인 콘텐츠 위험 신호와 분리되는지 규명하는 것이 시급한 과제입니다.
기존의 안전 프레임워크는 주로 출력 텍스트에서 유해한 키워드를 필터링하거나 악의적인 의도를 탐지하는 데 의존해 왔습니다. 그러나 구동 가능한 에이전트의 경우, 위험의 원인은 단어 자체보다 그 단어가 적용되는 물리적 문맥에 있을 수 있습니다. 가연성 물질이 있는 곳에서 불꽃을 만드는 명령이나, 미끄러운 바닥에서 균형을 잡으라는 명령은 텍스트상으로는 안전할 수 있지만 물리적으로는 위험합니다. 이는 물리적 실행과 관련된 위험이 전통적인 콘텐츠 기반 위험과 본질적으로 다르다는 것을 시사합니다. 따라서 대규모 언어 모델의 표현 공간 내에서 물리적 위험 신호가 콘텐츠 위험 신호와 독립적으로 존재하는지 확인하는 연구가 필요하며, 이는 실제 세계에서의 AI 사고를 예방하기 위한 견고한 안전 계층 개발의 기초가 됩니다.
심층 분석
연구진은 Qwen2.5 시리즈(3B, 7B, 14B, 32B 매개변수 버전), Phi-3.5, SmolLM2 등 여러 주요 오픈소스 모델을 대상으로 숨겨진 상태 방향 분석과 무작위 분할 제로샷 테스트를 수행했습니다. 그 결과, 모델의 크기와 상관없이 콘텐츠 위험과 물리적 위험은 모델의 표현 공간에서 명확하게 분리 가능한 신호를 형성한다는 사실을 발견했습니다. 이는 모델이 모든 형태의 위험을 단일한 의미적 범주로 혼동하지 않고, 물리적 결과와 텍스트 독성 각각에 해당하는 고유한 신경 경로나 벡터 방향을 유지하고 있음을 의미합니다. 이러한 통찰을 바탕으로 연구팀은 PRISM을 제안했는데, 이는 언어 모델의 전체 숨겨진 상태에 직접 작용하는 경량의 단일 레이어 L2 정규화 로지스틱 프로브입니다.
PRISM은 생성된 최종 텍스트를 분석하는 전통적인 안전 평가기와 달리, 행동이 확정되기 전에 모델의 내부 표현을 가로채 잠재적 물리적 위험을 조기에 탐지합니다. L2 정규화를 사용하여 훈련된 이 프로브는 복잡한 고차원 숨겨진 상태 공간에서 특정 물리적 위험 신호를 추출하는 동시에 계산 오버헤드를 최소화합니다. 이는 사후 텍스트 필터링에서 proactive한 내부 상태 모니터링으로의 패러다임 전환을 의미합니다. 실험 결과, PRISM은 SafeAgentBench에서 86.2%에서 87.7%의 정확도와 11.7%에서 13.7%의 낮은 오경보율을 기록하며, 동급 규모의 LLM 기반 평가기(오경보율 24.7%~39.0%)를 크게 상회했습니다. 이는 대규모 모델 자체가 안전 심사관으로 작용할 때 지나치게 보수적으로 작용하여 안전한 작업을 과도하게 거부하는 한계를 보완하는 결과입니다.
또한 연구진은 PRISM이 단순히 유해한 단어를 매칭하는 것이 아니라 문맥 의존적 위험을 이해하는지 검증하기 위해 PhysicalSafetyBench-1K라는 새로운 벤치마크를 도입했습니다. 이 벤치마크는 1,000개의 신중하게 선별된 물리적 위험 쌍으로 구성되어 있으며, 명시적인 유해 키워드를 포함하지 않고 물리적 위험만 내포하고 있습니다. PRISM은 이 벤치마크에서 99.6%의 놀라운 정확도와 단 0.7%의 오경보율을 달성했습니다. 반면, Qwen2.5-3B 기반의 기준 평가기는 동일한 테스트에서 67.8%의 안전한 작업을 잘못 거부하는 등 내재된 물리적 위험 처리 능력의 현저한 부족을 드러냈습니다. 이는 PRISM이 진정한 의미의 물리적 안전성을 감지할 수 있음을 입증하는 결정적인 증거입니다.
산업 영향
이 연구는 인공지능 안전 분야에 지대한 영향을 미칩니다. 첫째, 텍스트 안전과 물리적 안전을 동일시하던 기존 관념을 깨뜨려, 현재 대규모 모델 안전 정렬의 공백을 지적했습니다. 오픈소스 커뮤니티에게 PRISM은 기초 모델을 재학습하지 않고도 기존 모델의 안전성을 강화할 수 있는 경량화된 도구입니다. 이는 개발자가 민감한 환경에서 구동 가능한 에이전트를 배포할 때 추가적인 계산 비용 없이 보안 레이어를 추가할 수 있게 하여, 보안 메커니즘의 빠른 반복과 개선을 가능하게 합니다. 둘째, 산업 현장에서 물리적 에이전트가 가정 서비스나 제조업에 널리 보급됨에 따라, 오경보율 감소는 시스템 효율성과 사용자 신뢰도에 직결되는 핵심 요소입니다. PRISM의 높은 정확도와 낮은 오경보율은 복잡한 장기 계획 수행 중 불필요한 중단을 최소화하며, 실제 적용에 적합한 신뢰할 수 있는 안전 계층을 제공합니다.
PhysicalSafetyBench-1K의 등장은 학술계와 산업계 모두에게 표준화된 테스트 플랫폼을 제공합니다. 이는 모델이 물리적 결과를 어떻게 표현하고 추론하는지에 대한 심층적인 연구를 촉진하며, 구동 가능한 AI 안전성에 대한 더 엄격한 접근 방식을 장려합니다. 현재 AI 안전 연구에서 물리적 안전 평가는 중요한 격차로 남아 있었는데, 이 벤치마크는 이를 해소하는 데 기여할 것입니다. 또한 PRISM의 성공은 유사한 기법이 사회적 상호작용이나 윤리적 의사결정 관련 위험 등 다른 유형의 위험 탐지에도 적용될 수 있음을 시사하며, AI 정렬을 위한 도구 상자를 확장하는 계기가 될 것입니다.
전망
향후 이 연구의 함의는 텍스트에서 행동으로의 안전성을 넘어 다중 모달 대규모 언어 모델로 확장될 것입니다. 이러한 모델이 시각 및 촉각 입력을 통합함에 따라, PRISM의 원리는 크로스모달 표현을 분석하는 데 적용되어 시각적 단서와 물리적 행동의 상호작용에서 발생하는 위험을 탐지할 수 있을 것입니다. 예를 들어, 모델은 시각적 질감과 무게 분포를 바탕으로 겉보기에는 안정해 보이는 물체가 실제로 불안정함을 인식해야 할 수 있으며, 이는 다중 감각 모달리티의 통합을 요구하는 과제입니다. 또한 PRISM이 달성한 낮은 오경보율은 구동 가능한 AI 시스템에서 정밀도의 중요성을 강조합니다. 향후 연구는 이러한 프로브를 실시간 제어 루프에 통합하여 로봇이 내부 상태에서 감지된 위험 신호에 따라 행동을 동적으로 조정할 수 있도록 하는 방향으로 전개될 것입니다.
구동 가능한 AI가 의료, 가정 보조, 중요한 인프라 등 핵심 분야에 더 많이 도입됨에 따라, 과거 경험을 학습하고 시간이 지남에 따라 위험 평가 능력을 향상시키는 적응형 안전 시스템에 대한 수요는 더욱 커질 것입니다. 궁극적으로 이 연구는 텍스트적 차원과 물리적 차원을 모두 포괄하는 포괄적인 AI 안전 접근 방식의 필요성을 강조합니다. PRISM이 보여준 콘텐츠 위험과 물리적 위험의 분리는 이러한 목표를 향한 기초적인 한 걸음입니다. 기술이 성숙함에 따라 차세대 지능형 에이전트의 복잡한 안전 요구 사항을 충족시키기 위해 더 전문화된 도구와 벤치마크가 등장할 것으로 예상되며, 이는 에이전트가 우리의 물리적 세계에서 안전하고 효과적으로 작동함을 보장하는 데 기여할 것입니다.