능동적 관찰자 테스트: 다중모달 대규모 언어모델의 동적 시각 지각에서 드러나는 능력 부재
이 논문은 인간 지각에 특징적인 능동적 시각 관찰 능력을 다중모달 대규모 언어모델(MLLMs)이 갖추었는지 평가하기 위해 설계된 새로운 벤치마크 ActiveVision을 제시한다. 인간 시각은 폐쇄 루프 과정으로, 시선은 단순한 정적 스냅샷에 의존하는 것이 아니라 중간 가설에 기반하여 지속적으로 재지시된다. 그러나 기존 시각-언어 벤치마크는 이 중요한 능력을 평가할 수 없다. ActiveVision은 세 가지 주요 범주에 걸쳐 17개의 과제로 구성되며, 모델에 반복적이고 반복적인 시각 지각을 강제한다. 결과는 극명하다. 최상위 모델조차도 처참한 성능을 보였다. 최고 점수의 GPT-5.5조차 17개 중 10.6%만 해결했고 11개 과제에서 제로를 기록했다. Claude Fable 5는 3.5%에 그쳐 더 나빴다. 반면 세 명의 인간 참가자는 평균 96.1%의 점수를 달성했다. 연구는 모델이 이미지 추론을 위해 시각 코드를 작성하고 실행하는 경우에도 실제 이미지에서의 신뢰성이 충분하지 않으며, 특히 중요한 것은 생성된 코드 내 오류를 감지하는 것 자체가 능동적 지각 능력을 요구한다는 점을 추가로 밝혀냈다. 이러한 발견은 현재 모델이 지각-추론 루프를 어떻게 닫고 있는지에 대한 근본적인 격차를 노출하며, 향후 아키텍처 설계 및 훈련 목표에 대한 명확한 방향성을 제시한다.
배경
인간의 시각 시스템은 단순히 정적인 이미지를 수동적으로 받아들이는 과정이 아니라, 역동적인 폐쇄 루프(closed-loop) 과정으로 작동합니다. 오랜 기간 동안 심리학과 인지 과학 연구는 복잡한 인지 과제에서 '능동적 관찰(active observation)'의 핵심적인 역할을 강조해 왔습니다. 인간은 시선을 고정된 단일 스냅샷에 의존하지 않고, 중간 가설에 기반하여 지속적으로 시선을 재지시하며 환경을 반복적으로 샘플링함으로써 세계에 대한 일관된 이해를 구축합니다. 이러한 메커니즘은 광범위한 개요에서 즉시 드러나지 않는 모호성을 해소하고 중요한 세부 정보를 추출할 수 있게 해줍니다. 그러나 다중모달 대규모 언어모델(MLLMs)이 급속도로 발전하고 있음에도 불구하고, 이러한 시스템이 인간 인지 기능과 유사한 능동적 시각 관찰 능력을 갖추고 있는지 여부를 묻는 중요한 실증적 질문은 아직 해결되지 않은 상태로 남아 있습니다. 기존의 시각-언어 벤치마크는 주로 정적 이미지 설명이나 질문 응답에 중점을 두고 있어, 모델이 목표 지향적인 반복적 시각 탐색에 참여할 수 있는 능력을 평가하는 데 실패해 왔습니다.
이러한 평가 방법론의 상당한 격차를 해소하기 위해 연구자들은 ActiveVision이라는 새로운 벤치마크를 도입했습니다. 이 벤치마크는 능동적 관찰 능력을 정량화하고 측정하기 위해 설계되었으며, 세 가지 주요 범주에 걸쳐 17개의 신중하게 선별된 과제로 구성됩니다. 각 과제는 모델이 반복적인 시각 지각의 순환에 참여하도록 강요하도록 공학적으로 설계되었습니다. ActiveVision의 핵심 설계 논리는 모델이 일회성 정적 특징 추출에 의존하지 못하도록 하는 것입니다. 대신 시스템이 정보 부족 상태를 식별하고, 누락된 데이터에 대한 가설을 생성하며, 새로운 시각적 증거를 수집하기 위해 특정 관찰 행동을 실행하도록 요구합니다. 이 접근 방식은 불확실한 요소를 명확히 하기 위해 세부 사항에 확대하거나 시점을 전환하는 인간의 과정을 시뮬레이션하여, 기존 AI 평가에서 측정할 수 없었던 역동적 시각 추론 능력을 평가하기 위한 엄격한 프레임워크를 제공합니다.
심층 분석
ActiveVision의 기술적 아키텍처는 MLLMs가 고정된 시각 토큰 시퀀스에 전통적으로 의존하는 방식을 깨기 위해 설계되었습니다. 기존 모델은 일반적으로 입력 이미지를 정적 표현으로 인코딩하여 이 단일 스냅샷을 기반으로 추론을 수행합니다. 반면, ActiveVision은 '가설-검증' 루프를 요구합니다. 정보가 부족할 때 모델은 추가 관찰의 필요성을 인식하고 새로운 시각적 데이터를 검색하기 위해 적절한 쿼리나 행동을 생성해야 합니다. 이 메커니즘은 특정 관심 영역에 주의를 집중시키는 인간의 전략과 유사합니다. 연구는 모델이 이 과정에서 코드를 생성하여 도움을 줄 수 있는지 여부도 조사합니다. 그러나 기술적 분석에 따르면, 모델이 시각 코드를 작성하고 실행할 수 있는 경우조차도 실제 세계의 복잡한 이미지를 다루는 신뢰성은 극도로 낮습니다. 시스템은 지각을 돕기 위해 실행 가능하거나 정확한 코드 스니펫을 생성하는 데 종종 실패합니다.
심층 분석의 중요한 발견 중 하나는 자체적으로 생성된 코드에서 오류를 감지하는 능력 자체가 능동적 지각 능력을 필요로 한다는 점입니다. 모델이 자신의 코드 실행 결과인 시각적 출력을 정확하게 지각할 수 없다면, 추론 과정을 효과적으로 디버깅하거나 수정할 수 없습니다. 이는 역동적 지각의 부재가 코드 실행과 같은 고급 추론 기술 자체를 약화시키는 근본적인 병목 현상을 만들어냅니다. 연구는 이러한 결핍이 단순히 연산 자원의 부족에서 비롯된 것이 아니라, 현재 모델 아키텍처와 훈련 목표에서 역동적 지각 루프를 구조적으로 무시했기 때문임을 보여줍니다. 모델은 새로운 시각적 피드백에 기반하여 이해를 반복적으로 정제하는 데 필요한 내부 표현 메커니즘이 부족하여, 지각-추론 루프를 효과적으로 닫지 못합니다.
산업 영향
ActiveVision에서 얻은 실험 결과는 현재 최첨단 MLLMs의 한계를 명확히 보여주는 증거를 제공합니다. 평가된 모델 중 최고 노출 추론 노력 수준으로 테스트된 GPT-5.5는 해결률 10.6%에 그쳤습니다. 더욱 경각심을 주는 것은 17개 과제 중 11개에서 제로를 기록했다는 점으로, 이는 역동적 관찰이 필요한 시나리오를 완전히 처리할 능력이 없음을 나타냅니다. 추론 및 프로그래밍 벤치마크에서 또 다른 상위 모델인 Claude Fable 5는 해결률 3.5%로 더 나쁜 성과를 보였습니다. 이러한 수치는 심각한 능력 격차를 강조합니다. 이와 대조적으로, 세 명의 인간 참가자는 동일한 과제에서 평균 96.1%의 점수를 달성했습니다. 이 거대한 격차는 현재 AI 시스템이 능동적 시각 탐색과 반복적 가설 검사가 필요한 작업에 근본적으로 부적합하며, 이러한 능력은 인간에게는 일상적인 것임을 강조합니다.
이러한 결과는 산업 전반에 지대한 영향을 미칩니다. 이 결과는 오픈소스 커뮤니티와 산업 개발자들에게 MLLMs가 정적 이미지 이해에서 상당한 진전을 이루었음에도 불구하고 역동적 환경에서 여전히 취약하다는 신호를 보냅니다. 이러한 한계는 실시간 능동적 지각이 안전과 운영 신뢰성에 중요한 자율 주행 및 로봇 항법과 같은 애플리케이션에 심각한 위험을 초래합니다. 이 발견들은 단순히 정적 벤치마크 점수를 개선하는 것으로는 불충분하며, 산업이 폐쇄 루프 지각-추론 주기를 지원하는 아키텍처 개발로 전환해야 함을 시사합니다. 이러한 근본적인 결핍을 해결하지 않는 한, AI 시스템은 정보가 종종 부분적이고 능동적인 수집이 필요한 복잡하고 구조화되지 않은 물리적 세계에서 견고하게 작동하는 데 어려움을 겪을 것입니다.
전망
앞으로 ActiveVision 벤치마크는 미래 연구 및 아키텍처 설계를 위한 명확한 방향을 제시합니다. 식별된 격차는 차세대 모델이 강화 학습과 유사한 메커니즘을 통합해야 함을 시사하며, 여기서 에이전트는 능동적 관찰을 통해 내부 가설을 최적화하는 방법을 학습합니다. 훈련 목표는 최종 답변뿐만 아니라 관찰 전략 자체의 효율성과 정확성에 대한 보상을 위해 진화해야 합니다. 이는 불확실성 수준에 따라 시각 장면의 다른 부분에 계산 자원을 동적으로 할당할 수 있는 새로운 네트워크 구조를 개발하는 것을 포함합니다. 지각-추론 루프의 완수를 우선시함으로써 연구자는 더 견고하고 효율적이며 인간과 유사한 인지 과정과 일치하는 시스템을 구축할 수 있습니다.
궁극적으로 진정한 능동적 관찰 능력을 갖춘 MLLMs의 개발은 실제 응용 분야에서 신뢰할 수 있는 범용 인공지능(AGI)을 달성하기 위한 중요한 단계입니다. AI 시스템이 더 복잡하고 상호 작용적인 환경에 배치됨에 따라 정보를 능동적으로 찾고 검증하는 능력은 이를 처리하는 능력만큼 중요해질 것입니다. ActiveVision은 현재 기술이 부족한 구체적인 영역을 강조하고 커뮤니티를 더 정교하고 역동적이며 궁극적으로 더 능력 있는 인공지능 시스템으로 안내하는 중요한 진단 도구 역할을 합니다. 이 벤치마크는 정적 정확도뿐만 아니라 역동적 역량에 따라 미래의 진전을 측정하도록 보장하며 새로운 평가 기준을 설정합니다.