ByDeWay-V2: 의사결정 핵심 응용을 위한 학습 없는 해석 가능한 공간 추론 프레임워크
본 논문은 로봇 및 자율 주행과 같은 안전 핵심 시나리오에서 멀티모달 대규모 언어 모델(MLLM)의 공간 이해 모호성과 환각 문제를 해결하도록 설계된 학습 없는 경량 프레임워크 ByDeWay-V2를 제시합니다. 거친 깊이 계층에만 의존하여 공면 물체 간 미세 공간 관계를 해결할 수 없었던 전작 ByDeWay를 기반으로, ByDeWay-V2는 YOLO-World-L 기반 오픈 보캐뷸러 검출기를 도입하여 물체 간 기하학적 관계를 계산하고 판독 가능한 술어로 변환하여 깊이 단서와 함께 프롬프트에 주입합니다. VSR 및 BLINK 벤치마크에 대한 실험은 이 접근법이 공간 추론 능력을 상당히 향상시켜 BLINK 공간 하위세트에서 Qwen2.5-VL의 상대 F1 점수를 46% 개선하고, VSR에서 BLIP-Base의 성능을 거의 무작위 수준에서 경쟁력 있는 0.53으로 회복시킨다는 것을 보여줍니다. 엄격한 40토큰 컨텍스트 예산 내에서 작동하는 이 프레임워크는 자원 제약 환경에서의 실시간 의사결정 지원을 위한 효율적이고 감사 가능한 솔루션을 제공합니다.
배경
로봇 제어, 자율주행, 산업 자동화 등 안전이 최우선인 핵심 도메인에서 멀티모달 대규모 언어 모델(MLLM)의 도입이 가속화되면서, 모델의 공간적 추론 과정이 보이는 '블랙박스' 특성이 주요한 장벽으로 대두되고 있습니다. 비록 이러한 모델들은 일반적인 추론 능력에서는 뛰어난 성과를 보이지만, 세밀한 공간 이해가 요구되는 작업에서는 종종 실패하며, 존재하지 않는 물체나 관계를 잘못 설명하는 '환각(Hallucination)' 현상을 빈번히 발생시킵니다. 이는 운영자의 신뢰를 저해할 뿐만 아니라, 고위험 의사결정 파이프라인에서 필수적인 시스템의 감사 가능성(Auditability)을 불가능하게 만듭니다. 기존 연구 중 하나인 ByDeWay 프레임워크는 단안 깊이 추정을 통해 입력 프롬프트를 구조화하는 계층적 깊이 프롬프트(LDP) 방식을 제안하여 환각을 완화하려 시도했습니다. 그러나 이 방식은 거친 깊이 계층화에만 의존했기 때문에, 같은 평면 위에 있는 물체들 간의 미세한 공간 관계, 예를 들어 '왼쪽'이나 '접촉'과 같은 기하학적 및 위상학적 관계를 명확히 해결하는 데에는 한계가 있었습니다.
이러한 핵심적인 한계를 극복하기 위해 제안된 것이 ByDeWay-V2 프레임워크입니다. 이 프레임워크의 핵심 기여도는 MLLM의 재학습 없이도 명시적인 공간 관계 문맥과 깊이 단서를 결합하여, 인간이 판독 가능한 논리적 술어(Predicate)를 생성함으로써 하류 의사결정 지원에 대한 검증 가능한 증거 사슬을 제공한다는 점에 있습니다. 이는 3D 장면의 깊이 정보와 2D 공간 의미론을 연결하는 가교 역할을 하며, 모델이 복잡한 시나리오에 대한 공간적 지각 능력을 현저히 향상시킵니다. 특히, 이 접근법은 계산 효율성을 해치지 않으면서도 공간적 오인으로 인한 환각을 대폭 줄여, 지연 시간과 리소스 소비가 중요한 실시간 애플리케이션에 적합하도록 설계되었습니다. 이는 오류가 심각한 물리적 결과를 초래할 수 있는 환경에서 MLLM 출력의 투명성과 신뢰성을 높이는 중요한 진전으로 평가됩니다.
심층 분석
기술적 구현 측면에서 ByDeWay-V2는 컴퓨터 비전의 객체 탐지 기술과 자연어 처리의 프롬프트 엔지니어링을 매끄럽게 통합한 혁신적인 추론 강화 전략을 채택하고 있습니다. 프레임워크는 먼저 오픈 보캐뷸러 객체 탐지기인 YOLO-World-L을 활용하여 입력 이미지 내의 핵심 엔티티를 식별하고, 해당 물체의 경계 상자(Bounding Box) 정보를 추출합니다. 이 단계는 일반적인 깊이 추정을 넘어 특정 물체에 대한 정확한 공간 좌표를 제공한다는 점에서 중요합니다. 탐지된 후, 시스템은 식별된 물체들 간의 쌍별 기하학적 관계를 계산하고, 이를 구조화된 공간 술어로 변환합니다. 예를 들어, '물체 A가 물체 B의 왼쪽에 있다'거나 '물체 C가 물체 D와 접촉하고 있다'는 식의 명확한 문장으로 변환됩니다. 이러한 변환은 원시 기하학적 데이터를 MLLM이 추론 과정에서 쉽게 해석하고 활용할 수 있는 의미론적 형식으로 바꿉니다.
이렇게 생성된 공간 술어들은 단안 깊이 추정을 통해 얻은 깊이 단서와 결합되어 MLLM의 입력 프롬프트에 직접 주입됩니다. 이 하이브리드 접근법은 모델이 깊이 정보와 명시적인 공간 제약 조건을 모두 활용하도록 보장하여, 환각 발생 가능성을 크게 줄입니다. 특히 ByDeWay-V2는 엄격한 40토큰의 컨텍스트 예산 내에서 작동하도록 설계되었습니다. 이는 프롬프트 크기를 작게 유지함으로써 더 큰 컨텍스트 윈도우와 관련된 계산 병목 현상을 피하고, 빠른 추론 주기를 가능하게 합니다. 이 효율성은 정확성을 희생하지 않으면서 달성되는데, 명시적인 술어들이 모델에게 물체 관계에 대한 명확하고 모호하지 않은 지침을 제공하여, 모델이 시각적 특징만으로 이러한 복잡한 관계를 추론할 필요성을 제거하기 때문입니다. 이는 리소스가 제한된 환경에서도 고성능의 공간 추론을 가능하게 하는 핵심 기술적 이점입니다.
산업 영향
ByDeWay-V2의 유효성을 검증하기 위해 Visual Spatial Reasoning(VSR) 및 BLINK와 같은 권위 있는 멀티모달 공간 추론 벤치마크에서 광범위한 실험이 수행되었으며, POPE 지표를 통해 환각 위치 정확성도 평가되었습니다. 실험 결과, 이 방법은 다양한 아키텍처의 MLLM에서 모두 현저한 성능 향상을 보였습니다. 특히 BLINK 벤치마크의 공간 하위세트에서 Qwen2.5-VL 모델과 결합했을 때, ByDeWay-V2는 이전의 LDP 방법에 비해 상대 F1 점수가 46% 향상되는 성과를 거두었습니다. 이는 기존 MLLM들이 처리하기 어려웠던 복잡한 공간 쿼리를 다루는 데 있어 프레임워크의 탁월한 효과를 입증합니다. 더욱 주목할 만한 점은, 공간 추론 작업에서 원래 성능이 낮았던 BLIP-Base 모델의 경우, ByDeWay-V2가 VSR 벤치마크에서 거의 무작위 추측 수준의 성능을 경쟁력 있는 0.53의 F1 점수로 회복시켰다는 사실입니다. 이는 프레임워크가 모델의 기본 공간 추론 숙련도와 무관하게 다양한 모델 아키텍처 전반에 걸쳐 성능을 향상시킬 수 있는 다재다능함을 보여줍니다.
아블레이션 연구(Ablation Study)는 명시적인 공간 술어의 도입이 동평면 물체 간 관계 인식 향상에 필수적임을 추가로 확인했습니다. 실험 결과, 깊이 단서에만 의존하는 것은 동평면 물체 간의 관계를 정확하게 식별하기에 충분하지 않으며, 기하학적 술어의 통합이 공간 이해도 향상을 주도한다는 사실이 밝혀졌습니다. 이는 ByDeWay-V2의 다차원적 접근법이 깊이 정보와 명시적인 공간 논리를 결합함으로써 추론을 위한 더 견고한 기반을 제공한다는 점을 검증합니다. 학습이 필요 없다는 프레임워크의 특성은 기존 MLLM 파이프라인에 최소한의 노력으로 통합할 수 있게 하여, 신뢰할 수 있는 공간 추론을 애플리케이션에 구현하고자 하는 조직들의 진입 장벽을 낮춥니다. 이러한 통합의 용이성은 오픈소스 커뮤니티와 고급 AI 기능을 광범위한 재학습 인프라 없이 채택하려는 산업 부문 모두에게 특히 가치 있는 요소입니다.
전망
산업적 관점에서 ByDeWay-V2는 리소스가 제한된 환경에서의 실시간 의사결정 지원을 위한 실현 가능한 엔지니어링 패러다임을 제시합니다. CPU 리소스만 필요로 하고 엄격한 40토큰 예산 내에서 작동하는 이 프레임워크의 경량 구성은 에지 디바이스 배포에 이상적입니다. 이는 자율주행차의 경로 계획이나 산업용 로봇의 파지 작업과 같이 낮은 지연 시간과 높은 신뢰성이 가장 중요한 애플리케이션에 특히 관련성이 높습니다. 해석 가능한 공간 추론을 제공함으로써 프레임워크는 모델 출력의 투명성을 높여, 운영자가 결정背后的 논리를 빠르게 이해할 수 있도록 합니다. 안전 모니터링과 같은 고위험 애플리케이션에서 의사결정을 감사하고 검증할 수 있는 능력은 사고를 예방하고 규정 준수를 보장하는 데 필수적이므로, 이는 높은 신뢰성을 구축하는 데 핵심적입니다.
앞으로 ByDeWay-V2의 학습 불필요 특성은 더 넓은 AI 커뮤니티를 위한 확장 가능한 솔루션으로 자리매김할 것입니다. 다양한 MLLM과의 호환성은 플랫폼과 사용 사례 전반에 걸쳐 신속한 채택을 가능하게 하여, 구동 지능(Embodied Intelligence) 및 멀티모달 AI 시스템의 개발을 가속화할 것입니다. 핵심 분야에서 신뢰할 수 있고 설명 가능한 AI에 대한 요구가 증가함에 따라, ByDeWay-V2와 같은 프레임워크는 고급 AI 능력과 실제적이고 안전한 배포 사이의 격차를 메우는 데 중요한 역할을 할 것입니다. 환각을 완화하고 공간 추론을 향상시키는 프레임워크의 성공은 MLLM이 안전이 중요한 시나리오에서 활용되는 방식을 위한 새로운 기준을 설정하며, 미래의 더 신뢰할 수 있고 효율적인 AI 기반 시스템의 길을 열 것입니다.