OmniSeek: 다중 턴 오디오-비주얼 추론을 위한 네이티브 도구 통합 프레임워크
OmniSeek는 전모달 대형언어모델(Omni-LLM)을 하나의 긴 오디오-비주얼 시퀀스를 한 번에 처리하는 대신, 필요할 때마다 능동적으로 '보기'와 '듣기' 도구를 호출하는 다중 턴 추론 에이전트로 전환하는 프레임워크다. 추론 과정에서 희소하지만 핵심적인 증거 구간을 반복적으로 검색해 컨텍스트에 다시 결합한다. 다단계 사고 연쇄를 담은 17만 개 규모의 합성 궤적 데이터로 콜드스타트 학습을 수행한 뒤, 검증 가능한 보상을 사용하는 2단계 강화학습과 단일 모달리티 지름길을 억제하는 '오디오-비주얼 필요성' 목표로 정책을 정교화해 여러 벤치마크에서 꾸준한 성능 향상을 보였다.
기술 배경과 문제 정의
오디오, 비디오, 텍스트를 함께 다루는 대부분의 전모달 대형언어모델(Omni-LLM)은 여전히 전체 오디오-비주얼 시퀀스를 한 번의 순전파로 처리하는 수동적 방식에 머물러 있다. 이 방식은 시퀀스가 길어질수록 두 가지 근본적인 문제에 부딫힌다. 첫째, 신호가 희석된다. 실제로 답을 결정짓는 핵심 증거는 전체 길이 중 아주 짧은 구간에 집중되어 있지만, 연산량은 증거의 위치와 무관하게 전체 시퀀스 길이에 비례해 늘어난다. 둘째, 모델에는 스스로 검증할 메커니즘이 없다. 첫 번째 패스에서 특정 모달리티를 충분히 살피지 못했거나, 정답이 실제로 오디오와 비주얼 두 모달리티의 결합을 필요로 하는 경우에도, 단일 패스 모델은 불완전한 증거만으로 답을 확정해야 하며 재검토의 여지가 없다. OmniSeek은 이 문제를 능동적 증거 획득 문제로 재정의한다. 모델은 먼저 가설을 세우고, 부족한 증거를 파악하고, 어느 시간 구간을 보거나 들어야 할지 결정한 뒤, 증거가 충분해질 때까지 이를 반복해야 하며, 입력 전체를 한 번에 수동적으로 소비해서는 안 된다는 것이다.
핵심 아키텍처와 기술 원리
OmniSeek은 Omni-LLM을 네이티브 도구 호출 능력을 갖춘 다중 턴 추론 에이전트로 재구성한다. 추론은 단일 순전파가 아니라 반복적 프로토콜로 진행된다. 각 턴에서 모델은 현재 컨텍스트를 바탕으로 추론하고, '보기' 또는 '듣기' 도구를 호출할지 결정하며, 가져오고 싶은 구간의 시간 창을 구체적으로 지정한다. 검색된 원본 오디오 또는 비주얼 세그먼트는 컨텍스트에 다시 결합되고, 모델이 증거가 충분하다고 판단할 때까지 이 순환이 반복된다. 이러한 다중 턴 도구 사용 행동을 콜드스타트하기 위해 연구진은 데이터 합성 엔진을 구축해, 오디오와 비주얼 증거 검색 및 추론 단계가 모달리티를 넘나들며 교차 배치된 다단계 사고 연쇄 궤적 17만 건 규모의 OmniTraj-170K 코퍼스를 만들었다. 학습은 두 단계로 진행된다. 먼저 이 합성 궤적으로 지도 미세조정을 수행해 '추론하고, 무엇을 검색할지 결정하고, 증거를 다시 접합하고, 다시 추론한다'는 행동 패턴을 심어준다. 이어서 검증 가능한 보상을 사용하는 2단계 강화학습으로 모방 학습을 넘어 과제 수준의 정답 신호에 맞춰 검색 및 추론 정책을 정교화한다. 가장 특징적인 설계는 '오디오-비주얼 필요성' 목표로, 정답에 이르는 과정이 실제로 두 모달리티의 증거 모두에 의존하는 궤적을 명시적으로 보상해, 실제로 요구되는 모달리티 간 추론 없이 단일 모달리티 지름길로 우연히 정답을 맞히는 행동을 억제한다.
실용성과 검증 결과
이 체계가 만들어내는 능력은 적응적인 모달리티 간 증거 탐색이다. 모델은 입력 전체를 균일하게 다루지 않고, 질문의 난이도와 증거 분포에 따라 몇 번 검색할지, 어느 시간 구간을 대상으로 할지, 오디오와 비주얼 중 무엇을 우선할지를 유연하게 결정한다. 다양한 오디오-비주얼 추론 벤치마크 전반에 걸친 광범위한 실험에서 OmniSeek은 전체 시퀀스를 한 번에 입력하는 기준 방법들을 일관되게 앞섰다. 중요한 점은 이러한 개선이 단일 모달리티 강화의 부수적 결과가 아니라, 오디오와 비주얼 증거를 실제로 결합해야 하는 사례들에 집중되어 나타난다는 것이며, 이는 '오디오-비주얼 필요성' 목표가 의도한 바로 그 경험적 신호로서, 모델이 단일 모달리티 지름길이 아니라 진정한 검색 기반 추론 능력을 학습했음을 뒷받침한다.
산업적 영향과 향후 전망
OmniSeek은 텍스트 전용 에이전트에서 이미 성숙한 네이티브 도구 사용 패러다임을 오디오-비주얼 이해 영역으로 들여오는, 멀티모달 에이전트 엔지니어링의 중요한 방향 전환을 보여준다. 모델 스스로 추가 지각 입력이 언제 필요한지 판단할 수 있게 되어, 긴 녹음이나 영상을 미리 고정된 외부 파이프라인으로 잘라내거나 요약할 필요가 없어진다. 이는 장편 영상 이해, 회의록 분석, 감시 및 보안 검토, 그리고 모달리티 간 대조 확인이 필요한 사실 확인 업무와 직접적으로 관련이 있다. 앞으로는 도구의 종류를 보기/듣기에서 더 풍부한 지각 및 검색 연산(외부 검색 증강 호출, 전용 객체 추적이나 음성 인식 서브모델 호출 등)으로 확장하고, 이 다중 턴 증거 탐색 루프를 더 길고 실시간에 가까운 스트리밍 입력과 결합해 실시간 오디오-비주얼 추론에 대응하는 방향이 유력하다.
Sources
FAQ
OmniSeek과 기존 수동적 단일 패스 Omni-LLM의 가장 큰 차이는 무엇인가?
기존 방식은 전체 오디오-비주얼 시퀀스를 한 번 인코딩해 단일 순전파로 추론하지만, OmniSeek은 모델이 다중 턴 추론 중 어느 시간 구간의 오디오 또는 비디오 증거를 검색할지 능동적으로 결정하고 이를 컨텍스트에 다시 결합해 추론을 이어가는 반복적 증거 획득 과정이라는 점이 다르다.
OmniTraj-170K 데이터셋은 어떤 용도로 쓰이는가?
오디오와 비주얼 증거 검색 및 추론 단계가 교차 배치된 다단계 사고 연쇄 궤적 약 17만 건을 담은 합성 코퍼스로, 지도 미세조정 단계에서 다중 턴 도구 사용 행동을 콜드스타트하는 데 쓰인다.
오디오-비주얼 필요성 목표는 어떤 문제를 방지하는가?
정답에 이르는 과정이 실제로 두 모달리티의 증거 모두에 의존하는 궤적에만 보상을 주어, 단일 모달리티 단서만으로 우연히 정답을 맞히는 지름길 행동을 억제한다.