OmniCapBench: 오디오·비디오 캡션 평가를 검증 가능한 원자 단위로 분해하다
OmniCapBench는 오디오·비디오 캡션 평가의 예측 대상을 자유 서술에서 원자적이고 검증 가능한 평가 단위의 집합으로 바꾼다. 개체 참조, 시각 샷, 오디오 이벤트의 세 트랙과 촘촘히 주석된 786개 영상으로 시간적 접지 실패, 정체성 드리프트, 모달리티 간 불일치, 환각을 가려낸다.
멀티모달 대규모 언어 모델은 이미지 한 장을 보고 질문 하나에 답하던 단계에서 벗어나고 있다. 이제 모델은 소리를 듣고 화면을 보면서 둘을 같은 시간축에서 맞추고, 수십 초에서 수 분에 이르는 동안 같은 사람과 같은 사물을 기억해야 한다. 능력은 빠르게 오르고 있지만 평가는 그 속도를 따라가지 못했다. 오디오·비디오 캡션은 이런 능력을 진단하기에 알맞은 과제이다. 좋은 서술은 누가 있는지, 장면이 어떻게 전환되는지, 어떤 소리가 언제 나는지를 한꺼번에 담아야 하기 때문이다. 그러나 이를 정확히 재기는 어렵다. 캡션은 자유 서술이고, 같은 장면에도 타당한 표현이 무수히 많아서 항목별 대조도, 점수 재현도 쉽지 않다. 2026년 10월 8일 cs.CV로 arXiv에 올라온 OmniCapBench는 바로 이 틈을 겨냥한다.
저자들은 기존 벤치마크가 서로 얽힌 상충 관계에 빠져 있다고 지적한다. 첫째 방식은 캡션 전체에 점수 하나를 준다. 포괄성은 넓지만 어디서 틀렸는지 알 수 없다. 누락, 환각, 불일치가 한 점수 안에 섞이기 때문이다. 둘째 방식은 특정 세부 사항을 묻는 국소 프로브이다. 위치는 분명하지만 다루는 범위가 좁고, 프로브 묶음이 바뀌면 결론도 달라질 수 있다. 셋째 문제는 채점자 자체에 있다. 제약 없는 LLM 심판은 프롬프트, 캡션 길이, 표현의 작은 차이에 따라 판단이 흔들린다. 포괄성, 위치 특정, 안정성은 각각 따로는 얻을 수 있었다. 세 가지를 동시에 만족시키는 것이 미해결 과제였다.
OmniCapBench의 핵심 발상은 예측 대상을 바꾸는 것이다. 자유 서술은 더 이상 최종 산출물이 아니다. 평가 대상은 원자적이고 검증 가능한 평가 단위의 집합이 되며, 개체 참조, 시각 샷, 오디오 이벤트의 세 트랙으로 정리된다. 개체 참조 트랙은 모델이 시간이 흘러도 같은 사람이나 사물을 계속 가리키는지 묻는다. 시각 샷 트랙은 화면이 어떻게 바뀌고 각 샷에 무엇이 있는지 살핀다. 오디오 이벤트 트랙은 어떤 소리가 언제 나는지 살핀다. 채점도 두 층이다. 이벤트가 나타나는지, 순서가 맞는지처럼 규칙으로 정할 수 있는 제약은 결정적 검사로 처리한다. 의미 이해가 정말 필요한 부분만 국소적 LLM 비교로 넘기고, 심판의 판단 범위를 작은 단위 안에 가둔다. 토대는 촘촘히 주석된 786개 영상이다.
이런 깊은 구조화에는 채점이 깔끔해지는 것 이상의 공학적 이점이 있다. 자유 서술이 재현 가능하게 채점되기 어려운 까닭은 심판이 열린 표현 공간 안에서 판단해야 하기 때문이다. 원자 단위는 그 열린 공간을 닫힌 질문 여러 개로 자른다. 이 사람이 두 번째 샷에서 다시 나타나는가. 폭발음이 인물이 돌아서기 전에 나는가, 후에 나는가. 닫힌 질문은 규칙만으로 결판나는 경우가 많다. 규칙으로 정해지지 않는 것만 의미 비교로 가고, 그때도 심판이 읽는 것은 문맥이 적은 짧은 글이므로 실행마다 생기는 편차는 작아질 것으로 기대된다. 공개 벤치마크에는 다른 팀이 같은 숫자를 재현할 수 있다는 성질이 꼭 필요하다.
두 번째 큰 이점은 오류를 분류할 수 있다는 점이다. 논문에 따르면 이 벤치마크는 MLLM의 지각 오류를 네 가지로 구분한다. 시간적 접지 실패는 사건을 틀린 시점에 둔다. 정체성 드리프트는 같은 사람을 영상 후반에 다른 사람으로 취급한다. 모달리티 간 불일치는 소리를 엉뚱한 화면과 짝짓는다. 환각적 서술은 영상에 없는 내용을 지어낸다. 캡션 전체 점수에서는 이 문제들이 하나로 뭉개져, 개발자는 모델이 경쟁 모델보다 조금 못하다는 것만 알게 된다. 단위가 트랙에 묶여 있으면 실패 유형별로 따로 추적할 수 있고, 데이터, 아키텍처, 학습 목표 가운데 무엇을 바꿔야 할지 판단하기 쉬워진다. 최첨단 모델의 평가는 쓸모 있는 그림을 준다. 국소적 지각은 강하고, 긴 시간에 걸친 오디오·비디오 추론은 약하다. 모델은 한 샷에 무엇이 나오는지, 한순간에 어떤 소리가 들리는지는 답하지만, 더 긴 구간에서 일관성을 유지하는 데는 애를 먹는다. 특히 정체성 드리프트와 모달리티 간 불일치가 가장 뚜렷한 약점으로 꼽힌다. 많은 개발자의 경험과도 맞는다. 긴 영상을 짧은 조각으로 잘라 넣으면 조각마다 서술은 좋은데, 이어 붙인 이야기는 앞뒤가 맞지 않는다. 다만 초록에는 구체적인 점수가 없어서 모델 간 격차가 얼마나 큰지, 어떤 오류가 가장 많은지는 여기서 말할 수 없다. 결과를 인용할 때는 논문의 표를 확인해야 한다.
개발자에게 실제적인 질문은 이런 벤치마크를 어떻게 쓰느냐이다. 한 가지 방법은 세 트랙을 하나의 순위로 합치지 않고 따로 읽는 것이다. 시각 샷에서는 앞서면서 개체 참조에서 뒤처지는 모델이라면, 시각 인코더는 건전하고 문제는 시간을 가로지르는 기억과 결합에 있을 수 있다. 오디오 이벤트에서 뒤처진다면 오디오 인코딩이나 소리와 화면을 맞추는 학습이 부족할 가능성이 있다. 이렇게 나누면 절제 실험에 분명한 지표가 생기고, 다른 그룹도 같은 단위 위에서 서로의 결론을 재현할 수 있다. 산업의 관점에서 이런 벤치마크의 가치는 로드맵을 준다는 데 있다. 옴니모달 모델이 영상 이해, 실시간 보조, 접근성 자막, 로봇 지각으로 들어갈수록 긴 구간의 정체성 일관성과 소리·화면 정렬은 단일 프레임 인식보다 중요해진다. 구조화된 평가는 한정된 연구 예산을 가장 약한 고리로 돌리게 해 준다. 신중함도 필요하다. 786개 영상은 규모가 크지 않다. 원자를 나누는 방식이 열거하기 쉬운 내용에 치우칠 수 있고, 국소적 LLM 비교에도 잔여 편향이 남을 수 있다. 그럼에도 하나의 총점을 위치를 특정하고 다시 확인할 수 있는 단위로 바꾸는 방향은 탄탄하며, 평가 팀과 모델 팀이 계속 지켜볼 만하다.
Sources
FAQ
OmniCapBench는 기존 오디오·비디오 캡션 벤치마크와 무엇이 다른가?
자유 서술 캡션 전체에 점수 하나를 매기지 않는다. 예측 대상을 원자적이고 검증 가능한 평가 단위의 집합으로 바꾸고, 이를 개체 참조, 시각 샷, 오디오 이벤트의 세 트랙으로 나눈다. 포괄성을 유지하면서 오류 위치를 특정할 수 있고, 제약 없는 LLM 심판에 대한 의존도 줄어든다.
이 벤치마크는 어떤 오류를 구분할 수 있는가?
논문 초록은 네 가지를 든다. 시간적 접지 실패, 정체성 드리프트, 모달리티 간 불일치, 환각적 서술이다. 최첨단 모델은 국소적 지각에는 강하지만 긴 시간에 걸친 오디오·비디오 추론에는 약하며, 특히 정체성 드리프트와 모달리티 간 불일치가 두드러진다.
채점은 전적으로 LLM 심판에 의존하는가?
그렇지 않다. 채점은 두 층이다. 규칙으로 판정할 수 있는 부분은 결정적 제약 검사가 처리하고, 의미 이해가 필요한 부분만 국소적 LLM 의미 비교가 맡는다. 심판은 캡션 전체가 아니라 작은 단위만 보므로 결과가 더 안정적일 것으로 기대된다.