OmniCapBench:音声・映像キャプション評価を検証可能な原子単位に分解する
OmniCapBench は、音声・映像キャプションの評価対象を自由文から、原子的で検証可能な評価単位の集合へ置き換える。エンティティ参照、視覚ショット、音声イベントの三トラックと、密にアノテーションされた786本の動画を備え、時間的接地の失敗、同一性のドリフト、モダリティ間のずれ、幻覚を切り分ける。
マルチモーダル大規模言語モデルは、一枚の画像を見て一つの質問に答える段階から、音声と映像を同時に扱い続ける段階へ移りつつある。モデルは音を聞き、画面を見て、両者を同じ時間軸上で対応づけ、数十秒から数分にわたって同じ人物や物体を覚えておかなければならない。能力は急速に伸びているが、評価の整備は追いついていない。音声・映像キャプションは、この能力を診断するのに適した課題である。良い記述は、誰がいるか、場面がどう切り替わるか、いつどの音が鳴るかを同時に押さえる必要があるからだ。ところが、これを正確に測るのは難しい。キャプションは自由文であり、同じ場面にも無数の妥当な言い方があるため、項目ごとの照合も、点数の再現も容易ではない。2026年10月8日に cs.CV として arXiv に投稿された OmniCapBench は、まさにこの空白を狙った研究である。
著者らは、既存のベンチマークが結びついたトレードオフに陥っていると指摘する。第一の方式は、キャプション全体に一つの点数を付ける。網羅性は高いが、どこで誤ったのかは分からない。欠落も幻覚もずれも、一つの点数に溶け込んでしまうからである。第二の方式は、特定の細部を問う局所的なプローブである。位置は明確だが、カバーする範囲は狭く、プローブの組を変えれば結論も変わりうる。第三の問題は採点者そのものにある。制約のない LLM 審判は、プロンプトや文の長さ、言い回しの小さな違いで判断が揺れる。網羅性、位置の特定、安定性は、それぞれ単独なら得られる。三つを同時に満たすことが未解決の課題だった。 OmniCapBench の中心となる発想は、予測対象を変えることである。自由文はもはや最終成果物ではない。評価の対象は、原子的で検証可能な評価単位の集合になり、エンティティ参照、視覚ショット、音声イベントの三トラックに整理される。エンティティ参照のトラックは、モデルが時間を通じて同じ人物や物体を指し続けているかを問う。視覚ショットのトラックは、画面の切り替わりと各ショットの内容を調べる。音声イベントのトラックは、どんな音がいつ鳴るかを調べる。採点も二層である。イベントが現れるか、順序が正しいかといった規則で決められる制約は、決定的なチェックで処理する。意味の理解が本当に必要な部分だけを局所的な LLM 比較に回し、審判の判断範囲を小さな単位に閉じ込める。土台となるのは、密にアノテーションされた786本の動画である。
この深い構造化には、採点の明快さを超える工学的な利点がある。自由文の採点が再現しにくいのは、審判が開かれた言い回しの空間の中で判断しなければならないからだ。原子単位は、その開かれた空間を多数の閉じた問いに切り分ける。この人物は二つ目のショットで再び現れるか。爆発音は人物が振り向く前か後か。閉じた問いは規則だけで決着することが多い。規則で決まらないものだけが意味比較に進み、その場合でも審判が読むのは短い文章で、文脈も少ない。そのため、実行ごとのばらつきは小さくなると期待できる。公開ベンチマークには、他のチームが同じ数字を再現できることが欠かせない。 第二の大きな利点は、誤りを分類できることである。論文によれば、このベンチマークは MLLM の知覚誤りを四種に区別できる。時間的接地の失敗は、出来事を誤った時刻に置く。同一性のドリフトは、同じ人物を後半で別人として扱う。モダリティ間のずれは、音を誤った映像と結びつける。幻覚的な記述は、動画にない内容を作り出す。キャプション全体の点数では、これらは一つに混ざり、開発者はモデルが少し劣るとしか分からない。単位がトラックに結びついていれば、失敗の型ごとに追跡でき、データ、アーキテクチャ、学習目標のどこを変えるべきかを判断しやすくなる。 最先端モデルの評価からは、局所的な知覚は強いが、長い時間にわたる音声・映像推論は弱いという像が得られる。一つのショットに何が映り、一瞬に何が聞こえるかは答えられても、長い区間で一貫性を保つのは苦手である。特に同一性のドリフトとモダリティ間のずれが顕著な弱点とされる。長い動画を短い断片に切って与えると、各断片の記述は良いのに、つなぎ合わせると矛盾する。この経験は多くの開発者に共通する。ただし、要旨には具体的なスコアがなく、モデル間の差の大きさや、どの誤りが最も多いかは、ここでは述べられない。結果を引用する際は、論文の表を確認すべきである。
開発者にとっての実際的な問いは、このベンチマークをどう使うかである。一つの方法は、三トラックを一つの順位にまとめず、別々に読むことだ。視覚ショットで先行しながらエンティティ参照で遅れるモデルなら、視覚エンコーダは健全で、問題は時間をまたぐ記憶と結びつけにあるのかもしれない。音声イベントで遅れるなら、音声の符号化や音と映像の対応づけの学習が不足している可能性がある。この分解により、アブレーション実験に明確な指標が与えられ、別のグループも同じ単位で互いの結論を再現できる。 産業の視点では、この種のベンチマークの価値は道筋を示すことにある。オムニモーダルなモデルが動画理解、ライブ支援、アクセシビリティ向けの字幕、ロボットの知覚へ入っていくとき、長い区間にわたる同一性の一貫性と音と映像の対応は、単一フレームの認識より重要になる。構造化された評価により、限られた研究予算を最も弱い部分に向けられる。もちろん慎重さも要る。786本という規模は控えめであり、原子の切り分け方は列挙しやすい内容に偏る可能性があり、局所的な LLM 比較にも残差の偏りがありうる。それでも、一つの総合点を、位置を特定でき再確認できる単位に置き換えるという方向は堅実であり、評価とモデル開発の両チームが注視する価値がある。
Sources
FAQ
OmniCapBench は従来の音声・映像キャプション評価と何が違うのか。
キャプション全体に一つの点数を付けるのではなく、予測対象を原子的で検証可能な評価単位の集合に変える。単位はエンティティ参照、視覚ショット、音声イベントの三トラックに分かれる。網羅性を保ちつつ誤りの位置を特定でき、制約のない LLM 審判への依存も抑えられる。
この評価でどのような誤りを区別できるのか。
論文の要旨は、時間的接地の失敗、同一性のドリフト、モダリティ間のずれ、幻覚的な記述の四種を挙げている。最先端モデルは局所的な知覚に強い一方、長い時間にわたる音声・映像推論に弱く、特に同一性のドリフトとモダリティ間のずれが目立つ。
採点は LLM 審判だけに頼っているのか。
頼っていない。採点は二層である。規則で判定できる部分は決定的な制約チェックで処理し、意味の理解が必要な部分だけを局所的な LLM による意味比較に回す。審判が見るのは小さな単位であり、全体採点より結果が安定しやすい。