OmniCapBench:把音视频描述评测拆成可验证的原子单元
OmniCapBench 把音视频描述评测的预测目标,从自由文本改为原子、可验证的评估单元集合,覆盖实体指代、视觉镜头、音频事件三条轨道,含 786 段密集标注视频。评分用确定性约束检查加局部 LLM 语义比较,能区分时间定位失败、身份漂移、跨模态错位与幻觉。评测显示前沿模型局部感知强,但长程音视频推理弱。
多模态大语言模型正在从“看一张图、回答一个问题”,走向持续的音频与视频联合推理。模型要同时听见声音、看清画面,还要把两者在时间轴上对齐,并在几十秒甚至几分钟里记住同一个人、同一件物体。能力在变强,评测却没有跟上。音视频描述是检验这种能力的理想诊断任务,因为一段好的描述必须同时覆盖谁在场、画面如何切换、声音何时出现。但要把它测准,一直是个难题:描述是自由文本,同一个画面有无数种合法说法,既难以逐项核对,也难以复现。OmniCapBench 这篇论文针对的正是这个问题,于 2026 年 10 月 8 日发布在 arXiv,分类为 cs.CV。
作者先指出现有基准陷入一种耦合的取舍。第一类做法是对整段描述打一个总分,它覆盖面广,却说不清错在哪里,一个总分里混着遗漏、幻觉和错位。第二类做法是设计局部探针,针对某个具体细节提问,定位清楚,却只能覆盖很小一部分内容,换一批探针结论就可能不同。第三个问题来自评分者本身:让一个不受约束的 LLM 当裁判,它的判断会随提示词、随长度、随措辞而波动,稳定性不足。覆盖、定位、稳定,三者很难同时得到。 OmniCapBench 的核心思路是改变预测目标。它不再把自由文本当作最终产物,而是把评测对象拆成一组原子的、可验证的评估单元,并按三条轨道组织:实体指代、视觉镜头、音频事件。实体指代检查模型是否在不同时刻始终指向同一个人或物;视觉镜头检查画面切换与镜头内容;音频事件检查声音的类型与出现时间。评分也分两层。凡是能硬判定的约束,例如某个事件是否出现、顺序是否正确,用确定性检查完成;确实需要理解语义的部分,则交给局部的 LLM 比较,把裁判的判断范围压到一个很小的单元内。基准共有 786 段密集标注的视频,这是它的标注底座。
把评测单元做小,还有一层工程上的好处。自由文本的评分难以复现,是因为同一句话可以有很多种合法写法,裁判必须在开放空间里做判断。原子单元把开放空间切成了许多封闭的小问题:这个人是否在第二个镜头里再次出现,这个爆炸声是否发生在人物转身之前。封闭问题可以被规则直接检查,规则查不了的才进入语义比较,而且比较的对象只是一小段文字,上下文很短,波动自然更小。换一个裁判模型、换一次运行,结果更可能保持一致,这正是一个公共基准最需要的性质。 这种“深度结构化”的设计带来的最大好处,是错误可以归类。论文称,它能区分四类 MLLM 感知错误:时间定位失败,即事件发生在哪一刻被说错;身份漂移,即同一个人在后半段被当成另一个人;跨模态错位,即声音和画面对不上;以及幻觉描述,即写出视频里根本没有的内容。过去这些问题会一起被压进一个分数,开发者只知道模型“差一点”,却不知道该改数据、改架构还是改训练目标。现在每一类错误都有对应的单元和轨道,可以单独追踪。 对开发者而言,更实际的问题是如何使用这样的基准。一种做法是把三条轨道的得分分开看,而不是合成一个排名:如果某个模型在视觉镜头轨道领先、在实体指代轨道落后,说明它的视觉编码器不差,问题在跨时间的记忆与绑定;如果音频事件轨道落后,则可能是音频编码或音画对齐训练不足。这种分解让消融实验有了明确的观察指标,也让不同团队可以围绕同一套单元复现彼此的结论。 对前沿模型的评测给出了一个有启发性的画像:局部感知很强,长程音视频推理偏弱。换句话说,模型能认出一个镜头里有什么、一个瞬间听到了什么,但很难在较长的时间跨度里保持一致。其中身份漂移与跨模态错位最为突出。这与许多开发者的直觉相符:把长视频切成片段喂给模型,每一段都答得不错,拼起来却前后矛盾。需要说明的是,摘要没有给出具体分数,各模型的差距有多大、哪一类错误占比最高,需要读全文才能判断,此处不做推断。读者在引用结论时,也应以论文给出的原始表格为准。
从行业角度看,这类基准的价值在于给出一张“路线图”。当全模态模型要进入视频理解、直播辅助、无障碍描述、机器人感知等场景时,长时间的身份一致性和音画对齐比单帧识别更关键。结构化评测让团队能够把有限的研发预算投向最薄弱的环节。当然也要保持审慎:786 段视频的规模有限,原子单元的拆分方式可能偏向容易枚举的内容,局部 LLM 比较仍可能带有残余偏差。但把评测从“一个总分”改成“可定位、可复核的单元”,这个方向本身是扎实的,值得评测与模型团队持续跟进。
Sources
FAQ
OmniCapBench 与以往音视频描述基准最大的区别是什么?
它不再对整段自由文本打一个总分,而是把预测目标改成原子、可验证的评估单元集合,分属实体指代、视觉镜头、音频事件三条轨道。这样既保留覆盖面,又能定位错误出在哪里,同时减少对不受约束的 LLM 裁判的依赖。
这个基准能区分哪些典型错误?
论文摘要列出四类:时间定位失败、身份漂移、跨模态错位和幻觉描述。前沿模型在局部感知上表现较强,但在长程音视频推理上偏弱,身份漂移和跨模态错位尤其突出。
评分是否完全依赖 LLM 裁判?
不是。评分分两层:先用确定性的约束检查处理能硬判定的部分,再用局部的 LLM 语义比较处理需要理解含义的部分。LLM 只在小范围内比较,因此稳定性比整段打分更高。