OmniCapBench : décomposer l'évaluation des légendes audio-visuelles en unités atomiques vérifiables

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OmniCapBench note les légendes audio-visuelles via des unités atomiques et vérifiables, en trois pistes : entités, plans visuels, événements audio. Ses 786 vidéos annotées révèlent dérive d'identité et désalignement intermodal.

Les grands modèles de langage multimodaux s'éloignent de l'époque où l'on regardait une image pour répondre à une question. On attend désormais d'eux qu'ils écoutent et regardent en même temps, qu'ils alignent le son et l'image sur une même ligne temporelle, et qu'ils se souviennent de la même personne ou du même objet pendant des dizaines de secondes, voire plusieurs minutes. Les capacités progressent vite. L'évaluation n'a pas suivi. Le légendage audio-visuel est une tâche de diagnostic attrayante, car une bonne légende doit couvrir qui est présent, comment la scène est montée et à quel moment chaque son survient. Pourtant, il est difficile de bien le mesurer. Une légende est un texte libre, une même scène admet d'innombrables formulations valables, et vérifier point par point comme reproduire un score reste malaisé. OmniCapBench, déposé sur arXiv le 8 octobre 2026 dans la catégorie cs.CV, vise précisément cette lacune.

Les auteurs soutiennent que les bancs d'essai existants sont pris dans un compromis couplé. La première famille note la légende entière avec un seul chiffre. Elle offre une large couverture, mais elle ne dit pas où le modèle s'est trompé, car omissions, hallucinations et désalignements se fondent dans un même score. La deuxième famille utilise des sondes locales, qui interrogent un détail précis. La localisation est claire, mais la couverture est mince, et un autre jeu de sondes pourrait mener à un autre verdict. Un troisième problème vient du correcteur lui-même. Un juge LLM sans contraintes peut varier selon l'invite, la longueur de la légende et de petits changements de formulation. Couverture, localisation et stabilité existent chacune isolément. Les réunir restait un problème ouvert. Le geste central d'OmniCapBench consiste à changer la cible de prédiction. Le texte libre cesse d'être le produit final. L'objet évalué devient un ensemble d'unités atomiques et vérifiables, organisées en trois pistes : références d'entités, plans visuels et événements audio. La piste des entités demande si le modèle continue de désigner la même personne ou le même objet au fil du temps. La piste des plans examine l'évolution de l'image et le contenu de chaque plan. La piste audio examine quels sons surviennent et quand. La notation comporte aussi deux couches. Les contraintes qu'une règle peut trancher, par exemple la présence d'un événement ou le bon ordre de deux événements, passent par des contrôles déterministes. Les parties qui exigent vraiment du sens vont vers une comparaison locale par LLM, qui confine le juge à une petite unité. Le banc d'essai repose sur 786 vidéos densément annotées.

Cette conception profondément structurée apporte un bénéfice d'ingénierie qui dépasse la propreté de la notation. Le texte libre se note mal de façon reproductible, parce que le juge doit trancher dans un espace ouvert de formulations possibles. Les unités atomiques découpent cet espace en nombreuses questions fermées : cette personne réapparaît-elle au deuxième plan, le bruit de l'explosion précède-t-il ou suit-il le moment où le personnage se retourne. Une question fermée peut souvent être réglée par une règle. Seul ce que les règles ne tranchent pas passe à la comparaison sémantique, et même alors le juge lit un court passage avec peu de contexte, si bien que la variation d'une exécution à l'autre devrait être plus faible. Un banc d'essai public a besoin de cette propriété, car les équipes doivent pouvoir répéter les chiffres des autres.

Le second grand bénéfice est que les erreurs deviennent classables. Selon l'article, le banc d'essai sépare quatre types d'erreurs de perception des MLLM. L'échec d'ancrage temporel place un événement au mauvais moment. La dérive d'identité traite la même personne comme une autre plus tard dans l'extrait. Le désalignement intermodal associe un son à la mauvaise image. La description hallucinée invente un contenu absent de la vidéo. Dans un score global, ces problèmes se brouillent, et le développeur apprend seulement que son modèle est un peu moins bon qu'un concurrent. Avec des unités rattachées à des pistes, chaque mode d'échec peut être suivi séparément, et les équipes peuvent décider s'il faut changer les données, l'architecture ou l'objectif d'entraînement. L'évaluation des modèles de pointe donne une image utile : une perception locale forte, un raisonnement audio-visuel de longue portée faible. Un modèle peut dire ce qui apparaît dans un plan et quel son l'on entend à un instant donné, mais il peine à rester cohérent sur une durée plus longue. La dérive d'identité et le désalignement intermodal sont cités comme les faiblesses les plus marquées. Cela rejoint une expérience courante chez les développeurs : on découpe une longue vidéo en extraits, chaque extrait est bien décrit, mais le récit recollé se contredit. Le résumé ne donne aucun score. L'ampleur des écarts entre modèles, et le type d'erreur dominant, ne peuvent donc pas être indiqués ici. Qui cite ce résultat devrait se reporter aux tableaux de l'article. Pour les développeurs, la question pratique est de savoir comment employer un tel banc d'essai. Une approche consiste à lire les trois pistes séparément plutôt que de les fusionner en un classement. Si un modèle mène sur les plans visuels mais traîne sur les références d'entités, l'encodeur visuel est peut-être sain, et le problème se situe dans la mémoire et la liaison à travers le temps. S'il traîne sur les événements audio, l'encodage audio ou l'entraînement à l'alignement son-image est peut-être insuffisant. Cette décomposition donne aux études d'ablation une mesure claire et permet à des groupes distincts de reproduire leurs conclusions sur les mêmes unités. Du point de vue de l'industrie, la valeur d'un tel banc d'essai est de fournir une feuille de route. À mesure que les modèles omnimodaux entrent dans la compréhension vidéo, l'assistance en direct, le sous-titrage d'accessibilité et la perception robotique, la cohérence d'identité sur de longues durées et l'alignement du son et de l'image comptent davantage que la reconnaissance d'une seule image. Une évaluation structurée permet à une équipe d'orienter un budget de recherche limité vers le maillon le plus faible. Un peu de prudence reste de mise. Un ensemble de 786 vidéos est de taille modeste. La façon de découper les atomes peut favoriser un contenu facile à énumérer. La comparaison locale par LLM peut encore porter un biais résiduel. Malgré tout, remplacer un score global par des unités localisables et revérifiables est une direction solide, que les équipes d'évaluation et de modélisation ont intérêt à suivre.

Sources

FAQ

Qu'est-ce qui distingue OmniCapBench des bancs d'essai précédents de légendage audio-visuel ?

Il ne note pas une légende libre avec un seul chiffre. La cible de prédiction devient un ensemble d'unités d'évaluation atomiques et vérifiables, réparties en trois pistes : références d'entités, plans visuels et événements audio. On garde la couverture, on localise les erreurs et on réduit la dépendance à un juge LLM sans contraintes.

Quels types d'erreurs le banc d'essai permet-il de distinguer ?

Le résumé en nomme quatre : échecs d'ancrage temporel, dérive d'identité, désalignement intermodal et descriptions hallucinées. Les modèles de pointe perçoivent bien le local, mais raisonnent mal sur de longues durées audio-visuelles. La dérive d'identité et le désalignement intermodal sont les points les plus faibles.

La notation dépend-elle entièrement d'un juge LLM ?

Non. La notation comporte deux couches. Des contrôles de contraintes déterministes traitent tout ce qu'une règle peut trancher. Des comparaisons sémantiques locales par LLM ne traitent que les parties qui exigent du sens. Le juge lit une petite unité, non une légende entière, d'où des résultats plus stables.