OmniSeek : intégration native d'outils pour le raisonnement audiovisuel multi-tours

Published · AI Daily — AI-assisted deep research, methodology & disclosure

OmniSeek transforme un modèle de langage omnimodal en un agent de raisonnement actif à plusieurs tours, capable d'appeler nativement des outils pour « regarder » ou « écouter » à la demande plutôt que de traiter toute une séquence audiovisuelle en un seul passage. Il récupère itérativement des fenêtres d'évidence épars et les réinjecte dans le contexte. Démarré à froid sur un corpus synthétique de 170 000 trajectoires de chaîne de pensée multi-saut, puis affiné par un apprentissage par renforcement en deux étapes à récompenses vérifiables, complété par un objectif de nécessité audiovisuelle qui pénalise les raccourcis mono-modaux, le système améliore systématiquement le raisonnement audiovisuel sur plusieurs benchmarks.

Contexte et définition du problème

La plupart des Omni-LLM qui traitent conjointement l'audio, la vidéo et le texte traitent encore une séquence audiovisuelle entière en un seul passage avant : l'enregistrement complet est encodé une fois puis transmis au modèle pour un raisonnement en une seule passe. Ce paradigme passif se heurte à deux problèmes structurels dès que les séquences s'allongent. Premièrement, le signal est dilué : les quelques secondes qui portent réellement la preuve décisive sont noyées dans des heures d'audio ou des milliers d'images vidéo, alors que le coût de calcul croît avec la longueur totale de la séquence, indépendamment de l'emplacement de la preuve.

Deuxièmement, le modèle n'a aucun mécanisme pour revenir en arrière et se vérifier lui-même. Si le premier passage sous-échantillonne une modalité, ou si la bonne réponse exige réellement de combiner des indices audio et visuels, un modèle à passe unique doit s'engager sur une réponse construite sur des preuves incomplètes, sans possibilité de réexamen. OmniSeek reformule la compréhension audiovisuelle comme un problème d'acquisition active de preuves : le modèle doit formuler une hypothèse, identifier ce qui manque, décider s'il doit regarder ou écouter et sur quelle fenêtre temporelle, puis répéter jusqu'à ce que les preuves soient suffisantes, plutôt que de consommer passivement l'intégralité de l'entrée en une fois.

Architecture centrale et principes techniques

OmniSeek enveloppe un Omni-LLM dans un agent de raisonnement à plusieurs tours doté d'un appel natif d'outils. Le raisonnement ne se déroule plus en une seule passe mais comme un protocole itératif : à chaque tour, le modèle raisonne sur le contexte courant, décide s'il doit invoquer un outil « regarder » ou « écouter », et précise la fenêtre temporelle du segment qu'il souhaite récupérer. Le segment audio ou visuel brut récupéré est réinjecté dans le contexte, et le cycle se répète jusqu'à ce que le modèle juge les preuves suffisantes pour répondre.

Pour amorcer ce comportement d'appel d'outils à plusieurs tours, les auteurs ont construit un moteur de génération de données qui synthétise OmniTraj-170K, un vaste corpus de trajectoires de chaîne de pensée multi-saut où les étapes de récupération de preuves et de raisonnement s'entrelacent entre modalités. L'entraînement se déroule en deux étapes : un réglage fin supervisé sur ces trajectoires synthétiques instille d'abord le schéma « raisonner, décider quoi récupérer, réinjecter la preuve, raisonner à nouveau », puis une phase d'apprentissage par renforcement en deux étapes avec récompenses vérifiables affine la politique de récupération et de raisonnement contre des signaux de correction au niveau de la tâche plutôt que par simple imitation. Le choix de conception le plus distinctif est l'objectif de nécessité audiovisuelle, qui récompense explicitement les trajectoires dont la conclusion correcte dépend réellement de preuves provenant des deux modalités, découragent directement le modèle d'exploiter des raccourcis mono-modaux qui donnent la bonne réponse sans effectuer le raisonnement cross-modal réellement exigé par la tâche.

Évaluation pratique et applications

La capacité qui en résulte est une recherche adaptative de preuves cross-modales : plutôt que de traiter uniformément l'ensemble de l'entrée, le modèle décide du nombre de cycles de récupération, des fenêtres temporelles à cibler, et s'il faut privilégier l'inspection audio ou visuelle selon la difficulté et la distribution des preuves propres à chaque question.

Sur un large ensemble de benchmarks de raisonnement audiovisuel, OmniSeek surpasse de manière cohérente les méthodes de référence qui ingèrent la séquence entière en une seule passe. Fait crucial, ces gains ne sont pas un artefact de l'amélioration d'une seule modalité isolée : ils se concentrent sur les cas qui exigent réellement de combiner des preuves audio et vidéo, ce qui constitue précisément la signature empirique que l'objectif de nécessité audiovisuelle visait à produire, et qui confirme que le modèle a appris une véritable compétence de raisonnement par récupération plutôt qu'un raccourci mono-modal.

Impact sur l'industrie et perspectives

OmniSeek marque un virage significatif dans l'ingénierie des agents multimodaux : il importe le paradigme d'appel natif d'outils, déjà mature chez les agents purement textuels, dans la compréhension audiovisuelle, en laissant le modèle décider lui-même quand il a besoin d'entrées perceptuelles supplémentaires plutôt que de dépendre d'un pipeline de prétraitement externe figé pour pré-découper ou résumer de longs enregistrements.

Cela présente un intérêt direct pour la compréhension de vidéos longues, l'analyse de transcriptions de réunions, la revue de surveillance et de sécurité, ainsi que les flux de vérification des faits exigeant une corroboration cross-modale, des contextes tous caractérisés par des preuves rares noyées dans un long contexte, exactement le régime que vise OmniSeek. À l'avenir, des extensions plausibles incluent l'élargissement de la palette d'outils au-delà de regarder/écouter vers des opérations de perception et de récupération plus riches, ainsi que le couplage de cette boucle de recherche de preuves à plusieurs tours avec des flux en continu plus longs et en temps réel.

Sources

FAQ

Quelle est la différence fondamentale entre OmniSeek et les Omni-LLM passifs à passe unique ?

OmniSeek transforme le raisonnement en un protocole itératif à plusieurs tours où le modèle appelle nativement des outils « regarder » ou « écouter » pour récupérer des fenêtres temporelles précises de preuves audio ou vidéo et les réinjecte dans le contexte, au lieu d'encoder toute la séquence une seule fois pour un raisonnement en une passe.

Comment le modèle est-il amorcé pour effectuer un appel d'outils à plusieurs tours ?

Les auteurs construisent un moteur de données qui synthétise OmniTraj-170K, un corpus de trajectoires de chaîne de pensée multi-saut avec des étapes de récupération de preuves et de raisonnement entrelacées entre modalités, utilisé pour un réglage fin supervisé avant l'apprentissage par renforcement.

Que prévient l'objectif de nécessité audiovisuelle ?

Il empêche le modèle d'exploiter des raccourcis mono-modaux : les trajectoires qui atteignent la bonne réponse en utilisant les indices d'une seule modalité sans effectuer le raisonnement cross-modal réellement requis ne sont pas récompensées.