MoTE : Un décodeur à mélange d'experts de tâches pour la compréhension vidéo multitâche

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

Cet article traite du défi auquel sont confrontés les modèles vidéo-langue procéduraux, qui doivent traiter simultanément des tâches hétérogènes telles que la reconnaissance d'action, la prédiction d'action et la prédiction de processus à partir des mêmes preuves visuelles. Il souligne que les décodeurs transformer denses partagent un seul réseau feedforward pour toutes les tâches, ce qui confuse facilement le comportement des différentes tâches et rend difficile l'extension contrôlée des capacités. Bien que les décodeurs MoE épars puissent fournir un calcul conditionnel, le routage appris au niveau du token ne s'aligne pas naturellement avec les objectifs procéduraux au niveau de la tâche. Les auteurs proposent MoTE (Mixture of Task Experts), qui transforme le réseau feedforward d'un grand modèle de langue en experts spécifiques à la tâche tout en conservant le backbone multimodal partagé. Chaque échantillon route selon une seule tâche pour activer les experts, découplant la quantité de calcul activé du nombre d'experts de tâche stockés. Les auteurs mettent en œuvre cela sous le nom de VideoLLM-MoTE et l'évaluent avec un routage de tâche explicite sur cinq benchmarks COIN. Le modèle à cinq experts active environ 2B de paramètres par échantillon, atteignant une précision moyenne top-1 qui dépasse les références récentes de VideoLLM, et surpasse l'activation dense d'experts complets et le contrôle de routage épars appris sous la même topologie d'experts, démontrant que le routage structuré par tâche est un schéma de décodage interprétable et efficace en calcul.

Contexte

Les modèles vidéo-langue procéduraux doivent traiter simultanément des tâches hétérogènes—reconnaissance d'action, prédiction d'action et prédiction de processus—à partir des mêmes preuves visuelles. Cette exigence crée une tension durable dans le domaine : un modèle doit partager une seule représentation visuelle tout en raisonnant différemment pour chaque tâche. Les auteurs formulent ce défi comme un problème de décodage, estimant que la structure du décodeur détermine si les tâches restent clairement séparées ou si elles se mélangent.

L'article met en évidence une faiblesse concrète de l'approche dominante. Les décodeurs transformer denses partagent un seul réseau feedforward pour toutes les tâches. Chaque tâche tirant parti des mêmes poids, les comportements se retrouvent imbriqués, rendant difficile l'isolement des capacités individuelles. Cette intrication complique également l'extension contrôlée des abilities spécifiques, car étendre une tâche perturbe inévitablement les paramètres partagés. Les auteurs soulignent qu'il s'agit d'une limitation structurelle, non d'un simple problème d'échelle.

Les décodeurs MoE épars offrent un calcul conditionnel économique, mais leur routage appris au niveau du token ne s'aligne pas naturellement avec les objectifs de tâche. Les décisions émergent de poids difficiles à relier à une sémantique claire. Le résultat est un décodeur efficace mais opaque, incapable de garantir qu'un calcul sert réellement la tâche visée. Ce décalage motive la proposition centrale du travail.

Analyse approfondie

Les auteurs proposent MoTE, le décodeur à mélange d'experts de tâches, qui restructure le réseau feedforward d'un grand modèle de langue en une série d'experts spécifiques à la tâche tout en conservant le backbone multimodal partagé. Chaque échantillon route selon une seule tâche pour activer les experts correspondants. Cette conception préserve l'efficacité du calcul conditionnel tout en faisant correspondre directement le résultat du routage à une tâche concrète, établissant un équilibre entre interprétabilité et coût.

Le mouvement technique clé réside dans le routage de tâche au niveau de l'échantillon plutôt que dans le routage appris au niveau du token. Chaque input suivant un chemin de tâche explicite, la quantité de calcul activé se découple du nombre total d'experts stockés. Cette propriété importe pour contrôler le coût d'inférence : la dépense ne croît pas linéairement avec le nombre de tâches, élément essentiel pour les systèmes devant constamment ajouter de nouvelles capacités. Le comportement du routage devient explicite et observable, enfoui à l'intérieur de poids épars apprenables.

L'entraînement exploite la combinaison d'un backbone partagé avec des experts de décodage spécifiques à la tâche, permettant d'optimiser séparément les representations visuelles et les capacités de raisonnement dans un cadre unifié. Cette structure prolonge le paradigme mature des décodeurs de grands modèles de langue tout en le retravaillant au niveau sémantique par routage de tâche, de sorte que le calcul conditionnel serve véritablement les objectifs de la compréhension vidéo procédurale.

Impact sur l'industrie

Les auteurs évaluent VideoLLM-MoTE sur cinq benchmarks COIN, pilotant le décodeur par routage de tâche explicite. Le modèle à cinq experts active environ deux milliards de paramètres de grand modèle de langue par échantillon, tout en atteignant une précision moyenne top-1 qui dépasse les méthodes de référence récentes de VideoLLM. Ces résultats positionnent l'approche de façon compétitive face aux systèmes contemporains malgré l'activation d'une fraction contrôlée de paramètres.

Les ablations et comparaisons contrôlées s'avèrent décisives. Sous la même topologie d'experts, MoTE surpasse à la fois le scheme d'activation dense d'experts complets et un groupe de contrôle à routage épars appris. Cette comparaison démontre que le routage structuré par tâche possède un avantage en efficacité et en performance, non qu'il se contente de l'égaler. Les preuves suggèrent que les gains d'interprétabilité ne s'achètent pas au prix de la précision.

Pour le déploiement industriel, le découplage du calcul activé d'avec les experts stockés signifie que le coût d'inférence reste contrôlable même à mesure que le portefeuille de tâches s'élargit. Cela importe pour les scènes nécessitant l'ajout continu de capacités. Le routage explicite rend également le comportement du modèle plus traçable, favorisant la confiance dans les domaines à haute fiabilité tels que la compréhension vidéo et l'analyse de processus. Pour la communauté open-source, combiner le paradigme des décodeurs de grands modèles de langue avec les mécanismes d'experts de tâche fournit une référence architecturale réutilisable.

Perspectives

Le travail établit le routage structuré par tâche comme un schéma de décodage interprétable et efficace en calcul pour l'apprentissage multitâche vidéo-langue. En montrant que des experts spécifiques à la tâche avec routage de l'échantillon surpassent les alternatives denses et épars-appries sous topologie identique, il offre une alternative concrète au routage opaque qui domine actuellement les systèmes d'experts épars.

La direction la plus prometteuse consiste à évoluer vers des systèmes accumulant de nombreuses capacités de tâche au fil du temps. Le calcul activé ne croissant pas avec le nombre d'experts stockés, l'architecture convient particulièrement aux produits ajoutant à plusieurs reprises de nouvelles fonctions sans augmentation proportionnelle des coûts. Le routage explicite soutient en outre le déploiement dans des cadres réglementés ou sensibles à la sécurité où la traçabilité est requise.

D'une manière plus large, l'approche pourrait s'étendre au-delà de la vidéo vers toute conditionnalité trans-tâches où des representations partagées doivent coexister avec des chemins de raisonnement distincts. Le maintien des gains sous des backbones plus grands et des mélanges de tâches plus divers reste à tester, mais les résultats actuels fournissent une fondation crédible pour traiter la structure de tâche comme un principe de conception de premier ordre dans l'architecture des décodeurs.

Sources

FAQ

Qu'est-ce que MoTE et comment fonctionne-t-il ?

MoTE convertit le feedforward d'un LLM en experts de tâche sur un backbone multimodal partagé. En VideoLLM-MoTE, cinq experts activent environ 2B de paramètres par échantillon.

Pourquoi MoTE est-il important pour la compréhension vidéo multitâche ?

Le calcul activé est découplé du nombre d'experts stockés, donc le coût d'inférence reste contrôlable à mesure que les tâches grandissent, et le routage explicite rend les résultats interprétables.

Quelle est la prochaine étape pour cette approche ?

VideoLLM-MoTE combine le paradigme de décodage LLM avec des experts de tâche, référence réutilisable pour l'open source. Les travaux futurs étendent les capacités en partageant un backbone multimodal.