MoTE:マルチタスク動画理解のためのタスク専門家のミクスチャーデコーダ

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

本論文は、アクション認識、アクション予測、プロセス予測などの異種タスクを同じ視覚証拠から同時に処理しなければならない手続型動画-言語モデルが直面する課題に対応する。dense transformerデコーダは全てのタスクで同じフィードフォワードネットワークを共有しており、異なるタスクの挙動を混同しやすく、能力の制御可能な拡張を困難にする。スパースMoEデコーダは条件付き計算を提供できるが、トークンレベルの学習ルーティングはタスクレベルの手続型目標と自然に一致しない。著者はMoTE(Mixture of Task Experts)を提案し、大規模言語モデルのフィードフォワードネットワークをタスク専用Expertsに変換しつつ、マルチモーダルバックボーンは共有したまま、各サンプルが単一のタスクに沿ってルーティングしてExpertsを激活する。これにより、激活された計算量が保存されたタスクExpertsの数量から独立させる。著者はこれをVideoLLM-MoTEとして実装し、5つのCOINベンチマークで明示的なタスクルーティングにより評価する。5Expertsモデルはサンプルあたり約2Bのパラメータを激活し、平均top-1精度が最近のVideoLLMベースラインを上回り、同じExpertsトポロジー下でdense全Experts激活と学習スパースルーティング制御を上回り、タスク構造化ルーティングが説明可能で計算効率的なデコーダスキームであることを証明する。

背景と概要

程序化動画-言語モデルは、同一の視覚証拠からアクション認識、アクション予測、プロセス予測といった性質の異なる下流タスクを同時に処理しなければならない。単一の視覚表現を共有しつつ、タスクごとに異なる推論を行う必要があるため、この分野では長年解決が難しい問題とされてきた。著者はこの問題をデコーダの構造化に関わる問題として位置づけ、デコーダの設計がタスクをきれいに分離できるか、混ざってしまうかを決定すると論じる。

主流のdense transformerデコーダは、全タスクで同じフィードフォワードネットワークを共有している。すべてのタスクが同一の重みを利用するため、タスクご挙動が絡み合い、個別の能力を切り分けるのが困難になる。この絡み合いは、特定能力の制御可能な拡張をより難しくする。一つのタスクを拡張すると、共有パラメータが必然的に乱されるからだ。著者はこれはスケーリングの問題ではなく構造的な限界だと指摘する。

スパースMixture-of-Expertsデコーダは条件付き計算で演算を節約できるが、標準的なトークンレベルの学習ルーティングはタスクレベルの目標と自然に一致しない。ルーティングの判断は明確なタスク意味へマッピングが難しい学習重みから生じる。効率的なのに不透明なデコーダとなり、計算が意図したタスクに実際に奉職していることを保証できない。この不一致が、本論文の中心的な提案を促す動機となる。

深掘り分析

著者はMoTE(Mixture of Task Experts)を提案する。大規模言語モデルのフィードフォワードネットワークをタスク専用 experts のセットへ再構成しつつ、マルチモーダルバックボーンは全タスクで共有する。各サンプルは単一のタスク沿ってルーティングし、対応する experts を激活する。条件計算の効率を維持しつつ、ルーティング結果を具体的なタスクへ直接マッピングでき、説明可能性とコストのバランスを取る設計だ。

技術的な核心は、トークンレベルの学習ルーティングではなくサンプルレベルのタスクルーティングにある。各入力が単一の明確なタスクパスに沿うため、激活された計算量は保存されたタスク experts の総数から独立する。この性質は推論コストの制御に重要だ。コストがタスク数に線形に増加しない。タスク能力を継続的に追加しなければならないシステムにとって不可欠な特性である。ルーティング挙動は学習可能な疎重みの中に隠されず、明示的で観察可能となる。

訓練は、共有バックボーンとタスク専用デコーダ experts の組み合わせを利用する。視覚表現とタスク推論能力を、統一されたフレームワーク内でそれぞれ個別に最適化できる。これにより視覚理解の跨タスク共有を維持しつつ、タスク専用表現を可能にする。この構造は成熟した大規模言語モデルデコーダの范式を継承しつつ、タスクレベルのルーティングで意味層面から改造する。条件付き計算が程序化動画理解の目標に真正奉職するのである。

業界への影響

著者は5つのCOINベンチマークでVideoLLM-MoTEを評価し、明示的なタスクルーティングでデコーダを駆動する。5 experts のモデルはサンプルあたり約20億の大規模言語モデルパラメータを激活するが、平均top-1精度は最近のVideoLLMベースライン方法を上回る。制御された割合のパラメータしか激活しないにもかかわらず、同時代のシステムに対して競争力のある位置づけとなる。

消融と対照実験が決定的な証拠を示す。同一の experts トポロジーの下で、MoTEはdense全 experts 激活方案と、学習疎ルーティングを対照とした実験の両方を上回る。この比較は、タスク構造化ルーティングが純粋に学習されたルーティング相比、効率と性能の両面で優位を持つことを示す。説明可能性の向上が精度のコストで買われていないことを、証拠が示唆する。

工業的展開では、激活演算が保存 experts から独立しているため、タスクポートフォリオが拡大しても推論コストが制御可能だ。継続的にタスク能力を追加しなければならない場面で重要になる。明示的ルーティングはモデル挙動をより追跡可能にし、動画理解やプロセス分析といった高信頼性が求められるドメインでの信頼を支援する。开源コミュニティにとっては、大規模言語モデルデコーダの范式をタスクレベルの experts メカニズムと結合させたことで、将来の研究へ再利用可能なアーキテクチャの参考を提供する。

今後の展望

本論文は、タスク構造化ルーティングを、多タスク動画-言語学習のための説明可能で計算効率的なデコーダスキームとして確立する。同一トポロジーの下で、サンプルレベルのルーティングを持つタスク専用 experts がdenseや学習疎の代替方案を上回れることを示すことで、現在スパース experts システムを支配する不透明なルーティングへの具体的代替案を提供する。

最も見通しの良い方向は、多くのタスク能力を時間とともに蓄積しなければならないシステムへのスケーリングだ。激活演算が保存 experts 数で増加しないため、比例したコスト増なしに繰り返し新機能を追加するプロダクトに適している。明示的ルーティングは、追跡可能性が求められる規制対象や安全性に敏感な設定での展開も支援する。

より広くは、このアプローチは動画を超えて、共有表現が異なる推論パスと共存しなければならない任意の跨タスク条件付き計算へ拡張できる可能性がある。より大きなバックボーンやより多様なタスク混合下で向上が維持されるかは検証が必要だが、現在の結果は、タスク構造をデコーダアーキテクチャの第一級設計原理として扱うための信頼できる基盤を提供する。

Sources

FAQ

MoTEとは何ですか?どのように動作しますか?

MoTEは、大規模言語モデルのフィードフォワードネットワークをタスク専用エキスパートに変換し、モーダルバックボーンを共有します。VideoLLM-MoTEとしてサンプルあたり約2Bのパラメータを活性化します。

なぜMoTEは多任務動画理解にとって重要なのですか?

活性化された計算量は保存されたエキスパート数から独立しているため、タスクが増えても推理コストは可控です。明示的なタスクルーティングは挙動を説明可能にし、動画理解に価値があります。

この手法の今後の注目すべき方向は何ですか?

VideoLLM-MoTEは、成熟したLLMデコーダのパラダイムをタスク級エキスパートの機構と組み合わせ、オープンソースコミュニティが再利用できる構造参考を提供します。未来の研究はマルチモーダル表現を共有しつつ能力を拡張します。