MoTE:用任务专属专家重构视频理解解码器

Published 2026-08-25 · AI Daily — AI-assisted deep research, methodology & disclosure

程序化视频-语言模型需从同一视觉证据上同时处理动作识别、动作预测与流程预测等异构任务。研究者指出dense transformer解码器在所有任务间共享同一前馈网络,容易混淆不同任务的行为,也使能力可控扩展变得困难;而稀疏MoE虽能提供条件计算,其token级学习路由却与任务级目标天然不对齐。为此作者提出MoTE(Mixture of Task Experts),将大语言模型前馈网络改造为任务专属专家,同时保持多模态骨干共享,每个样本沿单一任务路由激活专家,使激活计算量与被存储的专家数量解耦。实现为VideoLLM-MoTE后,五专家模型每样本约激活2B参数,平均top-1准确率优于近期VideoLLM基线,并超越同拓扑下的dense全专家激活与学习稀疏路由控制,证明任务结构化路由是可解释且计算高效的解码方案。

程序化视频-语言模型需要在同一组视觉证据上同时完成动作识别、动作预测以及流程预测等性质各异的下游任务,这要求模型既能共享底层视觉表征,又能针对不同任务做出差异化的推理。作者指出,当前主流的dense transformer解码器在所有任务间共享同一组前馈网络,这种设计容易把不同任务的行为纠缠在一起,导致模型难以清晰地分离各任务的能力,也使得后续对特定能力的可控扩展变得困难。与此同时,稀疏的Mixture-of-Experts解码器虽然能够通过条件计算节省算力,但其典型的token级学习路由机制与任务级程序化目标之间并不天然对齐,路由结果往往难以对应到明确的任务语义。针对这一矛盾,作者提出MoTE,即任务专家混合解码器。它的核心思路是把大语言模型中的前馈网络改造为一组任务专属专家,同时保持多模态骨干网络在所有任务间共享。这样每个样本会沿着单一的任务路由激活对应的任务专家,既保留了条件计算的效率,又让路由结果直接对应到具体任务,从而在可解释性与计算效率之间取得平衡。这一设计在保持共享视觉理解能力的同时,为多任务视频-语言学习提供了一种任务结构化的解码替代方案。

在技术实现上,MoTE将原本作为统一前馈网络的前馈模块拆分为多个任务专属专家,使每个任务都能拥有独立的能力表达,而多模态骨干则继续为所有任务提供统一的视觉特征。与token级学习路由不同,MoTE采用样本级任务路由,即每个输入样本沿着一条明确的任务路径激活相应专家,因此被激活的任务专家计算量独立于被存储的任务专家总数,这一性质对于控制推理成本、避免随任务数量线性增长至关重要。作者将这一架构具体实现为VideoLLM-MoTE,并以显式任务路由进行评测,使得路由行为可被观察与解释,而不是隐藏在可学习的稀疏权重之中。在训练策略上,模型通过共享骨干与任务专属解码专家的组合,让视觉表征与任务推理能力分别得到针对性优化,从而在统一框架内兼顾跨任务共享与任务专属表达。这种结构既延续了大语言模型解码器的成熟范式,又通过任务级路由对其进行了语义层面的改造,使条件计算真正服务于程序化视频理解的任务目标。在实验设置上,作者使用五个COIN基准对VideoLLM-MoTE进行评测,并采用显式任务路由来驱动解码器。关键结果显示,五个专家的模型在每个样本上大约激活20亿大语言模型参数,其平均top-1准确率优于近期出现的VideoLLM基线方法。

进一步的对比表明,在相同的专家拓扑结构下,MoTE优于dense全专家激活方案,也优于以学习稀疏路由为控制组的对照实验,说明任务结构化路由相比纯学习的路由机制在效率与性能上都更具优势。这些消融与对照结果共同揭示,将前馈网络改造为任务专属专家、并以样本级任务路由进行条件计算,能够在不增加额外算力负担的前提下提升多任务视频理解的整体表现,同时也验证了该解码结构在可解释性与计算效率方面的双重价值。从行业与社区角度看,MoTE为多任务视频-语言模型提供了一条兼顾效率与可解释性的新路径。由于被激活的计算量独立于存储的任务专家数量,该设计在任务规模扩张时仍能保持可控的推理成本,这对需要持续新增任务能力的工业落地场景具有重要意义。显式任务路由使模型行为更可追溯,有助于在视频理解、流程分析等对可靠性要求较高的领域建立信任。对开源社区而言,VideoLLM-MoTE将大语言模型解码范式与任务级专家机制相结合,为后续研究提供了可复用的架构参考,推动研究者探索如何在共享多模态表征的同时实现任务专属的能力扩展。总体而言,这项工作表明任务结构化路由是一种可解释且计算高效的解码方案,为多任务视频-语言学习乃至更广泛的跨任务条件计算提供了有价值的思路。

Sources

FAQ

MoTE是什么?它是如何工作的?

MoTE(任务专家混合解码器)把大语言模型的前馈网络改造成任务专属专家,同时共享多模态骨干。每个样本沿单一任务路由激活专家。作为VideoLLM-MoTE,五个专家每个样本约激活20亿参数。

为什么MoTE对多任务视频理解很重要?

由于激活的计算量与存储的任务专家数量解耦,任务增加时推理成本仍可控;显式任务路由让模型行为可解释、可追溯,对视频理解、流程分析等可靠性要求高的领域很有价值。

这种方法接下来值得关注什么?

VideoLLM-MoTE把成熟的LLM解码范式与任务级专家机制结合,为开源社区提供可复用的架构参考。未来研究将探索在共享多模态表征的同时扩展任务专属能力。