OmniSeek:面向多輪音視頻推理的原生工具調用智能體框架
OmniSeek 把全模态大模型(Omni-LLM)改造成一个会主动“看”和“听”的多轮推理智能体,而不是一次性把整段音视频塞进模型做单次前向推理。它在推理过程中动态决定该检索哪个时间窗口的音频或视频证据,并把取回的原始片段重新拼回上下文继续推理。团队构建了含多跳思维链轨迹的 OmniTraj-170K 数据集先做监督微调冷启动,再用两阶段可验证奖励强化学习优化策略,并引入“音视频必要性”目标专门惩罚只靠单一模态走捷径的轨迹,在多个基准上稳定提升跨模态证据检索与推理表现。
技术背景与问题定义
多模态大模型近年来把音频、视频、文本都塞进同一个全模态大模型(Omni-LLM),但现有做法大多是“被动一次性看完”:把整段音视频一次性编码成特征序列,再交给模型做单次前向推理。这种方式在面对长视频、长录音时会遇到两个根本问题。
第一,信息被严重稀释——真正能回答问题的关键证据往往只占全部时长的一小段,而模型必须把注意力分摊到整段序列上,计算开销随时长线性甚至更快增长,却未必能定位到关键片段。第二,模型缺乏“主动验证”的能力:当第一遍扫过的证据不够充分、或者答案依赖音频和视频两种模态的联合信息时,模型没有机制去回头重新检查,只能凑合给出一个基于不完整证据的答案。OmniSeek 这篇论文把这个问题重新定义为一个主动证据获取问题:模型应该像人类一样,先形成一个初步假设,判断还缺什么证据,再决定“该去看哪一段画面”还是“该去听哪一段声音”,反复迭代直到证据充分为止,而不是被动地一次性消费全部输入。
核心架构与原理解析
OmniSeek 的核心做法是把 Omni-LLM 包装成一个具备原生工具调用能力的多轮推理智能体。推理过程不再是单次前向传播,而是一个迭代协议:模型在每一轮先基于已有上下文进行推理,然后决定是否需要调用“看”或“听”这类工具,并指定具体的时间窗口去检索对应模态的原始片段;取回的音频或视频证据会被重新拼接进上下文,供下一轮推理使用,如此循环直到模型认为证据已经充分、可以给出最终答案。
为了让模型冷启动具备这种多轮工具调用行为,作者团队构建了一个数据合成引擎,生成了名为 OmniTraj-170K 的语料库,其中包含大量多跳思维链轨迹,每条轨迹都交错穿插着音频和视频证据的检索与推理步骤。训练分两步:先用这批合成轨迹做监督微调,把“先思考、再决定检索什么、再把证据接回来继续推理”这种行为模式植入模型;再用两阶段强化学习、以可验证的奖励信号进一步优化检索与推理策略,使模型学会在真实任务分布下自主判断该查哪里。更关键的是,作者专门设计了一个“音视频必要性”目标,显式奖励那些确实同时依赖音频和视频证据才能得出正确结论的推理轨迹,从而抑制模型投机取巧——只用单一模态的线索就蒙对答案、却绕开了真正需要跨模态推理的路径。
关键功能与实战评估
这套框架带来的直接能力是自适应的跨模态证据检索:模型不再对整段输入一视同仁,而是能根据问题的难度和证据分布,灵活决定要检索几次、检索哪个时间段、优先看还是优先听。论文在一系列覆盖不同任务类型的基准测试上做了广泛实验,结果显示 OmniSeek 相比把全部音视频一次性塞进上下文的基线方法,在音视频联合推理任务上取得了一致的性能提升,并且这种提升并非来自某一个模态的增强,而是确确实实体现在需要跨模态证据协同的案例上——这恰恰验证了“音视频必要性”目标设计的有效性,证明模型学到的不是投机式的单模态捷径,而是真正学会了按需调用证据的检索式推理能力。
行业影响与未来演进
OmniSeek 代表了多模态智能体工程中的一个重要方向转变:把“工具调用”这一在纯文本智能体中已经相当成熟的范式,原生地引入到音视频理解场景中,让模型自己决定何时需要补充感知输入,而不是依赖外部固定的预处理流水线去提前裁剪或摘要长音视频。
这对长视频理解、会议记录分析、监控与安防场景、以及需要跨模态核验的事实核查类应用都有直接的借鉴价值——这些场景普遍存在“证据稀疏但上下文很长”的特征,正是 OmniSeek 要解决的核心问题。展望未来,这类框架的演进方向可能包括:把可调用的工具种类从“看/听”扩展到更丰富的感知与检索操作(例如调用外部检索增强、调用专门的物体跟踪或语音识别子模型),以及把这种多轮证据获取能力和更长的实时流式输入结合,应对现场音视频流的在线推理需求。
Sources
FAQ
OmniSeek 和传统全模态模型处理音视频的方式最大的区别是什么?
传统方式一次性把整段音视频编码后做单次前向推理;OmniSeek 让模型在多轮推理中主动决定要检索哪个时间窗口的音频或视频证据,取回后拼回上下文继续推理,是主动、迭代的证据获取过程。
OmniTraj-170K 数据集是用来做什么的?
它是一个含约17万条多跳思维链轨迹的合成语料库,轨迹中交错着音频和视频证据的检索与推理步骤,用于监督微调阶段冷启动模型的多轮工具调用行为。
音视频必要性目标解决的是什么问题?
它显式奖励那些确实需要同时依赖音频和视频证据才能得出正确结论的推理轨迹,从而抑制模型只用单一模态线索投机取巧蒙对答案的捷径行为。