WOVEN:把视觉世界建模编织进多模态大模型

Published · AI Daily — AI-assisted deep research, methodology & disclosure

WOVEN 是一个面向视觉状态转移推理的训练数据源与基准,共 36,076 条样本,覆盖 20 类场景、5 类动作和 8 类推理操作,素材来自视频预训练生成模型的 rollout。作者评测 38 个前沿多模态模型,发现最强者也远低于人类,且缺陷随规模持续存在。用 WOVEN 训练后,各约 2,000 条的子集合计改善 26 个外部基准中的 22 个,最高提升 27.3 个百分点,并可替代 30%至50%的任务自有训练数据。

多模态大语言模型在过去两年里,在图像描述、文档理解和视觉问答上进步很快。可是只要问题涉及空间关系、具身交互、物理规律或时间推移,它们的表现就明显掉队。机器人把杯子推向桌边会发生什么,积木塔抽走底层一块之后会怎样,画面中的物体下一秒会出现在哪里,这类问题看上去各不相同,长期被当作彼此独立的短板,各用各的基准去衡量,各用各的数据去补课。2026年10月8日发布在 arXiv 的论文 WOVEN(编号 2610.12417,作者包括 Zheyu Fan、Yue Zhang、Mingkai Deng、Kangrui Wang、Qineng Wang 等)提出了一个更简洁的解释:这些失败共享同一个根源,即视觉状态转移推理的缺失,也就是模型难以在内部推演“某个动作作用于某个场景之后,画面会变成什么样”。

这个假说的意义不在于命名一个新能力,而在于它改变了问题的组织方式。如果空间、具身、物理和时间推理的失败确实同源,那么就不必为每一个下游任务单独收集昂贵的标注,而可以把视觉转移推理当作一种共享的训练原语:不同模型可以从不同的监督来源学到它,再把它复用到不同的任务上。论文的目标正是检验这一点,并给出一套系统的训练配方。作者指出,现有基准只是分别记录这些缺陷,无法在场景、动作和推理操作之间做受控比较,所以光有评测还不够,必须有一个按这三个维度组织的数据源。

WOVEN 就是为此而建。它既是训练数据源,也是基准,共包含 36,076 条样本,覆盖 20 类场景、5 类动作和 8 类推理操作。素材来自视频预训练生成模型产生的多样而逼真的 rollout,也就是让生成模型根据初始画面和动作“推演”出后续画面,再围绕这些画面构造问题。这样的组织方式带来一个实际好处:研究者可以固定其中两个维度,单独改变第三个维度,从而回答“到底是场景、动作,还是推理操作本身决定了迁移效果”这类过去很难回答的问题。把变量拆干净,是这篇论文方法论上最值得学习的地方。

评测结果显示出系统性的缺陷。作者测试了 38 个前沿多模态模型,其中包括 GPT-5.4 和 Qwen3-VL-235B-A22B。结论有三层:缺陷显著,即使最强的模型也远低于人类;缺陷系统,同样的失败在不同模型家族中反复出现;缺陷顽固,它们随模型规模增大仍然存在。最后一点尤其重要,因为它说明单靠堆参数、堆通用数据,并不会自然长出对视觉状态变化的推演能力。这与近年来不少关于物理常识、空间推理的评测结论相互印证,也为“需要专门的监督信号”提供了证据。

训练实验则给出了更有价值的正面结果。作者在多个规模的多模态模型上用 WOVEN 训练,发现模型学到的是一种可广泛迁移的共享能力:每个约 2,000 条的训练子集,合计让 26 个外部基准中的 22 个得到提升,最高提升 27.3 个百分点。另一个对工程团队更实用的数字是,WOVEN 数据可以替代某个任务 30%至50%的自有训练数据,而精度相当。换句话说,对于标注昂贵的具身或空间任务,一部分监督可以由这种通用的转移推理数据来承担。需要提醒的是,这些数字是论文自行报告的,26 个基准中也有 4 个没有受益,落地前仍应在自己的任务上复测。从更大的图景看,这项工作触及了当前多模态研究的一个结构性问题。过去的基准多半只回答“模型对不对”,却很少回答“模型为什么不对”,所以每发现一个新短板,社区就新做一个基准、新攒一批数据,结果是评测越来越多,能力的提升却零散而不可复用。WOVEN 的做法是先按场景、动作和推理操作三个维度把监督拆开,再用受控实验观察哪一个维度真正承载了迁移,这使得“数据为什么有效”第一次有了可检验的答案。对于正在构建具身智能体、图形界面代理和机器人规划系统的团队,这条思路尤其有用:这些系统的核心都是预测行动的后果,如果底层的多模态模型连简单的状态变化都推不对,上层的规划和决策就缺少可靠的地基。因此,把转移推理单独拎出来训练和度量,既是研究方法的改进,也是工程上降低试错成本的办法。

最后是论文提炼出的训练配方,它经过在留出基准上的前瞻性验证。第一条是按样本所教授的推理操作来选择监督,而不是按它所展示的动作、场景或领域来选择。这与直觉相反:许多团队习惯“想提升机器人任务,就找机器人场景的数据”,而 WOVEN 提示,真正决定迁移的是样本训练了哪一种推理操作。第二条是优先选择视觉状态变化更大的样本,因为这样得到的能力更稳健。对行业而言,这意味着数据策划的单位应从“领域”转向“推理操作”,也意味着世界模型的训练未必只能依赖视频生成,让多模态语言模型直接学会转移推理是另一条值得投入的路线。当然,数据来自生成模型的 rollout,其物理保真度会限制监督的上限,这一点需要后续工作持续检验。

Sources

FAQ

什么是视觉状态转移推理?

它指模型根据当前画面和一个动作,推断动作之后场景会变成什么样的能力。例如推一个物体会滚到哪里,抽走积木后塔会不会倒。WOVEN 假设空间、具身、物理和时间推理的失败都来自这一项共同缺陷。

WOVEN 的训练配方有哪些要点?

论文给出两条经前瞻性验证的原则。第一,按样本所教的推理操作来挑选监督数据,而不是按它展示的动作、场景或领域来挑。第二,优先选择视觉状态变化更大的样本,这样得到的能力更稳健。

这项研究有哪些需要留意的边界?

摘要显示数据来自视频预训练生成模型的 rollout,其物理保真度会限制监督质量。提升数字来自论文自报的 26 个外部基准,并非所有基准都受益。实际部署前仍需在自己的任务上复测。