Where-OPD:空间引导的多模态模型在策略自蒸馏

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Where-OPD以程序生成的几何场景自动获得目标物体坐标,并仅向冻结教师提供包含位置与数量的文本提示。学生在自身生成的前缀上接受逐词蒸馏,推理时只需原图和问题。论文报告三个多模态模型在计数、图表和文档任务上的改进,Qwen3.5-4B在七项真实视觉基准上的平均增益为3.23个百分点;但个别基准退步,注意力可视化也不能独立证明机制。

技术背景与问题定义

多模态大模型回答视觉问题时,失败不一定发生在最终推理步骤。对于计数,模型可能漏掉边缘处的对象,或者把相似但不符合颜色条件的对象纳入统计;对于图表,模型必须先关联图例、轴标签与多个数据点;对于文档,答案可能散落在不同区域。单纯把图像裁大,主要解决局部细节不可辨认,未必解决“应该整合哪些区域”的问题。论文讨论的在策略自蒸馏(on-policy self-distillation, OPSD)利用教师与学生共享的模型来源制造信息差:教师拿到特权信息,学生在推理时拿不到。这里的核心问题不是能否让教师知道正确答案,而是学生能否从更有依据的教师分布中学会处理原图,并将训练中只见过的合成计数经验迁移到真实图像。

Where-OPD针对以裁剪或放大图像为教师特权的路线提出另一种选择。训练图像由程序生成,物体的类别、尺寸与中心坐标在渲染前已知,因此不需要人工逐物体标注或外部定位教师。训练任务仅为识别指定颜色和形状的对象并计数。必须直面限制:这些场景是互不重叠的简单几何图形,不代表真实文档、图表或复杂自然图像的分布。论文所称的跨域转移,是在指定基准上的实测现象,不能推论为所有场景都具有可靠定位能力。

核心架构与原理解析

一个场景状态记录每个元素的颜色与形状类别、半径、中心坐标以及背景颜色。渲染器生成图像后,采样一个确实存在的目标类别;程序从场景元数据筛出全部匹配对象,按固定文本模板生成提示。提示逐个列出目标的图像坐标,并给出总数。这一点很关键:教师得到的不只是“去哪里看”,也包含最终计数,因而主实验无法独立归因于空间提示。论文的消融实验通过仅答案提示、仅位置而无总数提示来拆分这两种信号。

设图像与问题为输入 x,学生在当前参数下采样回答序列 y。教师是冻结或指数滑动平均的同源模型,它读取相同图像、问题及额外提示 h;在学生已经走到的每一个前缀上,教师评估下一词概率。优化目标是让学生在这些前缀上的预测分布接近教师分布。与直接训练教师生成的完整答案相比,监督落在学生真实会遇到的状态上,缓解训练状态与推理状态错位。论文实现采用冻结教师的版本效果最佳;这仍然需要同时运行学生采样与教师打分,训练成本不能等同于普通监督微调。推理阶段不传入坐标提示,也不调用教师,因此部署路径维持原模型的图像加问题接口。

“自蒸馏”不意味着模型凭空创造答案。正确位置和计数来自生成器的隐藏场景状态,教师借此形成更强的条件分布;学生是否真的学会逐一定位,要由未见数据和针对性实验判断。该机制也存在潜在捷径:如果教师主要复制提示末尾的总数,学生可能学到回答形式或计数先验,而不是视觉搜索。只有位置无总数的消融能改善结果,为空间信号的作用提供更直接但仍非最终的证据。

关键功能与实战评估

论文在 Qwen3.5-4B、Qwen3.5-9B 与 Qwen3-VL-4B 上评估。默认设置关闭 thinking、采用贪心解码,15 项指标取不加权平均。Qwen3.5-4B 的总体均分从 73.86 提升到 78.31,增幅 4.45 个百分点;CountQA 从 32.00 到 34.53,ChartQA 从 79.32 到 86.52,EvoChart 从 68.32 到 78.43,OCRBench 从 87.30 到 89.23。七项真实视觉感知评估的平均提升为 3.23 个百分点,论文对另外两个模型报告 1.07 和 1.29 个百分点。这里的 3.23 是针对 Qwen3.5-4B 的特定集合和平均方式,不是所有模型或所有视觉任务的统一增益。

负面结果同样重要:Qwen3.5-4B 在 HR-Bench 4K 从 86.25 降至 85.62;Qwen3.5-9B 的 CVBench 与 BLINK 分别下降 0.05 和 0.62 个百分点,ZoomBench 下降 0.32。论文表格还显示,裁剪视觉信息的 Vision-OPD 在 Qwen3.5-4B 的 V* 和 ZoomBench 分别提高 8.90、14.56 点,却让 CountQA 降低 10.73 点。不同特权信息改善的任务分布不同,不能用平均分掩盖单项退步。

针对同一批 3000 张合成场景的七项消融,基座平均 69.63,普通监督微调 69.70,GRPO 69.56,仅答案提示蒸馏 71.27,位置提示但不含总数 72.35,完整 Where-OPD 72.94。这组对照说明空间提示比仅提供答案更有效;但加入总数仍带来额外收益。两个 Qwen3.5 主模型的 15 项均分分别取三个训练种子的均值,报告标准差均为约 0.20;这不是每个基准的置信区间。注意力图展示部分真实样本更关注目标区域,只能作为解释线索,不能证明模型内部真正执行了可靠的逐对象搜索。

行业影响与未来演进

方法的实用价值在于利用生成器天然拥有的结构化真值,避免为每张图人工画框或引入另一个定位模型。适合探索工业仪表、图表或布局理解等需要联合多个区域的任务,但目前论文只在简单合成计数场景中训练并在公开基准上测试,不能直接承诺生产环境的准确率。部署团队应保留原始输入、训练种子、逐样本输出及基准切分,特别评估密集遮挡、小字、坐标误差和分布外对象。若未来要声称“学会定位”,应加入目标漏检与重复计数的逐样本配对统计,以及对坐标、总数分别扰动的反事实实验。更强的证据还包括真实场景少量标注上的定位精度、训练与推理成本、最坏子群表现。当前结论限于论文提供的模型和评测:空间特权提示在这些设置下带来可测的跨域增益,但尚未证明普适视觉推理突破。

[论文原文](https://arxiv.org/html/2610.02117v1)

Sources

FAQ

教师与学生的输入差异是什么?

两者都读图像与问题;只有教师读程序生成的目标坐标与总数提示。推理时学生不使用提示。

3.23个百分点具体指什么?

Qwen3.5-4B 在论文选定的七项真实图像感知评估上的平均提升,不是所有模型或单项任务的统一增幅。