Where-OPD:合成シーンの空間手掛かりによる多モーダルモデルの自己蒸留
Where-OPDは幾何図形の合成画像から物体の位置と個数を自動取得し、その文章ヒントを凍結教師だけに渡す。生徒は自ら生成した系列の各時点で教師の確率分布を学び、推論時には画像と質問だけを使う。論文では計数、図表、文書理解で改善し、Qwen3.5-4Bの実画像系7評価の平均は3.23ポイント上昇した。ただし評価ごとの低下もあり、注意マップだけで因果機構は確定しない。
背景と課題の所在
多モーダル大規模言語モデルの視覚質問応答では、文章を組み立てる前の証拠収集が失敗しやすい。計数では条件に合う物体を漏れなく探す必要があり、図表では凡例、軸、複数の値を結び付ける必要がある。画像の一部分を拡大する方法は細部の判読に役立つが、離れた複数箇所を統合する訓練とは同じではない。
本研究は「何を拡大するか」ではなく「関連する証拠がどこにあるか」を文章で教師だけに教える。ただし訓練画像は単純な幾何図形であり、実写真や複雑な文書を直接再現していない。実画像への転移は指定された評価で観測された結果として読むべきである。
コアアーキテクチャと技術原理
生成器は物体ごとの色と形、半径、中心座標、背景色を保持し、重ならない図形を描画する。質問の対象になる種類を選び、一致する物体の座標を列挙した文章ヒントを生成する。ヒントの末尾には合計個数も書かれる。生徒は画像と質問のみを受け取る。凍結した同系統の教師はそれらにヒントを加えて受け取る。現在の生徒が回答系列を生成すると、教師はその生徒自身の各接頭系列に対して次のトークンの確率分布を計算する。学習は両分布の差を縮める。教師が独自に書いた理想的な文章だけを模倣する場合より、生徒が実際に到達する状態に監督を置ける点が重要である。推論では座標ヒントも教師も使わない。
最大の解釈上の注意は、教師が位置だけでなく答えの個数も受け取ることだ。主実験だけでは位置探索の習得と答えの伝達を切り分けられない。論文は答えのみ、位置のみで総数なし、完全なヒントを比較する。さらに凍結教師が最も良く、指数移動平均で教師を更新すると平均性能が下がる傾向を報告する。したがって「自己蒸留」は無から正解を作る方法ではなく、生成器の既知の状態を一時的に教師へ渡す方法である。訓練には生徒の系列生成と教師による採点が必要で、通常の教師あり微調整と同じ計算量とは言えない。
実用性と検証結果
対象は Qwen3.5-4B、Qwen3.5-9B、Qwen3-VL-4B の三モデルである。標準評価では思考モードを無効にし、貪欲復号を使用する。Qwen3.5-4B の十五指標の単純平均は 73.86 から 78.31 に上昇した。CountQA は 32.00 から 34.53、ChartQA は 79.32 から 86.52、EvoChart は 68.32 から 78.43、OCRBench は 87.30 から 89.23 となった。実画像系の七評価で示された平均 3.23 ポイントの改善は、この四十億規模モデルとその評価集合についての値である。他の二モデルの対応する平均改善は 1.07 と 1.29 ポイントと報告される。
不利な結果も明示する必要がある。Qwen3.5-4B の HR-Bench 4K は 0.63 ポイント低下し、Qwen3.5-9B では CVBench、BLINK、ZoomBench がそれぞれ 0.05、0.62、0.32 ポイント低下した。比較対象の Vision-OPD は四十億モデルで V* を 8.90、ZoomBench を 14.56 ポイント改善する一方、CountQA は 10.73 ポイント悪化した。同じ三千件の合成場面を用いた七指標の比較では、基盤モデル 69.63、通常の教師あり学習 69.70、GRPO 69.56、答えのみのヒント 71.27、位置のみで総数なし 72.35、完全版 72.94 である。位置情報の寄与を示すが、総数の追加効果も残る。注意マップの事例は解釈の補助であり、因果的な探索能力の証明ではない。
業界への影響と今後の展望
実装上の価値は、描画器が元から持つ構造化された正解を特権情報へ変え、人手の位置注釈や外部の高性能教師を省ける点にある。複数領域の統合が必要な計器、図表、書類への応用を研究する動機にはなるが、遮蔽された物体、小さな文字、未知のレイアウトでの運用品質は未確認である。次の検証では各サンプルの改善と悪化を対にして記録し、見落とし、重複計数、座標の誤差、総数の改変に対する頑健性を測るべきだ。訓練費用と弱い集団での性能も必要である。現時点で言えるのは、論文の指定条件において合成計数から実画像評価への転移が測定されたという範囲に限られる。
[原論文](https://arxiv.org/html/2610.02117v1)
Sources
FAQ
教師だけが受け取る情報は何か。
対象物体の座標と合計個数を列挙した生成器由来の文章である。生徒の推論入力には含まれない。
3.23ポイントは何の平均か。
Qwen3.5-4Bについて、論文が選んだ実画像系の七評価の平均改善である。