GeoReform:形式化そのものを進化させる、マルチモーダル幾何問題解決の新しい道
マルチモーダル大規模言語モデルは、幾何図形の関係を読み違えることが多い。GeoReformの論文は、図をテキストに変換する構造注入が安定した解決策ではないと示す。Geometry3Kの200例では、28件の誤りを直す一方で13件の新たな誤りを生んだ。著者は形式化を最適化可能な方策と捉え、失敗事例から表現を改善する。Qwen3VL-2Bの精度は42.0%から56.0%に向上した。
マルチモーダル大規模言語モデルは、幾何の問題を苦手としてきた。理由は明快である。解答の鍵は図の中にあり、どの線が垂直か、どの角が等しいか、どの弧がどの円に属するかといった情報を、モデルはしばしば正しく読み取れない。読み取れたとしても、それを正しく使えるとは限らない。近年の主流な対策は、図の中の幾何的な実体、関係、制約を明示的なテキストに変換し、そのテキスト上でモデルに推論させる方法である。この発想は直観的で、実際に効果もある。しかし2026年10月8日に公開された論文GeoReform(arXiv 2610.12391、著者はJialu Wang、Ruichen Zhang、Xiaoou Liu、Hua Wei、Tianlong Chen)は、一段鋭い問いを立てる。変換の質そのものが難問ではないのか、という問いである。
論文が示す数字は小さいが説得力がある。Geometry3Kの200例において、構造注入は元のモデルが間違えていた28問を正しく直した。ところが同時に、元は正解できていた13問を誤答に変えてしまった。差し引きでは改善しているものの、代償は現実のものである。著者は原因を平易に整理している。冗長な関係は、モデルの注意を散らす。図の要素への曖昧な参照は、制約を誤った対象に適用させる。したがって、ボトルネックは幾何的な事実をより多く抽出することではない。事実を、後段の推論を支える表現へと組織することである。情報を多く与えることは、正しい情報を与えることと同じではない。 この診断に基づき、GeoReformは形式化の位置づけを変える。形式化はもはやパーサーの固定された出力ではなく、最適化できる方策となる。手順は次のとおりである。まず、現在の形式化方策で推論パイプライン全体を実行する。次に、失敗した推論の軌跡を集める。続いて、現在の表現にどのような欠陥があるかを診断する。最後に、方策を変異させ、幾何的な実体、関係、制約、求める対象を、より良く選択し、接地し、グループ化し、提示できるようにする。この四つの動詞は、それぞれ別の失敗に対応している。選択は、どの事実を残すかを決める。接地は、ある記述が図のどの要素を指すかを確定する。グループ化は、事実同士の構造を決める。提示は、モデルが読むテキストの並べ方を決める。
設計の要点は、学習の信号がどこから来るかにある。従来のパーサーは画像を忠実に記述しようとするが、忠実な記述が有用な記述とは限らない。GeoReformでは、失敗した推論が、どの表現がモデルを誤らせるかをシステムに教える。この意味で、本手法は反省型・進化型のプロンプトおよび方策最適化の流れに連なり、過去の誤りの見直しを仕組みの一部にしている。ただし注意が必要である。要旨には、変異の具体的な演算、探索の予算、各構成要素のアブレーションは記されていない。これらは本文で確認すべき事項であり、ここでは推測しない。 結果は、特に小さなモデルに有利である。Geometry3Kにおいて、Qwen3VL-2Bの精度は42.0%から56.0%へ、14ポイント向上した。20億パラメータ規模のモデルが、より良い表現だけでこれほどの伸びを示した。これは、誤りのかなりの部分が推論能力の不足ではなく、推論の前に問題文の表現が損なわれていたことに由来する可能性を示す。著者は、複数の幾何推論ベンチマークで広範な実験と分析を行い、有効な形式化がマルチモーダル幾何推論に不可欠だと結論づけている。とはいえ、一つのベンチマークでの一つのモデルの結果を、一般則とみなすことはできない。より大きなモデルや他のベンチマークでも同程度の改善が得られるかは、独立した再現が必要である。
産業界にとっての示唆は、幾何の範囲を超える。視覚的あるいは半構造化された入力をテキストに変えてから推論する課題は、どれも同じ緊張を抱える。情報の抽出と情報の組織化は、別々の仕事である。グラフの質問応答、回路図の理解、設計図面の審査は、いずれもこの型に当てはまる。GeoReformは、中間表現を最適化すべき第一級の対象として扱うほうが、単にモデルを大きくするより割に合う場合があると示唆する。工学チームにとって現実的な一歩は、失敗事例を構造化して蓄積し、プロンプトだけでなく入力表現の修正にも使うことである。この道は低コストで監査しやすく、反復もしやすい。今日の技術レーダーに載せる価値がある。
Sources
FAQ
GeoReformが取り組む中心的な課題は何ですか。
幾何推論の障害は、事実を多く抽出することではなく、推論に役立つ形に組織することだと指摘します。Geometry3Kの200例で構造注入は28件の誤りを直す一方、13件の新たな誤りを生みました。そこで形式化を、失敗から改善できる方策として扱います。
最適化の流れはどのようなものですか。
推論パイプライン全体を実行し、失敗した軌跡を集め、現在の表現の欠陥を診断し、方策を変異させます。変異した方策は、実体、関係、制約、対象をより良く選択、接地、グループ化、提示します。信号は最終的な推論結果から得られます。
結果から何が言え、どんな限界がありますか。
Qwen3VL-2BはGeometry3Kで42.0%から56.0%に向上し、小さなモデルほど表現の質が効くことを示します。ただし要旨には大きなモデル、他のベンチマーク、構成要素ごとの寄与のデータがなく、本文の確認と独立した再現が必要です。