GeoReform:讓「形式化」本身進化,多模態幾何解題的新路徑

Published · AI Daily — AI-assisted deep research, methodology & disclosure

多模態大模型常讀不準幾何圖中的關係。GeoReform 論文發現,把圖轉成文字的「結構注入」並不穩:在 Geometry3K 的 200 個樣本上,它修復 28 個錯誤,卻帶來 13 個新錯誤。作者因此把形式化當作可最佳化的策略:跑完整推理流程,收集失敗樣本,診斷表示缺陷,再改寫策略。Qwen3VL-2B 在 Geometry3K 上的準確率由 42.0% 升至 56.0%。

多模態大模型在幾何題上長期吃力,原因並不神秘:題目的關鍵資訊藏在圖裡,哪條線垂直,哪個角相等,哪段弧屬於哪個圓,模型常常看不準,更談不上正確使用。近年的主流辦法,是先把圖中的幾何實體、關係和約束翻譯成顯式文字,再讓模型在文字上推理。這個思路直觀,也確實有效。但 2026 年 10 月 8 日釋出的論文 GeoReform(arXiv 2610.12391,作者包括 Jialu Wang、Ruichen Zhang、Xiaoou Liu、Hua Wei 與 Tianlong Chen)提出了一個更尖銳的問題:翻譯得好不好,本身就是難題。 論文給出了一組很有說服力的數字。在 Geometry3K 的 200 個樣本上,結構注入修復了 28 個原本答錯的題目,卻同時讓 13 道原本答對的題目變成了錯誤。淨收益是正的,但代價同樣真實。作者對原因的歸納很樸素:冗餘的關係會分散模型的注意力,而對圖中元素的指代含糊,會讓模型把約束套在錯誤的物件上。換句話說,瓶頸不在於抽取出更多幾何事實,而在於把這些事實組織成一種便於下游推理的表示。多給資訊,並不等於給對資訊。 基於這一判斷,GeoReform 把形式化從「固定的解析器輸出」改成「可以最佳化的策略」。它的流程可以概括為一個閉環。系統先用當前的形式化策略跑完整條推理流水線,然後收集失敗的推演軌跡,接著診斷當前表示裡的缺陷,最後對策略做變異,讓它更好地選擇、落地、分組和呈現幾何實體、關係、約束與求解目標。這四個動詞值得細看:選擇決定哪些事實該留下,落地解決指代是否清楚,分組決定事實之間的結構,呈現則關係到文字的排布方式。每一步都對應論文所說的一類表示缺陷。

這種設計的關鍵,在於最佳化訊號來自端到端的結果,而不是形式化本身的「看起來對不對」。傳統解析器追求的是忠實還原影象,但忠實不等於有用。GeoReform 讓失敗的推理告訴系統:哪種表示會把模型帶偏。這與近年反思式、進化式的提示與策略最佳化思路一脈相承,把「出錯後覆盤」變成了系統的一部分。需要說明的是,論文摘要並未披露變異的具體運算元、搜尋預算或各個元件的消融資料,這些細節要讀正文才能判斷,我們在這裡不做推測。 從結果看,這條路線對小模型尤其友好。在 Geometry3K 上,Qwen3VL-2B 的準確率從 42.0% 提高到 56.0%,提升 14 個百分點。一個只有 20 億引數量級的模型,靠更好的表示就拿到如此幅度的增益,說明相當一部分錯誤並非「不會推理」,而是「看到的題目被表示壞了」。作者還在多個幾何推理基準上做了廣泛實驗與分析,結論是:有效的形式化對多模態幾何推理至關重要。當然,單一資料集上的單一模型結果不能直接外推,是否在更大模型、更多基準上保持同樣幅度的收益,仍需獨立復現。

再往深處看,這篇論文還觸及一個常被忽視的評估問題:如何判斷一種形式化是「好」的。傳統做法是拿它和人工標註的幾何描述對比,看抽取得全不全、準不準。GeoReform 的數字卻說明,這種靜態指標和最終解題表現之間有缺口。結構注入在 200 個樣本里既救回了題,也毀掉了題,說明同一份看似完整的描述,對不同題目的影響方向並不一致。因此,衡量形式化的合理標準,應當是它在下游推理中的淨貢獻,包括它引入的新錯誤。這與軟體工程裡「看覆蓋率不如看回歸」的經驗相通:新增的資訊若會破壞原本正確的行為,就不能算純收益。 還有一點值得工程團隊留意。把形式化當作策略來演化,意味著系統需要穩定的失敗樣本、可重複的評測流程,以及能把失敗原因歸到具體表示缺陷上的診斷環節。後者最難,因為同一個錯誤答案可能源於遺漏了關鍵關係,也可能源於保留了過多無關關係,或者指代含糊。論文用「選擇、落地、分組、呈現」四個維度來組織這些缺陷,給出了一套實用的分類語言。即便不復現整套框架,團隊也可以借用這套語言,去審視自己現有的視覺轉文字流程,逐項檢查哪一環最容易出問題。這樣的做法門檻低,卻能把模糊的「效果不好」變成可以逐項修復的具體清單。這比盲目堆疊更多提示詞、更多抽取模組要踏實得多,也更容易向團隊解釋每一次改動究其根本究竟改善了什麼。

對行業而言,這項工作的啟發超出了幾何本身。凡是需要把視覺或半結構化輸入轉換成文字再推理的任務,例如圖表問答、電路圖理解、工程製圖審查,都面臨同樣的矛盾:資訊抽取與資訊組織是兩件事。GeoReform 提示我們,把中間表示當作一等公民來最佳化,可能比一味放大模型更划算。對工程團隊來說,一個現實的做法是,把失敗樣本系統地沉澱下來,用它們反向修正輸入表示,而不只是修提示詞。這是一條成本較低、可審計、也便於迭代的路徑,值得在今天的技術雷達上佔一個位置。

Sources

FAQ

GeoReform 解決的核心問題是什麼?

它指出幾何題的瓶頸不只是抽取更多幾何事實,而是把事實組織成利於推理的表示。結構注入在 Geometry3K 的 200 個樣本上修復 28 個錯誤,卻引入 13 個新錯誤,所以作者把形式化當成可最佳化的策略,透過失敗樣本反覆改進。

GeoReform 的最佳化流程是怎樣的?

系統先跑完整推理流水線,收集失敗推演,診斷當前表示的缺陷,再變異策略,使其更好地選擇、落地、分組和呈現實體、關係、約束與目標。最佳化訊號來自最終推理結果,而不是形式化看起來是否正確。

實驗結果說明了什麼,有哪些侷限?

在 Geometry3K 上,Qwen3VL-2B 的準確率從 42.0% 升至 56.0%。這說明表示質量對小模型影響很大。但摘要只給出這一組數字,更大模型、其他基準的收益和各元件貢獻,需要讀正文並等待獨立復現。