GeoReform:让「形式化」本身进化,多模态几何解题的新路径

Published · AI Daily — AI-assisted deep research, methodology & disclosure

多模态大模型常读不准几何图中的关系。GeoReform 论文发现,把图转成文本的「结构注入」并不稳:在 Geometry3K 的 200 个样本上,它修复 28 个错误,却带来 13 个新错误。作者因此把形式化当作可优化的策略:跑完整推理流程,收集失败样本,诊断表示缺陷,再改写策略。Qwen3VL-2B 在 Geometry3K 上的准确率由 42.0% 升至 56.0%。

多模态大模型在几何题上长期吃力,原因并不神秘:题目的关键信息藏在图里,哪条线垂直,哪个角相等,哪段弧属于哪个圆,模型常常看不准,更谈不上正确使用。近年的主流办法,是先把图中的几何实体、关系和约束翻译成显式文本,再让模型在文本上推理。这个思路直观,也确实有效。但 2026 年 10 月 8 日发布的论文 GeoReform(arXiv 2610.12391,作者包括 Jialu Wang、Ruichen Zhang、Xiaoou Liu、Hua Wei 与 Tianlong Chen)提出了一个更尖锐的问题:翻译得好不好,本身就是难题。 论文给出了一组很有说服力的数字。在 Geometry3K 的 200 个样本上,结构注入修复了 28 个原本答错的题目,却同时让 13 道原本答对的题目变成了错误。净收益是正的,但代价同样真实。作者对原因的归纳很朴素:冗余的关系会分散模型的注意力,而对图中元素的指代含糊,会让模型把约束套在错误的对象上。换句话说,瓶颈不在于抽取出更多几何事实,而在于把这些事实组织成一种便于下游推理的表示。多给信息,并不等于给对信息。 基于这一判断,GeoReform 把形式化从「固定的解析器输出」改成「可以优化的策略」。它的流程可以概括为一个闭环。系统先用当前的形式化策略跑完整条推理流水线,然后收集失败的推演轨迹,接着诊断当前表示里的缺陷,最后对策略做变异,让它更好地选择、落地、分组和呈现几何实体、关系、约束与求解目标。这四个动词值得细看:选择决定哪些事实该留下,落地解决指代是否清楚,分组决定事实之间的结构,呈现则关系到文本的排布方式。每一步都对应论文所说的一类表示缺陷。

这种设计的关键,在于优化信号来自端到端的结果,而不是形式化本身的「看起来对不对」。传统解析器追求的是忠实还原图像,但忠实不等于有用。GeoReform 让失败的推理告诉系统:哪种表示会把模型带偏。这与近年反思式、进化式的提示与策略优化思路一脉相承,把「出错后复盘」变成了系统的一部分。需要说明的是,论文摘要并未披露变异的具体算子、搜索预算或各个组件的消融数据,这些细节要读正文才能判断,我们在这里不做推测。 从结果看,这条路线对小模型尤其友好。在 Geometry3K 上,Qwen3VL-2B 的准确率从 42.0% 提高到 56.0%,提升 14 个百分点。一个只有 20 亿参数量级的模型,靠更好的表示就拿到如此幅度的增益,说明相当一部分错误并非「不会推理」,而是「看到的题目被表示坏了」。作者还在多个几何推理基准上做了广泛实验与分析,结论是:有效的形式化对多模态几何推理至关重要。当然,单一数据集上的单一模型结果不能直接外推,是否在更大模型、更多基准上保持同样幅度的收益,仍需独立复现。

再往深处看,这篇论文还触及一个常被忽视的评估问题:如何判断一种形式化是「好」的。传统做法是拿它和人工标注的几何描述对比,看抽取得全不全、准不准。GeoReform 的数字却说明,这种静态指标和最终解题表现之间有缺口。结构注入在 200 个样本里既救回了题,也毁掉了题,说明同一份看似完整的描述,对不同题目的影响方向并不一致。因此,衡量形式化的合理标准,应当是它在下游推理中的净贡献,包括它引入的新错误。这与软件工程里「看覆盖率不如看回归」的经验相通:新增的信息若会破坏原本正确的行为,就不能算纯收益。 还有一点值得工程团队留意。把形式化当作策略来演化,意味着系统需要稳定的失败样本、可重复的评测流程,以及能把失败原因归到具体表示缺陷上的诊断环节。后者最难,因为同一个错误答案可能源于遗漏了关键关系,也可能源于保留了过多无关关系,或者指代含糊。论文用「选择、落地、分组、呈现」四个维度来组织这些缺陷,给出了一套实用的分类语言。即便不复现整套框架,团队也可以借用这套语言,去审视自己现有的视觉转文本流程,逐项检查哪一环最容易出问题。这样的做法门槛低,却能把模糊的「效果不好」变成可以逐项修复的具体清单。这比盲目堆叠更多提示词、更多抽取模块要踏实得多,也更容易向团队解释每一次改动究其根本究竟改善了什么。

对行业而言,这项工作的启发超出了几何本身。凡是需要把视觉或半结构化输入转换成文本再推理的任务,例如图表问答、电路图理解、工程制图审查,都面临同样的矛盾:信息抽取与信息组织是两件事。GeoReform 提示我们,把中间表示当作一等公民来优化,可能比一味放大模型更划算。对工程团队来说,一个现实的做法是,把失败样本系统地沉淀下来,用它们反向修正输入表示,而不只是修提示词。这是一条成本较低、可审计、也便于迭代的路径,值得在今天的技术雷达上占一个位置。

Sources

FAQ

GeoReform 解决的核心问题是什么?

它指出几何题的瓶颈不只是抽取更多几何事实,而是把事实组织成利于推理的表示。结构注入在 Geometry3K 的 200 个样本上修复 28 个错误,却引入 13 个新错误,所以作者把形式化当成可优化的策略,通过失败样本反复改进。

GeoReform 的优化流程是怎样的?

系统先跑完整推理流水线,收集失败推演,诊断当前表示的缺陷,再变异策略,使其更好地选择、落地、分组和呈现实体、关系、约束与目标。优化信号来自最终推理结果,而不是形式化看起来是否正确。

实验结果说明了什么,有哪些局限?

在 Geometry3K 上,Qwen3VL-2B 的准确率从 42.0% 升至 56.0%。这说明表示质量对小模型影响很大。但摘要只给出这一组数字,更大模型、其他基准的收益和各组件贡献,需要读正文并等待独立复现。