GeoReform : faire évoluer la formalisation elle-même pour résoudre la géométrie multimodale
Les modèles multimodaux lisent mal les schémas. GeoReform montre que la conversion en texte peut nuire : sur 200 exemples de Geometry3K, l'injection de structure corrige 28 erreurs mais en crée 13. La formalisation est optimisée. Qwen3VL-2B : 42,0 % à 56,0 %.
Les grands modèles de langage multimodaux peinent depuis longtemps en géométrie, et la raison n'a rien de mystérieux. L'information décisive se trouve dans le schéma : quelles droites sont perpendiculaires, quels angles sont égaux, quel arc appartient à quel cercle. Les modèles lisent souvent mal ces relations, et ils les utilisent à tort même lorsqu'ils les lisent bien. Le remède courant de ces dernières années consiste à traduire les entités, les relations et les contraintes du schéma en texte explicite, puis à laisser le modèle raisonner sur ce texte. L'idée est intuitive et elle fonctionne. Pourtant, un article publié le 8 octobre 2026, GeoReform (arXiv 2610.12391, par Jialu Wang, Ruichen Zhang, Xiaoou Liu, Hua Wei et Tianlong Chen), pose une question plus tranchante : la qualité de la traduction n'est-elle pas elle-même le problème difficile ?
L'article avance quelques chiffres modestes mais parlants. Sur 200 exemples de Geometry3K, l'injection de structure corrige 28 problèmes que le modèle de base ratait, mais elle en fait aussi échouer 13 que le modèle réussissait auparavant. Le bilan net est positif, mais le coût est réel. Les auteurs expliquent le mécanisme en termes simples. Des relations redondantes distraient le modèle. Des références ambiguës aux éléments du schéma l'amènent à appliquer une contrainte au mauvais objet. Le goulot d'étranglement n'est donc pas l'extraction de davantage de faits géométriques. C'est l'organisation de ces faits en une représentation qui soutient l'étape de raisonnement suivante. Donner plus d'information à un modèle n'est pas lui donner la bonne information.
À partir de ce diagnostic, GeoReform change le statut de la formalisation. Elle n'est plus la sortie figée d'un analyseur. Elle devient une politique que le système peut optimiser. La boucle est simple à énoncer. Le système exécute toute la chaîne de raisonnement avec la politique de formalisation courante. Il collecte les trajectoires en échec. Il diagnostique les défauts de la représentation actuelle. Puis il fait muter la politique afin qu'elle sélectionne, ancre, regroupe et présente mieux les entités, les relations, les contraintes et les cibles. Chacun de ces quatre verbes correspond à un échec distinct. La sélection décide quels faits subsistent. L'ancrage précise à quel élément du schéma renvoie un énoncé. Le regroupement décide de la structure entre les faits. La présentation décide de la mise en forme du texte que le modèle lit.
Le choix de conception essentiel concerne l'origine du signal d'apprentissage. Un analyseur classique cherche à décrire l'image fidèlement, mais une description fidèle n'est pas toujours utile. Avec GeoReform, ce sont les raisonnements en échec qui indiquent au système quelles représentations égarent le modèle. En ce sens, la méthode appartient à la famille plus large des approches réflexives et évolutives d'optimisation de prompts et de politiques, où la revue des erreurs passées fait partie du système. Une réserve s'impose. Le résumé ne décrit ni les opérateurs de mutation, ni le budget de recherche, ni d'ablation de chaque composant. Ces détails figurent dans le texte complet, et nous ne les spéculons pas ici.
Le résultat principal favorise les petits modèles. Sur Geometry3K, la précision de Qwen3VL-2B passe de 42,0 % à 56,0 %, soit un gain de 14 points. Un modèle de l'ordre de deux milliards de paramètres gagne autant grâce à une meilleure représentation seule. Cela suggère qu'une part notable de ses erreurs ne vient pas d'un manque de capacité de raisonnement, mais d'un énoncé mal représenté avant même le début du raisonnement. Les auteurs rapportent aussi de vastes expériences et analyses sur plusieurs benchmarks de raisonnement géométrique, et concluent qu'une formalisation efficace est essentielle au raisonnement géométrique multimodal. Un modèle sur un benchmark ne fait pourtant pas une loi générale. Savoir si le même gain se maintient pour des modèles plus grands et d'autres benchmarks demande une réplication indépendante.
Pour l'industrie, la leçon dépasse la géométrie. Toute tâche qui transforme une entrée visuelle ou semi-structurée en texte avant de raisonner affronte la même tension : extraire l'information et l'organiser sont deux métiers distincts. Les questions-réponses sur graphiques, la compréhension de schémas électriques et la revue de plans techniques relèvent de ce schéma. GeoReform suggère que traiter la représentation intermédiaire comme un objet de premier rang à optimiser peut rapporter davantage que simplement agrandir le modèle. Une démarche concrète pour les équipes d'ingénierie consiste à conserver les cas d'échec dans un journal structuré et à s'en servir pour réviser la représentation d'entrée, et pas seulement le prompt. Cette voie est peu coûteuse, auditable et facile à itérer. Elle mérite une place sur le radar technologique du jour.
Sources
FAQ
Quel problème central GeoReform traite-t-il ?
L'article soutient que le goulot d'étranglement n'est pas d'extraire plus de faits, mais de les organiser en une représentation utile. Sur 200 exemples de Geometry3K, l'injection de structure corrige 28 erreurs et en ajoute 13. La formalisation devient donc une politique optimisable à partir des échecs.
Comment fonctionne la boucle d'optimisation ?
Le système exécute toute la chaîne de raisonnement, collecte les échecs, diagnostique les défauts de la représentation, puis fait muter la politique. Celle-ci sélectionne, ancre, regroupe et présente mieux entités, relations, contraintes et cibles. Le signal provient du résultat final du raisonnement.
Que montrent les résultats et que reste-t-il à vérifier ?
Qwen3VL-2B passe de 42,0 % à 56,0 % sur Geometry3K, ce qui montre le poids de la représentation pour les petits modèles. Le résumé ne donne rien sur les modèles plus grands, les autres benchmarks ou les ablations : lecture du texte complet et réplication indépendante restent nécessaires.