GeoReform: Die Formalisierung selbst weiterentwickeln, für multimodales Lösen von Geometrieaufgaben
Multimodale Modelle lesen Geometriediagramme falsch. GeoReform zeigt: Textumwandlung kann schaden. Bei 200 Geometry3K-Beispielen behebt Strukturinjektion 28 Fehler, erzeugt aber 13. Die Formalisierung wird optimiert. Qwen3VL-2B: 42,0 % auf 56,0 %.
Multimodale große Sprachmodelle tun sich seit Langem schwer mit Geometrie, und der Grund ist nicht geheimnisvoll. Die entscheidende Information steckt im Diagramm: Welche Geraden stehen senkrecht, welche Winkel sind gleich, welcher Bogen gehört zu welchem Kreis. Die Modelle lesen diese Beziehungen oft falsch, und sie wenden sie falsch an, selbst wenn sie sie richtig lesen. Das gängige Gegenmittel der letzten Jahre besteht darin, die Objekte, Beziehungen und Bedingungen des Diagramms in expliziten Text zu übersetzen und das Modell dann über diesen Text schließen zu lassen. Die Idee ist anschaulich, und sie funktioniert. Doch eine am 8. Oktober 2026 veröffentlichte Arbeit, GeoReform (arXiv 2610.12391, von Jialu Wang, Ruichen Zhang, Xiaoou Liu, Hua Wei und Tianlong Chen), stellt eine schärfere Frage: Ist nicht die Qualität der Übersetzung selbst das schwierige Problem?
Die Arbeit liefert einige kleine, aber aussagekräftige Zahlen. Bei 200 Beispielen aus Geometry3K behebt die Strukturinjektion 28 Aufgaben, die das Basismodell falsch löste. Zugleich bringt sie 13 Aufgaben zum Scheitern, die das Modell zuvor richtig löste. Per Saldo ist der Effekt positiv, doch der Preis ist real. Die Autoren erklären den Mechanismus in schlichten Worten. Redundante Beziehungen lenken das Modell ab. Mehrdeutige Verweise auf Diagrammelemente führen dazu, dass es eine Bedingung auf das falsche Objekt anwendet. Der Engpass liegt also nicht darin, mehr geometrische Fakten zu gewinnen. Er liegt darin, diese Fakten zu einer Darstellung zu ordnen, die den nächsten Denkschritt trägt. Einem Modell mehr Information zu geben heißt nicht, ihm die richtige Information zu geben.
Aus dieser Diagnose ändert GeoReform den Status der Formalisierung. Sie ist nicht länger die feste Ausgabe eines Parsers. Sie wird zu einer Strategie, die das System optimieren kann. Der Kreislauf lässt sich knapp beschreiben. Das System führt die gesamte Schlusskette mit der aktuellen Formalisierungsstrategie aus. Es sammelt die fehlgeschlagenen Durchläufe. Es diagnostiziert Mängel der aktuellen Darstellung. Dann mutiert es die Strategie, sodass sie geometrische Objekte, Beziehungen, Bedingungen und Zielgrößen besser auswählt, verankert, gruppiert und darstellt. Jedes der vier Verben entspricht einem eigenen Fehlerbild. Die Auswahl entscheidet, welche Fakten bleiben. Die Verankerung klärt, auf welches Diagrammelement sich eine Aussage bezieht. Die Gruppierung bestimmt die Struktur zwischen den Fakten. Die Darstellung legt fest, wie der Text für das Modell angeordnet ist.
Die zentrale Entwurfsentscheidung betrifft die Herkunft des Lernsignals. Ein klassischer Parser will das Bild getreu beschreiben, doch eine getreue Beschreibung ist nicht immer eine nützliche. Bei GeoReform sagen die gescheiterten Schlussketten dem System, welche Darstellungen das Modell in die Irre führen. In diesem Sinn gehört das Verfahren zur breiteren Familie reflexiver und evolutionärer Ansätze zur Optimierung von Prompts und Strategien, bei denen die Auswertung vergangener Fehler ein fester Teil des Systems ist. Eine Einschränkung ist angebracht. Die Kurzfassung beschreibt weder die Mutationsoperatoren noch das Suchbudget noch Ablationen einzelner Komponenten. Diese Einzelheiten stehen im Volltext, und wir spekulieren hier nicht darüber.
Das Hauptergebnis begünstigt kleine Modelle. Auf Geometry3K steigt die Genauigkeit von Qwen3VL-2B von 42,0 % auf 56,0 %, ein Gewinn von 14 Punkten. Ein Modell in der Größenordnung von zwei Milliarden Parametern gewinnt so viel allein durch eine bessere Darstellung. Das deutet darauf hin, dass ein beträchtlicher Teil seiner Fehler nicht aus mangelnder Schlussfähigkeit stammt, sondern aus einer Aufgabenstellung, die schon vor dem Schließen schlecht dargestellt wurde. Die Autoren berichten zudem von umfangreichen Experimenten und Analysen über mehrere Benchmarks für geometrisches Schließen und folgern, dass eine wirksame Formalisierung für multimodales geometrisches Schließen entscheidend ist. Ein Modell auf einem Benchmark ist dennoch kein allgemeines Gesetz. Ob derselbe Gewinn bei größeren Modellen und anderen Benchmarks bleibt, muss unabhängig nachgebildet werden.
Für die Branche reicht die Lehre über die Geometrie hinaus. Jede Aufgabe, die visuelle oder halbstrukturierte Eingaben vor dem Schließen in Text verwandelt, steht vor derselben Spannung: Information gewinnen und Information ordnen sind zwei getrennte Aufgaben. Fragen zu Diagrammen, das Verstehen von Schaltplänen und die Prüfung technischer Zeichnungen folgen diesem Muster. GeoReform legt nahe, dass es sich mehr lohnen kann, die Zwischendarstellung als erstklassiges Optimierungsobjekt zu behandeln, als das Modell bloß zu vergrößern. Ein praktischer Schritt für Entwicklungsteams besteht darin, Fehlfälle in einem strukturierten Protokoll zu sammeln und damit die Eingabedarstellung zu überarbeiten, nicht nur den Prompt. Dieser Weg ist günstig, prüfbar und leicht zu wiederholen. Er verdient heute einen Platz auf dem Technologieradar.
Sources
FAQ
Welches Kernproblem behandelt GeoReform?
Die Arbeit argumentiert, dass der Engpass nicht darin liegt, mehr Fakten zu extrahieren, sondern sie zu einer nützlichen Darstellung zu ordnen. Bei 200 Geometry3K-Beispielen behebt die Strukturinjektion 28 Fehler und erzeugt 13 neue. Daher wird die Formalisierung zu einer aus Fehlschlägen optimierbaren Strategie.
Wie funktioniert der Optimierungskreislauf?
Das System führt die gesamte Schlusskette aus, sammelt Fehlschläge, diagnostiziert Mängel der Darstellung und mutiert die Strategie. Sie wählt Objekte, Beziehungen, Bedingungen und Ziele besser aus, verankert, gruppiert und stellt sie besser dar. Das Signal stammt vom Endergebnis des Schließens.
Was zeigen die Ergebnisse, und was bleibt offen?
Qwen3VL-2B steigt auf Geometry3K von 42,0 % auf 56,0 %, was die Bedeutung der Darstellung für kleine Modelle zeigt. Die Kurzfassung nennt nichts zu größeren Modellen, anderen Benchmarks oder Ablationen, daher sind Volltextlektüre und unabhängige Nachbildung nötig.