Where-OPD: Räumlich angeleitete On-Policy-Selbstdestillation multimodaler Modelle
Where-OPD erzeugt geometrische Szenen mit bekannten Objektklassen und Koordinaten. Nur ein eingefrorenes Lehrermodell erhält einen Texthinweis mit Positionen und Anzahl der gesuchten Objekte. Das Schülermodell lernt die Tokenverteilungen des Lehrers auf selbst erzeugten Präfixen und benötigt bei der Inferenz keinen Hinweis. Die Studie meldet Verbesserungen beim Zählen sowie beim Lesen von Diagrammen und Dokumenten über drei multimodale Modelle hinweg. Bei Qwen3.5-4B steigt der Mittelwert von sieben Tests mit realen Bildern um 3,23 Prozentpunkte. Einzelne Tests verschlechtern sich jedoch; Aufmerksamkeitskarten belegen den Mechanismus nicht allein.
Hintergrund und Problemstellung
Bei visuellen Fragen scheitert ein multimodales Modell häufig schon beim Sammeln der Belege. Beim Zählen muss es alle Objekte einer gesuchten Farbe und Form finden; bei Diagrammen muss es Legende, Achsen und räumlich getrennte Werte verbinden. Eine vergrößerte Bildregion verbessert die Lesbarkeit eines Details, lehrt aber nicht zwangsläufig die Integration mehrerer Regionen.
Where-OPD untersucht deshalb einen anderen Informationsvorsprung für das Lehrermodell: einen Text mit den Positionen der relevanten Objekte. Die Trainingsbilder bestehen aus einfachen, nicht überlappenden geometrischen Formen. Ob der Effekt auf natürliche Bilder übergeht, muss anhand benannter Tests gemessen werden und folgt nicht schon aus der Konstruktion der Szenen.
Architektur und technische Prinzipien
Vor dem Rendern kennt der Generator für jedes Objekt die kombinierte Farb- und Formklasse, den Radius und die Mittelpunktkoordinaten sowie die Hintergrundfarbe. Er wählt eine vorhandene Zielklasse, ermittelt sämtliche passenden Positionen und formuliert einen Hinweis. Dieser nennt die Koordinaten und am Ende auch die Gesamtzahl. Der Schüler erhält Bild und Frage. Eine eingefrorene Kopie desselben Modells erhält zusätzlich den Hinweis. Der aktuelle Schüler erzeugt eine Antwortsequenz; für jedes tatsächlich erzeugte Präfix bewertet der privilegierte Lehrer die Verteilung des nächsten Tokens. Beim Training wird die Schülerverteilung an diese Verteilung angenähert. Die Aufsicht liegt damit auf Zuständen, die der Schüler selbst erreicht, statt nur auf unabhängig erzeugten Lehrerantworten. Bei der späteren Inferenz entfallen Hinweis und Lehrer.
Die zentrale Grenze der Interpretation liegt im Antwortleck: Der Hinweis enthält bereits die korrekte Anzahl. Ein Gewinn im Hauptversuch beweist daher keine gelernte visuelle Suche. Die Arbeit vergleicht zusätzlich einen Hinweis nur mit Antwort und räumliche Positionen ohne Gesamtsumme. Unter den getesteten Einstellungen erzielt ein eingefrorener Lehrer die beste mittlere Leistung; eine Aktualisierung per exponentiellem gleitendem Mittel verschlechtert sie überwiegend. Die richtige Zählung stammt aus dem bekannten Zustand des Generators. Das Verfahren braucht während des Trainings sowohl das Sampling des Schülers als auch die Bewertung durch den Lehrer und ist nicht mit den Kosten einer einfachen überwachten Feinabstimmung gleichzusetzen.
Empirische Bewertung und Anwendung
Getestet werden Qwen3.5-4B, Qwen3.5-9B und Qwen3-VL-4B. Standardmäßig erfolgen gierige Dekodierung und Auswertung ohne Denkmodus. Beim ersten Modell steigt das ungewichtete Mittel aus fünfzehn Benchmarks von 73,86 auf 78,31, also um 4,45 Punkte. CountQA verbessert sich von 32,00 auf 34,53, ChartQA von 79,32 auf 86,52, EvoChart von 68,32 auf 78,43 und OCRBench von 87,30 auf 89,23. Der häufig genannte Zuwachs von 3,23 Punkten ist das Mittel aus sieben Prüfungen mit realen Bildern für Qwen3.5-4B. Für die beiden anderen Modelle nennt die Studie entsprechende Zuwächse von 1,07 und 1,29 Punkten. Diese Mittelwerte sind kein Nachweis einer Verbesserung in jedem Einzelfall.
Es gibt Gegenbeispiele: Qwen3.5-4B verliert auf HR-Bench 4K 0,63 Punkte. Bei Qwen3.5-9B sinken CVBench um 0,05, BLINK um 0,62 und ZoomBench um 0,32 Punkte. Das auf Ausschnitte gestützte Vision-OPD gewinnt mit dem 4B-Modell 8,90 Punkte auf V* und 14,56 auf ZoomBench, verliert jedoch 10,73 auf CountQA. Die Wahl des Lehrervorsprungs verschiebt folglich die Stärken und Schwächen. Eine Ablation auf denselben 3.000 künstlichen Szenen und sieben ausgewählten Tests ergibt 69,63 für das Ausgangsmodell, 69,70 für überwachtes Training, 69,56 für GRPO, 71,27 für einen Hinweis nur mit Antwort, 72,35 für Positionen ohne Summe und 72,94 für die vollständige Methode. Die Positionen tragen über die Antwort hinaus bei, doch auch die Summe bringt einen Zusatznutzen. Visualisierte Aufmerksamkeitskarten sind Hinweise auf mögliche Belegnutzung, kein kausaler Beweis zuverlässiger Objektsuche.
Industrielle Bedeutung und Ausblick
Das übertragbare Entwicklungsprinzip besteht darin, bekannte Metadaten eines Bildgenerators als vorübergehenden Lehrerkontext zu verwenden. Dadurch lassen sich Forschungsdaten ohne manuell gezeichnete Objektgrenzen und ohne externes Lokalisierungsmodell erzeugen. Für Messgeräte, Diagramme und Dokumente ist das interessant, weil dort mehrere Belegstellen kombiniert werden müssen. Die Studie belegt aber noch keine Betriebstauglichkeit bei Verdeckung, winziger Schrift, neuen Layouts oder sicherheitskritischer Prüfung. Eine stärkere Folgestudie sollte gepaarte Ergebnisse pro Beispiel veröffentlichen, übersehene und doppelt gezählte Objekte erfassen sowie Koordinaten und Gesamtsummen gezielt stören. Zusätzlich sind Rechenkosten und die Leistung schwacher Teilgruppen nötig. Die derzeit belastbare Aussage beschränkt sich auf den gemessenen Transfer unter den veröffentlichten Testbedingungen.
[Originalarbeit](https://arxiv.org/html/2610.02117v1)
Sources
FAQ
Was erhält nur das Lehrermodell?
Einen vom Generator erzeugten Text mit den Koordinaten der Zielobjekte und ihrer Gesamtzahl; der Schüler erhält ihn nicht.
Worauf beziehen sich die 3,23 Punkte?
Auf den mittleren Zuwachs von Qwen3.5-4B in sieben Prüfungen mit realen Bildern.