Where-OPD : autodistillation en ligne guidée spatialement pour les modèles multimodaux

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Where-OPD crée des scènes géométriques dont les identités et les coordonnées sont connues, puis fournit au seul enseignant figé un indice textuel contenant les positions et le nombre des objets visés. L’élève apprend les distributions de l’enseignant sur ses propres préfixes générés et n’utilise aucun indice à l’inférence. L’étude rapporte des progrès en comptage, lecture de graphiques et de documents sur trois modèles. Pour Qwen3.5-4B, la moyenne de sept évaluations de perception sur images réelles augmente de 3,23 points. Certains scores reculent toutefois et les cartes d’attention ne prouvent pas à elles seules le mécanisme.

Contexte et définition du problème

Un modèle multimodal peut échouer avant même de raisonner sur sa réponse : il manque un objet à compter, confond une catégorie voisine ou ne relie pas une légende aux bonnes valeurs d’un graphique. Agrandir une zone aide à lire un détail, mais ne résout pas automatiquement la recherche de plusieurs éléments répartis dans l’image.

Where-OPD étudie donc un privilège différent pour l’enseignant : une indication textuelle sur les positions pertinentes. Les images d’apprentissage restent des scènes géométriques simples, avec des formes colorées non superposées. Le passage aux photographies et documents réels doit être évalué, et non présumé à partir de cette distribution synthétique.

Architecture et principes techniques

Le générateur connaît avant le rendu la catégorie couleur-forme, le rayon et les coordonnées centrales de chaque élément, ainsi que la couleur du fond. Il choisit une catégorie présente dans la scène, recueille toutes ses positions et produit un indice en texte. Cet indice énumère les coordonnées et se termine par le nombre total. L’élève reçoit seulement l’image et la question. Une copie figée du modèle, jouant le rôle d’enseignant, reçoit aussi l’indice. L’élève échantillonne une réponse avec sa politique courante ; à chaque préfixe effectivement produit, l’enseignant calcule sa distribution du prochain jeton. La mise à jour rapproche la distribution de l’élève de celle de l’enseignant sur ces états. Ce caractère « en ligne » rattache la supervision aux trajectoires que l’élève rencontre, plutôt qu’à des réponses entièrement rédigées par le professeur. À l’inférence, ni indice ni enseignant ne sont nécessaires.

Une limite d’attribution est fondamentale : l’indice révèle aussi la réponse numérique. Le résultat principal ne suffit donc pas à montrer que l’élève apprend vraiment à chercher les objets. Les auteurs comparent séparément un indice contenant seulement la réponse et un indice spatial sans total. La meilleure configuration testée conserve l’enseignant figé ; une mise à jour par moyenne mobile exponentielle dégrade généralement la moyenne rapportée. Cette autodistillation exploite une vérité connue du générateur, elle ne produit pas spontanément de nouvelles annotations. Elle exige également l’échantillonnage de l’élève et l’évaluation par l’enseignant pendant l’apprentissage.

Résultats et usages pratiques

Les expériences couvrent Qwen3.5-4B, Qwen3.5-9B et Qwen3-VL-4B, avec décodage glouton et mode de réflexion désactivé par défaut. Sur quinze critères, la moyenne non pondérée de Qwen3.5-4B passe de 73,86 à 78,31, soit 4,45 points. CountQA passe de 32,00 à 34,53 ; ChartQA de 79,32 à 86,52 ; EvoChart de 68,32 à 78,43 ; OCRBench de 87,30 à 89,23. Le gain moyen de 3,23 points concerne sept évaluations de perception sur images réelles pour ce modèle précis. Les deux autres modèles affichent des gains moyens correspondants de 1,07 et 1,29 point. Il serait trompeur de présenter 3,23 comme un gain universel.

Les reculs sont réels : Qwen3.5-4B perd 0,63 point sur HR-Bench 4K. Qwen3.5-9B baisse de 0,05 point sur CVBench, de 0,62 sur BLINK et de 0,32 sur ZoomBench. Une méthode fondée sur le recadrage, Vision-OPD, gagne 8,90 points sur V* et 14,56 sur ZoomBench avec le modèle 4B, mais perd 10,73 sur CountQA. Sur les mêmes 3 000 scènes synthétiques et sept évaluations choisies, les moyennes sont 69,63 pour le modèle initial, 69,70 pour le réglage supervisé, 69,56 pour GRPO, 71,27 avec la réponse seule, 72,35 avec les positions sans total et 72,94 pour Where-OPD complet. Les positions apportent ainsi un signal distinct de la seule réponse, tandis que le total garde un effet supplémentaire. Les cartes d’attention illustrent quelques exemples ; elles ne constituent pas une preuve causale d’une recherche exhaustive.

Portée industrielle et perspectives

L’idée exploitable est de transformer les métadonnées d’un moteur de rendu en contexte temporaire pour l’enseignant, sans demander des cadres dessinés à la main ni un modèle externe de localisation. Elle peut orienter des travaux sur les instruments, graphiques et documents où plusieurs régions doivent être associées. Les résultats publiés ne valident cependant pas un service en production sur des objets occultés, du texte minuscule ou des mises en page inconnues. Une validation plus forte suivrait, échantillon par échantillon, les améliorations et dégradations, les objets oubliés ou comptés deux fois, ainsi que l’effet d’erreurs injectées dans les coordonnées et le total. Elle mesurerait aussi les coûts d’entraînement et les groupes les moins performants. La conclusion défendable reste un transfert mesuré dans le protocole et sur les tests explicitement rapportés.

[Article original](https://arxiv.org/html/2610.02117v1)

Sources

FAQ

Quel est le privilège de l’enseignant ?

Un texte issu du générateur qui énumère les coordonnées des objets visés et leur nombre total ; l’élève ne le reçoit pas.

Que mesure le gain de 3,23 points ?

La hausse moyenne sur sept évaluations de perception d’images réelles pour Qwen3.5-4B.