SCoR Visuel RAG : Sélection de contexte et intégration d'preuves par agent
Cette étude traite de la difficulté d'exploiter les preuves dans la Génération Augmentée par Récupération Visuelle (VRAG). Les méthodes existantes font face à deux défis : les preuves visuelles pertinentes sont rares, soit concentrées dans une région locale d'une page, soit dispersées sur plusieurs pages ; et les approches par agent actuelles répondent principalement à partir de trajectoires d'exploration brutes ou de mémoires textuelles compressées, sans ensemble organisé de images de soutien, ce qui rend les réponses sensibles au bruit d'exploration et obscurcit la chaîne de raisonnement par preuves. Les auteurs estiment que le goulot d'étranglement ne se limite pas à la découverte de preuves mais aussi à leur préservation et organisation avant la génération de réponse. Ils proposent SCoRE, une boucle d'agent unifiée qui, pendant l'exploration, ne conserve que les observations pertinentes pour la requête avec leurs pointeurs de source, les écrit dans un registre textuel pour border le contexte visuel, et à la fin recharge les images originales et les intègre en preuves ordonnées pour répondre, découplant le raisonnement final de l'essai-erreur d'exploration. L'entraînement combine la distillation de trajectoires de démarrage à froid filtrées avec un apprentissage par renforcement sensible aux preuves, et la fonction de récompense équilibre la couverture des preuves, la compacité de l'intégration et la justesse de la réponse.
Contexte
La Génération Augmentée par Récupération Visuelle, dite VRAG, permet aux modèles de naviguer dans des documents riches en images, d'en extraire les pages pertinentes comme preuves visuelles et de raisonner sur leur contenu pour répondre aux requêtes des utilisateurs. Ce paradigme offre un fort potentiel pour la réponse aux questions sur documents et la compréhension de graphiques. Pourtant, les auteurs soulignent deux défis structurels qui freinent depuis longtemps l'exploitation efficace des preuves. La première difficulté réside dans le caractère souvent extrêmement rare des preuves véritablement liées à une réponse : celles-ci peuvent se concentrer dans une petite région locale d'une seule page ou se disperser sur plusieurs pages, compliquant la recherche et la localisation.
Le second problème concerne les approches par agent existantes, qui répondent principalement à partir de trajectoires d'exploration brutes ou de mémoires textuelles compressées plutôt qu'à partir d'un ensemble organisé et traçable d'images de soutien. Cela rend les réponses sensibles au bruit d'exploration et assombrit la chaîne de raisonnement par preuves qui devrait rester limpide. Les auteurs estiment que le goulot d'étranglement ne se limite pas à la découverte des preuves, mais réside aussi dans leur préservation et leur organisation avant la génération de réponse, ce qui recentre le travail sur la rétention et la structuration plutôt que sur la simple récupération.
Analyse approfondie
La contribution centrale est SCoRE, une boucle d'agent unifiée couplant le choix explicite des preuves à leur intégration. Pendant l'exploration, le modèle navigue dans les documents sans envoyer toutes les observations brutes au raisonnement final. Il ne conserve que les observations pertinentes pour la requête, accompagnées de pointeurs de source, et les consigne dans un registre textuel constamment maintenu. Cette approche préserve les découvertes précieuses tout en bornant le contexte visuel, évitant ainsi l'expansion du contexte qui survient quand trop de pages sont conservées.
Lorsque l'exploration se termine et que la phase de réponse débute, le système recharge les images originales citées selon les pointeurs du registre et les intègre en un ensemble de preuves ordonné logiquement avant de générer la réponse finale. Ce dispositif réalise deux découplages importants. Le raisonnement final est séparé de l'essai-erreur d'exploration, protégeant les réponses du bruit direct. Parallèlement, les liens indexés de l'argument à l'image permettent de remonter chaque conclusion à son image source, garantissant une ancrage visuel strict.
L'entraînement suit une optimisation bout-en-bout de la boucle unifiée, combinant la distillation de trajectoires de démarrage à froid filtrées avec un apprentissage par renforcement sensible aux preuves. La phase de démarrage à froid fournit des trajectoires de base de qualité raisonnable, puis élimine les samples inefficaces ou erronés pour offrir un point de départ fiable. L'étape de renforcement recourt à une fonction de récompense spécialement conçue qui pousse simultanément trois objectifs : une couverture suffisante des preuves, la compacité des preuves intégrées et la justesse de la réponse finale, équilibrant exploration et intégration.
Impact sur l'industrie
Ce travail propose un modèle de conception réutilisable pour la VRAG. En élargissant le regard de la recherche depuis la possibilité de récupérer des preuves vers celle de les préserver, les organiser et les traçer, il revêt une portée pratique pour les documents réels, vastes et riches en images. L'association d'un registre textuel à des liens d'argument à image indexés maîtrise le coût du contexte tout en garantissant l'interprétabilité et la vérifiabilité des conclusions, ce qui le rend particulièrement adapté à des déploiements sensibles à la crédibilité tels que l'intelligence documentaire d'entreprise, la révision de contrats ou la réponse aux questions sur des manuels techniques.
Le paradigme d'entraînement combinant distillation et renforcement sensible aux preuves constitue aussi une voie de référence pour l'optimisation bout-en-bout des modèles de type agent, susceptible de réduire la difficulté d'entraînement et d'améliorer la stabilité. Pour la communauté open source, la boucle d'agent unifiée et l'approche d'intégration des preuves offrent une nouvelle base de référence et une marge de progrès pour le raisonnement visuel, les agents multimodaux et la compréhension de documents longs.
Perspectives
Les expériences se sont déroulées autour de la tâche centrale de réponse aux questions visuelles, évaluant la performance globale et l'efficacité de chaque composant sur des jeux de données et des référentiels. Les mesures couvrent à la fois la précision au niveau des réponses et la couverture ainsi que la qualité d'intégration au niveau des preuves, mesurant si le modèle trouve réellement les preuves pertinentes, les organise de façon compacte et produit des réponses fiables. Des études d'消融 isolent le rôle des éléments clés : savoir si le registre textuel préserve les preuves critiques tout en bornant le contexte visuel, si le rechargement et l'intégration des preuves améliorent l'ancrage visuel, et dans quelle mesure chaque objectif de récompense contribue indépendamment.
Les résultats indiquent qu'avec le choix et l'intégration explicites, le modèle maintient une qualité de réponse stable même dans des situations de preuves rares, que le bruit d'exploration voit son interférence avec les conclusions finales nettement atténuée et que la chaîne de raisonnement appuyée sur les preuves devient plus claire et traçable. Ces constats valident les avantages doubles du framework en efficacité d'exploitation des preuves et en fiabilité du raisonnement, ouvrant la voie à une compréhension de documents multimodaux plus fiablee dans des contextes à forts enjeux.
Sources
FAQ
Qu'est-ce que SCoRE en RAG visuel ?
SCoRE est une boucle d'agent pour le RAG visuel qui garde les observations pertinentes et leurs sources dans un registre textuel, puis recharge les images comme preuves ordonnées.
Pourquoi SCoRE est-il important pour la question-réponse sur documents ?
Il traite les preuves visuelles rares ou dispersées, isole le raisonnement du bruit d'exploration, et ancre chaque conclusion dans une image originale pour des réponses traçables.
Que faut-il surveiller ensuite pour SCoRE et le RAG visuel ?
À suivre : la QA de documents d'entreprise, la revue de contrats et l'adoption en open source de son entraînement par distillation et renforcement.