Méthode RAG à graphe de connaissances multimodal renforcée par un contexte multi-granéarité
La génération augmentée par récupération (RAG) est largement utilisée pour atténuer les hallucinations des grands modèles de langage et des grands modèles de langage multimodaux (MLLM), les méthodes RAG basées sur des graphes de connaissances fournissant une information externe de haute qualité grâce à une connaissance structurée. Des travaux récents explo les graphes de connaissances multimodaux (MMKG) comme base de connaissance du GraphRAG pour intégrer la connaissance entre les modalités. Cependant, les méthodes existantes suivent généralement un pipeline commun traitant chaque modalité indépendamment avant fusion, ce qui limite l'utilisation du contexte textuel lors de l'extraction d'information visuelle et de la fusion de connaissance, et laisse un fossé sémantique entre l'image et le texte, contraignant les performances du GraphRAG multimodal. Nous proposons un nouveau cadre construisant un MMKG à contexte renforcé (CEMMKG), complétant chaque image d'un contexte textuel complémentaire à deux échelles, locale et globale. Le contexte local dépasse le texte environnant pour inclure des sentences sémantiquement liées à l'image, tandis que le contexte global fournit un résumé de niveau paragraphe ; nous introduisons en outre une conception multi-granéarité pour le contexte local afin de capturer des informations à différents niveaux de détail. De nombreuses expériences sur des ensembles de données centrés sur la vision valident l'efficacité du CCEMMKG et démontent sa large applicabilité à diverses méthodes RAG basées sur des MMKG.
Contexte
La génération augmentée par récupération (RAG) est devenue la approche dominante pour atténuer les hallucinations des grands modèles de langage et des grands modèles de langage multimodaux (MLLM). Les variantes basées sur des graphes de connaissances renforcent cette approche en injectant une information externe structurée, plus fiable qu'un simple retour de documents bruts. L'adoption croissante des graphes de connaissances multimodaux (MMKG) comme base de connaissance du GraphRAG permet désormais d'intégrer l'information à travers plusieurs modalités, étendant les avantages du retour structuré aux tâches combinant vision et langage.
Pourtant, la plupart des méthodes existantes suivent un pipeline commun traitant chaque modalité indépendamment avant toute fusion. Cette conception séquentielle signifie que le contexte textuel n'est utilisé qu'éparpillement lors de l'extraction d'information visuelle et de la fusion de connaissance, laissant subsister un fossé sémantique entre l'image et le texte qui contraint les performances globales du GraphRAG multimodal.
Analyse approfondie
Le framework proposé remédie à cette limitation en construisant un MMKG à contexte renforcé (CEMMKG), dans lequel chaque image est enrichie d'un contexte textuel complémentaire à deux échelles distinctes. Le contexte local dépasse le texte environnant pour inclure des sentences sémantiquement liées à l'image, fournissant une information plus riche et plus précise que la simple proximité. Le contexte global fournit quant à lui un résumé de niveau paragraphe aidant le modèle à saisir la narration sémantique d'ensemble.
Pour rendre ce contexte local adaptable à des besoins variés, la conception introduit une dimension multi-granéarité, permettant de capturer des informations sémantiquement pertinentes à différents niveaux de détail. Cela préserve les détails clés tout en conservant la synthèse globale, et embed chaque image dans un réseau sémantique à plusieurs couches plutôt que de la laisser comme élément visuel isolé. Lors de la construction, la méthode souligne l'utilisation complète des sémantiques textuelles durant les étapes d'extraction et de fusion, organisant les informations locales et globales de façon structurée dans le graphe.
Impact sur l'industrie
Les hallucinations ont longtemps constitué un goulot d'étranglement empêchant le déploiement des grands modèles de langage et multimodaux dans des domaines à haut risque tels que la santé, le droit et la finance, et le RAG est devenu une voie importante pour les atténuer. En comblant le fossé sémantique lors de la construction de la connaissance, l'approche proposée offre un chemin technique pratique vers des systèmes multimodaux plus fiables.
Son association d'un contexte local multi-granéarité à des résumés globaux fournit à la communauté open source des idées de représentation de connaissance réutilisables et évolutives, pouvant faire progresser le GraphRAG sur des tâches multimodaux plus complexes. Comme le framework démonte une large applicabilité à diverses méthodes RAG basées sur des MMKG, l'industrie peut intégrer cette amélioration sans modifier substantiellement ses architectures existantes.
Perspectives
La conception agnostique à la méthode suggère que le renforcement par contexte peut servir d'amélioration à usage général plutôt qu'une correction liée à un système précis, ouvrant la voie à son combinaison avec différentes stratégies de retour et de fusion à mesure que les graphes de connaissances multimodaux gagnent en ampleur.
Les travaux futurs pourraient étendre le mécanisme multi-granéarité à des niveaux de détail plus fins ou adapter l'équilibre local-global selon les patterns de recherche propres à un domaine. À mesure que les modèles multimodaux avancent vers un déploiement plus fiable et plus pratique, le renforcement par contexte structuré durant la construction de graphe devrait devenir un bloc de construction standard pour une génération multimodaux fiable.