PageIndex :检索 documentaire sans base de vecteurs
PageIndex est un moteur d'indexation et de recherche de documents open source de VectifyAI, centré sur un RAG de raisonnement sans vecteur et sans découpage. Le RAG vectoriel traditionnel repose sur la similarité sémantique pour la récupération, mais la similarité n'est pas la pertinence : sur les longs documents comme les comptes annuels, les documents juridiques, les déclarations réglementaires et les manuels techniques, il récupère souvent du similaire mais non pertinent tout en manquant du pertinent mais similaire. Inspiré par AlphaGo, PageIndex remplace l'index vectoriel par un index arborescent hiérarchique, permettant aux grands modèles de rechercher comme un expert feuilletant un long rapport en deux étapes de raisonnement : générer d'abord un index arborescent du document, puis faire rechercher cet arbre par un agent. Ses différenciateurs sont des résultats traçables et explicables avec des citations explicites et un contexte complet incluant l'histoire de la conversation et les connaissances du domaine. Il convient aux flux professionnels de longs documents en finance, en droit, en médecine et dans l'académique, et propose à la fois un mode local et une API cloud.
Contexte
Depuis longtemps, la génération augmentée de recherche s'appuie sur des bases de données vectorielles, associant les requêtes aux fragments stockés par similarité sémantique. Cette approche convient aux questions occasionnelles mais échoue sur les documents longs et à forts enjeux. VectifyAI, petite startup chinoise, vient de publier un moteur open source nommé PageIndex qui abandonne à la fois les bases vectorielles et le découpage en fragments. Il se positionne contre la trajectoire dominante du secteur, où la plupart des équipes poursuivent des index plus grands, un découage plus fin et des modèles d'embedding meilleurs. PageIndex simule plutôt la façon dont un expert humain lit un long rapport.
Le problème central ciblé par PageIndex est le décalage entre la méthode de recherche et la nature du document. Sur les comptes annuels, les déploiements juridiques, les déclarations réglementaires et les manuels techniques, la recherche vectorielle fait souvent ressortir des passages similaires mais non pertinents tout en manquant des contenus pertinents mais similaires. La thèse du moteur est que la similarité n'est pas la pertinence, et qu'une vraie pertinence exige le raisonnement. Plutôt que de classer les fragments par scores de distance, PageIndex reconstruit la structure d'un document pour que les modèles puissent raisonner vers les réponses.
Analyse approfondie
PageIndex s'inspire explicitement d'AlphaGo, le système de jeu de go cherchant dans des arbres de décision plutôt que par mémorisation. Le moteur convertit la mise en page structurée d'un document en un index arborescent hiérarchique, remplaçant l'index vectoriel plat. Le déroulement s'exécute en deux étapes. Pendant l'indexation, un index en arbre est généré pour chaque document, structure extraite directement de la mise en page. Le modèle d'indexation ne fait que résumer et affiner, un modèle de base peut donc réaliser la tâche. Pendant la recherche, un agent utilise un grand modèle de langage pour explorer l'arbre par raisonnement.
Ce changement produit plusieurs différences concrètes. L'indexation passe des vecteurs aux arbres, la recherche passe de la similarité au raisonnement arborescent, et les résultats passent de scores opaques à des conclusions traçables vers des citations explicites. Le contexte s'élargit aussi au-delà de l'embedding de requête pour inclure l'histoire de la conversation et les connaissances du domaine. Les développeurs voient exactement quelle partie d'un document une réponse désigne plutôt que des scores en boîte noire. Le design supprime également deux lourdes dépendances du pipeline RAG, réduisant complexité et coûts de maintenance.
L'intégration est délibérément légère. Les développeurs installent le package pageindex via pip, configurent le PageIndexClient avec des modèles distincts pour bâtir et chercher l'arbre, soumettent un document pour obtenir un doc_id, puis émettent des requêtes conversationnelles. Une mise à jour récente permet au mode local de réaliser entièrement l'indexation, la recherche et la conversation sur l'appareil avec les propres clés LLM de l'équipe, tandis que le même client peut pointer vers PageIndex Cloud avec une clé API. Le mode local adopte par défaut un chemin rapide Flash pour les PDF à base de texte.
Impact sur l'industrie
PageIndex cible les workflows professionnels de documents longs où l'exactitude et la conformité comptent le plus. Les usages typiques incluent l'analyse de comptes annuels, la révision de contrats, les requêtes de conformité réglementaire et les réponses aux questions sur la documentation technique. Les secteurs de la finance, du droit, de la médecine et de l'académique tirent parti de résultats explicables et auditables, conditions essentielles là où les décisions exigent des traces écrites et des revues. En réduisant la dépendance aux bases vectorielles et aux stratégies de découpage, le moteur offre aux équipes d'ingénierie un chemin vers des réponses plus traçables.
Pour l'échelle trans-document, VectifyAI a introduit PageIndex File System, étendant la couche d'indexation à un arbre de niveau fichier afin que le moteur puisse raisonner sur un corpus entier plutôt qu'un seul document. Les ressources de documentation, de site web, de cloud et de blog forment un chemin d'intégration complet, tandis qu'une application propose un agent d'analyse de documents humanisé destiné aux longs documents professionnels. La communauté reste active autour de thèmes tels que agentic-ai, agents, context-engineering, information-retrieval, llm et rag.
Perspectives
PageIndex redéfinit la recherche de documents longs en séparant la pertinence de la similarité, utilisant le raisonnement et des citations traçables pour servir des secteurs exigeant une grande exactitude. Sa valeur pour les développeurs réside dans la réduction de la dépendance à l'infrastructure vectorielle tout en rendant les résultats explicables et auditables. Pourtant, des risques méritent l'attention. La recherche par raisonnement dépend fortement de la capacité des modèles, et le coût comme le délai dépassent généralement ceux d'une recherche purement vectorielle. Les appels au modèle d'indexation et la taille de l'arbre affectent directement l'expérience.
Le raisonnement trans-document à l'échelle du million de documents reste à valider en performance et en cohérence, et de nouvelles capacités comme Flash et le fichier système restent en développement. Les orientations à observer incluent l'équilibre entre coût du raisonnement et délai de recherche, la façon dont les index arborescents s'étendent à de très grands corpus, et si PageIndex peut devenir une alternative durable au RAG vectoriel dans les industries exigeant des réponses hautement fiables.
Sources
FAQ
Qu'est-ce que PageIndex et quels problèmes de recherche de documents résout-il ?
PageIndex est un moteur RAG basé sur le raisonnement, sans base vectorielle ni découpage, développé par VectifyAI. Il corrige les problèmes de pertinence des recherches traditionnelles basées sur la similarité sémantique pour les longs documents spécialisés.
Quelle est la technologie clé et l'innovation majeure de PageIndex ?
Inspiré par AlphaGo, il utilise un index arborescent hiérarchique au lieu d'un index vectoriel. Cela permet aux grands modèles de rechercher en raisonnant, offrant des résultats traçables, explicables et avec des citations explicites.
À quels cas d'utilisation PageIndex est-il destiné et quelles sont les prochaines étapes de son évolution ?
Il est idéal pour les documents professionnels longs dans la finance, le droit, la médecine et l'académie, nécessitant une compréhension contextuelle approfondie. Son avenir réside dans l'équilibre coût/latence et l'extension aux corpus massifs.