PageIndex: Schlussfolgerungs-Dokumentsuche ohne Vektorspeicher
PageIndex ist eine Open-Source-Dokumentenindexierungs- und -suche von VectifyAI, die sich auf ein vektorfreies, chunkfreies Schlussfolgerungs-RAG konzentriert. Traditionelles Vektor-RAG verlässt sich bei der Rückholung auf semantische Ähnlichkeit, aber Ähnlichkeit ist nicht Relevanz: Bei langen Dokumenten wie Geschäftsberichten, Rechtsdokumenten, Aufsichtsmeldungen und technischen Handbüchern ruft es oft Ähnliches aber Irrelevantes ab und verliert Relevantes aber Ähnliches. Von AlphaGo inspiriert, ersetzt PageIndex den Vektorindex durch einen hierarchischen Baumindex, sodass große Modelle wie ein Experte, der einen langen Bericht durchblättert, in zwei Schlussfolgerungsschritten suchen: Erst einen Baumindex des Dokuments erstellen, dann einen Agenten die Suche auf dem Baum durchführen. Seine Differenzierungsmerkmale sind nachverfolgbare, erklärbare Ergebnisse mit ausdrücklichen Zitaten und vollständigem Kontext einschließlich Konversationsverlauf und Fachwissen. Es eignet sich für professionelle Langdokument-Workflows in Finanz, Recht, Medizin und Wissenschaft und bietet sowohl einen lokalen Modus als auch eine Cloud-API.
Hintergrund
Retrieval-augmented Generation hat lange Zeit auf Vektordatenbanken gesetzt und Abfragen über die semantische Ähnlichkeit mit gespeicherten Textabschnitten verknüpft. Dieser Ansatz funktioniert bei gelegentlichen Fragen noch zufriedenstellend, versagt aber bei langen, hochriskanten Dokumenten. Das kleine chinesische Startup VectifyAI hat nun die Open-Source-Engine PageIndex veröffentlicht, die sowohl Vektorspeicher als auch die Textaufteilung in Abschnitte aufgibt. Damit positioniert sich das Projekt gegen den vorherrschenden Branchentrend, bei dem die meisten Teams größere Vektorindizes, feinere Chunking-Strategien und bessere Embedding-Modelle anstreben. Stattdessen ahmt PageIndex nach, wie ein menschlicher Experte einen langen Bericht durchblättert.
Das Kernproblem, das PageIndex angeht, ist eine Fehlpassung zwischen Retrieval-Methode und Dokumentnatur. Bei Geschäftsberichten, Rechtsdokumenten, Aufsichts- und Regulierungsmeldungen sowie technischen Handbüchern ruft die Vekturückholung häufig ähnliches aber irrelevantes Material ab, während relevantes aber ähnliches Material übersehen wird. Die Grundthese der Engine lautet, dass Ähnlichkeit nicht Relevanz bedeutet und wahre Relevanz推理 erfordert. Statt Abschnitte nach Distanzwerten zu sortieren, rekonstruiert PageIndex die Struktur eines Dokuments, damit Modelle zu Antworten schließen können.
Tiefenanalyse
PageIndex entlehnt sich ausdrücklich Inspiration von AlphaGo, dem Go-Spielsystem, das Entscheidungsäume durchsuchte statt Positionen auswendig zu lernen. Die Engine wandelt die strukturierte Layout eines Dokuments in einen hierarchischen Baumindex um und ersetzt damit den flachen Vektorindex. Der Ablauf läuft in zwei Schritten ab. Beim Indizieren wird für jedes Dokument ein Baumindex erzeugt, eine Struktur, die direkt aus dem Dokumentlayout extrahiert wird. Der Indizierungsmodell fasst nur zusammen und verfeinert, sodass ein Basismodell diese Aufgabe übernehmen kann. Beim Retrieval nutzt ein Agent ein Large Language Model, um den Baum durch Schlussfolgerung zu durchsuchen.
Dieser Wandel bewirkt mehrere konkrete Unterschiede. Das Indizieren wechselt von Vektoren zu Bäumen, das Retrieval von Ähnlichkeitssuche zu baumbasierter Schlussfolgerung, und die Ergebnisse von undurchsichtigen Wertungen zu Schlussfolgerungen, die sich expliziten Zitaten nachverfolgen lassen. Der Kontext erweitert sich über die Query-Embedding hinaus um Konversationsverlauf und Fachwissen. Entwickler können genau sehen, auf welchen Teil eines Dokuments eine Antwort verweist, anstatt auf Blackbox-Werte zu starren. Das Design beseitigt zugleich zwei schwere Abhängigkeiten der üblichen RAG-Pipeline und senkt so Komplexität und Wartungskosten.
Die Integration ist bewusst leichtgewichtig gehalten. Entwickler installieren das Paket pageindex über pip, konfigurieren den PageIndexClient mit separaten Modellen für den Aufbau und die Durchsuchung des Baumindexes, übermitteln ein Dokument und erhalten eine doc_id, um anschließend konversationelle Abfragen zu stellen. Ein kürzliches Update erlaubt dem lokalen Modus, Indizierung, Retrieval und Konversation vollständig auf dem Gerät mit den eigenen LLM-Schlüsseln abzuschließen, während derselbe Client mit einem API-Schlüssel auf PageIndex Cloud zeigen kann. Der lokale Modus nutzt standardmäßig einen Flash-Pfad zur schnellen Baumindizierung für textbasierte PDFs.
Branchenwirkung
PageIndex richtet sich an professionelle Langdokument-Workflows, in denen Genauigkeit und Compliance am meisten zählen. Zu den typischen Anwendungsfällen gehören die Analyse von Finanzberichten, Vertragsprüfungen, regulatorische Compliance-Abfragen und die Beantwortung von Fragen zu technischen Dokumentationen. Die Sektoren Finanz, Recht, Medizin und Wissenschaft profitieren von erklärbaren und überprüfbaren Ergebnissen, Bedingungen, die dort eine Rolle spielen, wo Entscheidungen auf Nachweis und Prüfung angewiesen sind. Indem die Engine die Abhängigkeit von Vektorspeichern und Chunking-Strategien verringert, bietet sie Engineering-Teams einen Weg zu besser nachverfolgbaren Antworten.
Für die Skalierung über Dokumente hinaus hat VectifyAI das PageIndex File System eingeführt und die Indizierungsebene auf einen Dateibaum erweitert, sodass die Engine über ein ganzes Korpus statt nur über ein einzelnes Dokument schließen kann. Dokumentationen, Website, Cloud und Blog bilden einen vollständigen Onboarding-Weg, während eine App einen anthropomorphisierten Dokumentanalyse-Agenten für lange professionelle Dokumente bereitstellt. Die Community bleibt um Themen wie agentic-ai, agents, context-engineering, information-retrieval, llm und rag aktiv.
Ausblick
PageIndex definiert die Langdokument-Rückholung neu, indem es die Relevanz von der Ähnlichkeit trennt und mit Schlussfolgerung und nachverfolgbaren Zitaten Sektoren mit hohen Genauigkeitsanforderungen bedient. Sein Wert für Entwickler liegt im Verringern der Abhängigkeit von Vektorinfrastruktur bei gleichzeitig erklär- und überprüfbaren Ergebnissen. Doch Risiken verdienen Beachtung. Die folgebasierte Rückholung hängt stark von der Modellfähigkeit ab, und Kosten sowie Latenz übersteigen in der Regel die rein vektorbasierten Retrievals. Aufrufe des Indizierungsmodells und die Größe des Baums beeinflussen die Erfahrung unmittelbar.
Die dokumentübergreifende Schlussfolgerung im Maßstab von Millionen von Dokumenten muss hinsichtlich Leistung und Konsistenz noch validiert werden, und neue Fähigkeiten wie Flash und das Dateisystem befinden sich noch in Entwicklung. Zu beobachtenden Zukunftspunkten gehören das Gleichgewicht zwischen Schlussfolgerungskosten und Retrieval-Latenz, die Skalierung von Baumindizes auf sehr große Korpus sowie die Frage, ob PageIndex sich in Branchen mit hohen Vertrauensanforderungen zu einer nachhaltigen Alternative zum Vektor-RAG entwickeln kann.
Sources
FAQ
Was ist PageIndex und welche Probleme der traditionellen Dokumentensuche löst es?
PageIndex ist eine Open-Source-RAG-Engine von VectifyAI, die ohne Vektorspeicher und Chunks auskommt. Es löst das Problem, dass semantische Ähnlichkeit in der traditionellen Vektorsuche bei langen Fachdokumenten oft nicht der Relevanz entspricht.
Was ist die Kerntechnologie und die Innovation von PageIndex?
Inspiriert von AlphaGo, verwendet es einen hierarchischen Baumindex anstelle von Vektorindizes. Dies ermöglicht großen Modellen eine schlussfolgernde Suche wie Experten, mit nachvollziehbaren, erklärbaren Ergebnissen und expliziten Zitaten.
Für welche Anwendungsfälle ist PageIndex geeignet und wie sieht die weitere Entwicklung aus?
Es ist ideal für lange Fachdokumente in Finanzen, Recht, Medizin und Wissenschaft, die tiefes Kontextverständnis und mehrstufiges Schlussfolgern erfordern. Zukünftig sind die Balance zwischen Inferenzkosten und Skalierbarkeit sowie die potenzielle Ablösung von Vektor-RAG zu beobachten.