PageIndex:ベクトルストア不要の推論型ドキュメント検索エンジン

Published 2026-09-11 · AI Daily — AI-assisted deep research, methodology & disclosure

PageIndex は VectifyAI が提供するオープンソースのドキュメントインデックス・検索エンジンで、「ベクトル不要・チャンク不要」の推論型 RAG を特徴とします。従来のベクトル RAG は意味的類似性で検索しますが、類似性は関連性とは限りません。決算説明書、法務文書、規制提出物、技術マニュアルなどの長文書では、似て無関係な内容を召回し、関連する内容を見落とすことがあります。PageIndex は AlphaGo に着想を得て、ベクトルインデックスの代わりに階層ツリーインデックスを用い、大規模モデルが人間の専門家が長い報告書を読むように2段階の推論で検索します。まずドキュメントのツリーインデックスを生成し、エージェントでツリーを推論的に検索します。差異化の特徴は、追跡可能で説明可能な結果に明示的な引用を付し、会話履歴やドメイン知識を含む完全なコンテキストを取り込む点です。金融、法務、医療、学術など、コンテキスト理解と多段推論が必要な専門的な長文書ワークフローに適しており、ローカルモードとクラウド API の両方の接続方式に対応します。

背景と概要

長文書や専門的な複雑ドキュメントの検索において、ベクトルデータベースの召回精度は長年の課題であった。業界主流のベクトルRAGは意味的類似性で照合するが、類似性は関連性とは限らない。VectifyAIという中国の小規模スタートアップは、ベクトルストアもテキストチャンクも排除するオープンソースのPageIndexを発表した。多くのチームがより大きなベクトルインデックスや細かなチャンク、優れたエンベッドモデルを追求する中、PageIndexは人間の専門家が長报告を読む様子を模倣する反潮流的なアプローチを取る。

決算説明書、法務文書、規制提出物、技術マニュアルといった文書では、ベクトル検索は似て無関係な部分を優先し、関連する部分を見落とす。PageIndexの仮説は、真の関連性には推論が必要だというものだ。チャンクを距離スコアでランキングする 대신、ドキュメントの構造を再構成してモデルに推論させる。

深掘り分析

PageIndexはAlphaGoから明示的に着想を得た。囲碁AIは位置を暗記するのではなく判断ツリーを検索した。エンジンはドキュメントの構造化レイアウトを階層ツリーインデックスに変換し、フラットなベクトルインデックスを置き換える。処理は2段階で進む。索引段階では各ドキュメントのツリーインデックスを生成するが、これはレイアウトから直接抽出された構造であり、索引モデルは要約と精緻化だけを行うため基礎モデルでも実行可能だ。検索段階ではエージェントが大規模言語モデルを用いてツリーを推論的に検索する。

この転換は具体的な差異を生む。索引はベクトルからツリーへ、検索は類似性検索からツリー推論へ、結果は不透明なスコアリングから明示的な引用へ追跡可能な結論へ変化する。コンテキストもクエリエンベッドから会話履歴やドメイン知識を含む完全な範囲へ拡大する。開発者は黒盒のスコアを見るのではなく、答えがドキュメントのどの部分を指すのかを明確に確認できる。また、典型的なRAGパイプラインから2つの重い依存関係を排除し、システムの複雑性と維持コストを下げる。

統合は意図的に軽量だ。開発者はpipでpageindexパッケージをインストールし、PageIndexClientにツリーインデックス構築用と検索用の別々のモデルを指定してドキュメントを提出しdoc_idを受け取り、会話式クエリを発行する。最近の更新でローカルモードはチーム自有のLLMキーで索引・検索・会話を完全に端末内で完遂でき、同じクライアントをAPIキーでPageIndex Cloudへ向けることも可能だ。ローカルモードはテキストベースのPDF向けFlash高速ツリー索引生成を標準とする。

業界への影響

PageIndexは正確性とコンプライアンスが最も重視される専門的長文書ワークフローを対象とする。典型例として決算分析、契約審査、規制遵守クエリ、技術ドキュメント问答がある。金融、法務、医療、学術の各分野は、説明可能で監査可能な結果から恩恵を受ける。判断に記録と見直しが必要な場面でこれが重要になる。ベクトルストアとチャンク戦略への依存を減らすことで、エンジニアリングチームへより追跡可能な答えへの道を提供する。

ドキュメント横断的なスケーリングのためにVectifyAIはPageIndex File Systemを導入し、索引層をファイルレベルのツリーへ拡張して、単一ドキュメントではなく語料庫全体で推論できるようにした。ドキュメント、ウェブサイト、クラウド、ブログが完全なオンボーディングパスを構成し、アプリは専門的長文書向けの擬人化ドキュメント分析エージェントを提供する。コミュニティはagentic-ai、agents、context-engineering、information-retrieval、llm、ragといった主題を中心に活性を保つ。

今後の展望

PageIndexは関連性を類似性から分離し、推論と追跡可能な引用で高い正確性要件を持つ分野に奉仕することで、長文書検索のパラダイムを再定義する。開発者への価値は、ベクトルインフラへの依存を減らしつつ結果を説明可能・監査可能にすることだ。一方でリスクも注視に値する。推論型検索はモデル能力に大きく依存し、コストと遅延は純粋なベクトル検索を上回ることが多い。索引モデルへの呼出とツリーの規模が体験に直接影響する。

百万ドキュメント規模での跨ドキュメント推論は、パフォーマンスと一貫性の検証が必要で、Flashやファイルシステムといった新能力はまだ開発途中だ。注目に値する将来の方向性として、推論コストと検索遅延のバランス、超大规模語料におけるツリーインデックスのスケーリング方法、そしてPageIndexが高度に信頼できる答えを要求する産業でベクトルRAGの持続可能な代替方案となり得るかが挙げられる。

Sources

FAQ

PageIndex とは何ですか?従来のドキュメント検索のどのような問題を解決しますか?

PageIndex は VectifyAI によるオープンソースの推論型 RAG エンジンで、ベクトルストアとチャンクを使いません。従来のベクトル検索が意味的類似性に基づき、専門的な長文書で関連性の低い結果を返す問題を解決します。

PageIndex の核となる技術と主なイノベーションは何ですか?

AlphaGo に着想を得て、ベクトルインデックスの代わりに階層ツリーインデックスを使用し、大規模モデルが専門家のように推論的に検索します。これにより、追跡可能で説明可能な結果と明示的な引用が提供されます。

PageIndex はどのようなシナリオに適しており、今後の展望はどうですか?

金融、法務、医療、学術など、深いコンテキスト理解と多段階推論を要する専門的な長文書ワークフローに最適です。今後は推論コストと大規模コーパスへの拡張性、そしてベクトル RAG の代替としての可能性が注目されます。