Omni-Embed-Mini:密なキャプション蒸留でテキスト性能を失わずに全モダリティを統合
Omni-Embed-Miniは、テキスト・音声・オーディオ・画像・動画・視覚的文書を単一の共有コサイン空間へ写像する9億パラメータの全モダリティ埋め込みモデルで、テキスト側のバックボーンを一切更新しない。核心となる工夫は、凍結バックボーン自身による密なカスケードキャプションの埋め込みを教師信号として再利用し、別個の教師モデルを不要にする点であり、軽量プロジェクターと段階的LoRAアダプタで整合を取る。MTEB-v2 BEIR-8で49.57 nDCG@10のテキスト検索性能を維持しつつ、同等のオープン全モダリティ埋め込みモデルより2.7〜9.5倍小型であり、23億パラメータ版はGoogleのgemini-embedding-2と競合する。
背景と課題の所在
テキスト埋め込みモデルは現代の検索システムやRAG(検索拡張生成)の基盤となっているが、音声、オーディオ、画像、動画、視覚的に複雑な文書といった新しいモダリティへ拡張する際には代償が伴う。テキスト埋め込みモデルをピクセルや波形も理解できるように微調整すると、もともとテキスト検索性能を支えていた重みそのものが乱れてしまうことが多い。業界はこれまでパラメータ数を増やすことで対応してきており、既存のオープンな全モダリティ埋め込みモデルは数十億パラメータ規模に達するのが常態化している。
MBZUAI(ムハンマド・ビン・ザーイド人工知能大学)のMohammed Irfan Kurpathらによる本論文「Omni-Embed-Mini」は、より鋭い問いを立てる。わずか9億パラメータのコンパクトなモデルで、既に機能しているテキスト経路に一切手を加えずに、6つのモダリティを単一の共有コサイン類似度空間に統合できるだろうか、というものだ。多くの実運用の検索システムは遅延とメモリの制約を受けており、比較対象となる全モダリティ埋め込みモデルに対して2.7倍から9.5倍のサイズ削減を達成したことは、単なる見栄えの改善ではなく、エッジや大規模運用での実際のデプロイ可能性を左右する。
コアアーキテクチャと技術原理
核心となる発想はほぼ哲学的である。新モダリティのエンコーダに「良い埋め込みとは何か」を教える別個の事前学習済み埋め込みモデルを「教師」として導入するのではなく、凍結されたテキストバックボーン自体を教師として再利用する。音声クリップ、画像、動画、スキャン文書といった非テキストサンプルは、まず密なカスケード形式のキャプションに変換され、教師ターゲットはそのキャプションを生徒と同じバックボーンで埋め込んだベクトルそのものとなる。教師と生徒がバックボーンの重みを文字通り共有するため、両者の埋め込みはバイト単位で同一の幾何空間に存在し、橋渡しを必要とする似て非なる二つの空間という従来の問題が生じない。
これにより表現のドリフトという典型的な失敗要因が取り除かれる。その上で学習対象となるのは各モダリティエンコーダに付加された軽量なプロジェクターと段階的なLoRAアダプタのみであり、テキスト側のパラメータは一度も更新されない。これが、MTEB-v2 BEIR-8で49.57 nDCG@10というテキスト検索性能が、入念な調整の結果としてだけでなく、構造的に劣化し得ない理由でもある。対照学習の目的関数はMatryoshka型のSigLIP損失を用いており、再学習なしで同一の埋め込みをより低次元に切り詰められる。これにオンラインのハイブリッド困難負例マイナーを組み合わせ、エンコーダの能力向上に応じて負例の難度を段階的に上げることで、学習信号が早期に飽和することを防いでいる。
実用性と検証結果
この手法は高い汎用性を示している。ネイティブな視覚言語バックボーンに置き換えた23億パラメータ版は、Googleのクローズドモデルgemini-embedding-2と競合する性能を報告しており、モダリティ全体の平均指標ではわずかに上回っている。
多言語文書検索、スライドやPDFを対象とするクロスモーダルRAG、音声関連検索、動画クリップ検索といった実運用の検索システムにおいて、これは単一の共有ベクトル空間でモダリティ横断のクエリに対応できることを意味し、モダリティごとに個別のインデックスや埋め込みサービスを維持する必要も、モダリティを追加するとテキスト検索品質が静かに劣化するという従来のトレードオフも回避できる。著者らはモデル、コード、データ、評価ハーネスを公開プロジェクトページで公開しており、第三者による独立検証や追加の微調整のハードルを下げている。
業界への影響と今後の展望
より深い意義はアーキテクチャ上のものだ。「教師を生徒自身のバックボーンから借用する」という発想は本論文を超えて再利用可能なパターンであり、凍結された高品質モデルを微調整のリスクを負わずに隣接する入力形式へ拡張したい場面で広く応用できる。
全モダリティ能力をパラメータ数の膨張と同義に捉えてきた業界に対し、9億パラメータのモデルが5つのモダリティを追加しながらテキスト検索の性能を維持したという事実は、具体的な反証となる。今後の課題は、この手法がより雑音の多い実世界のモダリティやより長い動画に対しても成立するか、そしてカスケードキャプション自体に誤りや幻覚が含まれる場合に「密なキャプションを教師とする」設計が頑健であり続けるかという点であり、これは論文のキャプションカスケード設計がいずれ正面から向き合う必要がある依存関係である。
Sources
FAQ
Omni-Embed-Miniにおいて、非テキストモダリティの教師信号は何から得られるか。
凍結されたテキストバックボーン自身が、そのサンプルの密なカスケードキャプションを埋め込んだベクトルであり、別個の教師埋め込みモデルは使用しない。
新しいモダリティを追加してもテキスト検索性能が劣化しないのはなぜか。
学習中にテキスト側のバックボーンパラメータが一度も更新されず、各モダリティエンコーダに付加された軽量プロジェクターと段階的LoRAアダプタのみが学習されるため、テキスト重みは常に元のバックボーンとバイト単位で同一に保たれる。
Omni-Embed-Mini-0.9BはMTEB-v2 BEIR-8でどのような結果を示し、他のオープンな全モダリティ埋め込みモデルとサイズ比較はどうか。
MTEB-v2 BEIR-8で49.57 nDCG@10を達成し、比較対象となったすべてのオープンな全モダリティ埋め込みモデルよりも約2.7倍から9.5倍小さい。