EmbeddingGemma 2 公開:7億4,000万パラメータの軽量オープン・マルチモーダル埋め込みモデル

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind が EmbeddingGemma 2 を公開。Gemma 4 基盤、Apache 2.0、7億4,000万パラメータで、テキスト、コード、画像、音声、動画を一つの埋め込み空間に写像し、端末上で動く。量子化後の Pixel 11 Pro で約191MB。MRL で768次元を128次元まで切り詰め、保存容量は最大6分の1。MTEB Code は78.68へ。数値は提供元による。

2026年10月6日、Google DeepMind は EmbeddingGemma 2 を公開した。オープンで軽量、ネイティブにマルチモーダルな埋め込みモデルである。テキスト、コード、画像、音声、動画を、ひとつの共有埋め込み空間に写像する。Gemma 4 アーキテクチャを基盤とし、商用利用が可能な Apache 2.0 ライセンスで提供される。パラメータ数は7億4,000万で、端末上での推論を主な対象にしている。 一、何が発表されたか

昨年登場した初代 EmbeddingGemma はテキスト専用だった。消費者向けハードウェア上で、高品質なテキスト埋め込みを実現することが狙いである。Google によれば、ダウンロード数は2,000万回を超えた。開発者はオンデバイス検索ツールや、プライバシーを重視した検索拡張生成(RAG)のパイプラインに使ってきた。EmbeddingGemma 2 は入力をコード、画像、動画、音声へ広げる。複数の専用モデルをつなぐのではなく、単一のモデルがネイティブに処理する。Google が挙げる例は、音声メモから特定の動画クリップを探すこと、そして数時間分の録音をテキストのクエリで検索することである。モデルは Gemini Embedding と同じ技術を土台にしている。

二、モジュール式の構成

設計はモジュール式である。テキストのみの用途なら、必要なのは2億7,000万パラメータだけだ。1億7,000万パラメータの視覚エンコーダと、3億パラメータの音声エンコーダは任意で追加できる。三つを合わせると、7億4,000万パラメータの完全なマルチモーダルモデルになる。開発者は必要な部分だけを読み込めばよい。テキストだけを扱う検索アプリが、使わない視覚や音声の重みのためにメモリを払う必要はない。 三、マトリョーシカ表現学習と保存コスト

本モデルはマトリョーシカ表現学習(MRL)を使う。出力ベクトルは標準で768次元である。開発者は実行時に512、256、128次元へ切り詰められる。Google によれば、ローカルのベクトルデータベースの保存容量とメモリ使用量を、最大で6分の1に減らせる。スマートフォンやノートPCに大量のベクトルを持つアプリにとって、これは直接的なコスト削減の手段になる。ただし、次元を切り詰めれば精度と容量のトレードオフが生じる。発表資料は次元ごとの精度低下を示していないため、自社データでの検証が必要である。

四、端末上のメモリ使用量とコンテキスト長

Google Pixel 11 Pro で量子化を使うと、テキストのみの重みで稼働メモリは最小約191MB、完全なマルチモーダルモデルで約567MBである。コンテキストウィンドウは8Kトークンで、初代の4倍になった。Google によれば、1回の入力に最大5.5分の音声、29枚の画像、58フレームの動画、またはそれらの組み合わせを含められる。処理はすべてローカルのハードウェア上で行われる。 五、ベンチマーク

Google は、1B未満のマルチモーダル埋め込みモデルの中で、このサイズとして最高水準のスコアを得たとしている。対象には MTEB Code と MAEB(大規模音声埋め込みベンチマーク)が含まれる。テキスト、視覚、音声のタスクでは、より大きな多くのモデルに並ぶか上回るという。多言語テキスト性能は初代と同等である。最も大きな伸びはコードに現れた。MTEB Code のスコアは68.76から78.68へ、9.92ポイント上がった。画像、動画、文書、音声のタスクでは、自身の2倍を超える規模の専門モデルを上回る場合もあるとしている。詳細な指標はモデルカードにある。これらは提供元の自己申告の数値であり、第三者による再現はまだ確認されていない。

六、開発者と企業への意味

第一にプライバシーである。埋め込みをローカルで生成すれば、データは端末の外へ出ない。個人のメモ、法務文書、医療記録のような機微な情報に向く。第二に遅延とコストである。ローカル推論はネットワークの往復を必要とせず、呼び出しごとの API 課金もない。第三にワークフローの単純化である。従来のクロスモーダル検索では、テキスト、画像、音声ごとにモデルを用意し、ベクトル空間を揃える必要があった。今は一つのモデルで足りる。第四にコードの用途である。MTEB Code の向上により、ローカルのコードベース索引、意味的コード検索、コーディングエージェントの検索が実用的になる。第五に、Apache 2.0 は商用利用を認めるため、企業が組み込む際の法的な障壁が低い。 七、今後の展望と課題

オンデバイスのマルチモーダル埋め込みは、個人の写真、録音、動画、コードをひとつの場所で意味検索できる環境を一般的にするだろう。課題も明確である。8Kの窓は長い動画や長時間の録音には短く、分割と集約の工夫が要る。量子化の方式によって検索品質が変わる可能性があり、実データでの測定が必要である。ベクトルデータベース、検索フレームワーク、モバイルのランタイムも、マルチモーダル埋め込みへの対応を進めなければならない。ベンチマークの点数は業務成果と同じではないため、各チームは自分のコーパスで評価すべきである。全体として、EmbeddingGemma 2 は「小型、マルチモーダル、商用可」という三つの性質を一つのリリースにまとめた。AI ツール開発者は注視する価値がある。

Sources