EmbeddingGemma 2: ein offenes, leichtes multimodales Embedding-Modell

Published · AI Daily — AI-assisted deep research, methodology & disclosure

Google DeepMind hat EmbeddingGemma 2 veröffentlicht, ein offenes Modell mit 740 Millionen Parametern auf Basis der Gemma-4-Architektur unter Apache-2.0-Lizenz. Es bildet Text, Code, Bilder, Audio und Video in einem gemeinsamen Embedding-Raum ab und läuft auf dem Gerät. Der Textteil braucht mindestens 270 Millionen Parameter. Quantisiert belegt er auf einem Pixel 11 Pro etwa 191 MB aktiven Speicher, das volle multimodale Modell etwa 567 MB. Mit Matryoshka Representation Learning lassen sich Vektoren von 768 auf 128 Dimensionen kürzen, bei bis zu sechsfach weniger Speicher. Das Kontextfenster umfasst 8K Token. Der MTEB-Code-Wert steigt von 68,76 auf 78,68. Alle Zahlen stammen von Google.

Am 6. Oktober 2026 hat Google DeepMind EmbeddingGemma 2 veröffentlicht, ein offenes, leichtes und nativ multimodales Embedding-Modell. Es bildet Text, Code, Bilder, Audio und Video in einem gemeinsamen Embedding-Raum ab. Es basiert auf der Gemma-4-Architektur, steht unter der Apache-2.0-Lizenz, die kommerzielle Nutzung erlaubt, und hat 740 Millionen Parameter. Ziel ist die Inferenz direkt auf dem Gerät, auf Verbraucherhardware. Was angekündigt wurde Das erste EmbeddingGemma erschien im vergangenen Jahr als schlanke Option für hochwertige Text-Embeddings. Google nennt mehr als 20 Millionen Downloads. Entwickler nutzten es für lokale Suchwerkzeuge und für datenschutzfreundliche Retrieval-Augmented-Generation-Pipelines (RAG). EmbeddingGemma 2 erweitert die Eingaben um Code, Bilder, Video und Audio. Ein einziges Modell verarbeitet alle nativ. Es werden nicht mehrere Spezialmodelle zusammengesetzt. Google nennt zwei Beispiele: Aus einer Sprachnotiz einen bestimmten Videoausschnitt finden, und Stunden von Audioaufnahmen mit einer Textanfrage durchsuchen. Das Modell beruht auf derselben Technologie wie die Gemini-Embedding-Modelle.

Modulare Architektur Der Aufbau ist modular. Eine reine Textanwendung braucht mindestens 270 Millionen Parameter. Ein Vision-Encoder mit 170 Millionen Parametern ist optional. Ein Audio-Encoder mit 300 Millionen Parametern ist ebenfalls optional. Die drei Teile ergeben zusammen das vollständige multimodale Modell mit 740 Millionen Parametern. Entwickler laden nur, was die Anwendung braucht. Ein Suchwerkzeug nur für Text zahlt keinen Speicher für Vision- oder Audio-Gewichte, die es nie nutzt. Matryoshka Representation Learning und Speicherkosten Das Modell nutzt Matryoshka Representation Learning (MRL). Der Ausgabevektor hat standardmäßig 768 Dimensionen. Entwickler können ihn zur Laufzeit auf 512, 256 oder 128 Dimensionen kürzen. Laut Google senkt das den Speicherbedarf lokaler Vektordatenbanken und den Arbeitsspeicherverbrauch um bis zu das Sechsfache. Für eine Anwendung, die viele Vektoren auf einem Telefon oder Laptop hält, ist das ein direkter Kostenhebel. Das Kürzen tauscht Genauigkeit gegen Größe. Die Ankündigung beziffert diesen Verlust nicht je Dimension. Teams sollten ihn deshalb an eigenen Daten messen.

Ressourcenbedarf auf dem Gerät und Kontextfenster Mit Quantisierung braucht das Modell auf einem Google Pixel 11 Pro nur etwa 191 MB aktiven Arbeitsspeicher für die reinen Text-Gewichte. Das vollständige multimodale Modell braucht etwa 567 MB. Das Kontextfenster umfasst 8K Token, viermal so viel wie bei EmbeddingGemma 1. Laut Google passen in eine einzelne Eingabe bis zu 5,5 Minuten Audio, 29 Bilder, 58 Videobilder oder verschachtelte Kombinationen davon. Alles wird auf lokaler Hardware verarbeitet.

Benchmarks Google gibt an, dass EmbeddingGemma 2 unter multimodalen Embedding-Modellen mit weniger als 1 Milliarde Parametern Spitzenwerte für seine Größe erreicht. Zu den genannten Benchmarks zählen MTEB Code, aus dem Massive Text Embedding Benchmark, und MAEB, der Massive Audio Embedding Benchmark. Bei Text-, Bild- und Audioaufgaben erreicht oder übertrifft es außerdem viele größere Modelle. Die mehrsprachige Textleistung entspricht dem ersten Modell. Der deutlichste Gewinn liegt beim Code: Der MTEB-Code-Wert steigt von 68,76 auf 78,68, also um 9,92 Punkte. Google fügt hinzu, dass es bei Bild-, Video-, Dokument- und Audioaufgaben einige Spezialmodelle übertrifft, die mehr als doppelt so groß sind. Die vollständigen Kennzahlen stehen in der Modellkarte. Diese Zahlen stammen vom Hersteller. Eine unabhängige Reproduktion nennt die Ankündigung noch nicht.

Bedeutung für Entwickler und Unternehmen Zuerst kommt der Datenschutz. Lokal erzeugte Embeddings verlangen nicht, dass Daten das Gerät verlassen. Das passt zu sensiblen Inhalten wie persönlichen Notizen, Rechtsakten und Gesundheitsdaten. Danach folgen Latenz und Kosten. Lokale Inferenz braucht keinen Netzwerkweg und keine Gebühr pro API-Aufruf. Auch der Arbeitsablauf wird einfacher. Modalitätsübergreifende Suche verlangte bisher getrennte Modelle für Text, Bilder und Audio und eine Methode, die Vektorräume abzugleichen. Jetzt genügt ein Modell. Auch die Arbeit mit Code profitiert: Der Sprung bei MTEB Code macht lokale Indexierung von Codebasen, semantische Codesuche und Retrieval für Coding-Agenten praktikabler. Schließlich erlaubt Apache 2.0 die kommerzielle Nutzung, was die rechtliche Hürde für Unternehmen senkt.

Ausblick und Herausforderungen Multimodale Embeddings auf dem Gerät deuten auf eine verbreitete Fähigkeit hin: einen lokalen semantischen Index über Fotos, Aufnahmen, Videos und Code einer Person, an einer Stelle durchsuchbar. Mehrere Herausforderungen bleiben. Ein 8K-Fenster ist für lange Videos und lange Aufnahmen weiterhin knapp, also braucht es Strategien zum Zerlegen und Zusammenführen. Verschiedene Quantisierungsverfahren können die Suchqualität verändern, und das muss an echten Daten geprüft werden. Vektordatenbanken, Retrieval-Frameworks und mobile Laufzeitumgebungen müssen multimodale Embeddings unterstützen. Ein Benchmark-Wert ist kein Geschäftsergebnis, daher sollte jedes Team auf dem eigenen Korpus testen. Insgesamt vereint EmbeddingGemma 2 drei Eigenschaften in einer Veröffentlichung: klein, multimodal und kommerziell nutzbar. Entwickler von KI-Werkzeugen sollten es genau beobachten.

Sources