EmbeddingGemma 2 : un modèle d'embeddings multimodal, ouvert et léger
Google DeepMind publie EmbeddingGemma 2, un modèle ouvert de 740 millions de paramètres, fondé sur l'architecture Gemma 4 et sous licence Apache 2.0. Il projette texte, code, images, audio et vidéo dans un même espace d'embedding et s'exécute sur l'appareil. La partie texte demande 270 millions de paramètres au minimum. Quantifié sur un Pixel 11 Pro, il utilise environ 191 Mo de RAM active pour le texte, et environ 567 Mo pour le modèle multimodal complet. Le MRL réduit les vecteurs de 768 à 128 dimensions, pour un stockage jusqu'à 6 fois plus faible. Le contexte est de 8K jetons. MTEB Code passe de 68,76 à 78,68. Ces chiffres viennent de Google.
Le 6 octobre 2026, Google DeepMind a publié EmbeddingGemma 2, un modèle d'embeddings ouvert, léger et nativement multimodal. Il projette le texte, le code, les images, l'audio et la vidéo dans un seul espace d'embedding partagé. Il repose sur l'architecture Gemma 4, il est diffusé sous licence Apache 2.0, qui autorise l'usage commercial, et il compte 740 millions de paramètres. Sa cible est l'inférence sur l'appareil, sur du matériel grand public. Ce qui a été annoncé Le premier EmbeddingGemma est sorti l'an dernier comme une option légère pour des embeddings de texte de haute qualité. Google indique qu'il a dépassé 20 millions de téléchargements. Les développeurs l'ont utilisé pour des outils de recherche locaux et pour des chaînes de génération augmentée par récupération (RAG) qui protègent la vie privée. EmbeddingGemma 2 élargit les entrées au code, aux images, à la vidéo et à l'audio. Un seul modèle les traite de façon native. Il ne s'agit pas d'assembler plusieurs modèles spécialisés. Google donne deux exemples : retrouver un extrait vidéo précis à partir d'un mémo vocal, et chercher dans des heures d'enregistrements audio avec une requête textuelle. Le modèle s'appuie sur la même technologie que les modèles Gemini Embedding.
Une architecture modulaire La conception est modulaire. Une charge de travail purement textuelle exige 270 millions de paramètres au minimum. Un encodeur de vision de 170 millions de paramètres est optionnel. Un encodeur audio de 300 millions de paramètres l'est aussi. Les trois blocs forment ensemble le modèle multimodal complet de 740 millions de paramètres. Le développeur ne charge que ce dont l'application a besoin. Un outil de recherche limité au texte ne paie pas de mémoire pour des poids de vision ou d'audio qu'il n'utilise jamais. Matryoshka Representation Learning et coût de stockage Le modèle utilise le Matryoshka Representation Learning (MRL). Le vecteur de sortie compte 768 dimensions par défaut. Le développeur peut le tronquer à l'exécution à 512, 256 ou 128 dimensions. Google affirme que cela réduit jusqu'à 6 fois le stockage des bases vectorielles locales et l'usage de la mémoire. Pour une application qui conserve beaucoup de vecteurs sur un téléphone ou un portable, c'est un levier de coût direct. La troncature échange de la précision contre de la taille. L'annonce ne chiffre pas cette perte pour chaque dimension. Les équipes doivent donc la mesurer sur leurs propres données.
Empreinte sur l'appareil et fenêtre de contexte Avec la quantification, sur un Google Pixel 11 Pro, le modèle demande environ 191 Mo de RAM active pour les poids texte seuls. Le modèle multimodal complet demande environ 567 Mo. La fenêtre de contexte est de 8K jetons, soit quatre fois celle d'EmbeddingGemma 1. Selon Google, une seule entrée peut contenir jusqu'à 5,5 minutes d'audio, 29 images, 58 images vidéo, ou des combinaisons entrelacées, le tout traité sur le matériel local. Benchmarks Google affirme qu'EmbeddingGemma 2 obtient des scores de premier plan parmi les modèles d'embeddings multimodaux de moins de 1 milliard de paramètres. Les benchmarks cités comprennent MTEB Code, issu du Massive Text Embedding Benchmark, et MAEB, le Massive Audio Embedding Benchmark. Le modèle égale ou dépasse aussi de nombreux modèles plus grands en texte, en vision et en audio. La performance multilingue en texte reste celle du premier modèle. Le gain le plus net concerne le code : le score MTEB Code passe de 68,76 à 78,68, soit 9,92 points de plus. Google ajoute que, sur les tâches d'image, de vidéo, de documents et d'audio, il dépasse certains modèles spécialisés de plus de deux fois sa taille. Les métriques complètes figurent dans la fiche du modèle. Ces chiffres viennent de l'éditeur. L'annonce ne mentionne pas encore de reproduction indépendante.
Ce que cela change pour les développeurs et les entreprises La confidentialité vient en premier. Des embeddings produits en local n'obligent pas les données à quitter l'appareil. Cela convient aux contenus sensibles : notes personnelles, dossiers juridiques, données de santé. Viennent ensuite la latence et le coût. L'inférence locale n'exige pas d'aller-retour réseau ni de facturation par appel d'API. Le flux de travail se simplifie aussi. La recherche multimodale demandait des modèles distincts pour le texte, les images et l'audio, et un moyen d'aligner leurs espaces vectoriels. Un seul modèle suffit désormais. Le travail sur le code en profite : le bond sur MTEB Code rend plus réalistes l'indexation locale d'un dépôt, la recherche sémantique de code et la récupération pour les agents de programmation. Enfin, la licence Apache 2.0 autorise l'usage commercial, ce qui abaisse la barrière juridique pour les entreprises. Perspectives et défis Les embeddings multimodaux sur l'appareil annoncent une capacité courante : un index sémantique local des photos, des enregistrements, des vidéos et du code d'une personne, interrogeable en un seul endroit. Plusieurs défis demeurent. Une fenêtre de 8K reste courte pour de longues vidéos et de longs enregistrements, donc il faudra découper et agréger. Selon le schéma de quantification, la qualité de recherche peut changer, et il faut le tester sur des données réelles. Les bases vectorielles, les frameworks de récupération et les environnements mobiles doivent ajouter la prise en charge des embeddings multimodaux. Un score de benchmark n'est pas un résultat métier : chaque équipe doit évaluer sur son propre corpus. Au total, EmbeddingGemma 2 réunit trois qualités dans une même version : petit, multimodal et utilisable commercialement. Les développeurs d'outils d'IA ont intérêt à le suivre de près.