Présentation du modèle
Google a publié EmbeddingGemma 2, la seconde génération de sa famille d’embeddings. Le modèle accepte texte, images, audio et vidéo et place toutes ces modalités dans un même espace d’embedding. Il s’appuie sur l’architecture Gemma 4 annoncée en avril 2024 et porte 740 millions de paramètres, soit plus du double du modèle initial limité au texte.
Architecture et exigences matérielles
Le cœur textuel compte 270 M paramètres et occupe environ 191 Mo de mémoire lorsqu’il est quantifié sur un Google Pixel 11 Pro. Les encodeurs vision et audio, ajoutés pour la prise en charge multimodale, représentent la majeure partie de l’expansion de taille. Chaque vecteur d’embedding comprend 768 valeurs flottantes ; les applications doivent stocker ces vecteurs dans une base locale de vecteurs. Google propose la technique Matryoshka Representation Learning, qui permet de réduire la dimension à 128 valeurs, diminuant l’encombrement jusqu’à six fois. À 256 dimensions, la perte de qualité reste inférieure à 5 % pour la recherche d’images, de vidéos et de discours.
Performances et optimisation
Sur le Massive Text Embedding Benchmark, EmbeddingGemma 2 obtient un score de 78,68 dans la section code, soit près de dix points de plus que la version précédente. Les scores multilingues restent stables, tandis que les résultats multimodaux surpassent les modèles spécialisés deux fois plus gros sur les tâches d’image, de vidéo et d’audio. Le partage du tokenizer texte et de l’encodeur audio avec Gemma 4 réduit la consommation mémoire lorsqu’on combine les deux modèles dans un pipeline de génération augmentée par récupération, comparé à l’utilisation de deux modèles distincts. Google montre déjà une application « Video Moments Finder » capable de localiser une scène vidéo à partir d’une requête texte ou vocale, le tout exécuté sur l’appareil.
Disponibilité et écosystème
Les poids du modèle sont publiés sur Hugging Face et Kaggle sous licence Apache 2.0, autorisant un usage commercial. Ils sont compatibles avec les serveurs d’inférence open‑source vLLM, llama.cpp et Ollama, et seront intégrés prochainement au Model Garden de la plateforme Gemini Enterprise Agent. Cette ouverture facilite l’adoption par les développeurs qui souhaitent implémenter des systèmes de recherche locale sans transmettre les données vers le cloud.