Présentation du modèle
EmbeddingGemma 2 est un modèle d’embedding multimodal proposé par Google Gemma. Il intègre texte, code, images, vidéo et audio dans un même espace d’embedding, ce qui permet de comparer directement des contenus de natures différentes. Le modèle repose sur un facteur de forme de 740 M paramètres et utilise des encodeurs modulaires afin de séparer les traitements spécifiques à chaque modalité. La licence Apache 2.0 autorise une utilisation commerciale sans restriction, ce qui facilite son déploiement dans des produits propriétaires.
Architecture et flexibilité dimensionnelle
La structure modulaire s’appuie sur la technique Matryoshka Representation Learning (MRL), qui autorise des tailles d’embedding variables entre 768 dimensions et 128 dimensions. Cette granularité permet d’ajuster le compromis entre précision et coût mémoire selon les contraintes de l’appareil cible. Le modèle accepte un contexte de 8 000 tokens, soit quatre fois la fenêtre du précédent EmbeddingGemma dédié au texte uniquement, ce qui améliore la prise en compte de séquences longues dans les tâches multimodales.
Performances sur les benchmarks
Sur les suites d’évaluation MTEB (Code) et MIEB (Lite), EmbeddingGemma 2 se classe parmi les meilleures performances de sa catégorie de taille. En comparaison avec la version antérieure, il obtient une amélioration de 9,92 points sur les métriques de code, ce qui se traduit par une meilleure capacité à retrouver des fragments de code pertinents dans de grands dépôts. Ces résultats confirment que la combinaison d’un facteur de forme compact et d’une représentation multimodale n’entraîne pas de perte de qualité.
Scénarios d’utilisation et contraintes
Le modèle est destiné aux cas d’usage sur appareil, notamment l’indexation locale de bases de code, la recherche sémantique de snippets et la récupération d’informations pour des agents de programmation. La licence permissive facilite l’intégration dans des solutions commerciales, mais le déploiement requiert des ressources suffisantes pour charger 740 M paramètres, ce qui peut limiter l’utilisation aux appareils dotés de RAM et de puissance de calcul adéquates. La flexibilité dimensionnelle offre toutefois la possibilité de réduire la taille d’embedding afin d’adapter le modèle à des environnements plus contraints.