Modèles et plateformes d’IA
DeepMind lance EmbeddingGemma 2, cartographiant cinq modalités dans un même espace

Google DeepMind a lancé EmbeddingGemma 2 le 6 octobre 2026, un modèle ouvert de 740 millions de paramètres qui projette le texte, le code, les images, la vidéo et l’audio dans un espace d’incorporation unique de 768 dimensions, publié sous licence Apache 2.0 et conçu pour fonctionner sur du matériel grand public.
Le modèle a été présenté dans un article sur le blog officiel de Google par les ingénieurs chercheurs de Google DeepMind, Sahil Dua et Henrique Schechter Vera. Google décrit EmbeddingGemma 2 comme le modèle le plus performant pour les incorporations multimodales sur appareil et indique qu’il repose sur la même technologie que ses modèles Gemini Embedding. L’entreprise cite des exemples de capacités tels que récupérer un extrait vidéo précis à l’aide d’une note vocale ou interroger des heures d’enregistrements audio avec du texte.
Cette sortie fait suite à l’EmbeddingGemma original, que Google a présenté en 2025 comme une option légère pour les incorporations de texte sur du matériel grand public. Google indique que le modèle a dépassé les 20 millions de téléchargements, les développeurs l’utilisant pour des outils de recherche sur appareil et des pipelines de génération augmentée par récupération axés sur la confidentialité.
Encodeurs modulaires sur une base Gemma 4
EmbeddingGemma 2 est construit sur l’architecture Gemma 4. Selon la fiche modèle EmbeddingGemma 2, ses 740 millions de paramètres combinent un modèle texte de 270 millions de paramètres (un backbone transformeur de 130 millions plus un embedder de 140 millions) avec un encodeur vision de 170 millions de paramètres et un encodeur audio de 300 millions de paramètres, le tout projeté dans l’espace partagé de 768 dimensions. Comme les encodeurs sont indépendants, les développeurs peuvent charger sélectivement 270 millions de paramètres pour le texte et le code, 440 millions pour le texte et la vision, 570 millions pour le texte et l’audio, ou la configuration multimodale complète à partir du même point de contrôle, chaque configuration partageant un même espace vectoriel.
La fiche modèle indique une architecture à 24 couches avec attention groupée et multi‑requête, un vocabulaire de 262 144 tokens, un regroupement moyen et une couche de projection de 512 à 768 dimensions. Toutes les modalités partagent une fenêtre contextuelle de 8 192 tokens, que Google affirme être quatre fois plus grande que celle d’EmbeddingGemma 1. Chaque modalité consomme ce budget à des taux fixes : 280 tokens par image, 140 tokens par image vidéo, et 25 tokens par seconde d’audio, de sorte qu’une entrée unique peut contenir jusqu’à 29 images, 58 images vidéo ou 5,5 minutes d’audio. Les entrées entrelacées combinent texte et médias, avec des tokens de substitution marquant la position de chaque élément médiatique.
Résultats des benchmarks et troncature des vecteurs
Google indique qu’EmbeddingGemma 2 atteint les mêmes performances multilingues en texte que son prédécesseur tout en augmentant son score MTEB Code de 9,92 points, passant de 68,76 à 78,68. Les résultats en pleine précision de la fiche modèle indiquent 61,36 sur MTEB multilingue (v2), 64,64 sur MIEB lite, 57,28 sur MMEB v2 récupération d’images, 67,84 sur récupération de documents visuels, 50,67 sur récupération vidéo, 69,54 sur récupération sonore MSEB et 49,39 sur les tâches audio MAEB. Google affirme que le modèle obtient les meilleurs scores parmi les embeddeurs multimodaux de moins d’un milliard de paramètres et dépasse certains modèles spécialisés de plus du double de sa taille.
L’apprentissage de représentation Matryoshka permet aux développeurs de tronquer les vecteurs de sortie des 768 dimensions natives à 512, 256 ou 128, ce que Google affirme réduire les besoins de stockage des vecteurs jusqu’à 6 fois. Selon la fiche modèle, la qualité se maintient avec un impact minimal jusqu’à 256 dimensions, tandis que 128 dimensions convient surtout aux charges de travail texte uniquement. Un guide du développeur compagnon indique que les vecteurs de 256 dimensions conservent environ 95 % de la qualité complète pour la récupération d’images, de vidéos et de discours, tandis que 128 dimensions en conservent environ 90 % pour le texte et le code mais chutent à environ 75 % pour la récupération multimodale. Stocker un million de vecteurs de 768 dimensions en précision bfloat16 occupe environ 1,5 gigaoctet de mémoire, selon le guide, contre environ 250 mégaoctets à 128 dimensions.
Position de sécurité et limites déclarées
La fiche modèle décrit EmbeddingGemma 2 comme un modèle d’incorporation pré‑entraîné qui n’a pas subi d’alignement post‑entraînement, de réglage de sécurité ou de modération au niveau de la sortie, les mesures de sécurité étant concentrées sur le filtrage des données de pré‑entraînement. Cette préparation comprenait le filtrage du matériel d’abus sexuel d’enfants à plusieurs étapes ainsi que le filtrage automatisé des informations personnelles et d’autres données sensibles. Les données d’entraînement couvraient des documents web, du code, des images, de la vidéo, de l’audio et des échantillons croisés multimodaux, avec du texte web dans plus de 140 langues et une date limite de janvier 2025.
La fiche indique que, bien que le modèle prenne en charge plus de 100 langues, les performances peuvent varier d’une langue à l’autre, et que l’omission des préfixes d’instructions de tâche recommandés sur les entrées texte réduit la précision des incorporations. Elle avertit également que la plage d’activation du modèle dépasse la plage dynamique du float16, ce qui peut produire des valeurs NaN ou des incorporations dégradées silencieusement, et recommande d’effectuer l’inférence en bfloat16 ou float32. Les déploiements doivent respecter la politique d’utilisation interdite de Gemma, et la fiche attribue aux développeurs la responsabilité des garde‑fous au niveau de l’application tels que le filtrage des récupérations et les tests d’équité.
Performance sur appareil et disponibilité
Google rapporte que, avec quantisation sur un Pixel 11 Pro, EmbeddingGemma 2 nécessite aussi peu que environ 191 mégaoctets de RAM active pour les poids texte uniquement et environ 567 mégaoctets pour le modèle multimodal complet. Les poids sont disponibles sur Hugging Face et Kaggle, avec des versions optimisées pour l’appareil via la communauté LiteRT sur Hugging Face. Le modèle fonctionne avec transformers, sentence-transformers 6.1.0 ou version ultérieure, MLX, vLLM, llama.cpp, SGLang, Ollama et LMStudio, avec des conseils de fine‑tuning de Unsloth et un déploiement navigateur via transformers.js et WebGPU.
MediaPipe et LiteRT de Google AI Edge gèrent le déploiement multiplateforme, et une MediaPipe Decision Task API prend en charge la classification et le routage en temps réel dans un contexte multimodal. Des démos, dont Instant Media Search et Video Moments Finder, sont proposées dans l’application Google AI Edge Gallery, et l’application Google AI Edge Foresight associe EmbeddingGemma 2 pour la récupération locale de fichiers à Gemma 4 pour le raisonnement contextuel. Parce que les deux modèles partagent un tokenizer texte et une architecture d’encodeur audio, Google indique que les exécuter ensemble réduit leur empreinte mémoire combinée. La disponibilité dans le Gemini Enterprise Agent Platform Model Garden arrive bientôt, selon l’entreprise.












