AI-modeller och plattformar
DeepMind lanserar EmbeddingGemma 2, kartlägger fem modaliteter i ett enda utrymme

Google DeepMind lanserade EmbeddingGemma 2 den 6 oktober 2026, en öppen modell med 740 miljoner parametrar som kartlägger text, kod, bilder, video och ljud till ett enda 768-dimensionellt inbäddningsutrymme, släppt under Apache 2.0-licensen och avsedd att köras på konsumenthårdvara.
Modellen presenterades i ett inlägg på Googles officiella blogg av Google DeepMinds forskningsingenjörer Sahil Dua och Henrique Schechter Vera. Google beskriver EmbeddingGemma 2 som den mest kapabla modellen för multimodala inbäddningar på enheten och säger att den är byggd på samma teknik som deras Gemini Embedding-modeller. Företaget listar exempel på funktioner såsom att hämta ett specifikt videoklipp med ett röstmeddelande eller att söka i timmar av ljudinspelningar med text.
Utgåvan följer den ursprungliga EmbeddingGemma, som Google introducerade 2025 som ett lättviktigt alternativ för textinbäddningar på konsumenthårdvara. Google rapporterar att modellen har överstigit 20 miljoner nedladdningar, med utvecklare som använder den för sökverktyg på enheten och integritetsfokuserade retrieval‑augmented generation‑pipelines.
Modulära kodare på en Gemma 4‑bas
EmbeddingGemma 2 är byggd på Gemma 4‑arkitekturen. Enligt EmbeddingGemma 2-modellkort kombinerar dess 740 miljoner parametrar en 270‑miljonstransformationsmodell för text (en 130‑miljonstransformer‑ryggrad plus en 140‑miljonströmbäddare) med en 170‑miljonstransformationskodare för syn och en 300‑miljonstransformationskodare för ljud, alla projicerade in i det delade 768‑dimensionella utrymmet. Eftersom kodarna är oberoende kan utvecklare selektivt ladda 270 miljoner parametrar för text och kod, 440 miljoner för text och syn, 570 miljoner för text och ljud, eller hela den multimodala konfigurationen från samma checkpoint, och varje konfiguration delar ett gemensamt vektorrum.
Modellkortet listar en 24‑lagers arkitektur med grouped‑query och multi‑query‑attention, ett vokabulär på 262 144 token, medelvärdes‑poolning och ett projektionlager från 512 till 768 dimensioner. Alla modaliteter delar ett kontextfönster på 8 192 token, vilket Google säger är fyra gånger större än EmbeddingGemma 1:s. Varje modalitet förbrukar den budgeten med fasta satser: 280 token per bild, 140 token per videoram, och 25 token per sekund ljud, så en enskild inmatning kan rymma upp till 29 bilder, 58 videoramar eller 5,5 minuter ljud. Inbäddade inmatningar blandar text och media, med platshållartoken som markerar varje medieobjekts position.
Benchmarkresultat och vektortrunkering
Google rapporterar att EmbeddingGemma 2 matchar föregångarens flerspråkiga textprestanda samtidigt som den höjer sitt MTEB Code‑resultat med 9,92 poäng, från 68,76 till 78,68. Modellkortets fullprecisionresultat listar 61,36 på MTEB multilingual (v2), 64,64 på MIEB lite, 57,28 på MMEB v2 bildsökning, 67,84 på visuell‑dokument‑sökning, 50,67 på videosökning, 69,54 på MSEB ljudsökning och 49,39 på MAEB‑ljuduppgifter. Google säger att modellen uppnår ledande poäng bland multimodala inbäddare med under en miljard parametrar och överträffar vissa specialiserade modeller med mer än dubbelt så stor storlek.
Matryoshka Representation Learning låter utvecklare trunkera utgångsvektorer från de ursprungliga 768 dimensionerna ner till 512, 256 eller 128, vilket Google säger minskar lagringskraven för vektorer med upp till 6‑ gånger. Enligt modellkortet behåller kvaliteten sig med minimal påverkan ner till 256 dimensioner, medan 128 dimensioner är bäst lämpade för enbart textuppgifter. En tillhörande utvecklarguide rapporterar att 256‑dimensionella vektorer behåller cirka 95 % av full kvalitet för bild-, video‑ och tal‑sökning, medan 128 dimensioner behåller omkring 90 % för text och kod men sjunker till ungefär 75 % för multimodal sökning. Att lagra en miljon 768‑dimensionella vektorer i bfloat16‑precision tar ungefär 1,5 GB minne, enligt guiden, jämfört med cirka 250 MB vid 128 dimensioner.
Säkerhetsposition och angivna begränsningar
Modellkortet beskriver EmbeddingGemma 2 som en förtränad inbäddningsmodell som inte har genomgått efterträningsjustering, säkerhetsfinjustering eller moderering på utdata‑nivå, med säkerhetsåtgärder fokuserade på filtrering av förträningsdata. Denna förberedelse inkluderade filtrering av material med barnsexuellt utnyttjande i flera steg samt automatiserad filtrering av personlig information och annan känslig data. Träningsdata omfattade webb‑dokument, kod, bilder, video, ljud och parade tvärmodalitets‑prover, med webbtext på mer än 140 språk och ett avklippningsdatum i januari 2025.
Kortet noterar att även om modellen stödjer mer än 100 språk kan prestandan variera mellan dem, och att utelämnande av de rekommenderade uppgifts‑instruktions‑prefixen på textinmatningar minskar inbäddningsprecisionen. Det varnar också för att modellens aktiveringsintervall överskrider det dynamiska intervallet för float16, vilket kan ge NaN‑värden eller tyst försämrade inbäddningar, och rekommenderar inferens i bfloat16 eller float32. Distributioner måste följa Gemma‑policy för förbjuden användning, och kortet tilldelar utvecklare ansvar för skydd på applikationsnivå såsom filtrering av återhämtning och rättvisetestning.
Prestanda på enhet och tillgänglighet
Google rapporterar att med kvantisering på en Pixel 11 Pro kräver EmbeddingGemma 2 så lite som ungefär 191 megabyte aktivt RAM för enbart textviktningar och cirka 567 megabyte för den fullständiga multimodala modellen. Viktningarna finns tillgängliga på Hugging Face och Kaggle, med enhetsoptimerade versioner via LiteRT Community på Hugging Face. Modellen körs via transformers, sentence-transformers 6.1.0 eller senare, MLX, vLLM, llama.cpp, SGLang, Ollama och LMStudio, med finjusteringsvägledning från Unsloth och webbläsardistribution via transformers.js och WebGPU.
Google AI Edge:s MediaPipe och LiteRT hanterar plattformsoberoende distribution, och ett MediaPipe Decision Task‑API stödjer klassificering och dirigering i realtid i multimodal kontext. Demo‑exempel inklusive Instant Media Search och Video Moments Finder levereras i Google AI Edge Gallery‑appen, och Google AI Edge Foresight‑appen kombinerar EmbeddingGemma 2 för lokalt filhämtning med Gemma 4 för kontextuell resonemang. Eftersom de två modellerna delar en text‑tokenizer och en ljud‑kodararkitektur säger Google att körning av dem tillsammans minskar deras samlade minnesfotavtryck. Tillgänglighet i Gemini Enterprise Agent Platform Model Garden kommer snart, enligt företaget.












