AI-modeller og plattformer
DeepMind lanserer EmbeddingGemma 2, kartlegger fem modaliteter i ett rom

Google DeepMind lanserte EmbeddingGemma 2 6. oktober 2026, en åpen modell med 740 millioner parametere som kartlegger tekst, kode, bilder, video og lyd inn i ett enkelt 768‑dimensjonalt innbyggingsrom, utgitt under Apache 2.0‑lisensen og designet for å kjøre på forbruker‑maskinvare.
Modellen ble avduket i et innlegg på Googles offisielle blogg av forskningsingeniører fra Google DeepMind, Sahil Dua og Henrique Schechter Vera. Google beskriver EmbeddingGemma 2 som den mest avanserte modellen for på‑enheten multimodale innbygginger og sier den er bygget med samme teknologi som deres Gemini‑innbyggingsmodeller. Selskapet nevner eksempler på evner som å hente et spesifikt videoklipp med en talememo eller å søke i timer med lydopptak ved hjelp av tekst.
Utgivelsen følger den opprinnelige EmbeddingGemma, som Google introduserte i 2025 som et lettvektsalternativ for tekstinnbygginger på forbruker‑maskinvare. Google rapporterer at modellen har over 20 millioner nedlastinger, med utviklere som bruker den til på‑enheten søkeverktøy og personvern‑første gjenopprettings‑forsterkede generasjons‑pipelines.
Modulære enkodere på en Gemma 4‑base
EmbeddingGemma 2 er bygget på Gemma 4‑arkitekturen. Ifølge EmbeddingGemma 2-modellkort kombinerer de 740 millioner parametere en 270‑millioners tekstmodell (en 130‑millioners transformer‑ryggrad pluss en 140‑millioners innbygger) med en 170‑millioners visjonsenkoder og en 300‑millioners lyd‑enkoder, som alle projiseres inn i det delte 768‑dimensjonale rommet. Siden enkoderne er uavhengige, kan utviklere selektivt laste 270 millioner parametere for tekst og kode, 440 millioner for tekst og visjon, 570 millioner for tekst og lyd, eller den fullstendige multimodale konfigurasjonen fra samme sjekkpunkt, og hver konfigurasjon deler ett vektorrom.
Modellkortet lister en 24‑lags arkitektur med gruppert‑spørring‑ og multi‑spørrings‑oppmerksomhet, et vokabular på 262 144 token, gjennomsnittlig pooling og et projeksjonslag fra 512 til 768 dimensjoner. Alle modaliteter deler et kontekstvindu på 8 192 token, som Google sier er fire ganger større enn EmbeddingGemma 1s. Hver modalitet bruker dette budsjettet med faste satser: 280 token per bilde, 140 token per videoramme og 25 token per sekund med lyd, slik at en enkelt inndata kan inneholde opptil 29 bilder, 58 videorammer eller 5,5 minutter med lyd. Interleaved‑innndata blander tekst og media, med plassholder‑token som markerer hver medie‑elements posisjon.
Benchmark‑resultater og vektortrunkering
Google rapporterer at EmbeddingGemma 2 matcher forgjengerens flerspråklige tekstytelse samtidig som den øker MTEB Code‑poengsummen med 9,92 poeng, fra 68,76 til 78,68. Modellkortets full‑presisjonsresultater viser 61,36 på MTEB flerspråklig (v2), 64,64 på MIEB lite, 57,28 på MMEB v2 bildesøk, 67,84 på visuell‑dokument‑søk, 50,67 på videosøk, 69,54 på MSEB lyd‑søk, og 49,39 på MAEB lyd‑oppgaver. Google sier at modellen oppnår ledende resultater blant multimodale innbyggere med under én milliard parametere og overgår noen spesialiserte modeller med mer enn dobbelt så stor størrelse.
Matryoshka Representation Learning gjør det mulig for utviklere å forkorte utgangsvektorer fra de opprinnelige 768 dimensjonene ned til 512, 256 eller 128, noe Google sier reduserer lagringskravene for vektorer med opptil 6×. Ifølge modellkortet holder kvaliteten med minimal påvirkning ned til 256 dimensjoner, mens 128 dimensjoner er best egnet for kun‑tekst‑arbeidsbelastninger. En tilhørende utviklerguide rapporterer at 256‑dimensjonale vektorer beholder omtrent 95 % av full kvalitet på bilde‑, video‑ og tale‑søk, mens 128 dimensjoner beholder rundt 90 % på tekst og kode, men faller til omtrent 75 % på multimodalt søk. Å lagre én million 768‑dimensjonale vektorer i bfloat16‑presisjon krever omtrent 1,5 gigabyte minne, ifølge guiden, versus omtrent 250 megabyte ved 128 dimensjoner.
Sikkerhetsposisjon og oppgitte begrensninger
Modellkortet beskriver EmbeddingGemma 2 som en forhåndstrent innbyggingsmodell som ikke har gjennomgått etter‑trening‑justering, sikkerhets‑tuning eller moderering på utdata‑nivå, med sikkerhetsavbøtninger konsentrert om filtrering av forhåndstreningsdataene. Denne forberedelsen inkluderte filtrering av barne‑seksuell‑misbruk‑materiale på flere stadier og automatisert filtrering av personlig informasjon og annen sensitiv data. Treningsdataene omfattet nett‑dokumenter, kode, bilder, video, lyd og parrede kryss‑modalitets‑prøver, med nett‑tekst på mer enn 140 språk og en avskjæringsdato i januar 2025.
Kortet bemerker at selv om modellen støtter mer enn 100 språk, kan ytelsen variere mellom dem, og at det å utelate de anbefalte oppgave‑instruksjons‑prefiksene på tekst‑innspill reduserer innbyggingspresisjon. Det advarer også om at modellens aktiveringsområde overstiger dynamisk område for float16, noe som kan gi NaN‑verdier eller stille degradert innbygginger, og anbefaler inferens i bfloat16 eller float32. Distribusjoner må følge Gemma‑policyen for forbudt bruk, og kortet pålegger utviklere ansvar for applikasjons‑nivå sikkerhetstiltak som filtrering av gjenfinning og testing av rettferdighet.
Ytelse på enheten og tilgjengelighet
Google rapporterer at, med kvantisering på en Pixel 11 Pro, krever EmbeddingGemma 2 så lite som omtrent 191 megabyte aktiv RAM for kun tekstvektene og omtrent 567 megabyte for den fullstendige multimodale modellen. Vektene er tilgjengelige på Hugging Face og Kaggle, med enhetsoptimaliserte versjoner via LiteRT Community på Hugging Face. Modellen kjører gjennom transformers, sentence-transformers 6.1.0 eller nyere, MLX, vLLM, llama.cpp, SGLang, Ollama og LMStudio, med finjusteringsveiledning fra Unsloth og nettleserdeployering via transformers.js og WebGPU.
Google AI Edge sine MediaPipe og LiteRT håndterer tverrplattform‑distribusjon, og et MediaPipe Decision Task‑API støtter sanntidsklassifisering og ruting i multimodal kontekst. Demoer inkludert Instant Media Search og Video Moments Finder leveres i Google AI Edge Gallery‑appen, og Google AI Edge Foresight‑appen kombinerer EmbeddingGemma 2 for lokal filhenting med Gemma 4 for kontekstuell resonnering. Fordi de to modellene deler en tekst‑tokenizer og en lyd‑encoder‑arkitektur, sier Google at kjøring av dem sammen reduserer deres samlede minnebruk. Tilgjengelighet i Gemini Enterprise Agent Platform Model Garden kommer snart, ifølge selskapet.












