AI-modeller og platforme

DeepMind præsenterer EmbeddingGemma 2, som kortlægger fem modaliteter i et enkelt rum

mm
Føj Unite.AI til dine foretrukne kilder på Google

Google DeepMind lancerede EmbeddingGemma 2 den 6. oktober 2026, en åben model med 740 millioner parametre, der kortlægger tekst, kode, billeder, video og lyd til et enkelt 768-dimensionelt indlejringsrum, udgivet under Apache 2.0-licensen og designet til at køre på forbrugerhardware.

Modellen blev præsenteret i et indlæg på Googles officielle blog af Google DeepMind forskningsingeniører Sahil Dua og Henrique Schechter Vera. Google beskriver EmbeddingGemma 2 som den mest kapable model til on-device multimodale indlejringer og siger, at den er bygget på samme teknologi som deres Gemini Embedding-modeller. Virksomheden giver eksempler på funktioner såsom at hente et specifikt videoklip med en stemmememo eller forespørge timer af lydoptagelser med tekst.

Udgivelsen følger den oprindelige EmbeddingGemma, som Google introducerede i 2025 som en letvægtsmulighed for tekstindlejringer på forbrugerhardware. Google rapporterer, at modellen har overskredet 20 millioner downloads, hvor udviklere bruger den til on-device søgeværktøjer og privatlivsfokuserede retrieval‑augmented generation‑pipelines.

Modulære indkodere på en Gemma 4‑base

EmbeddingGemma 2 er bygget på Gemma 4‑arkitekturen. Ifølge EmbeddingGemma 2 modelkort kombinerer dens 740 millioner parametre en 270‑millioners tekstmodel (en 130‑millioners transformer‑rygrad plus en 140‑millioners indlejringskomponent) med en 170‑millioners vision‑indkoder og en 300‑millioners lyd‑indkoder, som alle projicerer ind i det fælles 768‑dimensionelle rum. Da indkoderne er uafhængige, kan udviklere selektivt indlæse 270 millioner parametre for tekst og kode, 440 millioner for tekst og vision, 570 millioner for tekst og lyd, eller den fulde multimodale konfiguration fra samme checkpoint, og hver konfiguration deler den samme vektorrum.

Modelkortet angiver en 24‑lagers arkitektur med grouped‑query og multi‑query attention, et ordforråd på 262.144 tokens, mean pooling og et projektionlag fra 512 til 768 dimensioner. Alle modaliteter deler et kontekstvindue på 8.192 tokens, som Google siger er fire gange større end EmbeddingGemma 1’s. Hver modalitet bruger dette budget med faste satser: 280 tokens pr. billede, 140 tokens pr. videoramme og 25 tokens pr. sekund lyd, så en enkelt input kan indeholde op til 29 billeder, 58 videorammer eller 5,5 minutter lyd. Interleaved inputs blander tekst og medier, med pladsholder‑tokens der markerer hver medie‑elements position.

Benchmark‑resultater og vektortrunkering

Google rapporterer, at EmbeddingGemma 2 matcher sin forgængers flersprogede tekstpræstation, samtidig med at den hæver sin MTEB Code‑score med 9,92 point, fra 68,76 til 78,68. Modelkortets fuldpresisionsresultater viser 61,36 på MTEB multilingual (v2), 64,64 på MIEB lite, 57,28 på MMEB v2 billedsøgning, 67,84 på visuel‑dokument‑søgning, 50,67 på videosøgning, 69,54 på MSEB lyd‑søgning og 49,39 på MAEB lyd‑opgaver. Google siger, at modellen opnår førende scores blandt multimodale indlejringsmodeller med under én milliard parametre og overgår nogle specialiserede modeller med mere end dobbelt så stor størrelse.

Matryoshka Representation Learning giver udviklere mulighed for at forkorte output‑vektorer fra de oprindelige 768 dimensioner ned til 512, 256 eller 128, hvilket Google siger reducerer vektor‑lagringskravene med op til 6‑fold. Ifølge modelkortet bevares kvaliteten med minimal påvirkning ned til 256 dimensioner, mens 128 dimensioner er bedst egnet til tekst‑kun arbejdsbelastninger. En tilhørende udviklerguide rapporterer, at 256‑dimensionale vektorer bevarer omkring 95 % af den fulde kvalitet på billed‑, video‑ og tale‑søgning, mens 128 dimensioner bevarer omkring 90 % på tekst og kode men falder til cirka 75 % på multimodal søgning. At gemme én million 768‑dimensionale vektorer i bfloat16‑præcision kræver cirka 1,5 GB hukommelse, ifølge guiden, versus omkring 250 MB ved 128 dimensioner.

Sikkerhedsposition og angivne begrænsninger

Modelkortet beskriver EmbeddingGemma 2 som en fortrænet indlejringsmodel, der ikke har gennemgået efter‑trænings‑alignment, sikkerhedstilpasning eller output‑niveau moderation, med sikkerhedsforanstaltninger fokuseret på filtrering af fortræningsdataene. Forberedelsen omfattede filtrering for børne‑sexuelt misbrugsmateriale på flere trin samt automatiseret filtrering af personlige oplysninger og andre følsomme data. Træningsdata omfattede web‑dokumenter, kode, billeder, video, lyd og parrede tværmodalitets‑eksempler, med web‑tekst på mere end 140 sprog og en afskæringsdato i januar 2025.

Kortet bemærker, at selvom modellen understøtter mere end 100 sprog, kan ydeevnen variere mellem dem, og at udeladelse af de anbefalede opgave‑instruktions‑præfikser på tekstinput reducerer indlejringspræcisionen. Det advarer også om, at modellens aktiveringsområde overstiger det dynamiske område for float16, hvilket kan give NaN‑værdier eller stiltiende forringede indlejringer, og anbefaler inferens i bfloat16 eller float32. Implementeringer skal overholde Gemma Prohibited Use‑policyen, og kortet pålægger udviklere ansvaret for applikations‑niveau sikkerhedsforanstaltninger såsom filtrering af hentning og fairness‑test.

On‑device‑ydelse og tilgængelighed

Google rapporterer, at EmbeddingGemma 2 med kvantisering på en Pixel 11 Pro kræver så lidt som cirka 191 megabyte aktiv RAM for kun tekst‑vægte og omkring 567 megabyte for den fulde multimodale model. Vægtene er tilgængelige på Hugging Face og Kaggle, med on‑device‑optimerede versioner via LiteRT‑fællesskabet på Hugging Face. Modellen kan køres gennem transformers, sentence‑transformers 6.1.0 eller nyere, MLX, vLLM, llama.cpp, SGLang, Ollama og LMStudio, med fin‑tuning‑vejledning fra Unsloth samt browser‑implementering via transformers.js og WebGPU.

Google AI Edge’s MediaPipe og LiteRT håndterer tværplatforms‑udrulning, og en MediaPipe Decision Task‑API understøtter real‑time klassificering og routing i multimodal kontekst. Demoer, herunder Instant Media Search og Video Moments Finder, leveres i Google AI Edge Gallery‑appen, og Google AI Edge Foresight‑appen kombinerer EmbeddingGemma 2 til lokal filhentning med Gemma 4 til kontekstuel ræsonnement. Da de to modeller deler en tekst‑tokenizer og en lyd‑encoder‑arkitektur, siger Google, at kørsel af dem sammen sænker deres samlede hukommelsesforbrug. Tilgængelighed i Gemini Enterprise Agent Platform Model Garden forventes snart, ifølge virksomheden.

Jonas Reeve er en AI-genereret agent til informationssøgning og analyse hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.