AI-modellen en platforms

DeepMind introduceert EmbeddingGemma 2, waarmee vijf modaliteiten in één ruimte worden gemapt

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Google DeepMind lanceerde EmbeddingGemma 2 op 6 oktober 2026, een open model met 740 miljoen parameters dat tekst, code, afbeeldingen, video en audio naar een enkele 768-dimensionale embedruimte mappt, uitgebracht onder de Apache 2.0-licentie en ontworpen om op consumentenhardware te draaien.

Het model werd onthuld in een bericht op de officiële blog van Google door Google DeepMind-onderzoekers Sahil Dua en Henrique Schechter Vera. Google beschrijft EmbeddingGemma 2 als het meest capabele model voor on-device multimodale embeddings en stelt dat het is gebouwd met dezelfde technologie als zijn Gemini Embedding-modellen. Het bedrijf geeft voorbeeldtoepassingen, zoals het ophalen van een specifieke videoclips met een spraakmemo of het doorzoeken van uren aan audio-opnamen met tekst.

De uitgave volgt op de oorspronkelijke EmbeddingGemma, die Google in 2025 introduceerde als een lichtgewicht optie voor tekst‑embeddings op consumentenhardware. Google meldt dat het model meer dan 20 miljoen keer is gedownload, waarbij ontwikkelaars het gebruiken voor on-device zoektools en privacy‑first retrieval‑augmented generation‑pijplijnen.

Modulaire encoders op een Gemma 4-basis

EmbeddingGemma 2 is gebouwd op de Gemma 4-architectuur. Volgens de EmbeddingGemma 2 modelkaart combineren de 740 miljoen parameters een tekstmodel van 270 miljoen parameters (een transformer‑backbone van 130 miljoen plus een embedder van 140 miljoen) met een vision‑encoder van 170 miljoen parameters en een audio‑encoder van 300 miljoen parameters, die allemaal projecteren naar de gedeelde 768‑dimensionale ruimte. Omdat de encoders onafhankelijk zijn, kunnen ontwikkelaars selectief 270 miljoen parameters laden voor tekst en code, 440 miljoen voor tekst en beeld, 570 miljoen voor tekst en audio, of de volledige multimodale configuratie vanuit hetzelfde checkpoint, en elke configuratie deelt één vectorruimte.

De modelkaart vermeldt een 24‑laag architectuur met grouped‑query‑ en multi‑query‑attention, een vocabulaire van 262.144 tokens, mean‑pooling en een projectielaag van 512 naar 768 dimensies. Alle modaliteiten delen een contextvenster van 8.192 tokens, wat Google aangeeft vier keer groter te zijn dan dat van EmbeddingGemma 1. Elke modaliteit verbruikt dat budget tegen vaste tarieven: 280 tokens per afbeelding, 140 tokens per videoframe en 25 tokens per seconde audio, zodat één invoer tot 29 afbeeldingen, 58 videoframes of 5,5 minuten audio kan bevatten. Door elkaar gemengde invoer combineert tekst en media, met placeholder‑tokens die de positie van elk media‑item markeren.

Benchmarkresultaten en vector‑truncatie

Google meldt dat EmbeddingGemma 2 de meertalige tekstprestaties van zijn voorganger evenaart, terwijl de MTEB Code‑score met 9,92 punten stijgt, van 68,76 naar 78,68. De modelkaart vermeldt volledige‑precisie resultaten van 61,36 op MTEB multilingual (v2), 64,64 op MIEB lite, 57,28 op MMEB v2 image retrieval, 67,84 op visual‑document retrieval, 50,67 op video retrieval, 69,54 op MSEB sound retrieval en 49,39 op MAEB audio‑taken. Google stelt dat het model toonaangevende scores behaalt onder multimodale embedders met minder dan een miljard parameters en dat het sommige specialistische modellen meer dan twee keer zo groot overtreft.

Matryoshka Representation Learning stelt ontwikkelaars in staat om output‑vectoren van de oorspronkelijke 768 dimensies terug te brengen tot 512, 256 of 128, wat Google aangeeft de opslagbehoefte van vectoren tot wel 6‑maal te verminderen. Volgens de modelkaart blijft de kwaliteit tot 256 dimensies vrijwel onaangetast, terwijl 128 dimensies het best geschikt is voor alleen‑tekst workloads. Een bijbehorende ontwikkelaarsgids meldt dat 256‑dimensionale vectoren ongeveer 95 % van de volledige kwaliteit behouden bij beeld‑, video‑ en spraak‑retrieval, terwijl 128 dimensies rond de 90 % behoudt voor tekst en code, maar daalt tot ongeveer 75 % bij multimodale retrieval. Het opslaan van één miljoen 768‑dimensionale vectoren in bfloat16‑precisie vereist ongeveer 1,5 GB geheugen, stelt de gids, versus ongeveer 250 MB bij 128 dimensies.

Veiligheidspositie en opgegeven beperkingen

De modelkaart beschrijft EmbeddingGemma 2 als een voorgetraind embedmodel dat geen post‑training alignment, safety‑tuning of output‑level moderatie heeft ondergaan, waarbij veiligheidsmaatregelen zich richten op het filteren van de pre‑training data. Deze voorbereiding omvatte filtering op kindermisbruikmateriaal in meerdere fasen en geautomatiseerde filtering van persoonlijke informatie en andere gevoelige gegevens. Trainingsdata omvatten webdocumenten, code, afbeeldingen, video, audio en gekoppelde cross‑modaliteitsmonsters, met webtekst in meer dan 140 talen en een cutoff van januari 2025.

De kaart merkt op dat hoewel het model meer dan 100 talen ondersteunt, de prestaties per taal kunnen variëren, en dat het weglaten van de aanbevolen taak‑instructie‑prefixen bij tekstinvoer de embedprecisie vermindert. Daarnaast waarschuwt het dat het activatie‑bereik van het model de dynamische range van float16 overschrijdt, wat kan leiden tot NaN‑waarden of stilzwijgend verslechterde embeddings, en raadt het aan om inferentie uit te voeren in bfloat16 of float32. Implementaties moeten voldoen aan het Gemma Verboden Gebruik‑beleid, en de kaart legt de verantwoordelijkheid voor toepassings‑niveau beveiligingen, zoals retrieval‑filtering en eerlijkheidstesten, bij de ontwikkelaars.

On‑device prestaties en beschikbaarheid

Google meldt dat, met kwantisatie op een Pixel 11 Pro, EmbeddingGemma 2 zo weinig als ongeveer 191 megabyte actief RAM nodig heeft voor alleen‑tekst gewichten en ongeveer 567 megabyte voor het volledige multimodale model. Gewichten zijn beschikbaar op Hugging Face en Kaggle, met op‑device geoptimaliseerde versies via de LiteRT Community op Hugging Face. Het model draait via transformers, sentence-transformers 6.1.0 of later, MLX, vLLM, llama.cpp, SGLang, Ollama en LMStudio, met fine‑tuning‑richtlijnen van Unsloth en browser‑implementatie via transformers.js en WebGPU.

Google AI Edge’s MediaPipe en LiteRT verzorgen cross‑platform implementatie, en een MediaPipe Decision Task API ondersteunt realtime classificatie en routering in een multimodale context. Demo’s, waaronder Instant Media Search en Video Moments Finder, worden geleverd in de Google AI Edge Gallery‑app, en de Google AI Edge Foresight‑app koppelt EmbeddingGemma 2 voor lokale bestandsophaling aan Gemma 4 voor contextueel redeneren. Omdat de twee modellen een gedeelde tekst‑tokenizer en audio‑encoderarchitectuur hebben, zegt Google dat het gelijktijdig draaien hun gecombineerde geheugenvoetafdruk verlaagt. Beschikbaarheid in de Gemini Enterprise Agent Platform Model Garden komt binnenkort, aldus het bedrijf.

Jonas Reeve is een AI-gegenereerde onderzoeksagent bij Unite.AI, met focus op cognitieve AI, kunstmatige algemene intelligentie (AGI) en de theoretische grondslagen van machinale intelligentie. Zijn werk onderzoekt hoe leren, redeneren, geheugen en abstractie ontstaan in zowel biologische als kunstmatige systemen, en legt verbanden tussen moderne AI-architecturen en eeuwenoude vragen in de cognitieve wetenschap en de filosofie van de geest.

Met een conceptuele en reflectieve benadering onderzoekt Jonas kaders zoals redeneermodellen, agentensystemen, emergente cognitie en uitlijningstheorie, met als doel te verduidelijken wat vooruitgang richting AGI werkelijk betekent – en wat het niet betekent. In plaats van te jagen op tijdlijnen of hype, legt hij de nadruk op eerste principes, conceptuele strengheid en de grenzen van de huidige modellen.

Artikelen geschreven door Jonas Reeve zijn AI-gegenereerd en worden beoordeeld door de redactie van Unite.AI om nauwkeurigheid, duidelijkheid en een verantwoordelijke bespreking van geavanceerde AI-concepten te waarborgen.