Modely a platformy AI
DeepMind představuje EmbeddingGemma 2, mapující pět modalit do jednoho prostoru

Google DeepMind spustil EmbeddingGemma 2 dne 6. října 2026, otevřený model s 740 miliony parametrů, který mapuje text, kód, obrázky, video a audio do jediného 768‑dimenzionálního vektorového prostoru, vydaný pod licencí Apache 2.0 a navržený pro běh na spotřebitelském hardwaru.
Model byl představen v příspěvku na oficiálním blogu Google výzkumnými inženýry Google DeepMind Sahilem Duou a Henrique Schechter Vera. Google popisuje EmbeddingGemma 2 jako nejvýkonnější model pro multimodální vkládání na zařízení a uvádí, že je postaven na stejné technologii jako jeho modely Gemini Embedding. Společnost uvádí příklady schopností, jako je získání konkrétního video klipu pomocí hlasové poznámky nebo dotazování na hodiny audio nahrávek pomocí textu.
Toto vydání navazuje na původní EmbeddingGemma, kterou Google představil v roce 2025 jako odlehčenou možnost pro textová vkládání na spotřebitelském hardwaru. Google uvádí, že model překročil 20 milionů stažení, přičemž vývojáři jej používají pro vyhledávací nástroje na zařízení a pipeline generování s důrazem na soukromí a rozšířené vyhledávání.
Modulární enkodéry na bázi Gemma 4
EmbeddingGemma 2 je postaven na architektuře Gemma 4. Podle karty modelu EmbeddingGemma 2 jeho 740 milionů parametrů kombinuje 270‑milionový textový model (130‑milionový transformerový základ plus 140‑milionový embedder) s 170‑milionovým vizuálním enkodérem a 300‑milionovým audio enkodérem, všechny projekcí do sdíleného 768‑dimenzionálního prostoru. Protože jsou enkodéry nezávislé, mohou vývojáři selektivně načíst 270 milionů parametrů pro text a kód, 440 milionů pro text a obraz, 570 milionů pro text a audio, nebo plnou multimodální konfiguraci ze stejného kontrolního bodu, a každá konfigurace sdílí jeden vektorový prostor.
Karta modelu uvádí 24‑vrstvou architekturu s grupovaným a multi‑dotazovým pozorností, slovníkem o 262 144 tokenů, průměrným poolingem a projekční vrstvou z 512 na 768 dimenzí. Všechny modality sdílejí kontextové okno o 8 192 tokenů, což Google uvádí jako čtyřikrát větší než u EmbeddingGemma 1. Každá modalita spotřebovává tento rozpočet pevnými sazbami: 280 tokenů na obrázek, 140 tokenů na video‑snímek a 25 tokenů na sekundu audia, takže jeden vstup může obsahovat až 29 obrázků, 58 video‑snímků nebo 5,5 minuty audia. Prokládané vstupy míchají text a média, přičemž zástupné tokeny označují pozici každé mediální položky.
Výsledky benchmarku a zkracování vektorů
Google uvádí, že EmbeddingGemma 2 dosahuje výkonu v multijazyčném textu svého předchůdce a zároveň zvyšuje skóre MTEB Code o 9,92 bodu, z 68,76 na 78,68. Výsledky v plné přesnosti v kartě modelu uvádějí 61,36 v MTEB multilingual (v2), 64,64 v MIEB lite, 57,28 v MMEB v2 image retrieval, 67,84 v vizuálním‑dokumentovém vyhledávání, 50,67 ve video‑vyhledávání, 69,54 v MSEB sound retrieval a 49,39 v MAEB audio úlohách. Google tvrdí, že model dosahuje špičkových výsledků mezi multimodálními vkládacími modely pod jedním miliardou parametrů a překonává některé specializované modely více než dvojnásobně větší velikosti.
Matryoshka Representation Learning umožňuje vývojářům zkrátit výstupní vektory z původních 768 dimenzí na 512, 256 nebo 128, což podle Google snižuje požadavky na úložiště vektorů až 6‑násobně. Podle karty modelu kvalita zůstává s minimálním dopadem až do 256 dimenzí, zatímco 128 dimenzí je nejvhodnější pro úlohy jen s textem. doprovodný vývojářský průvodce uvádí, že 256‑dimenzionální vektory zachovávají přibližně 95 % plné kvality při vyhledávání obrázků, videí a řeči, zatímco 128 dimenzí zachovává kolem 90 % u textu a kódu, ale klesá na zhruba 75 % u multimodálního vyhledávání. Uložení jednoho milionu 768‑dimenzionálních vektorů v přesnosti bfloat16 zabírá přibližně 1,5 GB paměti, uvádí průvodce, oproti asi 250 MB při 128 dimenzích.
Bezpečnostní postoj a uvedená omezení
Karta modelu popisuje EmbeddingGemma 2 jako předtrénovaný vkládací model, který neprošel následným sladěním, bezpečnostním laděním ani moderací na úrovni výstupu, přičemž bezpečnostní opatření jsou soustředěna na filtrování dat předtrénování. Příprava zahrnovala filtrování materiálů dětské sexuální zneužívání v několika fázích a automatické filtrování osobních informací a dalších citlivých dat. Tréninková data zahrnovala webové dokumenty, kód, obrázky, video, audio a párové vzorky napříč modalitami, s webovým textem ve více než 140 jazycích a uzávěrkou v lednu 2025.
Karta uvádí, že ačkoliv model podporuje více než 100 jazyků, výkon nemusí být mezi nimi stejný, a že vynechání doporučených předpon instrukcí úkolu u textových vstupů snižuje přesnost vkládání. Také varuje, že rozsah aktivace modelu překračuje dynamický rozsah float16, což může vést k NaN hodnotám nebo tiše degradovaným vektorům, a doporučuje provádět inferenci v bfloat16 nebo float32. Nasazení musí dodržovat Politiku zakázaného použití Gemma a karta přenáší zodpovědnost na vývojáře za bezpečnostní opatření na úrovni aplikace, jako je filtrování vyhledávání a testování spravedlnosti.
Výkon na zařízení a dostupnost
Google uvádí, že při kvantizaci na zařízení Pixel 11 Pro vyžaduje EmbeddingGemma 2 pouhých přibližně 191 MB aktivní RAM pro váhy pouze pro text a asi 567 MB pro plný multimodální model. Váhy jsou k dispozici na Hugging Face a Kaggle, s optimalizovanými verzemi pro zařízení prostřednictvím LiteRT Community na Hugging Face. Model běží na transformers, sentence-transformers 6.1.0 nebo novějším, MLX, vLLM, llama.cpp, SGLang, Ollama a LMStudio, s návodem na doladění od Unsloth a nasazením v prohlížeči pomocí transformers.js a WebGPU.
MediaPipe a LiteRT od Google AI Edge zajišťují nasazení napříč platformami a API MediaPipe Decision Task podporuje klasifikaci a směrování v reálném čase v multimodálním kontextu. Demo verze, včetně Instant Media Search a Video Moments Finder, jsou součástí aplikace Google AI Edge Gallery a aplikace Google AI Edge Foresight spojuje EmbeddingGemma 2 pro lokální vyhledávání souborů s Gemma 4 pro kontextové uvažování. Protože oba modely sdílejí architekturu textového tokenizéru a audio enkodéru, Google uvádí, že jejich společné spuštění snižuje celkovou paměťovou náročnost. Dostupnost v Gemini Enterprise Agent Platform Model Garden bude brzy, podle společnosti.












