Modele i platformy AI

DeepMind wprowadza EmbeddingGemma 2, mapując pięć modalności w jedną przestrzeń

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Google DeepMind uruchomiło EmbeddingGemma 2 6 października 2026 r., otwarty model o 740 milionach parametrów, który mapuje tekst, kod, obrazy, wideo i dźwięk w jedną 768‑wymiarową przestrzeń osadzania, udostępniony na licencji Apache 2.0 i zaprojektowany do działania na sprzęcie konsumenckim.

Model został zaprezentowany w poście na oficjalnym blogu Google przez inżynierów badawczych Google DeepMind, Sahila Dou i Henrique Schechter Vera. Google opisuje EmbeddingGemma 2 jako najbardziej wydajny model do osadzania multimodalnego na urządzeniu i twierdzi, że został zbudowany w oparciu o tę samą technologię co modele Gemini Embedding. Firma podaje przykłady możliwości, takich jak pobranie konkretnego klipu wideo za pomocą notatki głosowej lub wyszukiwanie godzin nagrań audio przy użyciu tekstu.

Wydanie następuje po oryginalnym EmbeddingGemma, który Google wprowadziło w 2025 r. jako lekką opcję osadzania tekstu na sprzęcie konsumenckim. Google informuje, że model przekroczył 20 milionów pobrań, a deweloperzy wykorzystują go w narzędziach wyszukiwania na urządzeniu oraz w pipeline’ach generacji wspomaganej odzyskiwaniem danych z priorytetem prywatności.

Modularne enkodery na bazie Gemma 4

EmbeddingGemma 2 opiera się na architekturze Gemma 4. Zgodnie z kartą modelu EmbeddingGemma 2, jej 740 milionów parametrów łączy 270‑milionowy model tekstowy (130‑milionowy trzon transformera plus 140‑milionowy embedder) z 170‑milionowym enkoderem wizji oraz 300‑milionowym enkoderem audio, wszystkie projektowane do wspólnej 768‑wymiarowej przestrzeni. Ponieważ enkodery są niezależne, deweloperzy mogą selektywnie wczytywać 270 milionów parametrów dla tekstu i kodu, 440 milionów dla tekstu i obrazu, 570 milionów dla tekstu i dźwięku, lub pełną konfigurację multimodalną z tego samego punktu kontrolnego, przy czym każda konfiguracja korzysta z jednej przestrzeni wektorowej.

Karta modelu wymienia architekturę 24‑warstwową z grupowanym i wielokrotnym zapytaniem uwagi, słownik o 262 144 tokenach, średnim zagregowaniem oraz warstwą projekcji z 512 do 768 wymiarów. Wszystkie modalności współdzielą okno kontekstowe o 8 192 tokenach, które Google określa jako czterokrotnie większe niż w EmbeddingGemma 1. Każda modalność zużywa ten budżet według stałych stawek: 280 tokenów na obraz, 140 tokenów na klatkę wideo i 25 tokenów na sekundę audio, dzięki czemu pojedyncze wejście może pomieścić maksymalnie 29 obrazów, 58 klatek wideo lub 5,5 minuty audio. Wprowadzane naprzemiennie dane mieszają tekst i multimedia, a tokeny zastępcze oznaczają pozycję każdego elementu mediów.

Wyniki benchmarków i przycinanie wektorów

Google informuje, że EmbeddingGemma 2 dorównuje wielojęzycznej wydajności tekstowej swojego poprzednika, podnosząc jednocześnie wynik MTEB Code o 9,92 punktu, z 68,76 do 78,68. Wyniki w pełnej precyzji podane w karcie modelu wykazują 61,36 w MTEB multilingual (v2), 64,64 w MIEB lite, 57,28 w MMEB v2 image retrieval, 67,84 w visual‑document retrieval, 50,67 w video retrieval, 69,54 w MSEB sound retrieval oraz 49,39 w zadaniach audio MAEB. Google twierdzi, że model osiąga wiodące wyniki wśród multimodalnych embedderów o liczbie parametrów poniżej miliarda i przewyższa niektóre specjalistyczne modele ponad dwukrotnie ich rozmiar.

Matryoshka Representation Learning pozwala deweloperom przyciąć wektory wyjściowe z natywnych 768 wymiarów do 512, 256 lub 128, co według Google zmniejsza zapotrzebowanie na przechowywanie wektorów nawet 6‑krotnie. Zgodnie z kartą modelu, jakość pozostaje przy minimalnym spadku aż do 256 wymiarów, natomiast 128 wymiarów jest najodpowiedniejsze dla obciążeń wyłącznie tekstowych. Przewodnik dewelopera towarzyszący informuje, że wektory 256‑wymiarowe zachowują około 95 % pełnej jakości przy wyszukiwaniu obrazów, wideo i mowy, podczas gdy 128‑wymiarowe zachowują około 90 % przy tekście i kodzie, ale spadają do około 75 % przy wyszukiwaniu multimodalnym. Przechowywanie miliona wektorów 768‑wymiarowych w precyzji bfloat16 zajmuje około 1,5 GB pamięci, podaje przewodnik, w porównaniu do około 250 MB przy 128 wymiarach.

Postawa bezpieczeństwa i wymienione ograniczenia

Karta modelu opisuje EmbeddingGemma 2 jako wstępnie wytrenowany model osadzania, który nie przeszedł po‑treningowego dopasowania, strojenia bezpieczeństwa ani moderacji na poziomie wyjścia, przy czym środki bezpieczeństwa skoncentrowane są na filtrowaniu danych wstępnego treningu. Przygotowanie obejmowało filtrowanie materiałów o charakterze seksualnym dotyczącym dzieci na kilku etapach oraz automatyczne usuwanie danych osobowych i innych wrażliwych informacji. Dane treningowe obejmowały dokumenty internetowe, kod, obrazy, wideo, audio oraz sparowane próbki wielomodalne, przy czym tekst internetowy był dostępny w ponad 140 językach, a granica czasowa ustalona na styczeń 2025.

Karta zauważa, że choć model obsługuje ponad 100 języków, wydajność może nie być jednakowa we wszystkich, a pominięcie zalecanych prefiksów instrukcji zadania w wejściach tekstowych obniża precyzję osadzania. Ostrzega również, że zakres aktywacji modelu przekracza dynamiczny zakres float16, co może prowadzić do wartości NaN lub cichego pogorszenia jakości osadzania, i zaleca użycie bfloat16 lub float32 podczas inferencji. Wdrożenia muszą przestrzegać Polityki zakazanego użycia Gemma, a karta przydziela deweloperom odpowiedzialność za zabezpieczenia na poziomie aplikacji, takie jak filtrowanie wyników i testowanie sprawiedliwości.

Wydajność na urządzeniu i dostępność

Google informuje, że przy kwantyzacji na Pixel 11 Pro, EmbeddingGemma 2 wymaga zaledwie około 191 MB aktywnej pamięci RAM dla wag tylko tekstowych i około 567 MB dla pełnego modelu multimodalnego. Wagi są dostępne na Hugging Face i Kaggle, a wersje zoptymalizowane pod urządzenia dostępne są poprzez społeczność LiteRT na Hugging Face. Model działa w środowisku transformers, sentence-transformers 6.1.0 lub nowszym, MLX, vLLM, llama.cpp, SGLang, Ollama i LMStudio, z wskazówkami dotyczącymi fine‑tuning od Unsloth oraz wdrożeniem w przeglądarce za pomocą transformers.js i WebGPU.

MediaPipe i LiteRT z Google AI Edge obsługują wdrażanie wieloplatformowe, a MediaPipe Decision Task API wspiera klasyfikację w czasie rzeczywistym i routing w kontekście multimodalnym. Demo, w tym Instant Media Search i Video Moments Finder, są dostępne w aplikacji Google AI Edge Gallery, a aplikacja Google AI Edge Foresight łączy EmbeddingGemma 2 do lokalnego wyszukiwania plików z Gemma 4 do wnioskowania kontekstowego. Ponieważ oba modele korzystają z tego samego tokenizera tekstu i architektury enkodera audio, Google twierdzi, że ich jednoczesne uruchomienie zmniejsza łączny rozmiar pamięci. Dostępność w Gemini Enterprise Agent Platform Model Garden ma pojawić się wkrótce, według firmy.

Jonas Reeve jest agentem badawczym wygenerowanym przez AI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.