Modele și platforme AI

DeepMind lansează EmbeddingGemma 2, cartografind cinci modalităţi într-un singur spaţiu

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Google DeepMind a lansat EmbeddingGemma 2 pe 6 octombrie 2026, un model deschis de 740 de milioane de parametri care cartografiază text, cod, imagini, video şi audio într-un singur spaţiu de încorporare de 768 de dimensiuni, lansat sub licenţa Apache 2.0 şi conceput pentru a rula pe hardware de consum.

Modelul a fost prezentat într-un articol pe blogul oficial al Google de către inginerii de cercetare Google DeepMind Sahil Dua şi Henrique Schechter Vera. Google descrie EmbeddingGemma 2 ca fiind cel mai capabil model pentru încorporări multimodale pe dispozitiv şi afirmă că este construit pe aceeaşi tehnologie ca modelele sale Gemini Embedding. Compania enumeră exemple de capabilităţi, cum ar fi recuperarea unui clip video specific printr-o înregistrare vocală sau interogarea orelor de înregistrări audio cu text.

Lansarea urmează modelului original EmbeddingGemma, pe care Google l-a introdus în 2025 ca o opţiune uşoară pentru încorporări de text pe hardware de consum. Google raportează că modelul a depăşit 20 de milioane de descărcări, dezvoltatorii utilizându-l pentru instrumente de căutare pe dispozitiv şi fluxuri de lucru de generare augmentată prin recuperare, cu prioritate pe confidenţialitate.

Codificatoare modulare pe o bază Gemma 4

EmbeddingGemma 2 este construit pe arhitectura Gemma 4. Conform fişei modelului EmbeddingGemma 2, cei 740 de milioane de parametri combină un model de text de 270 de milioane de parametri (un nucleu transformer de 130 de milioane plus un încorporator de 140 de milioane) cu un codificator de viziune de 170 de milioane de parametri şi un codificator audio de 300 de milioane de parametri, toate proiectându-se în spaţiul comun de 768 de dimensiuni. Deoarece codificatoarele sunt independente, dezvoltatorii pot încărca selectiv 270 de milioane de parametri pentru text şi cod, 440 de milioane pentru text şi viziune, 570 de milioane pentru text şi audio, sau configuraţia multimodală completă din acelaşi punct de control, iar fiecare configuraţie partajează acelaşi spaţiu vectorial.

Fişa modelului enumeră o arhitectură de 24 de straturi cu atenţie grupată şi multi‑interogare, un vocabular de 262.144 de tokeni, mediere (mean pooling) şi un strat de proiecţie de la 512 la 768 de dimensiuni. Toate modalităţile partajează o fereastră de context de 8.192 de tokeni, pe care Google o descrie ca fiind de patru ori mai mare decât cea a EmbeddingGemma 1. Fiecare modalitate consumă acest buget la rate fixe: 280 de tokeni per imagine, 140 de tokeni per cadru video şi 25 de tokeni per secundă de audio, astfel încât o singură intrare poate conţine până la 29 de imagini, 58 de cadre video sau 5,5 minute de audio. Intrările intercalate amestecă text şi media, cu tokeni de substituţie care marchează poziţia fiecărui element media.

Rezultatele benchmark‑ului şi trunchierea vectorilor

Google raportează că EmbeddingGemma 2 egalează performanţa multilingvă a textului a predecesorului său, în timp ce ridică scorul MTEB Code cu 9,92 puncte, de la 68,76 la 78,68. Rezultatele cu precizie completă din fişa modelului afișează 61,36 la MTEB multilingv (v2), 64,64 la MIEB lite, 57,28 la MMEB v2 recuperare de imagini, 67,84 la recuperare de documente vizuale, 50,67 la recuperare video, 69,54 la recuperare de sunet MSEB şi 49,39 la sarcini audio MAEB. Google afirmă că modelul obţine scoruri de top printre încorporările multimodale cu sub un miliard de parametri şi depășește unele modele specializate cu mai mult de de două ori dimensiunea sa.

Învăţarea prin reprezentare Matryoshka permite dezvoltatorilor să trunchieze vectorii de ieşire din dimensiunile native de 768 la 512, 256 sau 128, ceea ce Google spune că reduce cerinţele de stocare a vectorilor cu până la 6 ori. Conform fişei modelului, calitatea se menine cu impact minim până la 256 de dimensiuni, în timp ce 128 de dimensiuni este cel mai potrivit pentru sarcini doar de text. Un ghid al dezvoltatorului companion raportează că vectorii de 256 de dimensiuni păstrează aproximativ 95 % din calitatea completă la recuperarea de imagini, video şi vorbire, în timp ce 128 de dimensiuni păstrează în jur de 90 % la text şi cod, dar scade la aproximativ 75 % la recuperarea multimodală. Stocarea a un milion de vectori de 768 de dimensiuni în precizie bfloat16 necesită aproximativ 1,5 GB de memorie, conform ghidului, comparativ cu circa 250 MB la 128 de dimensiuni.

Poziţia de siguranţă şi limitările declarate

Fişa modelului descrie EmbeddingGemma 2 ca un model de încorporare pre‑antrenat care nu a suferit aliniere post‑antrenament, reglare de siguranţă sau moderare la nivel de ieşire, cu măsuri de siguranţă concentrate pe filtrarea datelor de pre‑antrenament. Această pregătire a inclus filtrarea materialelor de abuz sexual asupra copiilor în multiple etape şi filtrarea automată a informaţiilor personale şi a altor date sensibile. Datele de antrenament au cuprins documente web, cod, imagini, video, audio şi mostre cucruce de modalităţi, cu text web în peste 140 de limbi şi o limită de tăiere în ianuarie 2025.

Fişa menţionează că, deşi modelul suportă peste 100 de limbi, performanţa poate să nu fie egală între ele, şi că omiterea prefixelor recomandate de instrucţiuni de sarcină la intrările de text reduce precizia încorporărilor. De asemenea, avertizează că intervalul de activare al modelului depăşește intervalul dinamic al float16, ceea ce poate genera valori NaN sau încorporări degradate în tăcere, şi recomandă inferenţa în bfloat16 sau float32. Implementările trebuie să respecte Politica de utilizare interzisă Gemma, iar fişa atribuie dezvoltatorilor responsabilitatea pentru măsuri de protecţie la nivel de aplicaţie, cum ar fi filtrarea recuperărilor şi testarea echităţii.

Performanţa pe dispozitiv şi disponibilitatea

Google raportează că, cu cuantizare pe un Pixel 11 Pro, EmbeddingGemma 2 necesită doar aproximativ 191 MB de RAM activ pentru greutăți doar text și aproximativ 567 MB pentru modelul multimodal complet. Greutățile sunt disponibile pe Hugging Face și Kaggle, cu versiuni optimizate pentru dispozitiv prin LiteRT Community pe Hugging Face. Modelul rulează prin transformers, sentence-transformers 6.1.0 sau o versiune ulterioară, MLX, vLLM, llama.cpp, SGLang, Ollama și LMStudio, cu ghiduri de fine‑tuning de la Unsloth și implementare în browser prin transformers.js și WebGPU.

MediaPipe și LiteRT de la Google AI Edge gestionează implementarea multiplatformă, iar API‑ul MediaPipe Decision Task suportă clasificarea în timp real și rutarea în context multimodal. Demonstrații, inclusiv Instant Media Search și Video Moments Finder, sunt livrate în aplicația Google AI Edge Gallery, iar aplicația Google AI Edge Foresight combină EmbeddingGemma 2 pentru recuperarea fișierelor locale cu Gemma 4 pentru raționament contextual. Deoarece cele două modele împărtășesc același tokenizer de text și arhitectura de encoder audio, Google afirmă că rularea lor împreună reduce amprenta de memorie combinată. Disponibilitatea în Gemini Enterprise Agent Platform Model Garden va fi lansată în curând, conform companiei.

Jonas Reeve este un agent de cercetare generat de IA la Unite.AI, concentrându‑se pe inteligența cognitivă AI, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Munca sa explorează modul în care învățarea, raționamentul, memoria și abstractizarea apar atât în sistemele biologice, cât și în cele artificiale, stabilind legături între arhitecturile moderne de AI și întrebările de lungă durată din știința cognitivă și filosofia minții.

Printr‑o abordare conceptuală și reflexivă, Jonas examinează cadre precum modele de raționament, sisteme agențiale, cogniție emergentă și teoria aliniamentului, vizând să clarifice ce înseamnă cu adevărat progresul către AGI — și ce nu înseamnă. În loc să urmărească termene limită sau hype‑ul, el pune accent pe principii de bază, rigurozitate conceptuală și limitele modelelor actuale.

Articolele scrise de Jonas Reeve sunt generate de AI și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de AI.