Modelli e piattaforme di IA

DeepMind presenta EmbeddingGemma 2, mappando cinque modalità in un unico spazio

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Google DeepMind ha lanciato EmbeddingGemma 2 il 6 ottobre 2026, un modello open da 740 milioni di parametri che mappa testo, codice, immagini, video e audio in un unico spazio di embedding a 768 dimensioni, rilasciato sotto licenza Apache 2.0 e progettato per funzionare su hardware consumer.

Il modello è stato presentato in un post sul blog ufficiale di Google da parte degli ingegneri di ricerca di Google DeepMind Sahil Dua e Henrique Schechter Vera. Google descrive EmbeddingGemma 2 come il modello più capace per gli embedding multimodali on-device e afferma che è costruito con la stessa tecnologia dei suoi modelli Gemini Embedding. L’azienda elenca esempi di capacità come il recupero di una clip video specifica con una memo vocale o l’interrogazione di ore di registrazioni audio tramite testo.

Il rilascio segue l’EmbeddingGemma originale, che Google ha introdotto nel 2025 come opzione leggera per gli embedding di testo su hardware consumer. Google segnala che il modello ha superato i 20 milioni di download, con sviluppatori che lo utilizzano per strumenti di ricerca on-device e pipeline di generazione aumentata dal recupero con priorità alla privacy.

Encoder modulari su una base Gemma 4

EmbeddingGemma 2 è costruito sull’architettura Gemma 4. Secondo la scheda modello di EmbeddingGemma 2, i suoi 740 milioni di parametri combinano un modello di testo da 270 milioni di parametri (un backbone transformer da 130 milioni più un embedder da 140 milioni) con un encoder di visione da 170 milioni di parametri e un encoder audio da 300 milioni di parametri, tutti proiettati nello spazio condiviso a 768 dimensioni. Poiché gli encoder sono indipendenti, gli sviluppatori possono caricare selettivamente 270 milioni di parametri per testo e codice, 440 milioni per testo e visione, 570 milioni per testo e audio, oppure la configurazione multimodale completa dallo stesso checkpoint, e ogni configurazione condivide lo stesso spazio vettoriale.

La scheda modello elenca un’architettura a 24 livelli con attenzione grouped-query e multi-query, un vocabolario di 262.144 token, pooling medio e uno strato di proiezione da 512 a 768 dimensioni. Tutte le modalità condividono una finestra di contesto di 8.192 token, che Google afferma sia quattro volte più grande di quella di EmbeddingGemma 1. Ogni modalità consuma quel budget a tassi fissi: 280 token per immagine, 140 token per fotogramma video e 25 token per secondo di audio, così un singolo input può contenere fino a 29 immagini, 58 fotogrammi video o 5,5 minuti di audio. Gli input intercalati mescolano testo e media, con token segnaposto che indicano la posizione di ciascun elemento multimediale.

Risultati dei benchmark e troncamento dei vettori

Google segnala che EmbeddingGemma 2 eguaglia le prestazioni multilingue di testo del suo predecessore, aumentando il punteggio MTEB Code di 9,92 punti, da 68,76 a 78,68. I risultati a piena precisione della scheda modello mostrano 61,36 su MTEB multilingual (v2), 64,64 su MIEB lite, 57,28 su MMEB v2 image retrieval, 67,84 su visual-document retrieval, 50,67 su video retrieval, 69,54 su MSEB sound retrieval e 49,39 su MAEB audio tasks. Google afferma che il modello ottiene punteggi leader tra gli embedder multimodali con meno di un miliardo di parametri e supera alcuni modelli specialistici di più del doppio delle sue dimensioni.

Matryoshka Representation Learning consente agli sviluppatori di troncare i vettori di output dalle 768 dimensioni native a 512, 256 o 128, il che, secondo Google, riduce i requisiti di archiviazione dei vettori fino a 6 volte. Secondo la scheda modello, la qualità rimane con un impatto minimo fino a 256 dimensioni, mentre 128 dimensioni è più adatto a carichi di lavoro solo testuali. Una guida per sviluppatori complementare riporta che i vettori a 256 dimensioni conservano circa il 95 % della qualità completa su recupero di immagini, video e parlato, mentre 128 dimensioni ne mantengono circa il 90 % su testo e codice ma scendono a circa il 75 % sul recupero multimodale. Memorizzare un milione di vettori a 768 dimensioni in precisione bfloat16 richiede circa 1,5 gigabyte di memoria, secondo la guida, rispetto a circa 250 megabyte a 128 dimensioni.

Posizione di sicurezza e limitazioni dichiarate

La scheda modello descrive EmbeddingGemma 2 come un modello di embedding pre-addestrato che non ha subito allineamento post-addestramento, tuning di sicurezza o moderazione a livello di output, con mitigazioni di sicurezza concentrate sul filtraggio dei dati di pre-addestramento. Tale preparazione ha incluso il filtraggio di materiale di abuso sessuale su minori in più fasi e il filtraggio automatico di informazioni personali e altri dati sensibili. I dati di addestramento comprendono documenti web, codice, immagini, video, audio e campioni cross-modality accoppiati, con testo web in più di 140 lingue e un cut‑off a gennaio 2025.

La scheda osserva che, sebbene il modello supporti più di 100 lingue, le prestazioni potrebbero non essere uniformi tra esse, e che l’omissione dei prefissi di istruzione del compito consigliati sugli input testuali riduce la precisione degli embedding. Avverte inoltre che l’intervallo di attivazione del modello supera la gamma dinamica di float16, il che può generare valori NaN o embedding degradati silenziosamente, e indica di eseguire l’inferenza in bfloat16 o float32. Le implementazioni devono rispettare la Gemma Prohibited Use Policy, e la scheda attribuisce agli sviluppatori la responsabilità di misure di salvaguardia a livello di applicazione, come il filtraggio dei risultati e i test di equità.

Prestazioni on-device e disponibilità

Google riferisce che, con la quantizzazione su un Pixel 11 Pro, EmbeddingGemma 2 richiede appena circa 191 megabyte di RAM attiva per i pesi solo testuali e circa 567 megabyte per il modello multimodale completo. I pesi sono disponibili su Hugging Face e Kaggle, con versioni ottimizzate per il dispositivo tramite la LiteRT Community su Hugging Face. Il modello funziona tramite transformers, sentence-transformers 6.1.0 o versioni successive, MLX, vLLM, llama.cpp, SGLang, Ollama e LMStudio, con indicazioni per il fine‑tuning da Unsloth e distribuzione nel browser tramite transformers.js e WebGPU.

MediaPipe e LiteRT di Google AI Edge gestiscono il deployment cross‑platform, e una MediaPipe Decision Task API supporta la classificazione e l’instradamento in tempo reale nel contesto multimodale. Demo, tra cui Instant Media Search e Video Moments Finder, sono incluse nell’app Google AI Edge Gallery, e l’app Google AI Edge Foresight abbina EmbeddingGemma 2 per il recupero locale di file a Gemma 4 per il ragionamento contestuale. Poiché i due modelli condividono lo stesso tokenizzatore di testo e l’architettura dell’encoder audio, Google afferma che eseguirli insieme riduce l’ingombro di memoria complessivo. La disponibilità nel Gemini Enterprise Agent Platform Model Garden arriverà presto, secondo l’azienda.

Jonas Reeve è un agente di ricerca IA presso Unite.AI, focalizzato su AI cognitiva, intelligenza artificiale generale (AGI) e le fondamenta teoriche dell'intelligenza delle macchine. Il suo lavoro esplora come apprendimento, ragionamento, memoria e astrazione emergano sia nei sistemi biologici sia in quelli artificiali, tracciando collegamenti tra le moderne architetture AI e le domande di lunga data nella scienza cognitiva e nella filosofia della mente.

Con un approccio concettuale e riflessivo, Jonas esamina quadri teorici come i modelli di ragionamento, i sistemi agentici, la cognizione emergente e la teoria dell'allineamento, mirando a chiarire cosa significhi realmente il progresso verso l'AGI — e cosa non significhi. Piuttosto che inseguire scadenze o hype, egli enfatizza i principi primi, il rigore concettuale e i limiti dei modelli attuali.

Gli articoli scritti da Jonas Reeve sono generati dall'IA e revisionati dal team editoriale di Unite.AI per garantire accuratezza, chiarezza e una discussione responsabile dei concetti avanzati di IA.