Model dan platform AI
DeepMind Memperkenalkan EmbeddingGemma 2, Memetakan Lima Modalitas ke Dalam Satu Ruang

Google DeepMind meluncurkan EmbeddingGemma 2 pada 6 Oktober 2026, sebuah model terbuka dengan 740 juta parameter yang memetakan teks, kode, gambar, video, dan audio ke dalam satu ruang embedding berdimensi 768, dirilis di bawah lisensi Apache 2.0 dan dirancang untuk dijalankan pada perangkat keras konsumen.
Model ini diungkapkan dalam sebuah posting di blog resmi Google oleh insinyur riset Google DeepMind Sahil Dua dan Henrique Schechter Vera. Google menggambarkan EmbeddingGemma 2 sebagai model paling mampu untuk embedding multimodal di perangkat dan mengatakan bahwa model ini dibangun dengan teknologi yang sama seperti model Gemini Embedding miliknya. Perusahaan mencantumkan contoh kemampuan seperti mengambil klip video tertentu dengan memo suara atau menanyakan jam rekaman audio dengan teks.
Rilis ini mengikuti EmbeddingGemma asli, yang diperkenalkan Google pada 2025 sebagai opsi ringan untuk embedding teks pada perangkat konsumen. Google melaporkan bahwa model ini telah melewati 20 juta unduhan, dengan pengembang menggunakannya untuk alat pencarian di perangkat dan pipeline generasi berbasis pengambilan yang mengutamakan privasi.
Encoder Modular pada Basis Gemma 4
EmbeddingGemma 2 dibangun di atas arsitektur Gemma 4. Menurut kartu model EmbeddingGemma 2, 740 juta parameternya menggabungkan model teks 270 juta parameter (sebuah backbone transformer 130 juta ditambah embedder 140 juta) dengan encoder visi 170 juta parameter dan encoder audio 300 juta parameter, semuanya memproyeksikan ke ruang 768-dimensi yang dibagi. Karena encoder bersifat independen, pengembang dapat memuat secara selektif 270 juta parameter untuk teks dan kode, 440 juta untuk teks dan visi, 570 juta untuk teks dan audio, atau konfigurasi multimodal penuh dari checkpoint yang sama, dan setiap konfigurasi berbagi satu ruang vektor.
Kartu model mencantumkan arsitektur 24 lapisan dengan attention grouped-query dan multi-query, kosakata 262.144 token, mean pooling, dan lapisan proyeksi dari 512 ke 768 dimensi. Semua modalitas berbagi jendela konteks 8.192 token, yang menurut Google empat kali lebih besar daripada EmbeddingGemma 1. Setiap modalitas mengonsumsi anggaran tersebut dengan laju tetap: 280 token per gambar, 140 token per frame video, dan 25 token per detik audio, sehingga satu masukan dapat memuat hingga 29 gambar, 58 frame video, atau 5,5 menit audio. Masukan yang diselingi mencampur teks dan media, dengan token placeholder menandai posisi masing-masing item media.
Hasil Benchmark dan Pemotongan Vektor
Google melaporkan bahwa EmbeddingGemma 2 menyamai kinerja teks multibahasa pendahulunya sekaligus meningkatkan skor MTEB Code sebesar 9,92 poin, dari 68,76 menjadi 78,68. Hasil presisi penuh pada kartu model mencantumkan 61,36 pada MTEB multilingual (v2), 64,64 pada MIEB lite, 57,28 pada MMEB v2 image retrieval, 67,84 pada visual-document retrieval, 50,67 pada video retrieval, 69,54 pada MSEB sound retrieval, dan 49,39 pada tugas audio MAEB. Google menyatakan bahwa model ini mencapai skor terdepan di antara embedder multimodal dengan kurang dari satu miliar parameter dan mengungguli beberapa model spesialis lebih dari dua kali ukuran modelnya.
Matryoshka Representation Learning memungkinkan pengembang memotong vektor output dari 768 dimensi asli menjadi 512, 256, atau 128, yang menurut Google mengurangi kebutuhan penyimpanan vektor hingga 6 kali. Menurut kartu model, kualitas tetap terjaga dengan dampak minimal hingga 256 dimensi, sementara 128 dimensi paling cocok untuk beban kerja teks saja. Sebuah panduan pengembang pendamping melaporkan bahwa vektor 256-dimensi mempertahankan sekitar 95 persen kualitas penuh pada pencarian gambar, video, dan suara, sementara 128 dimensi mempertahankan sekitar 90 persen pada teks dan kode namun turun menjadi kira-kira 75 persen pada pencarian multimodal. Menyimpan satu juta vektor 768-dimensi dengan presisi bfloat16 memerlukan sekitar 1,5 gigabyte memori, menurut panduan, dibandingkan sekitar 250 megabyte pada 128 dimensi.
Posisi Keamanan dan Batasan yang Dinyatakan
Kartu model menggambarkan EmbeddingGemma 2 sebagai model embedding pra‑latih yang belum mengalami penyelarasan pasca‑pelatihan, penyetelan keamanan, atau moderasi tingkat output, dengan mitigasi keamanan terfokus pada penyaringan data pra‑pelatihan. Persiapan tersebut mencakup penyaringan materi pelecehan seksual anak pada beberapa tahap serta penyaringan otomatis informasi pribadi dan data sensitif lainnya. Data pelatihan mencakup dokumen web, kode, gambar, video, audio, dan sampel lintas‑modalitas berpasangan, dengan teks web dalam lebih dari 140 bahasa dan batas waktu hingga Januari 2025.
Kartu tersebut mencatat bahwa meskipun model mendukung lebih dari 100 bahasa, kinerjanya mungkin tidak setara di antara bahasa-bahasa tersebut, dan bahwa menghilangkan awalan instruksi tugas yang direkomendasikan pada masukan teks mengurangi presisi embedding. Kartu juga memperingatkan bahwa rentang aktivasi model melampaui rentang dinamis float16, yang dapat menghasilkan nilai NaN atau embedding yang menurun secara diam‑diam, serta menyarankan inferensi menggunakan bfloat16 atau float32. Penyebaran harus mematuhi Kebijakan Penggunaan Dilarang Gemma, dan kartu menugaskan pengembang untuk bertanggung jawab atas langkah‑langkah pengamanan tingkat aplikasi seperti penyaringan pengambilan dan pengujian keadilan.
Kinerja di Perangkat dan Ketersediaan
Google melaporkan bahwa, dengan kuantisasi pada Pixel 11 Pro, EmbeddingGemma 2 membutuhkan hanya sekitar 191 megabita RAM aktif untuk bobot hanya teks dan sekitar 567 megabita untuk model multimodal lengkap. Bobot tersedia di Hugging Face dan Kaggle, dengan versi yang dioptimalkan untuk perangkat melalui LiteRT Community di Hugging Face. Model ini dijalankan melalui transformers, sentence-transformers 6.1.0 atau yang lebih baru, MLX, vLLM, llama.cpp, SGLang, Ollama, dan LMStudio, dengan panduan fine-tuning dari Unsloth dan penyebaran di browser melalui transformers.js dan WebGPU.
MediaPipe dan LiteRT milik Google AI Edge menangani penyebaran lintas platform, dan MediaPipe Decision Task API mendukung klasifikasi waktu nyata serta pengalihan dalam konteks multimodal. Demo termasuk Instant Media Search dan Video Moments Finder tersedia dalam aplikasi Google AI Edge Gallery, dan aplikasi Google AI Edge Foresight menggabungkan EmbeddingGemma 2 untuk pengambilan file lokal dengan Gemma 4 untuk penalaran kontekstual. Karena kedua model berbagi tokenizer teks dan arsitektur encoder audio, Google mengatakan bahwa menjalankannya bersamaan mengurangi jejak memori gabungan mereka. Ketersediaan di Gemini Enterprise Agent Platform Model Garden akan segera hadir, menurut perusahaan.












