Yapay zeka modelleri ve platformları
DeepMind, EmbeddingGemma 2’yi Tanıttı, Beş Modu Tek Bir Alana Haritalıyor

Google DeepMind, 6 Ekim 2026’da EmbeddingGemma 2’yi piyasaya sürdü; 740 milyon parametreli açık bir model olup metin, kod, görsel, video ve sesleri tek bir 768 boyutlu gömme alanına haritalıyor, Apache 2.0 lisansı altında yayınlandı ve tüketici donanımında çalışacak şekilde tasarlandı.
Model, Google DeepMind araştırma mühendisleri Sahil Dua ve Henrique Schechter Vera tarafından Google’ın resmi blogunda bir gönderi ile tanıtıldı. Google, EmbeddingGemma 2’yi cihaz içi çok modlu gömmeler için en yetkin model olarak tanımlıyor ve aynı teknolojiden, Gemini Embedding modelleriyle aynı temelden üretildiğini belirtiyor. Şirket, bir sesli notla belirli bir video klibi geri getirme veya metinle saatlerce ses kaydını sorgulama gibi yetenek örneklerini listeliyor.
Bu yayın, Google’ın 2025’te tüketici donanımında metin gömmeleri için hafif bir seçenek olarak tanıttığı orijinal EmbeddingGemma’nın ardından geliyor. Google, modelin 20 milyon indirmeyi aştığını ve geliştiricilerin onu cihaz içi arama araçları ve gizlilik odaklı geri getirme destekli üretim hatları için kullandığını rapor ediyor.
Gemma 4 Tabanlı Modüler Kodlayıcılar
EmbeddingGemma 2, Gemma 4 mimarisi üzerine inşa edilmiştir. EmbeddingGemma 2 model kartı’na göre, 740 milyon parametresi 270 milyon parametreli bir metin modeli (130 milyon transformer omurgası ve 140 milyon embedder) ile 170 milyon parametreli bir görsel kodlayıcı ve 300 milyon parametreli bir ses kodlayıcısını birleştiriyor ve hepsi ortak 768 boyutlu alana projekte ediliyor. Kodlayıcılar bağımsız olduğundan, geliştiriciler aynı kontrol noktasından metin ve kod için 270 milyon, metin ve görsel için 440 milyon, metin ve ses için 570 milyon parametreyi seçerek yükleyebilir ya da tam çok modlu yapılandırmayı kullanabilir; ve tüm yapılandırmalar tek bir vektör alanını paylaşır.
Model kartı, gruplanmış sorgu ve çoklu sorgu dikkat mekanizmaları, 262.144 tokenlık bir kelime hazinesi, ortalama havuzlama ve 512’den 768 boyuta bir projeksiyon katmanı içeren 24 katmanlı bir mimari listeliyor. Tüm modlar, Google’ın EmbeddingGemma 1’den dört kat daha büyük olduğunu söylediği 8.192 tokenlık bir bağlam penceresini paylaşıyor. Her mod, bu bütçeyi sabit oranlarda tüketir: görüntü başına 280 token, video karesi başına 140 token ve ses saniyesi başına 25 token, böylece tek bir giriş en fazla 29 görüntü, 58 video karesi ya da 5,5 dakikalık ses içerebilir. İç içe geçmiş girişler metin ve medyayı karıştırır, her medya öğesinin konumunu işaretleyen yer tutucu tokenler kullanır.
Kıyaslama Sonuçları ve Vektör Kısaltma
Google, EmbeddingGemma 2’nin selefinin çok dilli metin performansını eşleştirdiğini ve MTEB Code puanını 68,76’dan 78,68’e yükselterek 9,92 puan artırdığını rapor ediyor. Model kartının tam hassasiyetli sonuçları, MTEB çok dilli (v2) için 61,36, MIEB lite için 64,64, MMEB v2 görüntü geri getirme için 57,28, görsel-belge geri getirme için 67,84, video geri getirme için 50,67, MSEB ses geri getirme için 69,54 ve MAEB ses görevleri için 49,39 puan listeliyor. Google, modelin bir milyar parametreden az bir çok modlu gömme modeli arasında lider puanlar elde ettiğini ve bazı uzman modelleri boyutlarının iki katından fazla geride bıraktığını belirtiyor.
Matryoshka Temsil Öğrenimi, geliştiricilerin yerel 768 boyutlu vektörleri 512, 256 veya 128’e kadar kısaltmasına olanak tanır; Google buna göre vektör depolama gereksinimlerini en fazla 6 kat azaltıyor. Model kartına göre, kalite 256 boyuta kadar minimal etkiyle korunurken, 128 boyut yalnızca metin odaklı iş yükleri için en uygunudur. yardımcı geliştirici kılavuzu, 256 boyutlu vektörlerin görüntü, video ve konuşma geri getirmede tam kalitenin yaklaşık %95’ini koruduğunu, 128 boyutlu vektörlerin ise metin ve kodda %90 civarında, çok modlu geri getirmede ise yaklaşık %75’e düştüğünü bildiriyor. Bir milyon 768 boyutlu vektörü bfloat16 hassasiyetiyle depolamak yaklaşık 1,5 gigabayt bellek gerektirirken, 128 boyutta bu yaklaşık 250 megabayt olur.
Güvenlik Yaklaşımı ve Belirtilen Sınırlamalar
Model kartı, EmbeddingGemma 2’yi önceden eğitilmiş bir gömme modeli olarak tanımlıyor; model, eğitim sonrası hizalama, güvenlik ayarı veya çıktı seviyesi denetimi görmemiştir; güvenlik önlemleri ön eğitim verisinin filtrelenmesine odaklanmıştır. Bu hazırlık, çocuk istismarı materyallerinin birden fazla aşamada filtrelenmesini ve kişisel bilgi ile diğer hassas verilerin otomatik filtrelenmesini içeriyordu. Eğitim verileri web belgeleri, kod, görseller, video, ses ve eşleşen çapraz-mod örneklerini kapsadı; web metni 140’tan fazla dilde ve Ocak 2025 kesim tarihine kadar.
Kart, modelin 100’den fazla dili desteklediğini ancak performansın hepsinde eşit olmayabileceğini, metin girişlerinde önerilen görev talimatı ön eklerinin eksik bırakılmasının gömme doğruluğunu azalttığını belirtiyor. Ayrıca, modelin aktivasyon aralığının float16’nın dinamik aralığını aştığını, bu durumun NaN değerlerine veya sessizce bozulmuş gömmelere yol açabileceğini ve çıkarımın bfloat16 veya float32 kullanılmasını önerdiğini uyarıyor. Dağıtımlar, Gemma Yasak Kullanım Politikası’na uymalı ve kart, geliştiricilerin uygulama düzeyinde geri getirme filtreleme ve adalet testi gibi güvenlik önlemlerinden sorumlu olduğunu belirtiyor.
Cihaz İçinde Performans ve Kullanılabilirlik
Google, Pixel 11 Pro’da kuantizasyonla EmbeddingGemma 2’nin yalnızca metin ağırlıkları için yaklaşık 191 megabayt aktif RAM ve tam çok modlu model için yaklaşık 567 megabayt gerektirdiğini bildiriyor. Ağırlıklar Hugging Face ve Kaggle’da mevcut, Hugging Face üzerindeki LiteRT Community aracılığıyla cihazda optimize edilmiş sürümleri de bulunuyor. Model, transformers, sentence-transformers 6.1.0 veya daha yeni sürümler, MLX, vLLM, llama.cpp, SGLang, Ollama ve LMStudio üzerinden çalışıyor; ince ayar rehberliği Unsloth tarafından sağlanıyor ve tarayıcı dağıtımı transformers.js ve WebGPU ile yapılabiliyor.
Google AI Edge’in MediaPipe ve LiteRT, çok platformlu dağıtımı yönetiyor ve bir MediaPipe Decision Task API, çok modlu bağlamda gerçek zamanlı sınıflandırma ve yönlendirmeyi destekliyor. Instant Media Search ve Video Moments Finder gibi demolar, Google AI Edge Gallery uygulamasında sunuluyor ve Google AI Edge Foresight uygulaması, EmbeddingGemma 2’yi yerel dosya geri getirme için Gemma 4 ile bağlamsal akıl yürütme için eşleştiriyor. İki model aynı metin tokenlayıcısı ve ses kodlayıcı mimarisini paylaştığı için, Google birlikte çalıştırmanın birleşik bellek ayak izini azalttığını belirtiyor. Şirketin ifadesine göre, Gemini Enterprise Agent Platform Model Garden’da kullanılabilirlik yakında geliyor.












