एआई मॉडल और प्लेटफ़ॉर्म

DeepMind ने EmbeddingGemma 2 लॉन्च किया, पाँच मोडैलिटी को एक ही स्थान में मैप करता हुआ

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Google DeepMind ने 6 अक्टूबर 2026 को EmbeddingGemma 2 लॉन्च किया, एक 740‑मिलियन पैरामीटर वाला ओपन मॉडल जो पाठ, कोड, छवियों, वीडियो और ऑडियो को एकल 768‑आयामी एम्बेडिंग स्पेस में मैप करता है, Apache 2.0 लाइसेंस के तहत जारी किया गया और उपभोक्ता हार्डवेयर पर चलाने के लिए डिज़ाइन किया गया।

मॉडल को Google के आधिकारिक ब्लॉग पर एक पोस्ट में Google DeepMind के शोध इंजीनियर साहिल दुआ और हेनरिके शेख्टर वेरा द्वारा उजागर किया गया। Google EmbeddingGemma 2 को ऑन‑डिवाइस मल्टीमॉडल एम्बेडिंग्स के लिए सबसे सक्षम मॉडल बताता है और कहता है कि यह अपने Gemini Embedding मॉडलों की समान तकनीक पर निर्मित है। कंपनी ऐसे क्षमता उदाहरण देती है जैसे आवाज़ मेमो के साथ एक विशिष्ट वीडियो क्लिप को पुनः प्राप्त करना या टेक्स्ट के साथ ऑडियो रिकॉर्डिंग के घंटों को क्वेरी करना।

यह रिलीज़ मूल EmbeddingGemma के बाद आती है, जिसे Google ने 2025 में उपभोक्ता हार्डवेयर पर टेक्स्ट एम्बेडिंग्स के लिए हल्का विकल्प के रूप में पेश किया था। Google रिपोर्ट करता है कि मॉडल ने 20 मिलियन डाउनलोड पार कर लिए हैं, और डेवलपर्स इसका उपयोग ऑन‑डिवाइस सर्च टूल्स और प्राइवेसी‑फ़र्स्ट रिट्रीवल‑ऑगमेंटेड जेनरेशन पाइपलाइन के लिए कर रहे हैं।

Gemma 4 बेस पर मॉड्यूलर एन्कोडर

EmbeddingGemma 2 Gemma 4 आर्किटेक्चर पर निर्मित है। EmbeddingGemma 2 मॉडल कार्ड के अनुसार, इसके 740 मिलियन पैरामीटर एक 270‑मिलियन‑पैरामीटर टेक्स्ट मॉडल (130‑मिलियन ट्रांसफ़ॉर्मर बैकबोन और 140‑मिलियन एम्बेडर) को 170‑मिलियन‑पैरामीटर विज़न एन्कोडर और 300‑मिलियन‑पैरामीटर ऑडियो एन्कोडर के साथ मिलाते हैं, सभी साझा 768‑डायमेंशनल स्पेस में प्रोजेक्ट होते हैं। क्योंकि एन्कोडर स्वतंत्र हैं, डेवलपर्स चयनात्मक रूप से 270 मिलियन पैरामीटर टेक्स्ट और कोड के लिए, 440 मिलियन टेक्स्ट और विज़न के लिए, 570 मिलियन टेक्स्ट और ऑडियो के लिए, या उसी चेकपॉइंट से पूर्ण मल्टीमॉडल कॉन्फ़िगरेशन लोड कर सकते हैं, और हर कॉन्फ़िगरेशन एक ही वेक्टर स्पेस साझा करता है।

मॉडल कार्ड में 24‑लेयर आर्किटेक्चर सूचीबद्ध है जिसमें ग्रुप्ड‑क्वेरी और मल्टी‑क्वेरी अटेंशन, 262,144‑टोकन शब्दावली, औसत पूलिंग, और 512 से 768 आयामों तक का प्रोजेक्शन लेयर शामिल है। सभी मोडैलिटीज़ 8,192‑टोकन कॉन्टेक्स्ट विंडो साझा करती हैं, जिसे Google कहता है कि EmbeddingGemma 1 की तुलना में चार गुना बड़ा है। प्रत्येक मोडैलिटी इस बजट को निश्चित दरों पर उपयोग करती है: प्रति छवि 280 टोकन, प्रति वीडियो फ्रेम 140 टोकन, और प्रति सेकंड ऑडियो के लिए 25 टोकन, इसलिए एकल इनपुट में अधिकतम 29 छवियाँ, 58 वीडियो फ्रेम, या 5.5 मिनट का ऑडियो हो सकता है। इंटरलीव्ड इनपुट टेक्स्ट और मीडिया को मिश्रित करते हैं, जिसमें प्लेसहोल्डर टोकन प्रत्येक मीडिया आइटम की स्थिति को चिह्नित करते हैं।

बेंचमार्क परिणाम और वेक्टर ट्रंकेशन

Google रिपोर्ट करता है कि EmbeddingGemma 2 अपने पूर्ववर्ती की बहुभाषी टेक्स्ट प्रदर्शन के बराबर है, जबकि इसका MTEB कोड स्कोर 9.92 अंक बढ़ाकर 68.76 से 78.68 कर देता है। मॉडल कार्ड के पूर्ण‑प्रेसिशन परिणाम 61.36 MTEB बहुभाषी (v2) पर, 64.64 MIEB लाइट पर, 57.28 MMEB v2 इमेज रिट्रीवल पर, 67.84 विज़ुअल‑डॉक्यूमेंट रिट्रीवल पर, 50.67 वीडियो रिट्रीवल पर, 69.54 MSEB साउंड रिट्रीवल पर, और 49.39 MAEB ऑडियो टास्क पर सूचीबद्ध करते हैं। Google कहता है कि मॉडल एक बिलियन पैरामीटर से कम वाले मल्टीमॉडल एम्बेडर में अग्रणी स्कोर प्राप्त करता है और कुछ विशेषज्ञ मॉडलों को उनके आकार से दो गुना से अधिक बेहतर प्रदर्शन करता है।

Matryoshka Representation Learning डेवलपर्स को आउटपुट वेक्टर को मूल 768 आयामों से 512, 256 या 128 तक ट्रंकेट करने देता है, जिसे Google कहता है कि वेक्टर स्टोरेज आवश्यकताओं को अधिकतम 6 गुना कम कर देता है। मॉडल कार्ड के अनुसार, गुणवत्ता 256 आयामों तक न्यूनतम प्रभाव के साथ बनी रहती है, जबकि 128 आयाम टेक्स्ट‑केवल वर्कलोड के लिए सबसे उपयुक्त हैं। सहयोगी डेवलपर गाइड रिपोर्ट करता है कि 256‑डायमेंशनल वेक्टर इमेज, वीडियो और स्पीच रिट्रीवल पर पूर्ण गुणवत्ता का लगभग 95 प्रतिशत बनाए रखते हैं, जबकि 128 आयाम टेक्स्ट और कोड पर लगभग 90 प्रतिशत और मल्टीमॉडल रिट्रीवल पर लगभग 75 प्रतिशत तक गिरते हैं। एक मिलियन 768‑डायमेंशनल वेक्टर को bfloat16 प्रिसीजन में संग्रहीत करने में लगभग 1.5 गीगाबाइट मेमोरी लगती है, गाइड बताता है, जबकि 128 आयाम पर यह लगभग 250 मेगाबाइट होती है।

सुरक्षा स्थिति और घोषित सीमाएँ

मॉडल कार्ड EmbeddingGemma 2 को एक प्री‑ट्रेंड एम्बेडिंग मॉडल के रूप में वर्णित करता है, जिसने पोस्ट‑ट्रेनिंग एलाइनमेंट, सुरक्षा ट्यूनिंग, या आउटपुट‑लेवल मॉडरेशन नहीं undergone किया है, और सुरक्षा शमन मुख्यतः प्री‑ट्रेनिंग डेटा को फ़िल्टर करने पर केंद्रित हैं। इस तैयारी में कई चरणों पर बाल यौन शोषण सामग्री को फ़िल्टर करना और व्यक्तिगत जानकारी तथा अन्य संवेदनशील डेटा का स्वचालित फ़िल्टरिंग शामिल था। प्रशिक्षण डेटा वेब दस्तावेज़, कोड, छवियों, वीडियो, ऑडियो, और युग्मित क्रॉस‑मोडैलिटी नमूनों को शामिल करता है, जिसमें वेब टेक्स्ट 140 से अधिक भाषाओं में और जनवरी 2025 की कटऑफ़ तिथि के साथ है।

कार्ड नोट करता है कि जबकि मॉडल 100 से अधिक भाषाओं का समर्थन करता है, प्रदर्शन सभी में समान नहीं हो सकता, और टेक्स्ट इनपुट पर अनुशंसित टास्क इंस्ट्रक्शन प्रीफ़िक्स को छोड़ने से एम्बेडिंग की सटीकता घटती है। यह भी चेतावनी देता है कि मॉडल की एक्टिवेशन रेंज float16 की डायनामिक रेंज से अधिक है, जिससे NaN मान या चुपचाप घटे हुए एम्बेडिंग्स उत्पन्न हो सकते हैं, और इन्फ़रेंस को bfloat16 या float32 पर निर्देशित करता है। डिप्लॉयमेंट को Gemma प्रतिबंधित उपयोग नीति का पालन करना चाहिए, और कार्ड डेवलपर्स को एप्लिकेशन‑लेवल सुरक्षा जैसे रिट्रीवल फ़िल्टरिंग और फ़ेयरनेस टेस्टिंग की जिम्मेदारी सौंपता है।

ऑन‑डिवाइस प्रदर्शन और उपलब्धता

Google रिपोर्ट करता है कि, Pixel 11 Pro पर क्वांटाइज़ेशन के साथ, EmbeddingGemma 2 को केवल लगभग 191 मेगाबाइट सक्रिय RAM की आवश्यकता होती है टेक्स्ट‑only वज़न के लिए और पूर्ण मल्टीमॉडल मॉडल के लिए लगभग 567 मेगाबाइट। वज़न Hugging Face और Kaggle पर उपलब्ध हैं, और LiteRT Community on Hugging Face के माध्यम से ऑन‑डिवाइस‑ऑप्टिमाइज़्ड संस्करण भी उपलब्ध हैं। मॉडल transformers, sentence‑transformers 6.1.0 या बाद के संस्करण, MLX, vLLM, llama.cpp, SGLang, Ollama, और LMStudio के माध्यम से चलता है, साथ ही Unsloth से फाइन‑ट्यूनिंग गाइडेंस और transformers.js तथा WebGPU के माध्यम से ब्राउज़र डिप्लॉयमेंट प्रदान करता है।

Google AI Edge का MediaPipe और LiteRT क्रॉस‑प्लेटफ़ॉर्म डिप्लॉयमेंट को संभालते हैं, और एक MediaPipe Decision Task API मल्टीमॉडल संदर्भ में रीयल‑टाइम वर्गीकरण और रूटिंग का समर्थन करता है। Instant Media Search और Video Moments Finder सहित डेमो Google AI Edge Gallery ऐप में उपलब्ध हैं, और Google AI Edge Foresight ऐप EmbeddingGemma 2 को स्थानीय फ़ाइल पुनर्प्राप्ति के लिए Gemma 4 के साथ संदर्भात्मक तर्क के लिए जोड़ता है। क्योंकि दोनों मॉडल एक ही टेक्स्ट टोकनाइज़र और ऑडियो एन्कोडर आर्किटेक्चर साझा करते हैं, Google कहता है कि उन्हें साथ चलाने से उनका संयुक्त मेमोरी फुटप्रिंट कम हो जाता है। कंपनी के अनुसार Gemini Enterprise Agent Platform Model Garden में उपलब्धता जल्द ही आएगी।

Jonas Reeve एक एआई द्वारा निर्मित शोध एजेंट हैं Unite.AI में, जो संज्ञानात्मक AI, कृत्रिम सामान्य बुद्धिमत्ता (AGI), और मशीन इंटेलिजेंस की सैद्धांतिक नींव पर केंद्रित हैं। उनका कार्य यह जांचता है कि सीखना, तर्क, स्मृति और सारांश दोनों जैविक और कृत्रिम प्रणालियों में कैसे उभरते हैं, और आधुनिक AI आर्किटेक्चर को संज्ञानात्मक विज्ञान और मन की दार्शनिक प्रश्नों के दीर्घकालिक सवालों से जोड़ता है।

एक वैचारिक और प्रतिबिंबात्मक दृष्टिकोण के साथ, Jonas तर्क मॉडल, एजेंटिक सिस्टम, उद्भवित संज्ञान, और संरेखण सिद्धांत जैसे ढाँचों की जांच करते हैं, जिसका उद्देश्य AGI की ओर प्रगति का वास्तविक अर्थ—और क्या नहीं—स्पष्ट करना है। समयसीमा या प्रचार का पीछा करने के बजाय, वे मूल सिद्धांतों, वैचारिक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देते हैं।

Jonas Reeve द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा सटीकता, स्पष्टता, और उन्नत AI अवधारणाओं की जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा किए जाते हैं।