نماذج ومنصات الذكاء الاصطناعي
DeepMind تُطلق EmbeddingGemma 2، وتُحوِّل خمس وسائط إلى مساحة واحدة

أطلقت Google DeepMind نموذج EmbeddingGemma 2 في 6 أكتوبر 2026، وهو نموذج مفتوح يضم 740 مليون معامل يَحوِّل النص، الشيفرة، الصور، الفيديو، والصوت إلى فضاء تضمين أحادي أبعاد 768، صدر بموجب ترخيص Apache 2.0 وصُمم للعمل على أجهزة المستهلك.
تم الكشف عن النموذج في منشور على المدونة الرسمية لجوجل بواسطة مهندسي البحث في Google DeepMind، ساهيل دوّا وهنريك شيتشر فيرا. تصف جوجل EmbeddingGemma 2 بأنه النموذج الأكثر قدرة على إنشاء تضمينات متعددة الوسائط على الجهاز وتقول إنه مبني على نفس التقنية المستخدمة في نماذج Gemini Embedding. تسرد الشركة أمثلة على القدرات مثل استرجاع مقطع فيديو محدد باستخدام ملاحظة صوتية أو استعلام ساعات من التسجيلات الصوتية بالنص.
يأتي هذا الإصدار بعد EmbeddingGemma الأصلي، الذي قدمته جوجل في عام 2025 كخيار خفيف الوزن لتضمينات النص على أجهزة المستهلك. تقارير جوجل أن النموذج تجاوز 20 مليون عملية تنزيل، حيث يستخدمه المطورون لأدوات البحث على الجهاز وأنابيب التوليد المعززة بالاسترجاع التي تضع الخصوصية في المقام الأول.
المشفّرات المعيارية على قاعدة Gemma 4
تم بناء EmbeddingGemma 2 على بنية Gemma 4. وفقًا لـ بطاقة نموذج EmbeddingGemma 2، تجمع معلماته البالغ عددها 740 مليون بين نموذج نصي يضم 270 مليون معامل (نواة محول 130 مليون بالإضافة إلى مُدمج 140 مليون) ومشفّر رؤية يضم 170 مليون معامل ومشفّر صوت يضم 300 مليون معامل، جميعها تُسقِط إلى الفضاء المشترك بأبعاد 768. وبما أن المشفّرات مستقلة، يمكن للمطورين تحميل 270 مليون معامل للنص والشيفرة، أو 440 مليون للنص والرؤية، أو 570 مليون للنص والصوت، أو التكوين المتعدد الوسائط الكامل من نفس نقطة التحقق، وتشارك كل تكوين مساحة متجه واحدة.
تُدرج بطاقة النموذج بنية مكوّنة من 24 طبقة مع انتباه مجموعة الاستعلامات واستعلامات متعددة، ومفردات حجمها 262,144 رمزًا، وتجمع متوسط، وطبقة إسقاط من 512 إلى 768 بُعدًا. تشترك جميع الوسائط في نافذة سياق تبلغ 8,192 رمزًا، وتقول جوجل إن ذلك أكبر بأربع مرات من نافذة EmbeddingGemma 1. تستهلك كل وسائط هذه الحصة بمعدلات ثابتة: 280 رمزًا لكل صورة، 140 رمزًا لكل إطار فيديو، و25 رمزًا لكل ثانية من الصوت، وبالتالي يمكن لمدخل واحد أن يحتوي حتى 29 صورة، 58 إطار فيديو، أو 5.5 دقيقة من الصوت. تُخلط المدخلات المتداخلة بين النص والوسائط، مع رموز نائبة تُحدد موقع كل عنصر وسائط.
نتائج القياس واختصار المتجهات
تُفيد جوجل أن EmbeddingGemma 2 يواكب أداء النص متعدد اللغات لنموذجه السابق مع رفع درجة MTEB Code بمقدار 9.92 نقطة، من 68.76 إلى 78.68. تُظهر نتائج الدقة الكاملة في بطاقة النموذج 61.36 على MTEB متعدد اللغات (الإصدار 2)، 64.64 على MIEB lite، 57.28 على استرجاع الصور في MMEB الإصدار 2، 67.84 على استرجاع المستندات البصرية، 50.67 على استرجاع الفيديو، 69.54 على استرجاع الصوت في MSEB، و49.39 على مهام الصوت في MAEB. تقول جوجل إن النموذج يحقق أعلى الدرجات بين مُضمّنات الوسائط المتعددة التي تقل معلماتها عن مليار، ويتفوق على بعض النماذج المتخصصة بأكثر من ضعف حجمه.
تتيح تقنية التعلم التمثيلي المتداخل (Matryoshka Representation Learning) للمطورين تقليص المتجهات الناتجة من الأبعاد الأصلية 768 إلى 512 أو 256 أو 128، وتقول جوجل إن ذلك يقلل متطلبات تخزين المتجهات حتى 6 أضعاف. وفقًا لبطاقة النموذج، يبقى الجودة ثابتة مع تأثير طفيف حتى 256 بُعدًا، بينما 128 بُعدًا يناسب أحمال العمل النصية فقط. تُشير دليل المطور المرافق إلى أن المتجهات ذات الـ 256 بُعدًا تحتفظ بحوالي 95٪ من الجودة الكاملة في استرجاع الصور والفيديو والصوت، بينما المتجهات ذات الـ 128 بُعدًا تحتفظ بحوالي 90٪ في النص والشيفرة لكن تنخفض إلى نحو 75٪ في الاسترجاع متعدد الوسائط. يخزن مليون متجه بأبعاد 768 بدقة bfloat16 تقريبًا 1.5 جيجابايت من الذاكرة، وفقًا للدليل، مقابل حوالي 250 ميغابايت عند 128 بُعدًا.
موقف الأمان والقيود المعلنة
تصف بطاقة النموذج EmbeddingGemma 2 بأنه نموذج تضمين مُدرب مسبقًا لم يخضع لمواءمة بعد التدريب، أو ضبط أمان، أو تعديل على مستوى المخرجات، مع تركيز تدابير الأمان على تصفية بيانات ما قبل التدريب. شمل هذا التحضير تصفية محتوى استغلال الأطفال الجنسي في مراحل متعددة وتصفية آلية للمعلومات الشخصية والبيانات الحساسة الأخرى. امتدت بيانات التدريب لتشمل مستندات الويب، الشيفرة، الصور، الفيديو، الصوت، وعينات متقاطعة الوسائط، مع نصوص ويب بأكثر من 140 لغة وتاريخ قطع في يناير 2025.
تشير البطاقة إلى أنه رغم أن النموذج يدعم أكثر من 100 لغة، قد لا تكون الأداء متساوية بينها، وأن إغفال بادئات تعليمات المهمة الموصى بها على مدخلات النص يقلل من دقة التضمين. كما تحذر من أن نطاق تنشيط النموذج يتجاوز النطاق الديناميكي لـ float16، مما قد ينتج قيم NaN أو تضمينات متدهورة بصمت، وتوجه الاستدلال إلى bfloat16 أو float32. يجب على عمليات النشر الالتزام بسياسة الاستخدام المحظور لـ Gemma، وتُحمل البطاقة المطورين مسؤولية إجراءات الحماية على مستوى التطبيق مثل تصفية الاسترجاع واختبار العدالة.
الأداء على الجهاز وتوافره
تقرير جوجل أن، مع التكميم على Pixel 11 Pro، يتطلب EmbeddingGemma 2 ما لا يقل عن حوالي 191 ميغابايت من الذاكرة العشوائية النشطة للأوزان النصية فقط وحوالي 567 ميغابايت للنموذج المتعدد الوسائط الكامل. الأوزان متاحة على Hugging Face وKaggle، مع إصدارات محسّنة للجهاز عبر مجتمع LiteRT على Hugging Face. يعمل النموذج عبر transformers، sentence-transformers 6.1.0 أو أحدث، MLX، vLLM، llama.cpp، SGLang، Ollama، وLMStudio، مع إرشادات ضبط دقيق من Unsloth ونشر عبر المتصفح باستخدام transformers.js وWebGPU.
يتولى MediaPipe وLiteRT من Google AI Edge نشرًا متعدد المنصات، وتدعم واجهة برمجة تطبيقات MediaPipe Decision Task التصنيف الفوري وتوجيهه في سياق متعدد الوسائط. تُشحن العروض التجريبية بما في ذلك Instant Media Search وVideo Moments Finder في تطبيق Google AI Edge Gallery، ويُقرن تطبيق Google AI Edge Foresight EmbeddingGemma 2 لاسترجاع الملفات المحلية مع Gemma 4 للتفكير السياقي. وبما أن النموذجين يشتركان في مُجزئ نصي وبنية مشفر صوتي، تقول جوجل إن تشغيلهما معًا يقلل من البصمة الذاكرية المشتركة لهما. وفقًا للشركة، سيتوفر قريبًا في Gemini Enterprise Agent Platform Model Garden.












