نماذج ومنصات الذكاء الاصطناعي

Google تُضيف وجودًا بصريًا للصور الرمزية الحية إلى Gemini 3.8 Live

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أعلنت Google في 24 سبتمبر 2026 عن Gemini 3.8 Live مع Live Avatar، وهي ميزة تُضيف فيديو مُولَّد شبه فوري إلى الكلام في نماذج الحوار الحية الأصلية، وجعلتها متاحة بشكل عام في Gemini Enterprise مع نقاط نهاية في الولايات المتحدة والاتحاد الأوروبي.

الإعلان، الذي كتبه عالم الأبحاث شيو-يين تشانغ ومهندس البرمجيات سي جاي تشنغ نيابةً عن فريق Gemini Audio، يقدم الميزة كطبقة حضور بصري للذكاء الاصطناعي الحواري الخاص بـ Gemini. تقول Google إن مزامنة الشفاه الدقيقة، والتعبيرات الطبيعية، وتناوب الأدوار السلس يتيحان للمؤسسات توسيع عروضها الافتراضية مثل خدمة العملاء والجولات التفاعلية.

يأتي الإصدار بعد إطلاق 15 سبتمبر 2026 لـ Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking من Google، وهما نماذج حوارية حية صُممت للمحادثات القابلة للتوسع وذات التكلفة الفعّالة، وللمهام الاستدلالية عالية التعقيد على التوالي، والتي بدأت تُطرح عبر Gemini API، وGoogle AI Studio، وتطبيق Gemini، وGoogle Workspace، وSearch Live.

التوفر العام في Gemini Enterprise

يتوفر Gemini 3.8 Live مع Live Avatar بشكل عام في Gemini Enterprise اعتبارًا من 24 سبتمبر 2026، وذكرت Google Cloud أن التقنية عُرضت لأول مرة في Google Cloud Next 2026. يُقدَّم الإصدار عبر نقاط نهاية في الولايات المتحدة والاتحاد الأوروبي ويشمل معدل نقل مخصص، والامتثال المؤسسي، وحوكمة بيانات صارمة، وفقًا لمنشور Google Cloud الذي كتبه فابيان بلانك-باك، مدير مجموعة المنتجات لـ Gemini Live. يظل Gemini 3.8 Live Extended Thinking في مرحلة المعاينة الخاصة.

يمكن لعملاء المؤسسات تجربة النموذج في وحدة تحكم Gemini Enterprise، ودمجه عبر وثائق Gemini Live API، ومراجعة الأسعار على صفحة التسعير الخاصة بـ Google Cloud. تُنصح الشركات بالتعاون مع ممثلي المبيعات للحصول على معدل نقل مخصص، وهياكل نشر مُخصصة، وإدراج قائمة السماح للصور الرمزية المخصصة.

كيف يعمل Live Avatar

يعالج Live Avatar المدخلات البصرية والصوتية في آنٍ واحد ويجيب بصوت وفيديو تعبيريين شبه فوريين، وفقًا لـ Google. تدعم الميزة أيضًا استدعاء الأدوات بشكل غير متزامن، بحيث يمكنها بدء استدعاءات الأدوات واسترجاع البيانات في الخلفية دون إيقاف المحادثة. تُظهر إحدى عروض Google أن الصورة الرمزية تتحقق من حالة نزيل فندق بينما يستمر الحوار دون انقطاع.

تقول Google إن الصورة الرمزية تضبط مزامنة الشفاه وتعبيراتها مع انتقال المحادثات عبر 97 لغة، محافظًا على جودة الفيديو وتجنب الانحراف البصري. يضيف منشور Google Cloud فهمًا بصريًا حيًا لتدفقات الكاميرا ومشاركة الشاشة إلى جانب الصوت، واستعادة الانقطاعات التي تحافظ على سياق المحادثة ومعاملات الخلفية، واكتشاف تلقائي للغة وانتقال دون تبديلات يدوية، ونشر عبر الويب والهواتف المحمولة والأكشاك التفاعلية. تُظهر تجربة منفصلة من Google Cloud وكيل استقبال مطالبات التأمين يملأ دفتر مطالبة بينما يُظهر العميل الضرر عبر الكاميرا، بينما يتحقق فريق الوكلاء المُبني باستخدام مجموعة أدوات تطوير الوكلاء من Google من السياسة، ويطبق قواعد الاستقبال، ويجمع حزمة المُعَدِّل في الخلفية.

الصور الرمزية، العلامات المائية، وحدود بطاقة النموذج

يمكن للمؤسسات النشر من مكتبة من الصور الرمزية المُعدة مسبقًا أو إنشاء صور رمزية مخصصة من صورة مرجعية عالية الجودة، وتقول Google إن النتيجة تحتفظ بالمظهر أو نمط العلامة التجارية أو هوية الشخصية للمرجع. يتطلب الوصول إلى إنشاء صورة رمزية مخصصة إدراجًا في قائمة السماح للمؤسسات؛ وتصف Google Cloud عملية الإدراج والتحقق كإجراء وقائي للهوية وضد سوء الاستخدام. يتم دمج علامة مائية SynthID غير ملحوظة في كل تدفق صوت وفيديو مُولد، مما يبقي المحتوى المُولد بالذكاء الاصطناعي قابلاً للكشف.

وفقًا لـ Gemini 3.8 Audio بطاقة النموذج، تستند النماذج إلى Gemini 3 Pro. يقبل Gemini 3.8 Live الصوت، والصور، والفيديو، والنص بسياق يصل إلى 128 ألف رمز، ومع Live Avatar ينتج صوتًا وفيديوً ونصًا ضمن حد إخراج يبلغ 24 ألف رمز. تشير بطاقة النموذج إلى أن إصدارات Live Avatar تنتج فيديوً تعبيريًا لحركات رأس طبيعية متزامنة مع الكلام، مدفوعة بالصور المدخلة والصوتيات المُكوَّنة، وأنها تدعم بضع دقائق من التفاعل المستمر بدلاً من ساعات ممتدة.

تُدرج بطاقة النموذج القيود المعروفة بما في ذلك احتمالية الهلوسة والبطء أو الانقطاعات العرضية، وتحدد حد المعرفة في يناير 2025. لم تُظهر تقييمات السلامة الحدودية أي قدرات جديدة ذات معنى أو تحسينات أداء ملحوظة مقارنةً بـ Gemini 3.7 Flash، وعلى هذا الأساس تعتبر Google نماذج Gemini 3.8 Audio غير محتملة للوصول إلى أي مستويات قدرة متتبعة أو حرجة ضمن إطار عمل السلامة الحدودية الخاص بها.

نشر العملاء

ذكرت Google Cloud عدة مؤسسات تستخدم الميزة. قامت Cox Automotive بإنشاء مساعد تسوق مدعوم بالذكاء الاصطناعي لـ Autotrader يستخدم تمييز الشاشة الحي واستدعاء الأدوات لتوجيه مشتري السيارات عبر البحث عن المركبات، والمقارنة، والتمويل في الوقت الفعلي.

“يتوقع المتسوقون بشكل متزايد أن يصفوا ما يحتاجون إليه بكلماتهم الخاصة بدلاً من التنقل عبر الفلاتر والقوائم. يقدّم Avatar الذكاء الاصطناعي الحواري الجديد من Autotrader هذه التجربة لاكتشاف السيارات من خلال مطابقة الحوار الطبيعي مع المخزون المناسب،” قالت ماريان جونسون، النائب التنفيذي لرئيس الشركة ورئيسة المنتج في Cox Automotive، في إعلان Google Cloud.

صرّح أكهيلش داماراجو، الرئيس التنفيذي لشركة Equal AI، أن الذكاء الاصطناعي الشخصي للشركة يتعامل مع أكثر من مليون مكالمة مباشرة يوميًا عبر تسع لغات هندية، وأضاف أن Gemini 3.8 Live حسّن معالجة الانقطاعات، والمحادثات متعددة اللغات، وموثوقية استدعاء الأدوات. وقال بوب فان أوستن، نائب رئيس المنتج في Salesforce لبرنامج Agentforce، إن Agentforce وGemini 3.8 Live سيتحدان في تعاون بين أبحاث الذكاء الاصطناعي في Salesforce وGoogle يجمع بين قدرات متعددة الوسائط في الوقت الفعلي والذكاء الاصطناعي الوكالي. وأوضح إريك والش، مهندس برمجيات في Specs، أن تحديثات كشف نشاط الصوت وتحسينات الكمون في النموذج تمثل خطوات إلى الأمام للمساعد الذكي على منصة SPECS.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.