نماذج ومنصات الذكاء الاصطناعي

Google تُطلق نماذج الصوت Gemini 3.8 Live و Extended Thinking

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

Google أعلنت عن Gemini 3.8 Live و Gemini 3.8 Live Extended Thinking في 15 سبتمبر 2026، وهو زوج من نماذج الحوار الحي التي يتم طرحها عبر Gemini API وGoogle AI Studio وGemini Enterprise وSearch Live وGemini Live وGoogle Workspace.

قدّم النماذج توم أويانغ، مهندس رئيسي، وماليني جاجاناثان، عضو في الطاقم التقني، نيابةً عن فريق Gemini Audio. تصف Google الزوج بأنه أكثر نماذج الحوار الحي تقدمًا حتى الآن، صُمم للمحادثة الطبيعية، وتقول إن التحسينات في الذكاء والاستدلال المتوازي تجعلها أكثر بديهية للتعاون في المهام المعقدة التي تُنفّذ بالصوت. تضع الشركة Gemini 3.8 Live للقدرة على التوسع وكفاءة التكلفة، حيث يجمع بين الذكاء الحواري وحوار سلس وتثبيت بصري، بينما صُمم Gemini 3.8 Live Extended Thinking للمهام عالية التعقيد التي تتطلب ذكاءً متزايدًا واستدلالًا متعدد الخطوات. وفقًا لـ Google، توفر النماذج للمطورين والمؤسسات اللبنات الأساسية لإنشاء وكلاء صوتيين موثوقين وجاهزين للإنتاج، مع جعل المحادثات مع Gemini عبر تطبيق Gemini وWorkspace وSearch أكثر سلاسة.

نتائج المعايير المبلغ عنها

تُفيد Google أن Gemini 3.8 Live Extended Thinking احتل المرتبة الأولى إجمالًا في مؤشر جودة الكلام إلى الكلام الخاص بـ Artificial Analysis بمعدل 82.6، وأنه يتصدر إكمال المهام الوكيلية بنسبة 68.6٪ على τ-Voice و35.1٪ على معيار τ-Voice-banking الخاص بـ Sierra. كما تُبلغ الشركة عن حصوله على درجة 97.7٪ في Big Bench Audio وتقول إن Extended Thinking يحافظ على سعر تنافسي للغاية مقارنةً بالنماذج المتقدمة الأخرى. تقول Google إن Gemini 3.8 Live احتل المرتبة الثانية في مسابقة Speech Agent Arena الخاصة بـ Artificial Analysis، مشيرةً إلى تفضيل عالٍ بين المستخدمين، وتصفه بأنه فعال من حيث التكلفة ومصمم للتوسع. في EVA-Bench الخاص بـ ServiceNow، وهو معيار لتقييم وكلاء الصوت، تقول Google إن نماذجها تدفع حدود Pareto للعمليات المعقدة من خلال موازنة الدقة مع جودة الحوار؛ وتشير المشاركة إلى أن هذا التقييم تم تشغيله على واجهة Live API على منصة الوكيل Gemini Enterprise.

قدرات المحادثة في الوقت الفعلي

وفقًا لـ Google، يعالج Gemini 3.8 Live المدخلات البصرية في وقت شبه فوري، مضيفًا سياقًا تقول الشركة إن ذلك ينتج ردودًا أكثر فائدة. يكتشف النموذج تلقائيًا ويتنقل بين 97 لغة مدعومة أثناء المحادثة، وينفّذ الأدوات واستدعاءات API في الخلفية بينما تستمر المحادثة، مع الاعتراف بالطلبات والحفاظ على استمرارية الحوار حتى تُنجَز المهام. بالنسبة للمهام التي تتطلب استدلالًا أعمق، تقول Google إن Extended Thinking يستنتج ويتحدث في آنٍ واحد، مستخدمًا إشارات لفظية مبكرة للاعتراف بالمطالبات بشكل طبيعي وسردًا مباشرًا لتقدم العملية لتوجيه المستخدمين عبر مهام خلفية متعددة الخطوات أثناء تقدمها، دون كسر تدفق الحوار.

تُظهر مقاطع الفيديو التجريبية المنشورة مع الإعلان Gemini 3.8 Live وهو يوجه جلسة إلحاق موظف في الوقت الفعلي باستخدام السياق البصري للإجابة على الأسئلة الحية، ويلعب الشطرنج في وقت شبه فوري، ويبني خطط أعمال كاملة ومجموعات أدوات تسويقية مخصصة عبر الكلام الطبيعي، ويُوفر مساعدة تشخيصية خطوة بخطوة داخل Search Live. تُظهر عروض Extended Thinking النموذج وهو يحوّل الرسومات الأولية الخام وتعليقات الصوت شبه الفورية إلى مكوّنات React وظيفية، وينسق حجوزات مطاعم متعددة الخطوات عبر استدعاءات وظائف غير متزامنة دون مقاطعة الحوار، ويعمل عبر Docs Live وGmail Live وKeep Live في Google Workspace.

واجهة برمجة التطبيقات الحية ونظام المطورين

تُشير Google إلى أن Agora وFishjam وLiveKit وPipecat وVercel وVision Agents هي منصات مطورين تستخدم Gemini Live API لتمكين المطورين من بناء ونشر واجهات مدفوعة بالصوت بينما تدير المنصات البنية التحتية لتدفق الوسائط في الوقت الفعلي. وتقول الشركة إنها تتعاون أيضًا مع Salesforce وGenspark وLumeris على النماذج الجديدة، مشيرةً إلى اهتمامهم بكمون النماذج، وسلاستها، وقدرات استدعاء الأدوات.

تصف وثائق واجهة برمجة التطبيقات الحية الرسمية الواجهة بأنها تمكّن من تفاعلات صوت ورؤية منخفضة الكمون وفي الوقت الفعلي مع Gemini، حيث تعالج تدفقات مستمرة من الصوت والصور والنص لتقديم ردود منطوقة فورية عبر اتصال WebSocket ثابت. المدخلات الموثقة هي صوت PCM 16‑بت غير مضغوط بتردد 16 كيلوهرتز، وصور JPEG بحد أقصى إطار واحد في الثانية، ونص، مع مخرجات صوتية بصيغة PCM 16‑بت غير مضغوط بتردد 24 كيلوهرتز. يمكن للمطورين اختيار تنفيذ من خادم إلى خادم، حيث يرسل الخادم الخلفي بيانات تدفق العميل إلى واجهة Live API، أو تنفيذ من عميل إلى خادم، حيث يتصل كود الواجهة الأمامية مباشرة عبر WebSockets. تسرد الوثائق حالات الاستخدام التي تشمل مساعدين للتسوق في التجزئة ووكلاء الدعم، وشخصيات ألعاب تفاعلية، وتجارب صوتية وفيديوية في الروبوتات والنظارات الذكية والمركبات، ومرافق صحية، وأدوات استشارة مالية، ومُرشدي تعليم، وترجمة فورية، وتفريغ نصي مباشر وتوليد ترجمات.

تؤكد Google أن جميع الصوتيات التي تُنتجها منتجاتها الذكائية تحمل علامة مائية باستخدام SynthID، وهي علامة مائية غير ملحوظة تُدمج مباشرةً في مخرجات الصوت بحيث يبقى المحتوى المُولد بالذكاء الاصطناعي قابلاً للكشف للمساعدة في منع المعلومات المضللة. تُشير المشاركة القراء إلى بطاقة النموذج للحصول على تفاصيل حول نهج الشركة في السلامة والمسؤولية.

التوفر وإطلاق النموذج

بدأ طرح النموذجين في 15 سبتمبر. للمطورين، يتوفران عبر Gemini API وGoogle AI Studio، وللشركات هما في مرحلة المعاينة الخاصة في Gemini Enterprise. يتوفر Gemini 3.8 Live للجميع في Search Live، بينما يتوفر Extended Thinking في Gemini Live، وفي Docs للمشتركين في Google AI Pro وUltra عبر Workspace، وفي Gmail وKeep لجميع مشتركين Google AI. تقول Google إن Gemini Enterprise لدعم تجربة العملاء لكلا النموذجين سيأتي قريبًا، وأن Extended Thinking سيأتي قريبًا لعملاء Google Workspace من الشركات.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.