نماذج ومنصات الذكاء الاصطناعي

جوجل تُطلق نماذج Gemini 3.8 الصوتية في API وAI Studio

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أعلنت جوجل في 23 سبتمبر 2026 عن Gemini 3.8 Flash TTS و Gemini 3.8 Flash-Lite TTS، وهما نموذجين لتحويل النص إلى كلام وصفتهما بأنها أكثر نماذج توليد الصوت تعبيرًا حتى الآن. بدأ نشر النموذجين في نفس اليوم في Gemini API وGoogle AI Studio.

أُعلنت هذه الرسالة، التي كتبها مدير مجموعة المنتجات ليلاند ريتشيس ومدير أبحاث العلوم آلان كوين نيابةً عن فريق Gemini Audio، لتضع Gemini 3.8 Flash TTS في موقع يُتيح توجيهًا إبداعيًا عميقًا وتصميم الشخصيات عبر الألعاب والكتب الصوتية الغامرة والبودكاست والوسائط التفاعلية. تم بناء Gemini 3.8 Flash-Lite TTS للاستخدام عالي الحجم وبكفاءة تكلفة، مُحسّن للدبلجة وإنشاء المحتوى الصوتي ووكلاء الصوت مع تحكم دقيق في النغمة والإيقاع والتعبير الدقيق. تُقدم الرسالة الزوج كمتابعة لإصدارات Gemini Audio السابقة: 3.5 Live Translate، 3.5 Transcribe، وGemini 3.8 Live و 3.8 Live Extended Thinking النماذج. وفقًا لـبطاقة النموذج الخاصة بـ Gemini 3.8 Audio، تستند النماذج إلى Gemini 3 Pro، وتقبل إصدارات TTS مدخلات نصية تصل إلى 8K رمز وتعيد مخرجات صوتية تصل إلى 64K رمز.

تصميم الصوت وتكراره

قالت جوجل إن Gemini 3.8 Flash TTS يمكنه إنشاء أصوات مخصصة من الصفر عبر توجيه باللغة الطبيعية، مع تخصيص الدور واللهجة وخصائص الصوت عبر أكثر من 100 لغة ولهجة. وأشارت الشركة إلى أن الإصدار يوسع مجموعة الأصوات الأصلية التي كانت 30 صوتًا إلى مكتبة تضم أكثر من 2,000 صوت جاهز للإنتاج مع تغطية لغوية واسعة، بما في ذلك المتنوعات الإقليمية مثل الإسبانية المكسيكية، والفرنسية الكيبكية، والإنجليزية الاسكتلندية. يمكن للمستخدمين حفظ وإدارة أصواتهم المخصصة للحفاظ على أداء ثابت عبر المشاريع المستمرة، وتُدرج ميزة إعادة مزج الصوت التي تعدل الطابع، النغمة، الإيقاع، واللهجة على أصوات المكتبة كقريبًا.

تُعيد خاصية تكرار الصوت إنشاء ملف صوتي ثابت من عينة صوتية مدتها 30 ثانية لصوت المستخدم نفسه أو صوت يملك المستخدم حق استخدامه. وقالت جوجل إن هذه القدرة تُصدر مع تحقق مدمج من الموافقة، وعلامة مائية SynthID، واعتمادات C2PA.

توجيه الأداء والمعايير المبلغ عنها

كلا النموذجين يتيحان توجيهًا سطرًا بسطر لكل أداء: يمكن للمستخدمين كتابة توجيهاتهم المسرحية أو السماح لـ Gemini بتوجيه الإلقاء استنادًا إلى إشارات النص الطبيعية. وقالت جوجل إن توليد المحتوى الطويل يحافظ على جودة الصوت والإيقاع وطابع الشخصية ثابتًا عبر ساعات من الصوت المتواصل مع انحراف متحدث قليل، موجهًا للبودكاست والكتب الصوتية. يوجه تنسيق المشهد الثنائي المتحدث محادثات متعددة الأدوار من نص واحد مع الحفاظ على فصل الصوتين عبر تبادل أدوار طبيعي. تضيف الانفجارات الصوتية المكتوبة والتفاعل الخلفي إشارات غير لفظية مثل <laughs>، <sigh>، و<gasp>، بالإضافة إلى تعبيرات مثل “mhm” و”yeah”.

في التقييمات، أفادت جوجل أن Gemini 3.8 Flash TTS احتل المركز الأول العام في معيار تصميم الصوت من Hume AI بنتيجة 71.4 وتصدر أيضًا نمذجة اللهجات بـ 60.8. وقالت إن Flash TTS وFlash-Lite TTS يحتلان المركزين الأول والثاني في مؤشر الجودة العام من Hume AI، وأن النماذج الجديدة تُظهر تحسينات كبيرة مقارنةً بـ Gemini 3.1 Flash TTS عبر حالات الاستخدام بما في ذلك المحتوى طويل الشكل والتحكم في سيناريوهات المتحدثين المزدوجين. في تقييمات تفضيل البشر العمياء على Voice Arena، صرحت جوجل أن النموذجين احتلّا المراكز العليا بين المنافسين في لغات تشمل اليابانية، البرتغالية البرازيلية، الفيتنامية، العربية الفصحى الحديثة، الإسبانية المكسيكية، والهندية.

الأمان والقيود والتوافر

بموجب نظام التحقق من الموافقة، يجب على المستخدم تقديم تسجيل موافقة شفهي من مالك الصوت يتطابق مع المتحدث المرجعي قبل إمكانية إنشاء صوت مكرر. كل مقطع صوتي تُولده نماذج Gemini Audio يحمل علامة مائية SynthID، التي تصفها جوجل بأنها غير ملحوظة ومدمجة مباشرةً في مخرجات الصوت لضمان إمكانية اكتشاف الكلام المُولد بالذكاء الاصطناعي.

تُدرج بطاقة النموذج القيود المعروفة بما فيها الهلوسة ومشكلات البطء أو انتهاء المهلة العرضية، وتحدِّد حد المعرفة في يناير 2025. بالنسبة لأمان الحدود المتقدمة، صرّح Google DeepMind أن تقييماته لم تُظهر أي قدرات جديدة ذات معنى أو زيادات جوهرية في الأداء في نماذج Gemini 3.8 Audio مقارنةً بـ Gemini 3.7 Flash، حيث لم تصل تقييماته إلى أي مستويات قدرة متتبعة أو حرجة وفقًا لإطار أمان الحدود المتقدمة. بناءً على ذلك، أفاد أن نماذج Gemini 3.8 Audio غير مرجّحة للوصول إلى تلك المستويات.

يتوفر Gemini 3.8 Flash TTS أيضًا في Gemini Notebook وFlash-Lite TTS في Google Vids، مع وصول مؤسسي عبر API في Gemini Enterprise يُذكر أنه سيُتاح قريبًا. يضيف Google AI Studio ساحة صوتية مُصممة كمساحة عمل لتصميم الصوت، حيث يمكن للمطورين إنشاء هويات صوتية جديدة من الصفر أو تكرار صوت ثم توجيه التسليم سطرًا بسطر في محرر سيناريو مزدوج المتحدثين. تُشير هامشية في الإعلان إلى أن تكرار الصوت عبر AI Studio غير متاح في إلينوي، وتكساس، والمنطقة الاقتصادية الأوروبية، والمملكة المتحدة، وسويسرا، والهند. تدعم منصات المطورين Agora وLiveKit وPipecat وVercel النماذج عبر Gemini API، وقد سمت جوجل Figma وHeyGen وLinguana وWondercraft و99.co وOllang كشركاء يدمجون نماذج TTS الجديدة للدبلجة العالمية، وتوطين الإعلام، ووكلاء الصوت التفاعليين.

جوناس ريف هو محلل منشأ بالذكاء الاصطناعي في Unite.AI، يركز على الذكاء الاصطناعي الإدراكي والذكاء الاصطناعي العام (AGI) والأسس النظرية للذكاء الآلي. يعمل على كيفية ظهور التعلم والاستدلال والذاكرة والاستخراج في الأنظمة البيولوجية والاصطناعية، ورسم الصلات بين هياكل الذكاء الاصطناعي الحديثة والأسئلة القديمة في العلوم الإدراكية وفلسفة العقل.
مع نهج概念ي واعٍ، يبحث جوناس في الإطارات مثل نماذج الاستدلال والأنظمة الوكيلية والاعتراف الناشئ ونظرية التوجيه، بهدف توضيح ما يعنيه التقدم نحو AGI بالفعل - وما لا يعنيه. بدلاً من مطاردة الجداول الزمنية أو الهياج، يؤكد على المبادئ الأولى والصقل المفاهيمي وحدود النماذج الحالية.
المقالات التي كتبها جوناس ريف هي منشأة بالذكاء الاصطناعي ومراجعة بواسطة فريق تحرير Unite.AI لضمان الدقة والوضوح والمناقشة المسؤولة للمفاهيم المتقدمة للذكاء الاصطناعي.