एआई मॉडल और प्लेटफ़ॉर्म
Google ने API और AI Studio में Gemini 3.8 स्पीच मॉडल जारी किए

Google ने 23 सितंबर 2026 को Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS पेश किए, दो टेक्स्ट‑टू‑स्पीच मॉडल जिन्हें उसने अब तक के सबसे अभिव्यंजक ऑडियो जनरेशन मॉडल बताया। दोनों मॉडलों को उसी दिन Gemini API और Google AI Studio में जारी किया गया।
घोषणा, जो समूह उत्पाद प्रबंधक लेलैंड रेचिस और अनुसंधान विज्ञान निदेशक एलन कोवेन ने Gemini Audio टीम की ओर से लिखी है, Gemini 3.8 Flash TTS को गेमिंग, इमर्सिव ऑडियोबुक, पॉडकास्ट और इंटरैक्टिव मीडिया में गहन रचनात्मक दिशा और कैरेक्टर डिजाइन के लिए स्थित करती है। Gemini 3.8 Flash-Lite TTS को उच्च-आयतन, लागत‑कुशल उपयोग के लिए बनाया गया है, डबिंग, ऑडियो कंटेंट निर्माण और आवाज़ एजेंटों के लिए अनुकूलित, जिसमें टोन, गति और अभिव्यंजक सूक्ष्मता पर सूक्ष्म नियंत्रण होता है। घोषणा इस जोड़ी को पिछले Gemini Audio रिलीज़: 3.5 Live Translate, 3.5 Transcribe, और Gemini 3.8 Live and 3.8 Live Extended Thinking मॉडलों के बाद प्रस्तुत करती है। Gemini 3.8 Audio मॉडल कार्ड के अनुसार, ये मॉडल Gemini 3 Pro पर आधारित हैं, और TTS वैरिएंट 8K टोकन तक का टेक्स्ट इनपुट स्वीकार करते हैं और 64K टोकन तक का ऑडियो आउटपुट लौटाते हैं।
आवाज़ डिज़ाइन और प्रतिकृति
Google ने कहा कि Gemini 3.8 Flash TTS प्राकृतिक भाषा प्रॉम्प्टिंग के माध्यम से शून्य से कस्टम आवाज़ें बना सकता है, भूमिका, लहजा और आवाज़ की विशेषताओं को 100 से अधिक भाषाओं और बोलियों में अनुकूलित करता है। कंपनी ने बताया कि यह रिलीज़ अपनी मूल 30 आवाज़ों को 2,000 से अधिक उत्पादन‑तैयार आवाज़ों की लाइब्रेरी में विस्तारित करती है, जिसमें व्यापक भाषा कवरेज है, जैसे मैक्सिकन स्पेनिश, क्वेबेक फ़्रेंच और स्कॉट्स इंग्लिश। उपयोगकर्ता अपनी कस्टम आवाज़ें सहेज और प्रबंधित कर सकते हैं ताकि चल रहे प्रोजेक्ट्स में प्रदर्शन स्थिर रहे, और एक आवाज़‑रीमिक्सिंग सुविधा जो लाइब्रेरी आवाज़ों की टिम्बर, पिच, गति और लहजे को समायोजित करती है, जल्द ही उपलब्ध होने के रूप में सूचीबद्ध है।
आवाज़ प्रतिकृति उपयोगकर्ता की अपनी आवाज़ या ऐसी आवाज़ जिसका उपयोग करने का अधिकार उपयोगकर्ता के पास है, के 30‑सेकंड ऑडियो नमूने से एक सुसंगत वोकल प्रोफ़ाइल बनाती है। Google ने कहा कि यह क्षमता बिल्ट‑इन कंसेंट वेरिफिकेशन, SynthID वॉटरमार्किंग, और C2PA क्रेडेंशियल्स के साथ आती है।
प्रदर्शन दिशा और रिपोर्ट किए गए बेंचमार्क
दोनों मॉडल प्रत्येक प्रदर्शन की लाइन‑बाय‑लाइन दिशा की अनुमति देते हैं: उपयोगकर्ता अपनी स्वयं की स्टेज निर्देश लिख सकते हैं या Gemini को प्राकृतिक स्क्रिप्ट संकेतों से डिलीवरी नियंत्रित करने दे सकते हैं। Google ने कहा कि लॉन्ग‑फ़ॉर्म जेनरेशन आवाज़ की गुणवत्ता, गति, और कैरेक्टर टिम्बर को कई घंटों के निरंतर ऑडियो में स्थिर रखता है, जिसमें स्पीकर ड्रिफ्ट न्यूनतम रहता है, और यह पॉडकास्ट और ऑडियोबुक के लिए लक्षित है। नेटिव दो‑स्पीकर सीन स्टेजिंग एक ही स्क्रिप्ट से मल्टी‑टर्न बातचीत को निर्देशित करती है जबकि दो आवाज़ों को प्राकृतिक टर्न‑टेकिन्ग के साथ अलग रखती है। स्क्रिप्टेड वोकल बर्स्ट्स और बैक‑चैनलिंग गैर‑शाब्दिक संकेत जैसे <laughs>, <sigh>, और <gasp> जोड़ते हैं, साथ ही “mhm” और “yeah” जैसे इंटरजेक्शन भी।
मूल्यांकन में, Google ने रिपोर्ट किया कि Gemini 3.8 Flash TTS ने Hume AI के Voice Design Benchmark में 71.4 स्कोर के साथ कुल मिलाकर शीर्ष स्थान प्राप्त किया और 60.8 पर एक्सेंट मॉडलिंग में भी अग्रणी रहा। कंपनी ने कहा कि Flash TTS और Flash‑Lite TTS Hume AI के Overall Quality Index में क्रमशः पहला और दूसरा स्थान रखते हैं, और नए मॉडल Gemini 3.1 Flash TTS की तुलना में लम्बी‑फ़ॉर्म कंटेंट और दो‑स्पीकर स्क्रीनप्ले नियंत्रण जैसे उपयोग मामलों में महत्वपूर्ण सुधार दिखाते हैं। Voice Arena पर ब्लाइंड मानव प्राथमिकता मूल्यांकन में, Google ने कहा कि दोनों मॉडलों ने जापानी, ब्राज़ीलियाई पुर्तगाली, वियतनामी, आधुनिक मानक अरबी, मैक्सिकन स्पेनिश और हिंदी सहित भाषाओं में प्रतिस्पर्धियों में शीर्ष स्थान हासिल किया।
सुरक्षा, सीमाएँ, और उपलब्धता
कंसेंट वेरिफिकेशन सिस्टम के तहत, उपयोगकर्ता को आवाज़ मालिक की एक मौखिक सहमति रिकॉर्डिंग प्रदान करनी होती है जो रेफ़रेंस स्पीकर से मेल खाती हो, तभी प्रतिकृति आवाज़ बनाई जा सकती है। Gemini Audio मॉडल द्वारा उत्पन्न प्रत्येक ऑडियो क्लिप में SynthID वॉटरमार्क होता है, जिसे Google ने अभेद्य और सीधे ऑडियो आउटपुट में एम्बेडेड बताया है ताकि AI‑जनित स्पीच का पता लगाया जा सके।
मॉडल कार्ड में ज्ञात सीमाओं की सूची दी गई है, जिसमें भ्रम (हैलुसिनेशन) और कभी‑कभी धीमी गति या टाइमआउट समस्याएँ शामिल हैं, और यह जनवरी 2025 की नॉलेज कटऑफ़ बताता है। फ्रंटियर सुरक्षा के लिए, Google DeepMind ने कहा कि उसके मूल्यांकन में Gemini 3.8 Audio मॉडलों में Gemini 3.7 Flash की तुलना में कोई महत्वपूर्ण नई क्षमताएँ या प्रदर्शन वृद्धि नहीं पाई गई, जिसके मूल्यांकन में यह पाया गया कि वह अपने फ्रंटियर सुरक्षा फ्रेमवर्क के तहत किसी भी ट्रैक्ड या क्रिटिकल क्षमता स्तर तक नहीं पहुँचा। इस आधार पर, उन्होंने कहा कि Gemini 3.8 Audio मॉडल संभवतः उन स्तरों तक नहीं पहुँचेंगे।
Gemini 3.8 Flash TTS Gemini Notebook में और Flash‑Lite TTS Google Vids में भी उपलब्ध है, साथ ही एपीआई के माध्यम से एंटरप्राइज़ एक्सेस Gemini Enterprise में जल्द ही आने वाला बताया गया है। Google AI Studio एक ऑडियो प्लेग्राउंड जोड़ता है जो आवाज़ डिज़ाइन कार्यक्षेत्र जैसा बनाया गया है, जहाँ डेवलपर शून्य से नई वोकल पहचान बना सकते हैं या आवाज़ को प्रतिकृति कर सकते हैं और फिर दो‑स्पीकर स्क्रीनप्ले एडिटर में लाइन‑बाय‑लाइन डिलीवरी निर्देशित कर सकते हैं। घोषणा में एक फुटनोट यह बताता है कि AI Studio के माध्यम से आवाज़ प्रतिकृति इलिनॉय, टेक्सास, यूरोपीय आर्थिक क्षेत्र, यूनाइटेड किंगडम, स्विट्ज़रलैंड और भारत में उपलब्ध नहीं है। डेवलपर प्लेटफ़ॉर्म Agora, LiveKit, Pipecat, और Vercel Gemini API के माध्यम से मॉडलों का समर्थन करते हैं, और Google ने Figma, HeyGen, Linguana, Wondercraft, 99.co, और Ollang को साझेदार के रूप में नामित किया है जो नए TTS मॉडलों को वैश्विक डबिंग, मीडिया लोकलाइज़ेशन और संवादात्मक आवाज़ एजेंटों के लिए एकीकृत कर रहे हैं।












