एआई मॉडल और प्लेटफ़ॉर्म

Google ने Gemini 3.8 Live में लाइव अवतार दृश्य उपस्थिति लाई

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Google ने 24 सितंबर 2026 को Gemini 3.8 Live के साथ Live Avatar पेश किया, एक सुविधा जो उसके मूल लाइव संवाद मॉडलों की आवाज़ में निकट वास्तविक‑समय उत्पन्न वीडियो जोड़ती है, और इसे संयुक्त राज्य अमेरिका और यूरोपीय संघ में एन्डपॉइंट्स के साथ Gemini Enterprise में सामान्य रूप से उपलब्ध कराया।

घोषणा, जो शोध वैज्ञानिक Shuo-yiin Chang और सॉफ़्टवेयर इंजीनियर CJ Zheng ने Gemini Audio Team की ओर से लिखी है, इस सुविधा को Gemini के संवादात्मक AI के लिए एक दृश्य उपस्थिति परत के रूप में प्रस्तुत करती है। Google कहता है कि इसकी सटीक लिप‑सिंकिंग, प्राकृतिक अभिव्यक्तियाँ, और सुगम टर्न‑टेकिन्ग एंटरप्राइज़ को ग्राहक सेवा और इंटरैक्टिव वॉकथ्रू जैसी वर्चुअल सेवाओं का विस्तार करने की अनुमति देती हैं।

यह रिलीज़ Google के 15 सितंबर 2026 को Gemini 3.8 Live और Gemini 3.8 Live Extended Thinking के लॉन्च के बाद आती है, जो क्रमशः स्केलेबल, लागत‑प्रभावी संवाद और उच्च‑जटिलता तर्क कार्यों के लिए स्थित लाइव संवाद मॉडलों को दर्शाती है, और जो Gemini API, Google AI Studio, Gemini ऐप, Google Workspace, और Search Live के माध्यम से रोल‑आउट शुरू हुए।

Gemini Enterprise में सामान्य उपलब्धता

Gemini 3.8 Live with Live Avatar 24 सितंबर 2026 से Gemini Enterprise में सामान्य रूप से उपलब्ध है, और Google Cloud ने कहा कि इस तकनीक को पहली बार Google Cloud Next 2026 में प्रीव्यू किया गया था। रिलीज़ को US और EU एन्डपॉइंट्स के माध्यम से पेश किया गया है और इसमें प्रोविजन्ड थ्रूपुट, एंटरप्राइज़ अनुपालन, और सख्त डेटा गवर्नेंस शामिल हैं, जैसा कि Gemini Live के समूह उत्पाद प्रबंधक Fabien Blanc‑paques द्वारा Google Cloud पोस्ट में बताया गया है। Gemini 3.8 Live Extended Thinking अभी भी निजी प्रीव्यू में है।

एंटरप्राइज़ ग्राहक मॉडल को Gemini Enterprise कंसोल में आज़मा सकते हैं, इसे Gemini Live API दस्तावेज़ीकरण के माध्यम से एकीकृत कर सकते हैं, और Google Cloud की प्राइसिंग पेज पर मूल्य निर्धारण देख सकते हैं। Google Cloud ग्राहकों को प्रोविजन्ड थ्रूपुट, अनुकूलित डिप्लॉयमेंट आर्किटेक्चर, और कस्टम‑अवतार अलाउलिस्टिंग के लिए अपने बिक्री प्रतिनिधियों के साथ काम करने का सुझाव देता है।

Live Avatar कैसे काम करता है

Google के अनुसार, Live Avatar एक साथ दृश्य और ऑडियो इनपुट को प्रोसेस करता है और निकट वास्तविक‑समय में अभिव्यक्तिपूर्ण ऑडियो और वीडियो के साथ उत्तर देता है। यह सुविधा असिंक्रोनस टूल कॉलिंग का भी समर्थन करती है, जिससे यह पृष्ठभूमि में टूल कॉल शुरू कर सकता है और डेटा पुनः प्राप्त कर सकता है बिना संवाद को रोकें। एक Google डेमॉन्स्ट्रेशन दिखाता है कि अवतार होटल अतिथि की जाँच कर रहा है जबकि संवाद बिना रुकावट जारी रहता है।

Google कहता है कि अवतार 97 भाषाओं में संवाद के दौरान अपनी लिप‑सिंक और अभिव्यक्तियों को समायोजित करता है, वीडियो की सटीकता बनाए रखता है और दृश्य विचलन से बचता है। Google Cloud पोस्ट में कैमरा फ़ीड और स्क्रीन शेयर के साथ ऑडियो में लाइव दृश्य समझ, संवाद संदर्भ और बैकएंड लेन‑देनों को संरक्षित करने वाली बाधा‑रिकवरी, मैन्युअल टॉगल के बिना स्वचालित भाषा पहचान और संक्रमण, तथा वेब, मोबाइल और इंटरैक्टिव कियोस्क पर डिप्लॉयमेंट जोड़ा गया है। एक अलग Google Cloud डेमॉन्स्ट्रेशन में एक बीमा दावा इंटेक एजेंट ग्राहक के कैमरे पर क्षति दिखाते समय दावा नोटबुक भर रहा है, जबकि Google’s Agent Development Kit से निर्मित एजेंट टीम नीति की पुष्टि करती है, इंटेक नियम लागू करती है, और पृष्ठभूमि में एडजस्टर पैकेट तैयार करती है।

अवतार, वॉटरमार्किंग, और मॉडल‑कार्ड सीमाएँ

संगठन प्रीसेट अवतारों की लाइब्रेरी से डिप्लॉय कर सकते हैं या उच्च‑गुणवत्ता वाली रेफ़रेंस इमेज से कस्टम अवतार बना सकते हैं, और Google कहता है कि परिणाम रेफ़रेंस की समानता, ब्रांड स्टाइलिंग या कैरेक्टर पहचान को बनाए रखता है। कस्टम अवतार निर्माण तक पहुँच के लिए एंटरप्राइज़ अलाउलिस्टिंग आवश्यक है; Google Cloud अलाउलिस्टिंग और सत्यापन प्रक्रिया को पहचान की सुरक्षा और दुरुपयोग से बचाव के रूप में वर्णित करता है। प्रत्येक उत्पन्न ऑडियो और वीडियो स्ट्रीम में एक अप्रकट SynthID वॉटरमार्क एम्बेड किया जाता है, जिससे AI‑जनित सामग्री का पता लगाया जा सके।

Gemini 3.8 ऑडियो मॉडल कार्ड के अनुसार, मॉडल Gemini 3 Pro पर आधारित हैं। Gemini 3.8 Live ऑडियो, छवियों, वीडियो और टेक्स्ट को अधिकतम 128K टोकन के कॉन्टेक्स्ट विंडो के साथ स्वीकार करता है, और Live Avatar के साथ यह ऑडियो, वीडियो और टेक्स्ट को 24K टोकन आउटपुट सीमा के अधीन आउटपुट करता है। मॉडल कार्ड बताता है कि Live Avatar वैरिएंट्स प्राकृतिक सिर की हरकतों के साथ समन्वित अभिव्यक्तिपूर्ण वीडियो उत्पन्न करते हैं, जो कॉन्फ़िगर की गई छवियों और ऑडियो इनपुट्स द्वारा संचालित होते हैं, और वे विस्तारित घंटों के बजाय कुछ मिनटों तक निरंतर इंटरैक्शन बनाए रखते हैं।

मॉडल कार्ड ज्ञात सीमाओं की सूची देता है जिसमें संभावित हॉलुसिनेशन और कभी‑कभी धीमा होना या टाइम‑आउट शामिल हैं, और यह ज्ञान कट‑ऑफ़ को जनवरी 2025 पर सेट करता है। इसका फ्रंटियर सुरक्षा मूल्यांकन Gemini 3.7 Flash की तुलना में कोई महत्वपूर्ण नई क्षमताएँ या महत्वपूर्ण प्रदर्शन वृद्धि नहीं पाता, और इस आधार पर Google मानता है कि Gemini 3.8 Audio मॉडल फ्रंटियर सुरक्षा फ्रेमवर्क के तहत किसी भी ट्रैक्ड या क्रिटिकल क्षमता स्तर तक पहुँचने की संभावना नहीं रखते।

ग्राहक डिप्लॉयमेंट्स

Google Cloud ने इस सुविधा का उपयोग करने वाले कई एंटरप्राइज़ का उल्लेख किया। Cox Automotive ने Autotrader के लिए एक AI‑संचालित शॉपिंग असिस्टेंट बनाया जो लाइव स्क्रीन‑हाइलाइटिंग और टूल कॉलिंग का उपयोग करके कार खरीदारों को वाहन खोज, तुलना, और वित्तपोषण में वास्तविक‑समय में मार्गदर्शन करता है।

“खरीदार अब अधिकतर उम्मीद करते हैं कि वे अपनी ज़रूरतों को अपने शब्दों में वर्णित करें, न कि फ़िल्टर और मेनू के माध्यम से खोजें। Autotrader का नया संवादात्मक AI अवतार इस अनुभव को वाहन खोज में लाता है, प्राकृतिक बातचीत को सही इन्वेंट्री से मिलाकर,” Cox Automotive की कार्यकारी उपाध्यक्ष और मुख्य उत्पाद अधिकारी Marianne Johnson ने Google Cloud घोषणा में कहा।

Equal AI के मुख्य कार्यकारी अधिकारी Akhilesh Damaraju ने कहा कि कंपनी का व्यक्तिगत AI दैनिक रूप से नौ भारतीय भाषाओं में एक मिलियन से अधिक लाइव कॉल संभालता है, और बताया कि Gemini 3.8 Live ने व्यवधान प्रबंधन, बहुभाषी वार्तालाप और टूल‑कॉल विश्वसनीयता में सुधार किया है। Salesforce के Agentforce उत्पाद उपाध्यक्ष Bob Van Osten ने कहा कि Agentforce और Gemini 3.8 Live Salesforce AI Research और Google के बीच एक सहयोग में एक साथ आ रहे हैं, जो वास्तविक‑समय मल्टीमॉडल क्षमताओं को एजेंटिक AI के साथ जोड़ता है। Specs के सॉफ़्टवेयर इंजीनियर Eric Walsh ने कहा कि मॉडल की वॉइस एक्टिविटी डिटेक्शन अपडेट और लेटेंसी सुधार SPECS प्लेटफ़ॉर्म पर AI सहायक के लिए आगे के कदम हैं।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।