एआई मॉडल और प्लेटफ़ॉर्म

Microsoft ने MAI-Transcribe-2-Streaming और दो MAI-Voice मॉडल लॉन्च किए

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Microsoft AI ने 1 अक्टूबर, 2026 को MAI-Transcribe-2-Streaming लॉन्च किया, यह अपना पहला स्ट्रीमिंग ट्रांसक्रिप्शन मॉडल, साथ ही दो नए टेक्स्ट‑टू‑स्पीच मॉडल, MAI-Voice-2.1 और MAI-Voice-2.1-Flash, और ये सभी Microsoft Foundry के माध्यम से उपलब्ध हैं।

MAI-Transcribe-2-Streaming और Artificial Analysis बेंचमार्क

Microsoft वर्णन करता है कि MAI-Transcribe-2-Streaming 60 भाषाओं में कम विलंबता, वास्तविक‑समय ट्रांसक्रिप्ट प्रदान करता है, जिसमें स्वचालित, निरंतर भाषा पहचान शामिल है। कंपनी ने कहा कि यह मॉडल Artificial Analysis पर अंतिम और आंशिक दोनों ट्रांसक्रिप्ट की शुद्धता में नंबर 1 पर है, और यह बेंचमार्क के शुद्धता‑विरुद्ध‑विलंबता मूल्यांकन के Pareto सीमा पर स्थित है, जिसका अर्थ है कि अधिक शुद्धता के लिए भारी विलंबता का समझौता आवश्यक नहीं है। पोस्ट में दर्शाए गए लीडरबोर्ड चार्ट, जिसमें 28 सितंबर, 2026 की Artificial Analysis स्ट्रीमिंग लीडरबोर्ड का उल्लेख है, मॉडल को 2.5 % अंतिम शब्द‑त्रुटि दर, 2.8 % प्रथम‑आंशिक दर, और अंतिम ट्रांसक्रिप्शन तक 0.13 सेकंड दिखाता है।

वक्ता के बोलना समाप्त करने की प्रतीक्षा करने के बजाय, मॉडल ऑडियो प्राप्त होने के लगभग 100 मिलीसेकंड में अपनी पहली धारणाएँ, जिन्हें आंशिक (partials) कहा जाता है, उत्पन्न करता है, फिर अधिक संदर्भ मिलने पर उन्हें संशोधित करता है और स्थिर ट्रांसक्रिप्ट को अंतिम रूप देता है। Microsoft ने कहा कि यह आवाज‑सक्षम अनुप्रयोगों को वक्ता के समाप्त होने से पहले ही भाषण पर कार्रवाई करने की अनुमति देता है: आवाज एजेंट वाक्य के मध्य में ही तर्क करना या टूल्स को कॉल करना शुरू कर सकते हैं, और लाइव ट्रांसक्रिप्ट लोग बात करते समय दिखाई दे सकते हैं। वास्तविक‑समय डिक्टेशन और सबटाइटलिंग के लिए, कंपनी ने कहा कि उसके आंतरिक मूल्यांकन दर्शाते हैं कि शब्द ट्रांसक्रिप्ट में प्रतिस्पर्धी की तुलना में दो गुना तेज़ दिखाई देते हैं।

Artificial Analysis कहता है कि इसका AA-WER Streaming सूचकांक उन मॉडलों की ट्रांसक्रिप्शन शुद्धता को मापता है जहाँ ऑडियो वास्तविक‑समय में, टुकड़ा‑टुकड़ा, लगभग आठ घंटे के ऑडियो पर तीन डेटासेट्स से आता है: AA‑AgentTalk 50 % पर, VoxPopuli 25 % पर, और Earnings22 25 % पर। ये डेटासेट्स वास्तविक‑दुनिया की आवाज़ को विविध उच्चारण, डोमेन‑विशिष्ट भाषा, और चुनौतीपूर्ण ध्वनिक परिस्थितियों के साथ कवर करते हैं, और बेंचमार्क के Time to Final और Time to First Partial माप दोनों SileroVAD आवाज‑गतिविधि डिटेक्टर द्वारा पहचानी गई आवाज़ के अंत से शुरू होते हैं।

MAI-Transcribe-2-Streaming वर्ष के अंत तक ऑडियो के प्रत्येक घंटे के लिए $0.54 की शुरुआती कीमत पर उपलब्ध है। यह मॉडल Microsoft की MAI ऑडियो लाइन का विस्तार करता है, जिसमें पहले से ही MAI-Transcribe-2 शामिल है, जो पूर्व का गैर‑स्ट्रीमिंग स्पीच रिकग्निशन मॉडल है, जिसे कंपनी ने दुनिया का सबसे तेज़, सबसे सटीक और सबसे सस्ता बताया था।

MAI-Voice-2.1 और MAI-Voice-2.1-Flash

MAI-Voice-2.1 23 भाषाओं और 26 लोकेल्स को समर्थन देता है, और Microsoft ने कहा कि एक ही आवाज़ सभी को मूल उच्चारण के साथ उपयोग कर सकती है, भाषा बदलते समय समान वक्ता पहचान बनाए रखती है। कंपनी के उदाहरण में एक ट्यूटोरिंग ऐप पाठ के मध्य में भाषा बदल सकता है बिना शिक्षक बदलें, और एक बहुभाषी सहायक जिस भी भाषा में संबोधित किया जाए, उसी आवाज़ में उत्तर दे सकता है। इस मॉडल की कीमत $22 प्रति 1 M अक्षर है।

MAI-Voice-2.1-Flash समान भाषाओं और क्रॉस‑लैंग्वेज़ स्पीकर को समर्थन देता है, लेकिन यह उच्च‑वॉल्यूम, विलंब‑संवेदनशील कार्यभार के लिए बनाया गया है। यह अधिकतम 45 सेकंड का ऑडियो 150 मिलीसेकंड की एंड‑टू‑एंड विलंबता के साथ उत्पन्न कर सकता है, और Microsoft ने कहा कि यह मॉडल इनफ़रेंस में 55 % तेज़ और तुलनीय मॉडलों की तुलना में लगभग 60 % सस्ता है। इसकी कीमत $15 प्रति 1 M अक्षर है।

दोनों आवाज़ मॉडल कुछ सेकंड के रेफ़रेंस ऑडियो का उपयोग करके सभी समर्थित भाषाओं में आवाज़ क्लोनिंग का समर्थन करते हैं, जिसमें अंतर्निहित सहमति सुरक्षा उपाय हैं जिन्हें Microsoft ने दुरुपयोग रोकने के लिए बताया है। दो नए आवाज़ मॉडलों को मिलाकर 4,000 श्रोताओं के साथ किए गए ट्यूरिंग टेस्ट में, Microsoft ने कहा कि 50.3 % श्रोताओं ने MAI-Voice को मानव रिकॉर्डिंग के समान या अधिक मानव‑समान माना।

Microsoft ने MAI-Transcribe-2-Streaming को MAI-Voice-2.1-Flash के साथ जोड़ने को आवाज‑एजेंट लूप के दोनों सिरों पर समय बचाने के रूप में प्रस्तुत किया, जहाँ सुनना, समझना, निर्णय लेना और बोलना की क्रमावली उस विंडो में होती है जहाँ मानव अभी भी बातचीत को संवाद के रूप में अनुभव करता है। सूचीबद्ध डेवलपर उपयोग मामलों में ग्राहक सेवा एजेंट शामिल हैं जो बोले गए अनुरोधों को ट्रांसक्राइब करते हैं और प्राकृतिक आवाज़ में उत्तर देते हैं, बहुभाषी सहायक जो बोली गई भाषा का पता लगाते हैं और 23 समर्थित MAI-Voice भाषाओं में से किसी में भी उत्तर देते हैं, तथा इंटरैक्टिव लर्निंग और मीडिया एप्लिकेशन जो ट्यूटोरिंग, रोल‑प्ले, सिमुलेशन, नैरेशन और संवादात्मक सामग्री के लिए अलग‑अलग स्पीकर का उपयोग करते हैं।

उपलब्धता और Chatter डेमो

MAI-Voice-2.1 और MAI-Voice-2.1-Flash OpenRouter के माध्यम से उपलब्ध हैं। सभी तीन मॉडल Microsoft Foundry, MAI Playground, Vercel, और Azure Voice Live के माध्यम से उपलब्ध हैं, जबकि LiveKit को जल्द ही आने वाला बताया गया है।

मॉडलों को लाइव एजेंट में साथ काम करते दिखाने के लिए, Microsoft ने Chatter बनाया, जो MAI Playground में एक नया डेमो है और उपयोगकर्ताओं को ट्रांसक्रिप्शन और आवाज़ मॉडल द्वारा संचालित आवाज़ सहायक से बात करने की अनुमति देता है।

Jonas Reeve एक AI-जनित विश्लेषक हैं Unite.AI में, जो संज्ञानात्मक AI, कृत्रिम सामान्य बुद्धिमत्ता (AGI), और मशीन इंटेलिजेंस की सैद्धांतिक नींव पर केंद्रित हैं। उनका कार्य यह जांचता है कि सीखना, तर्क, स्मृति और सारांश दोनों जैविक और कृत्रिम प्रणालियों में कैसे उभरते हैं, और आधुनिक AI आर्किटेक्चर को संज्ञानात्मक विज्ञान और मन की दार्शनिक प्रश्नों के दीर्घकालिक सवालों से जोड़ता है।

एक वैचारिक और प्रतिबिंबात्मक दृष्टिकोण के साथ, Jonas तर्क मॉडल, एजेंटिक सिस्टम, उद्भवित संज्ञान, और संरेखण सिद्धांत जैसे ढाँचों की जांच करते हैं, जिसका उद्देश्य AGI की ओर प्रगति का वास्तविक अर्थ—और क्या नहीं—स्पष्ट करना है। समयसीमा या प्रचार का पीछा करने के बजाय, वे मूल सिद्धांतों, वैचारिक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देते हैं।

Jonas Reeve द्वारा लिखे गए लेख AI-जनित हैं और Unite.AI की संपादकीय टीम द्वारा सटीकता, स्पष्टता, और उन्नत AI अवधारणाओं की जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा किए जाते हैं।