एआई मॉडल और प्लेटफ़ॉर्म

MAI-Transcribe-2 ने 60 भाषाओं में FLEURS बेंचमार्क में शीर्ष स्थान हासिल किया, माइक्रोसॉफ्ट कहता है

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Microsoft AI ने 3 सितंबर 2026 को MAI-Transcribe-2 जारी किया, एक स्पीच रिकग्निशन मॉडल जिसे प्रयोगशाला ने 60 भाषाओं में FLEURS बेंचमार्क पर औसत शब्द त्रुटि दर 5.2% के साथ प्रथम स्थान पर बताया। अपने घोषणा में, Microsoft ने इस मॉडल को अब तक का सबसे सक्षम ट्रांसक्रिप्शन सिस्टम बताया और इसकी कीमत $0.10 प्रति घंटे ऑडियो निर्धारित की।

Microsoft ने कहा कि MAI-Transcribe-2 स्पीकर डायरिएज़ेशन, कॉन्फ़िगर करने योग्य ट्रांसक्रिप्शन शैलियों और शब्द-स्तर टाइमस्टैम्प जोड़ता है, और Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large, तथा ScribeV2 सहित प्रतिस्पर्धी मॉडलों को वास्तविक ऑडियो की विस्तृत श्रेणी में पीछे छोड़ता है। घोषणा के अनुसार, यह मॉडल Artificial Analysis पर सटीकता और लेटेंसी के लिए पैरिटो फ्रंटियर निर्धारित करता है और Artificial Analysis शब्द त्रुटि दर लीडरबोर्ड पर दूसरा स्थान प्राप्त करता है, जिससे पहले के MAI-Transcribe संस्करणों की तुलना में सुधार दिखता है।

Microsoft ने इस मॉडल को क्लिनिकल नोट‑टेकिंग, कानूनी दस्तावेज़ीकरण, एक्सेसिबिलिटी और क्लोज़्ड कैप्शनिंग जैसे कार्यभारों के लिए स्थित किया है। कंपनी ने तेज़ इनफ़रेंस और उल्लेखनीय रूप से कम लेटेंसी की रिपोर्ट की है, विशेष रूप से लंबी ऑडियो के लिए, जो प्रमुख प्रतिस्पर्धियों की तुलना में 10 गुना तक तेज़ प्रोसेसिंग गति प्रदान करता है। उन्होंने यह भी कहा कि मॉडल नियंत्रित रिकॉर्डिंग पर्यावरण के बाहर शोरयुक्त परिस्थितियों में भी ट्रांसक्रिप्शन गुणवत्ता बनाए रखता है।

बेंचमार्क परिणाम

Artificial Analysis द्वारा चलाए गए मूल्यांकन का हवाला देते हुए, Microsoft ने कहा कि MAI-Transcribe-2 OpenAI के GPT-Transcribe से 10 गुना तेज़, ElevenLabs के Scribe v2 से 7 गुना तेज़ और Gemini 3.5 Transcribe से 5 गुना तेज़ है, जबकि उच्च सटीकता भी प्रदान करता है। कंपनी ने बताया कि मॉडल बेंचमार्क के सटीकता‑वर्सेज‑स्पीड चार्ट के सबसे आकर्षक चतुर्थांश में अकेला स्थित है, 2.0% त्रुटि दर और 403.6 की गति कारक के साथ, जिसका अर्थ है कि एक घंटे की ऑडियो लगभग दस सेकंड में लौटती है।

सार्वजनिक बहुभाषी FLEURS बेंचमार्क पर, Microsoft ने रिपोर्ट किया कि MAI-Transcribe-2 सभी 60 परीक्षणित भाषाओं में लगातार उच्च सटीकता बनाए रखता है। कंपनी ने मॉडल को किसी भी अन्य मॉडल की तुलना में अधिक भाषाओं में सटीक बताया और कहा कि कई भाषाओं में ट्रांसक्राइब करने वाले डेवलपर्स एक ही मॉडल पर भरोसा कर सकते हैं, जिससे जटिलता कम होती है और संभावित रूप से GPU उपयोग में बचत होती है। घोषणा में यह भी कहा गया है कि मॉडल की गति और थ्रूपुट Microsoft को बाजार में सबसे प्रतिस्पर्धी कीमत प्रदान करने में सक्षम बनाते हैं। लॉन्च के समय, $0.10 प्रति घंटे की दर एक सीमित‑समय ऑफ़र है जो वर्ष के अंत तक जारी रहेगा।

उपलब्धता और डेवलपर सुविधाएँ

Microsoft Learn दस्तावेज़ में MAI-Transcribe-2 को Azure Speech में सार्वजनिक प्रीव्यू के रूप में सूचीबद्ध किया गया है, बिना किसी सर्विस‑लेवल एग्रीमेंट के और उत्पादन कार्यभारों के लिए अनुशंसित नहीं है। दस्तावेज़ MAI-Transcribe को Microsoft AI टीम द्वारा इन‑हाउस निर्मित एक स्पीच‑टू‑टेक्स्ट मॉडल के रूप में वर्णित करता है, जो वीडियो कैप्शनिंग, मीटिंग्स, क्लिनिकल नोट्स, कॉल सेंटर दस्तावेज़ीकरण, एक्सेसिबिलिटी टूल्स, कंटेंट क्रिएशन और वॉयस एजेंट्स जैसे कार्यभारों को कवर करता है। यह MAI-Transcribe-2 को पहले के MAI-Transcribe-1.5 और MAI-Transcribe-1 के साथ सूचीबद्ध करता है, जिसमें बाद वाला 20 अगस्त 2026 को अप्रचलित हो गया।

अनुरोध Fast Transcription API के एन्हांस्ड मोड के माध्यम से रूट होते हैं, जहाँ मॉडल को एन्हांस्ड मोड मॉडल प्रॉपर्टी को MAI-Transcribe-2 सेट करके चुना जाता है। ऑडियो इनपुट WAV, MP3 या FLAC फॉर्मेट में 300 MB से कम फाइलों तक सीमित है, और उपयोग के लिए Azure सब्सक्रिप्शन और Speech के लिए Microsoft Foundry संसाधन आवश्यक है।

वैकल्पिक पैरामीटर मॉडल की विशेषताओं को नियंत्रित करते हैं। स्पीकर डायरिएज़ेशन रिकॉर्डिंग को स्पीकर के अनुसार विभाजित करता है और ऑफ़सेट व अवधि मेटाडेटा के साथ स्पीकर‑लेबल्ड सेगमेंट लौटाता है। शब्द‑स्तर टाइमस्टैम्प प्रत्येक शब्द के समय को लौटाते हैं, जबकि सेगमेंट विकल्प प्रत्येक सेगमेंट के समय को देता है और ‘none’ विकल्प समय डेटा को छोड़ देता है। फ़्रेज़‑लिस्ट पैरामीटर प्रदान किए गए शब्दों जैसे डोमेन‑विशिष्ट शब्दावली, संक्षिप्त रूप और विशेष संज्ञाओं की ओर पहचान को झुकाव देता है, और दस्तावेज़ में कहा गया है कि ये शब्द संकेत के रूप में कार्य करते हैं, अनिवार्य आउटपुट नहीं।

ट्रांसक्रिप्शन शैली पैरामीटर का डिफ़ॉल्ट मान ‘verbatim’ है, जो बोले गए शब्दों को ठीक उसी तरह कैप्चर करता है, जिसमें फ़िलर शब्द और गलत शुरुआत शामिल हैं, जिससे अनुपालन, QA और विश्लेषण कार्यभारों में मदद मिलती है। ‘clean’ सेटिंग फ़िलर को हटाती है और सामान्य भाषण पैटर्न को ऑटो‑फ़ॉर्मेट करके अधिक पठनीय कैप्शन, नोट्स और प्रकाशित ट्रांसक्रिप्ट बनाती है। भाषा चयन वैकल्पिक है; डिफ़ॉल्ट रूप से मॉडल स्वचालित रूप से बोली गई भाषा का पता लगाता है, और दस्तावेज़ केवल तब विशिष्ट भाषा को बाध्य करने की सलाह देता है जब स्वचालित पहचान विफल हो। Hinglish और Spanglish जैसे मिश्रित भाषा जोड़ों के लिए कोड‑स्विचिंग स्वचालित रूप से संभाली जाती है, और नियंत्रित पर्यावरण के बाहर रिकॉर्ड किए गए ऑडियो के लिए शोर प्रतिरोध मॉडल में अंतर्निहित है।

दस्तावेज़ यह भी उल्लेख करता है कि MAI-Transcribe वॉइस लाइव API में एक सत्र कॉन्फ़िगरेशन फ़ील्ड के माध्यम से इनपुट ऑडियो ट्रांसक्रिप्शन प्रदान कर सकता है। Microsoft ने कहा कि मॉडल Microsoft Foundry और MAI Playground के माध्यम से डेमो के लिए उपलब्ध है, और OpenRouter पर उपलब्धता जल्द ही आने वाली है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।