एआई मॉडल और प्लेटफ़ॉर्म

xAI ने Grok Voice Transcribe 2.0 स्पीच-टू-टेक्स्ट मॉडल जारी किया

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

xAI ने Grok Voice Transcribe 2.0, अपना नवीनतम स्पीच-टू-टेक्स्ट मॉडल, 18 सितंबर, 2026 को जारी किया, बैच मूल्य निर्धारण $0.10 प्रति ऑडियो घंटे पर रखा, और मॉडल को Grok Voice Transcribe 1.0 से दो गुना अधिक सटीक बताया।

Grok Voice Transcribe 2.0, Grok Voice के पीछे के ऑडियो फाउंडेशन मॉडल पर निर्मित है। xAI के अनुसार, Grok Voice पहले ही प्रतिदिन दसियों हज़ार ग्राहक‑समर्थन कॉल को संचालित करता है, वीडियो वर्णन के लाखों घंटे को ट्रांसक्राइब करता है, और भौतिक उत्पादों में वॉयस एजेंट चलाता है, जिसमें टेस्ला वाहनों में Grok सहायक शामिल है। कंपनी ने कहा कि नया मॉडल लाइव, शोरयुक्त, बहुभाषी ऑडियो पर प्रशिक्षित किया गया है, जो विभिन्न पर्यावरणों में रिकॉर्ड किया गया था और पोस्ट‑ट्रेनिंग के साथ परिष्कृत किया गया, और इस परिणाम को वास्तविक‑विश्व स्थितियों में उपलब्ध सबसे सटीक ट्रांसक्रिप्शन मॉडलों में से एक बताया।

सटीकता मूल्यांकन

xAI ने कहा कि Grok Voice Transcribe 2.0 सार्वजनिक Artificial Analysis लीडरबोर्ड पर 32 स्ट्रीमिंग मॉडलों में सटीकता के लिए प्रथम स्थान पर है। सार्वजनिक बेंचमार्क के परे, कंपनी उत्पादन ट्रैफ़िक से निकाले गए चार आंतरिक मूल्यांकन सेटों पर शब्द त्रुटि दर मापती है: ग्राहक‑समर्थन कॉल की टेलीफ़ोनी ऑडियो, Grok के साथ संवाद, खाता कोड और ई‑मेल पतों जैसे बोले गए प्रमाणपत्र, और छोटे बहुभाषी वॉयस कमांड। कंपनी ने रिपोर्ट किया कि नया मॉडल सभी चार सेटों में Grok Voice Transcribe 1.0 से बेहतर है और टेलीफ़ोनी सेट में प्रत्येक मॉडल को पीछे छोड़ता है, जो 8 kHz अंग्रेज़ी ग्राहक‑समर्थन कॉलों से बना है। xAI के प्रकाशित चार्ट इस मॉडल की तुलना Gemini 3.5 Transcribe, MAI-Transcribe-2, ElevenLabs Scribe v2, Deepgram Nova-3, और Whisper Large v3 से इन आंतरिक सेटों पर करते हैं।

xAI के अनुसार, बहुभाषी ट्रांसक्रिप्शन संस्करण 1.0 की तुलना में सबसे बड़ा सटीकता सुधार है। कंपनी ने कहा कि मॉडल दर्जनों भाषाओं को ट्रांसक्राइब करता है, भाषा को स्वचालित रूप से पहचानता है, और रिकॉर्डिंग के मध्य में भाषा परिवर्तन को एक ही पास में संभालता है। छोटे वाक्यांश, जैसे कार के अंदर के कमांड, मॉडल को भाषा पहचानने के लिए कम संदर्भ देते हैं; xAI के 19 भाषाओं को कवर करने वाले छोटे‑वाक्यांश सेट में शब्द त्रुटि दर 20.6 प्रतिशत से घटकर 6.8 प्रतिशत हो गई, कंपनी ने रिपोर्ट किया।

विशेषताएँ और API पहुंच

Speech-to-Text API के माध्यम से, Grok Voice Transcribe 2.0 रिकॉर्ड किए गए फ़ाइलों और URL की बैच ट्रांसक्रिप्शन तथा वास्तविक‑समय स्ट्रीमिंग को संभालता है। दस्तावेज़ित विशेषताओं में शब्द‑स्तर टाइमस्टैम्प्स के साथ विश्वास स्कोर, अतिरिक्त लागत के बिना स्पीकर डायरिएशन, अधिकतम आठ चैनलों तक मल्टी‑चैनल ट्रांसक्रिप्शन, प्रति अनुरोध अधिकतम 100 डोमेन शब्दों की की‑टर्म बायसिंग, ऐसा टेक्स्ट फ़ॉर्मेटिंग जो संख्याएँ, तिथियाँ, मुद्राएँ, फ़ोन नंबर और ई‑मेल पते लिखित रूप में लौटाता है, filler शब्दों का हटाना, और स्मार्ट टर्न डिटेक्शन शामिल है जो वॉयस एजेंट के लिए स्पीकर के टर्न के अंत की पहचान करता है। xAI ने कहा कि मौजूदा Speech-to-Text API इंटीग्रेशन को कोड परिवर्तन के बिना सटीकता सुधार मिल रहा है।

आधिकारिक स्पीच-टू-टेक्स्ट दस्तावेज़ीकरण 12 समर्थित ऑडियो फ़ॉर्मेट, अधिकतम फ़ाइल आकार 500 MB, और 8000, 16000, 22050, 24000, 44100, तथा 48000 Hz के सैंपल रेट सूचीबद्ध करता है। एक भाषा पैरामीटर 25 भाषाओं में लिखित‑रूप फ़ॉर्मेटिंग सक्षम करता है, जिनमें अंग्रेज़ी, स्पेनिश, फ्रेंच, जर्मन, हिंदी, जापानी और कोरियाई शामिल हैं।

बैच अनुरोध multipart फ़ॉर्म डेटा का उपयोग करते हैं और सर्वर को डाउनलोड और ट्रांसक्राइब करने के लिए या तो अपलोड की गई फ़ाइल या URL प्रदान करना आवश्यक है; प्रतिक्रिया में पूर्ण ट्रांसक्रिप्ट, BCP-47 कोड के रूप में पहचानी गई भाषा, सेकंड में ऑडियो अवधि, और प्रारम्भ एवं समाप्ति समय के साथ शब्द‑स्तर सेगमेंट लौटाए जाते हैं। स्ट्रीमिंग के लिए, क्लाइंट कच्चा ऑडियो बाइनरी फ़्रेम के रूप में wss://api.x.ai/v1/stt पर WebSocket एन्डपॉइंट को भेजते हैं और ऑडियो प्रोसेस होते समय JSON ट्रांसक्रिप्ट इवेंट प्राप्त करते हैं, जिसमें लगभग हर 500 मिलीसेकंड पर वैकल्पिक मध्यवर्ती परिणाम जारी होते हैं।

Loom तैनाती, मूल्य निर्धारण, और निरसन

xAI ने कहा कि Atlassian ने Grok Voice Transcribe 2.0 का अपने मौजूदा ट्रांसक्रिप्शन समाधान के साथ मूल्यांकन किया, इसे अधिक सटीक पाया, और अब इस मॉडल का उपयोग Loom, उनके स्क्रीन‑रिकॉर्डिंग उत्पाद, पर हर वीडियो को ट्रांसक्राइब करने के लिए करता है। xAI की घोषणा ने Atlassian के Teamwork Collection के वरिष्ठ उपाध्यक्ष Sanchan Saxena का उद्धरण दिया, जिन्होंने बताया कि Loom ट्रांसक्रिप्ट को Cursor कोडिंग टूल में पाइप करने वाले कार्यप्रवाह: “Grok द्वारा Loom की स्पीच‑टू‑टेक्स्ट को शक्ति मिल रही है और Cursor उसे कोड में बदल रहा है, हम संदर्भ से कोड तक लूप को बंद कर रहे हैं: आप जो कहना चाहते हैं उसे रिकॉर्ड करें, और काम हो जाता है।”

मूल्य निर्धारण Grok Voice Transcribe 1.0 के समान है: बैच ट्रांसक्रिप्शन के लिए ऑडियो प्रति घंटा $0.10 और स्ट्रीमिंग के लिए $0.20, जिसमें डायरिएशन, टाइमस्टैम्प और की‑टर्म शामिल हैं। xAI ने कहा कि Grok Voice Transcribe 2.0 जल्द ही Speech-to-Text API में डिफ़ॉल्ट मॉडल बन जाएगा और संस्करण 1.0 आने वाले हफ्तों में निरस्त किया जाएगा; ग्राहक जो संक्रमण के दौरान पहले मॉडल पर बने रहना चाहते हैं, वे अपने अनुरोधों में grok-voice-transcribe-1.0 को पिन कर सकते हैं। दस्तावेज़ वर्तमान में मॉडल पैरामीटर छोड़े जाने पर grok-voice-transcribe-1.0 को डिफ़ॉल्ट सूचीबद्ध करता है, जबकि grok-voice-transcribe-2.0 दोनों REST और WebSocket एन्डपॉइंट पर चयन योग्य है।

जोनस रीव यूनाइट.एआई में एक एआई-जनरेटेड विश्लेषक है, जो कॉग्निटिव एआई, आर्टिफिशियल जनरल इंटेलिजेंस (एजीआई), और मशीन इंटेलिजेंस के सैद्धांतिक आधारों पर ध्यान केंद्रित करता है। उनका काम यह देखता है कि जीवविज्ञान और कृत्रिम प्रणालियों दोनों में सीखने, तर्क, स्मृति, और अमूर्तता कैसे उत्पन्न होती है, आधुनिक एआई आर्किटेक्चर और संज्ञान विज्ञान और मन के दर्शन में लंबे समय से चली आ रही प्रश्नों के बीच संबंध बनाते हैं।
एक अवधारणात्मक और प्रतिबिंबात्मक दृष्टिकोण के साथ, जोनस तर्क मॉडल, एजेंटिक सिस्टम, उभरने वाली संज्ञान, और संरेखण सिद्धांत जैसे ढांचे की जांच करता है, एजीआई की ओर वास्तविक प्रगति का क्या अर्थ है - और क्या नहीं - स्पष्ट करने का लक्ष्य रखते हुए। समयसीमा या हाइप का पीछा करने के बजाय, वह पहले सिद्धांतों, अवधारणात्मक कठोरता, और वर्तमान मॉडलों की सीमाओं पर जोर देता है।
जोनस रीव द्वारा लिखित लेख एआई-जनरेटेड हैं और यूनाइट.एआई की संपादकीय टीम द्वारा उन्नत एआई अवधारणाओं की सटीकता, स्पष्टता, और जिम्मेदार चर्चा सुनिश्चित करने के लिए समीक्षा की जाती है।