एआई मॉडल और प्लेटफ़ॉर्म
IBM कहता है कि Granite Speech 5.0 एक सेकंड में 3.5 घंटे की आवाज़ को ट्रांसक्राइब करता है

IBM ने 25 अगस्त, 2026 को दो कॉम्पैक्ट अंग्रेज़ी स्पीच रिकॉग्निशन मॉडल जारी किए, यह दावा करते हुए कि ट्रांसक्रिप्शन थ्रूपुट कोई भी खुला मॉडल पहले नहीं दिखा पाया: एक सेकंड में 3.5 घंटे की आवाज़ को प्रोसेस किया गया। यह जोड़ी, Granite Speech 5.0 TurboCTC और एक गैर‑व्यावसायिक समकक्ष, प्रत्येक में केवल 470 मिलियन पैरामीटर हैं, और कंपनी ने एकल NVIDIA H200 GPU पर 12,600 RTFx से अधिक का समग्र थ्रूपुट बताया है, जिसका अर्थ है कि ऑडियो मॉडल से वास्तविक समय से बारह हजार गुना अधिक तेज़ी से गुजरता है।
गति IBM के आंकड़ों के अनुसार प्रतिस्पर्धी सटीकता के साथ आती है। सार्वजनिक अंग्रेज़ी शॉर्ट‑फ़ॉर्म टेस्ट सेटों पर OpenASR Leaderboard में, गैर‑व्यावसायिक संस्करण ने 4.85% समग्र शब्द त्रुटि दर (WER) हासिल की और खुले लाइसेंस वाले संस्करण ने 5.00% दर्ज किया, जैसा कि IBM की घोषणा में बताया गया है। दोनों आंकड़े विक्रेता‑रिपोर्टेड हैं: IBM उन्हें अनौपचारिक लेबल करता है, हालांकि इन्फ़रेंस Hugging Face की अपनी जॉब्स इन्फ्रास्ट्रक्चर के माध्यम से चलाया गया और लीडरबोर्ड के टूलिंग से स्कोर किया गया, इसलिए कंपनी उम्मीद करती है कि ये आधिकारिक तालिका के अपडेट होने पर मेल खाएँगे।
दोनों मॉडल आकार और आर्किटेक्चर में समान हैं और प्रशिक्षण डेटा तथा लाइसेंस में अंतर है। Apache 2.0 मॉडल लगभग 60,000 घंटे के अंग्रेज़ी ऑडियो पर प्रशिक्षित है और व्यावसायिक उपयोग के लिए क्लियर है। गैर‑व्यावसायिक संस्करण में GigaSpeech और SPGI Speech जोड़कर लगभग 15,000 अतिरिक्त घंटे शामिल किए गए हैं, जिससे इसका कॉर्पस लगभग 75,000 घंटे का हो जाता है और यह CC‑BY‑NC‑SA‑4.0 लाइसेंस के तहत है। IBM का कहना है कि अतिरिक्त डेटा अधिकांश टेस्ट सेटों पर मामूली सटीकता बढ़ाता है, जबकि SPGI Speech पर अधिक स्पष्ट लाभ और लीडरबोर्ड के नए chunked Earnings22 टेस्ट पर उल्लेखनीय नुकसान दिखाता है।
भाषा मॉडल के बिना एक एन्कोडर
गति का दावा IBM ने जो नहीं बताया, वह है मॉडल की संरचना। पहले के Granite Speech रिलीज़ (3.3 और 4.x लाइनें, जिन्हें IBM के Granite Speech paper में दस्तावेज़ किया गया है) ने Conformer ध्वनिक एन्कोडर को Granite भाषा मॉडल से प्रोजेक्टर और LoRA एडॉप्टर के माध्यम से जोड़ा था, जिससे टेक्स्ट ऑटोरिग्रेसिव रूप से उत्पन्न होता था, जैसे चैट मॉडल करता है। 5.0 मॉडल पूरी तरह से भाषा मॉडल को हटा देते हैं। शेष केवल 16‑लेयर Conformer एन्कोडर है, जो कनेक्शनिस्ट टेम्पोरल क्लासिफिकेशन (CTC) के साथ प्रशिक्षित है, एक डिकोडिंग योजना जो ऑडियो फ्रेम को सीधे आउटपुट टोकन में एक ही गैर‑ऑटोरिग्रेसिव पास में ग्रीडी डिकोडिंग के साथ मैप करती है।
दो और परिवर्तन अधिकांश काम करते हैं। जहाँ पिछले Granite एन्कोडर प्रति सेकंड 50 अक्षर उत्पन्न करते थे, नए मॉडल प्रति सेकंड 12.5 टोकन उत्पन्न करते हैं, जो 100‑फ़्रेम‑पर‑सेकंड लॉग‑मेल फ्रंट‑एंड से 2× टेम्पोरल सबसैंपलिंग के तीन चरणों द्वारा प्राप्त किया गया है। और आउटपुट शब्दावली अक्षरों से 16,384 प्रशिक्षित सबवर्ड यूनिट्स में बदल गई, गैर‑व्यावसायिक मॉडल में SentencePiece और Apache मॉडल में BPE का उपयोग किया गया। कम, लंबे टोकन, फ्रेम रेट के एक चौथाई पर, वही थ्रूपुट को पहले के Granite Speech मॉडल से 20 गुना अधिक आगे ले जाता है, IBM के अनुसार।
यह ट्रेड‑ऑफ़ क्षमता की व्यापकता को ट्रांसक्रिप्शन फोकस के लिए बदलता है। भाषा मॉडल के बिना, ये मॉडल स्पीच ट्रांसलेशन और कीवर्ड बायसिंग जैसी क्षमताएँ खो देते हैं, जो पहले की लाइन में समर्थित थीं। जो वे प्राप्त करते हैं वह लैपटॉप और एज हार्डवेयर के लिए उपयुक्त फुटप्रिंट है: IBM इन दोनों को एंटरप्राइज़ स्पीच‑टू‑टेक्स्ट के लिए स्थित करता है, जहाँ लेटेंसी और थ्रूपुट मॉडल की उस क्षमता से अधिक महत्वपूर्ण होते हैं, जो सुनाई गई चीज़ पर तर्क भी कर सके।
मूल्यांकन क्या दिखाते हैं और क्या नहीं दिखाते
अब तक का सबसे मजबूत स्वतंत्र संकेत फार‑फ़ील्ड ऑडियो से आता है। FFASR Leaderboard पर, जो शोरगुल वाले, रिवर्बरेंट स्पीच की पहचान को मापता है, IBM ने 25 अगस्त, 2026 की आधिकारिक परिणामों को रिपोर्ट किया, जिसमें गैर‑व्यावसायिक मॉडल ने सटीकता में पाँचवाँ स्थान और Apache मॉडल ने नौवाँ स्थान प्राप्त किया — जबकि दोनों बोर्ड पर दो सबसे तेज़ एंट्रीज़ के रूप में रैंक किए गए, एकल NVIDIA L4 पर थ्रूपुट मापते हुए। FFASR मॉडल को शोरगुल वाले, रिवर्बरेंट, और मूविंग‑सोर्स ऑडियो पर कई SNR पर मूल्यांकित करता है, ऐसी स्थितियों में जहाँ फार‑फ़ील्ड पहचान घटती है, जैसा कि लीडरबोर्ड के अपने विवरण में बताया गया है।
हेडलाइन 12,600 RTFx आंकड़े को उसके संदर्भ में देखना चाहिए। यह सबसे तेज़ डेटासेंटर GPU में से एक पर बैच्ड‑इन्फ़रेंस संख्या है, न कि वह जो लैपटॉप पर WebGPU स्ट्रीमिंग डेमो चलाते समय देखा जाएगा। समग्र WER आंकड़े केवल शॉर्ट‑फ़ॉर्म अंग्रेज़ी को कवर करते हैं, और OpenASR Leaderboard की आधिकारिक रैंकिंग, जिसमें निजी टेस्ट सेट भी शामिल हैं, ने अभी तक प्रकाशन के समय नए मॉडल को शामिल नहीं किया था। IBM का अपना फ्रेमिंग यहाँ ईमानदार है: ये मजबूत विक्रेता‑रिपोर्टेड परिणाम हैं, जो लीडरबोर्ड की पुष्टि का इंतज़ार कर रहे हैं।
प्रशिक्षण रेसिपी भी डेटा ओपननेस के बारे में उल्लेखनीय है। दोनों मॉडलों के कॉर्पस में मौजूद प्रत्येक डेटासेट सार्वजनिक रूप से उपलब्ध है, और 2,740 घंटे के सिंथेटिक जोड़ में 2,500 घंटे के मल्टी‑स्पीकर ऑडियो शामिल हैं, जो सिंगल‑स्पीकर सेगमेंट्स को जोड़कर बनाये गये हैं, तथा 240 घंटे के utterances OpenAI के ओपन‑वेट gpt‑oss मॉडल से उत्पन्न और StyleTTS2 के साथ सिंथेसाइज़ किए गये हैं, जो उन संख्याओं, मुद्राओं और पतों को लक्षित करते हैं जो पहचानकर्ताओं को भ्रमित करते हैं। प्रशिक्षण IBM के Blue Vela क्लस्टर पर 8 NVIDIA H100 GPU पर 10 दिन लगा, जैसा कि मॉडल कार्ड में बताया गया है।
दोनों मॉडल अब Hugging Face पर ट्रांसफ़ॉर्मर्स लाइब्रेरी में मूल समर्थन के साथ लाइव हैं — अगले रिलीज़ तक स्रोत से इंस्टॉल किया गया — Granite Speech संग्रह के तहत, और एक ब्राउज़र‑आधारित स्ट्रीमिंग डेमो Chrome और Edge में चलता है। यह समझने के लिए कि समर्पित ट्रांसक्रिप्शन मॉडल व्यावसायिक सेवाओं के मुकाबले कहाँ स्थित हैं, हमारा AI ट्रांसक्रिप्शन सॉफ़्टवेयर का राउंड‑अप देखें।












