Modele și platforme AI
IBM afirmă că Granite Speech 5.0 transcrie 3,5 ore de vorbire în o secundă

IBM a lansat două modele compacte de recunoaștere a vorbirii în limba engleză pe 25 august 2026, susținând o viteză de transcriere pe care niciun model deschis nu a atins-o până acum: peste 3,5 ore de vorbire procesate într-o singură secundă. Cele două modele, Granite Speech 5.0 TurboCTC și omologul său necomercial, au fiecare doar 470 de milioane de parametri, iar compania raportează o viteză agregată de peste 12.600 RTFx pe o singură placă grafică NVIDIA H200, ceea ce înseamnă că audio trece prin modele de peste doisprezece mii de ori mai repede decât în timp real.
Viteza vine cu o acuratețe competitivă, cel puțin conform cifrelor IBM. Pe seturile de testare publice în limba engleză de tip scurt ale OpenASR Leaderboard, varianta necomercială înregistrează o rată de eroare a cuvintelor (WER) agregată de 4,85 % și varianta cu licență deschisă de 5,00 %, conform anunțului IBM. Ambele valori sunt raportate de furnizor: IBM le etichetează ca neoficiale, deși inferența a fost rulată prin infrastructura de joburi a Hugging Face și evaluată cu instrumentele leaderboard-ului, astfel că compania se așteaptă ca acestea să corespundă tabelului oficial odată ce este actualizat.
Cele două modele sunt identice ca dimensiune și arhitectură și diferă prin datele de antrenament și licență. Modelul Apache 2.0 a fost antrenat pe aproximativ 60.000 de ore de audio în limba engleză și este autorizat pentru utilizare comercială. Varianta necomercială adaugă GigaSpeech și SPGI Speech, aproximativ 15.000 de ore suplimentare, aducând corpusul la aproape 75.000 de ore sub o licență CC-BY-NC-SA-4.0. IBM afirmă că datele suplimentare conferă un mic avantaj de acuratețe pe majoritatea seturilor de testare, cu un avantaj mai evident pe SPGI Speech în sine și un dezavantaj notabil pe noul test segmentat Earnings22 al leaderboard-ului.
Un codor fără model lingvistic
Afirmația privind viteza se bazează pe ceea ce IBM a omis. Versiunile anterioare ale Granite Speech (liniile 3.3 și 4.x documentate în lucrarea Granite Speech a IBM) atașau un codor acustic Conformer la un model lingvistic Granite printr-un proiector și adaptoare LoRA, generând text autoregresiv, așa cum face un model de chat. Modelele 5.0 elimină complet modelul lingvistic. Ce rămâne este un codor Conformer cu 16 straturi, antrenat cu clasificare temporală conexistă, o schemă de decodare care mapează cadrele audio direct la tokenii de ieșire într-o singură trecere non‑autoregresivă cu decodare lacomă.
Două modificări suplimentare fac cea mai mare parte a diferenței. În timp ce codorii Granite anteriori emiteau 50 de caractere pe secundă, noile modele emit 12,5 tokeni pe secundă, realizat prin trei etape de subeșantionare temporală de 2× de la interfața log‑Mel de 100 de cadre pe secundă. De asemenea, vocabularul de ieșire a trecut de la caractere la 16.384 de unități subcuvânt antrenate, SentencePiece în modelul necomercial și BPE în cel Apache. Un număr mai mic de tokeni, dar mai lungi, la un sfert din rata cadrelor este ceea ce împinge viteza la peste 20 de ori cea a modelelor Granite Speech anterioare, conform IBM.
Compensarea constă în lărgirea capacităților în favoarea concentrării pe transcriere. Fără modelul lingvistic, aceste modele pierd traducerea vocală și orientarea pe cuvinte cheie pe care le susținea versiunea anterioară. Ceea ce câștigă este o amprentă potrivită pentru laptopuri și hardware de tip edge: IBM poziționează perechea pentru recunoaștere vocală în mediul enterprise, unde latența și viteza sunt mai importante decât un model capabil să raționeze și asupra conținutului auzit.
Ce arată și ce nu arată evaluările
Cel mai puternic semnal independent până acum provine din audio de tip far‑field. Pe FFASR Leaderboard, care măsoară recunoașterea vorbirii zgomotoase și reverberante, IBM raportează rezultate oficiale la data de 25 august 2026, plasând modelul necomercial pe locul al cincilea în acuratețe și modelul Apache pe locul al nouălea — în timp ce ambele se clasează ca cele două intrări cele mai rapide pe tablă, cu viteza măsurată pe o singură NVIDIA L4. FFASR evaluează modelele pe audio zgomotos, reverberant și cu sursă în mișcare la multiple niveluri de raport semnal‑zgomot (SNR), condiții în care recunoașterea far‑field se deteriorează, conform descrierii proprii a leaderboard‑ului.
Totuși, cifra de 12.600 RTFx trebuie contextualizată. Este un număr de inferență în loturi pe una dintre cele mai rapide GPU‑uri de centre de date disponibile, nu ceea ce va vedea un laptop care rulează demonstrația de streaming WebGPU. Valorile agregate ale WER acoperă doar engleza de tip scurt, iar clasamentele oficiale ale OpenASR Leaderboard, care includ seturi de testare private, nu integraseră încă noile modele la momentul publicării. Prezentarea IBM este cea sinceră în acest caz: acestea sunt rezultate puternice raportate de furnizor, în așteptarea confirmării de către leaderboard.
Rețeta de antrenament merită, de asemenea, menționată pentru ceea ce spune despre deschiderea datelor. Fiecare set de date din corpusurile ambelor modele este disponibil public, iar cele 2.740 de ore de adăugiri sintetice includ 2.500 de ore de audio cu mai mulți vorbitori, concatenate din segmente cu vorbitor unic, plus 240 de ore de enunțuri generate de modelele open‑weight gpt‑oss ale OpenAI și sintetizate cu StyleTTS2, vizând numerele, monedele și adresele care încurcă recunoașterea. Antrenamentul a durat 10 zile pe 8 GPU‑uri NVIDIA H100 în clusterul Blue Vela al IBM, conform fișei modelului.
Ambele modele sunt disponibile pe Hugging Face în prezent, cu suport nativ în biblioteca transformers — instalat din sursă până la următoarea versiune — în colecția Granite Speech, iar o demonstrație de streaming bazată pe browser rulează în Chrome și Edge. Pentru a înțelege cum se poziționează modelele de transcriere dedicate în raport cu serviciile comerciale, consultați analiza noastră a software‑ului de transcriere AI.












