Model dan platform AI
IBM Katakan Granite Speech 5.0 Mentranskripsi 3,5 Jam Suara dalam Satu Detik

IBM merilis dua model pengenalan suara bahasa Inggris yang kompak pada 25 Agustus 2026, mengklaim kecepatan transkripsi yang belum pernah dicapai model terbuka sebelumnya: lebih dari 3,5 jam suara diproses dalam satu detik. Kedua model, Granite Speech 5.0 TurboCTC dan varian nonkomersialnya, masing‑masing hanya memiliki 470 juta parameter, dan perusahaan melaporkan total kecepatan di atas 12.600 RTFx pada satu GPU NVIDIA H200, artinya audio mengalir melalui model lebih dari dua belas ribu kali lebih cepat daripada kecepatan waktu nyata.
Kecepatan ini disertai akurasi yang kompetitif, setidaknya menurut angka IBM. Pada set tes bahasa Inggris format pendek publik OpenASR Leaderboard, varian nonkomersial mencatat tingkat kesalahan kata (WER) agregat 4,85 % dan varian berlisensi terbuka 5,00 %, menurut pengumuman IBM. Kedua angka tersebut dilaporkan vendor: IBM menyebutnya tidak resmi, meskipun inferensi dijalankan melalui infrastruktur pekerjaan Hugging Face dan dihitung dengan alat leaderboard, sehingga perusahaan mengharapkan angka tersebut akan cocok dengan tabel resmi setelah pembaruan.
Dua model tersebut identik dalam ukuran dan arsitektur, berbeda pada data pelatihan dan lisensi. Model Apache 2.0 dilatih dengan kira‑kira 60.000 jam audio bahasa Inggris dan diizinkan untuk penggunaan komersial. Varian nonkomersial menambahkan GigaSpeech dan SPGI Speech, sekitar 15.000 jam tambahan, sehingga korpusnya mendekati 75.000 jam di bawah lisensi CC-BY-NC-SA-4.0. IBM menyatakan data tambahan tersebut memberikan keunggulan akurasi yang modest pada kebanyakan set tes, dengan keunggulan lebih jelas pada SPGI Speech itu sendiri dan kerugian yang terasa pada tes Earnings22 berpotongan baru di leaderboard.
Encoder Tanpa Model Bahasa
Klaim kecepatan ini bergantung pada apa yang tidak disertakan IBM. Rilis Granite Speech sebelumnya (seri 3.3 dan 4.x yang didokumentasikan dalam makalah Granite Speech IBM) menambahkan encoder akustik Conformer ke model bahasa Granite melalui proyektor dan adaptor LoRA, menghasilkan teks secara autoregresif seperti model percakapan. Model 5.0 menghilangkan model bahasa sepenuhnya. Yang tersisa adalah encoder Conformer 16‑lapis yang dilatih dengan Connectionist Temporal Classification, sebuah skema decoding yang memetakan bingkai audio langsung ke token output dalam satu lintasan non‑autoregresif dengan decoding rakus.
Dua perubahan lebih lanjut melakukan sebagian besar pekerjaan. Pada encoder Granite sebelumnya menghasilkan 50 karakter per detik, model baru menghasilkan 12,5 token per detik, dicapai melalui tiga tahap subsampling temporal 2× dari front‑end log‑Mel 100‑frame‑per‑detik. Dan kosakata output beralih dari karakter ke 16.384 unit sub‑kata yang dilatih, SentencePiece pada model nonkomersial dan BPE pada model Apache. Token yang lebih sedikit namun lebih panjang pada seperempat laju bingkai inilah yang mendorong throughput melewati 20× model Granite Speech sebelumnya, menurut IBM.
Pertukaran yang terjadi adalah ruang kemampuan untuk fokus pada transkripsi. Tanpa model bahasa, model ini kehilangan kemampuan terjemahan suara dan bias kata kunci yang didukung oleh lini sebelumnya. Apa yang mereka dapatkan adalah jejak memori yang cocok untuk laptop dan perangkat edge: IBM menempatkan pasangan ini untuk solusi speech‑to‑text perusahaan di mana latensi dan throughput lebih penting daripada model yang juga dapat menalar apa yang didengarnya.
Apa yang Ditunjukkan dan Tidak Ditunjukkan oleh Evaluasi
Sinyal independen terkuat sejauh ini datang dari audio jarak jauh. Pada FFASR Leaderboard, yang mengukur pengenalan suara berisik, bergaung, dan bergerak, IBM melaporkan hasil resmi per 25 Agustus 2026 menempatkan model nonkomersial pada peringkat kelima dalam akurasi dan model Apache pada peringkat kesembilan — sementara keduanya menjadi dua entri tercepat di papan, dengan throughput diukur pada satu NVIDIA L4. FFASR mengevaluasi model pada audio berisik, bergaung, dan sumber bergerak pada berbagai SNR, kondisi di mana pengenalan jarak jauh menurun, menurut deskripsi leaderboard itu sendiri.
Angka headline 12.600 RTFx memerlukan konteks. Itu adalah angka inferensi batch pada salah satu GPU data center tercepat yang dijual, bukan apa yang akan dilihat laptop yang menjalankan demo streaming WebGPU. Angka WER agregat hanya mencakup bahasa Inggris format pendek, dan peringkat resmi OpenASR Leaderboard, yang mencakup set tes privat, belum menyerap model baru pada saat publikasi. Penjabaran IBM sendiri adalah yang paling jujur di sini: ini adalah hasil vendor yang kuat menunggu konfirmasi leaderboard.
Resep pelatihan juga patut dicatat terkait keterbukaan data. Setiap dataset dalam korpus kedua model tersedia secara publik, dan 2.740 jam tambahan sintetis terdiri dari 2.500 jam audio multi‑pembicara yang digabungkan dari segmen satu‑pembicara plus 240 jam ujaran yang dihasilkan oleh model gpt‑oss OpenAI dengan bobot terbuka dan disintesis menggunakan StyleTTS2, menargetkan angka, mata uang, dan alamat yang biasanya membingungkan pengenalan. Pelatihan memakan waktu 10 hari pada 8 GPU NVIDIA H100 di klaster Blue Vela milik IBM, menurut kartu model.
Kedua model kini tersedia di Hugging Face dengan dukungan native di perpustakaan transformers — diinstal dari sumber hingga rilis berikutnya — di bawah koleksi Granite Speech, dan demo streaming berbasis browser berjalan di Chrome dan Edge. Untuk memahami posisi model transkripsi khusus dibandingkan layanan komersial, lihat rangkuman kami tentang perangkat lunak transkripsi AI.












