Yapay zeka modelleri ve platformları

IBM, Granite Speech 5.0’ın Bir Saniyede 3,5 Saat Konuşmayı Transkribe Ettiğini Duyurdu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

IBM, 25 Ağustos 2026’da iki kompakt İngilizce konuşma tanıma modeli yayınladı ve transkripsiyon verimliliğinin daha önce hiçbir açık modelin elde edemediğini iddia ediyor: tek bir saniyede 3,5 saatten fazla konuşmanın işlenmesi. Bu ikili, Granite Speech 5.0 TurboCTC ve ticari olmayan bir karşılığı, her biri yalnızca 470 milyon parametre içeriyor ve şirket, tek bir NVIDIA H200 GPU üzerinde toplam verimliliğin 12 600 RTFx’in üzerinde olduğunu bildiriyor; bu, sesin modellere gerçek zamandan on iki bin kat daha hızlı aktığı anlamına geliyor.

Bu hız, en azından IBM’in verilerine göre rekabetçi bir doğrulukla birlikte geliyor. OpenASR Leaderboard’un kamuya açık İngilizce kısa biçimli test setlerinde, ticari olmayan varyant %4,85 toplam kelime hata oranı, açık lisanslı varyant ise %5,00 puan alıyor; bu IBM duyurusuna göre. Her iki oran da satıcı tarafından raporlanmış; IBM bunları resmi olmayan olarak etiketliyor, ancak çıkarım Hugging Face’in kendi iş altyapısı üzerinden çalıştırıldı ve lider tablonun araçlarıyla puanlandı, bu yüzden şirket, tablo güncellendiğinde resmi tabloyla eşleşmesini bekliyor.

İki model boyut ve mimari olarak aynı olup, eğitim verisi ve lisans açısından farklılık gösterir. Apache 2.0 modeli, yaklaşık 60 000 saatlik İngilizce ses üzerinde eğitilmiş ve ticari kullanım için onaylanmıştır. Ticari olmayan varyant ise GigaSpeech ve SPGI Speech’i ekleyerek yaklaşık 15 000 saat daha eklemiş, böylece veri kümesini CC-BY-NC-SA-4.0 lisansı altında yaklaşık 75 000 saate çıkarmıştır. IBM, ek verinin çoğu test setinde mütevazı bir doğruluk avantajı sağladığını, SPGI Speech üzerinde daha belirgin bir üstünlük ve lider tablonun yeni bölünmüş Earnings22 testinde ise belirgin bir dezavantaj oluşturduğunu belirtiyor.

Bir Dil Modeli Olmadan Kodlayıcı

Hız iddiası, IBM’in dışarıda bıraktığı şeylere dayanıyor. Önceki Granite Speech sürümleri (IBM’in Granite Speech makalesinde belgelenen 3.3 ve 4.x serileri), bir projeksiyon cihazı ve LoRA adaptörleri aracılığıyla bir Conformer akustik kodlayıcıyı Granite dil modeline bağlayarak, sohbet modelinin yaptığı gibi metni özyinelemeli olarak üretiyordu. 5.0 modelleri ise dil modelini tamamen bırakıyor. Geriye, bağlantısal zamansal sınıflandırma ile eğitilmiş 16 katmanlı bir Conformer kodlayıcı kalıyor; bu, ses çerçevelerini tek bir özyinelemeli olmayan geçişte, açgözlü çözümlenme ile doğrudan çıktı token’larına eşleyen bir kod çözme şemasıdır.

İki ek değişiklik ise işin çoğunu yapıyor. Önceki Granite kodlayıcıları saniyede 50 karakter üretirken, yeni modeller saniyede 12,5 token üretiyor; bu, 100 kare/saniye log-Mel ön ucundan 2 kat zamansal alt örnekleme yapılan üç aşama ile elde ediliyor. Ayrıca çıktı sözlüğü karakterlerden 16 384 eğitilmiş alt kelime birimine, ticari olmayan modelde SentencePiece, Apache modelinde ise BPE’ye kaydı. Çerçeve hızının dörtte biri olan daha az ama daha uzun token’lar, IBM’in hesabına göre, önceki Granite Speech modellerinin verimliliğini 20 katın üzerine çıkarıyor.

Takas, kapsamlı yetenekleri transkripsiyon odaklı bir yapıya dönüştürmek. Dil modeli olmadan, bu modeller önceki sürümün desteklediği konuşma çevirisi ve anahtar kelime önyargısını kaybediyor. Kazandıkları ise dizüstü bilgisayarlar ve uç donanım için uygun bir ayak izi; IBM, bu ikiliyi gecikme ve verimliliğin, duyulanı yorumlayabilen bir modelden daha önemli olduğu kurumsal konuşmadan metne senaryoları için konumlandırıyor.

Değerlendirmelerin Ne Gösterdiği ve Ne Gösteremediği

Şimdiye kadar en güçlü bağımsız sinyal, uzaktan alan sesinden geliyor. Gürültülü ve yankılı konuşma tanımasını ölçen FFASR Leaderboard’da, IBM 25 Ağustos 2026 itibarıyla resmi sonuçları raporlayarak ticari olmayan modelin doğrulukta beşinci, Apache modelin ise dokuzuncu sırada olduğunu belirtiyor — her iki model de tek bir NVIDIA L4 üzerinde ölçülen verimlilikle tablodaki iki en hızlı giriş olarak yer alıyor. FFASR, lider tablonun kendi açıklamasına göre, birden çok SNR’de gürültülü, yankılı ve hareketli kaynaklı sesleri değerlendiriyor; bu koşullarda uzaktan alan tanıması azalıyor.

Ancak başlıkta belirtilen 12 600 RTFx rakamının bağlamı da gerekir. Bu, satılan en hızlı veri merkezi GPU’larından birinde toplu çıkarım sayısıdır; WebGPU akış demosunu çalışan bir dizüstü bilgisayarın göreceği değer değildir. Toplam WER oranları yalnızca kısa biçimli İngilizceyi kapsar ve OpenASR Leaderboard’un özel test setlerini de içeren resmi sıralamaları, yayın anında yeni modelleri henüz dahil etmemişti. IBM’in kendi çerçevesi burada dürüst: bunlar, lider tablo onayı bekleyen güçlü satıcı raporlu sonuçlardır.

Eğitim tarifine, veri açıklığı açısından ne söylediği de not edilmeli. Her iki modelin veri kümelerindeki tüm veri setleri kamuya açıktır ve 2 740 saatlik sentetik eklemeler, tek konuşmacı segmentlerinden birleştirilmiş 2 500 saatlik çok konuşmacılı ses ve OpenAI’nin açık ağırlıklı gpt-oss modelleriyle oluşturulup StyleTTS2 ile sentezlenen 240 saatlik ifadelerden oluşur; bu ifadeler tanıyıcıları zorlayan sayı, para birimi ve adresleri hedef alır. Eğitim, model kartına göre IBM’in Blue Vela kümesinde 8 NVIDIA H100 GPU üzerinde 10 gün sürmüştür.

Her iki model de şu anda Hugging Face’te, Granite Speech koleksiyonu altında, transformers kütüphanesinde yerel destekle — bir sonraki sürüme kadar kaynak kodundan kurularak — yayındadır ve tarayıcı tabanlı bir akış demosu Chrome ve Edge’de çalışmaktadır. Özel transkripsiyon modellerinin ticari hizmetlere kıyasla nerede konumlandığını görmek için AI transcription software konulu derlememize bakın.

Jonas Reeve bilişsel AI, yapay genel zeka (AGI) ve makine zekasının teorik temelleri üzerine odaklanan Unite.AI'de AI tarafından oluşturulan bir analisttir. Çalışmaları, öğrenme, akıl yürütme, bellek ve soyutlama gibi kavramların hem biyolojik hem de yapay sistemlerde nasıl ortaya çıktığını keşfederek, modern AI mimarileri ile bilişsel bilim ve zihin felsefesindeki uzun süredir devam eden sorular arasında bağlantılar kurar.
Kavramsal ve düşünceli bir yaklaşım benimseyen Jonas, akıl yürütme modelleri, ajan sistemleri, ortaya çıkan biliş ve hizalama teorisi gibi çerçeveleri inceleyerek, AGI'ye doğru ilerlemenin ne anlama geldiğini - ve ne anlamadığını - açıklamayı amaçlar. Zaman çizelgesi veya hırs peşinde koşmak yerine, ilk ilkeleri, kavramsal titizliği ve mevcut modellerin sınırlarını vurgular.
Jonas Reeve tarafından yazılan makaleler AI tarafından oluşturulur ve Unite.AI'nin editör ekibi tarafından advanced AI kavramlarının doğruluğu, açıklığı ve sorumlu tartışması için gözden geçirilir.