AI-modeller och plattformar

IBM säger att Granite Speech 5.0 transkriberar 3,5 timmars tal på en sekund

mm
Lägg till Unite.AI bland dina föredragna källor på Google

IBM släppte två kompakta engelska taligenkänningsmodeller den 25 augusti 2026 och påstod att transkriptionsgenomströmningen är något som ingen öppen modell tidigare har uppnått: mer än 3,5 timmars tal bearbetat på en enda sekund. Duon, Granite Speech 5.0 TurboCTC och en icke‑kommersiell motsvarighet, har vardera bara 470 miljoner parametrar, och företaget rapporterar en samlad genomströmning på över 12 600 RTFx på ett enda NVIDIA H200‑GPU, vilket innebär att ljudet passerar modellerna mer än tolv tusen gånger snabbare än realtid.

Hastigheten kommer med konkurrenskraftig noggrannhet, åtminstone enligt IBMs siffror. På de offentliga engelska kortformstestsetterna i OpenASR Leaderboard får den icke‑kommersiella varianten en samlad felordsfrekvens på 4,85 % och den öppet licensierade varianten 5,00 %, enligt IBMs tillkännagivande. Båda siffrorna är leverantörsrapporterade: IBM märker dem som inofficiella, även om inferensen kördes via Hugging Faces egna jobb‑infrastruktur och poängsätts med leaderboardens verktyg, så företaget förväntar sig att de kommer att matcha den officiella tabellen när den uppdateras.

De två modellerna är identiska i storlek och arkitektur och skiljer sig åt i träningsdata och licens. Apache 2.0‑modellen är tränad på ungefär 60 000 timmars engelsk ljuddata och är godkänd för kommersiell användning. Icke‑kommersiella varianten lägger till GigaSpeech och SPGI Speech, cirka 15 000 ytterligare timmar, vilket ger ett korpus på nära 75 000 timmar under en CC‑BY‑NC‑SA‑4.0‑licens. IBM säger att den extra datan ger en modest noggrannhetsfördel på de flesta testset, med en mer märkbar fördel på SPGI Speech själv och en tydlig nackdel på leaderboardens nya chunkade Earnings22‑test.

En kodare utan språkmodell

Hastighetsanspråket bygger på det IBM utelämnade. Tidigare Granite Speech‑utgåvor (3.3‑ och 4.x‑serierna som dokumenteras i IBMs Granite Speech‑paper) fäste en Conformer‑akustisk kodare på en Granite‑språkmodell via en projektor och LoRA‑adaptrar, vilket genererade text autoregressivt på samma sätt som en chattmodell. 5.0‑modellerna tar helt bort språkmodellen. Det som återstår är en 16‑lagers Conformer‑kodare tränad med connectionist temporal classification, ett avkodningsschema som mappar ljudramar direkt till utgångstoken i ett enda icke‑autoregressivt pass med girig avkodning.

Två ytterligare förändringar utför det mesta av arbetet. Där tidigare Granite‑kodare producerade 50 tecken per sekund, producerar de nya modellerna 12,5 token per sekund, uppnått genom tre steg av 2× temporär underprovtagning från 100‑ramar‑per‑sekund log‑Mel‑frontänden. Dessutom skiftade utmatningsvokabulären från tecken till 16 384 tränade subordsenheter, SentencePiece i den icke‑kommersiella modellen och BPE i Apache‑modellen. Färre, längre token med en fjärdedel av bildfrekvensen är det som driver genomströmningen till över 20‑ gånger den för de tidigare Granite Speech‑modellerna, enligt IBM.

Avvägningen är bredd i funktionalitet mot fokus på transkription. Utan språkmodellen förlorar dessa modeller talöversättning och nyckelords‑bias som den tidigare versionen stödde. Vad de får är ett fotavtryck som passar bärbara datorer och edge‑hårdvara: IBM placerar duon för företags‑tal‑till‑text där latens och genomströmning är viktigare än en modell som också kan resonera kring vad den hörde.

Vad utvärderingarna visar och inte visar

Det starkaste oberoende signalen hittills kommer från fjärrfält‑ljud. På FFASR Leaderboard, som mäter igenkänning av brusigt, efterklangsrikt tal, rapporterar IBM officiella resultat per den 25 augusti 2026 där den icke‑kommersiella modellen placerar sig femte i noggrannhet och Apache‑modellen nionde — samtidigt som båda är de två snabbaste bidragen på listan, med genomströmning mätt på en enda NVIDIA L4. FFASR utvärderar modeller på brusigt, efterklangsrikt och rörligt källljud vid flera SNR‑nivåer, förhållanden där fjärrfältigenkänning försämras, enligt leaderboardens egen beskrivning.

Rubriktalet 12 600 RTFx kräver dock kontext. Det är ett batch‑inferensvärde på en av de snabbaste datacenter‑GPU‑erna som säljs, inte vad en bärbar dator som kör WebGPU‑strömningsdemo kommer att se. De samlade WER‑siffrorna gäller endast kortform‑engelska, och OpenASR Leaderboards officiella rankningar, som inkluderar privata testset, hade ännu inte integrerat de nya modellerna vid publiceringen. IBMs egen ram är den ärliga här: detta är starka leverantörsrapporterade resultat som väntar på bekräftelse från leaderboarden.

Träningsreceptet förtjänar också uppmärksamhet för vad det säger om datatillgänglighet. Varje dataset i båda modellernas korpus är offentligt tillgängligt, och de 2 740 timmarna av syntetiska tillägg består av 2 500 timmar med flertalar‑ljud sammansatt från enstaka talarsegment plus 240 timmar med uttalanden genererade av OpenAIs öppna vikt‑gpt‑oss‑modeller och syntetiserade med StyleTTS2, inriktade på siffror, valutor och adresser som förvirrar igenkännare. Träningen tog 10 dagar på 8 NVIDIA H100‑GPU:er i IBMs Blue Vela‑kluster, enligt modellkortet.

Båda modellerna finns nu live på Hugging Face med inbyggt stöd i transformers‑biblioteket — installerat från källkod tills nästa version — under Granite Speech‑samlingen, och en webbläsar‑baserad strömningsdemo körs i Chrome och Edge. För en uppfattning om var dedikerade transkriptionsmodeller placerar sig gentemot kommersiella tjänster, se vår sammanställning av AI‑transkriptionsprogramvara.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.