AI-modeller og plattformer
IBM sier Granite Speech 5.0 transkriberer 3,5 timer med tale på ett sekund

IBM lanserte to kompakte engelske talegjenkjenningsmodeller 25. august 2026, og hevder en transkripsjonshastighet som ingen åpen modell har oppnådd før: mer enn 3,5 timer med tale behandlet på ett sekund. Paaren, Granite Speech 5.0 TurboCTC og en ikke‑kommersielt motpart, har hver kun 470 millioner parametere, og selskapet rapporterer en samlet gjennomstrømning på over 12 600 RTFx på én NVIDIA H200‑GPU, noe som betyr at lyd strømmer gjennom modellene mer enn tolv tusen ganger raskere enn sanntid.
Hastigheten kommer med konkurransedyktig nøyaktighet, i hvert fall etter IBMs tall. På de offentlige engelske kortform‑testsettene i OpenASR Leaderboard får den ikke‑kommersielle varianten en samlet ordfeilrate på 4,85 % og den åpent lisensierte varianten 5,00 %, ifølge IBMs kunngjøring. Begge tallene er leverandørrapporterte: IBM merker dem som uoffisielle, selv om inferensen ble kjørt gjennom Hugging Faces egen jobbinfrastruktur og vurdert med leaderboard‑verktøyet, så selskapet forventer at de vil stemme overens med den offisielle tabellen når den oppdateres.
De to modellene er identiske i størrelse og arkitektur, men varierer i treningsdata og lisens. Apache 2.0‑modellen er trent på omtrent 60 000 timer med engelsk lyd og er godkjent for kommersiell bruk. Den ikke‑kommersielle varianten legger til GigaSpeech og SPGI Speech, omtrent 15 000 ekstra timer, og bringer korpuset nær 75 000 timer under en CC‑BY‑NC‑SA‑4.0‑lisens. IBM sier at de ekstra dataene gir en beskjeden nøyaktighetsfordel på de fleste testsett, med en mer merkbar fordel på SPGI Speech selv og en merkbar ulempe på leaderboardets nye oppdelte Earnings22‑test.
En enkoder uten språkmodell
Hastighetspåstanden hviler på det IBM utelot. Tidligere Granite Speech‑utgivelser (3.3‑ og 4.x‑seriene dokumentert i IBMs Granite Speech paper) festet en Conformer‑akustisk enkoder til en Granite‑språkmodell via en projektor og LoRA‑adaptere, og genererte tekst autoregressivt på samme måte som en chat‑modell. 5.0‑modellene fjerner språkmodellen helt. Det som gjenstår er en 16‑lags Conformer‑enkoder trent med connectionist temporal classification, et dekodingsskjema som kartlegger lydrammer direkte til utgangstoken i ett enkelt ikke‑autoregressivt pass med grådig dekoding.
To ytterligere endringer gjør mesteparten av arbeidet. Hvor tidligere Granite‑enkodere sendte ut 50 tegn per sekund, sender de nye modellene ut 12,5 token per sekund, oppnådd gjennom tre trinn med 2× tidsmessig undersampling fra 100‑rammer‑per‑sekund log‑Mel‑frontenden. I tillegg skiftet utgangsvokabularet fra tegn til 16 384 trente subordsenheter, SentencePiece i den ikke‑kommersielle modellen og BPE i Apache‑modellen. Færre, lengre token ved en fjerdedel av rammehastigheten er det som driver gjennomstrømningen til over 20‑ganger den tidligere Granite Speech‑modellene, ifølge IBM.
Byttet er bredde i funksjonalitet for fokus på transkripsjon. Uten språkmodellen mister disse modellene tale‑oversettelse og nøkkelord‑bias som den tidligere linjen støttet. Det de får er et fotavtrykk som passer for bærbare PC‑er og edge‑maskinvare: IBM posisjonerer paret for bedrifts‑speech‑to‑text hvor latenstid og gjennomstrømning er viktigere enn en modell som også kan resonere om hva den hørte.
Hva evalueringene viser og ikke viser
Det sterkeste uavhengige signalet så langt kommer fra fjernfelt‑audio. På FFASR Leaderboard, som måler gjenkjenning av støyende, reverbererende tale, rapporterer IBM offisielle resultater per 25. august 2026 som plasserer den ikke‑kommersielle modellen på femteplass i nøyaktighet og Apache‑modellen på niende – mens begge rangerer som de to raskeste bidragene på tavlen, med gjennomstrømning målt på én NVIDIA L4. FFASR evaluerer modeller på støyende, reverbererende og bevegelig kilde‑audio ved flere SNR‑nivåer, forhold der fjernfeltgjenkjenning forverres, ifølge leaderboardets egen beskrivelse.
Toppoverskriften på 12 600 RTFx‑tallet trenger kontekst, dog. Det er et tall for batch‑inferens på en av de raskeste datacenters‑GPU‑ene som selges, ikke det en bærbar PC som kjører WebGPU‑streaming‑demoen vil oppleve. De samlede WER‑tallene dekker kun kortform‑engelsk, og OpenASR Leaderboard‑s offisielle rangeringer, som inkluderer private testsett, hadde ennå ikke tatt i bruk de nye modellene ved publisering. IBMs egen ramme er den ærlige her: dette er sterke leverandørrapporterte resultater som venter på bekreftelse fra leaderboardet.
Treningsoppskriften fortjener også oppmerksomhet for hva den sier om datåpenhet. Alle datasett i begge modellers korpus er offentlig tilgjengelige, og de 2 740 timene med syntetiske tillegg består av 2 500 timer med fler‑talende lyd satt sammen fra enkelt‑talende segmenter pluss 240 timer med uttalelser generert av OpenAIs open‑weight gpt‑oss‑modeller og syntetisert med StyleTTS2, rettet mot tall, valutaer og adresser som forvirrer gjenkjennere. Treningen tok 10 dager på 8 NVIDIA H100‑GPU‑er i IBMs Blue Vela‑klynge, ifølge modellkortet.
Begge modellene er nå tilgjengelige på Hugging Face med innebygd støtte i transformers‑biblioteket — installert fra kildekode frem til neste utgivelse — under Granite Speech‑samlingen, og en nettleser‑basert streaming‑demo kjører i Chrome og Edge. For å få en forståelse av hvor dedikerte transkripsjonsmodeller står i forhold til kommersielle tjenester, se vår oversikt over AI transcription software.












