AI-modeller og platforme
IBM siger, at Granite Speech 5.0 transskriberer 3,5 timers tale på ét sekund

IBM udgav to kompakte engelske talegenkendelsesmodeller den 25. august 2026 og hævder en transskriptionsgennemstrømning, som ingen åben model har opnået før: mere end 3,5 timers tale behandlet på ét sekund. Parret, Granite Speech 5.0 TurboCTC og en ikke‑kommerciel pendant, har hver kun 470 millioner parametre, og virksomheden rapporterer en samlet gennemstrømning på over 12.600 RTFx på en enkelt NVIDIA H200 GPU, hvilket betyder, at lyd passerer gennem modellerne mere end tolv tusinde gange hurtigere end realtid.
Hastigheden kommer med konkurrencedygtig nøjagtighed, i hvert fald ifølge IBM:s tal. På de offentlige engelske kortform‑test‑sæt fra OpenASR Leaderboard opnår den ikke‑kommercielle variant en samlet ordfejlrate på 4,85 % og den åbent licenserede variant 5,00 %, ifølge IBM's announcement. Begge tal er leverandør‑rapporterede: IBM betegner dem som uofficielle, selvom inferensen blev kørt gennem Hugging Face's egen job‑infrastruktur og vurderet med leaderboard‑værktøjet, så virksomheden forventer, at de vil svare til den officielle tabel, når den opdateres.
De to modeller er identiske i størrelse og arkitektur og adskiller sig i træningsdata og licens. Apache 2.0‑modellen er trænet på cirka 60.000 timers engelsk lyd og er godkendt til kommerciel brug. Den ikke‑kommercielle variant tilføjer GigaSpeech og SPGI Speech, omkring 15.000 ekstra timer, så dens korpus nærmer sig 75.000 timer under en CC‑BY‑NC‑SA‑4.0‑licens. IBM siger, at de ekstra data giver en beskeden nøjagtighedsfordel på de fleste testsæt, med en mere mærkbar fordel på SPGI Speech selv og en tydelig ulempe på leaderboard‑ens nye chunked Earnings22‑test.
En encoder uden en sprogmodel
Hastigheds‑påstanden hviler på, hvad IBM udelod. Tidligere Granite Speech‑udgivelser (3.3‑ og 4.x‑linjerne dokumenteret i IBM's Granite Speech paper) fastgjorde en Conformer‑akustisk encoder til en Granite‑sprogmodel via en projektor og LoRA‑adaptere, og genererede tekst autoregressivt som en chat‑model gør. 5.0‑modellerne fjerner sprogmodellen fuldstændigt. Det, der er tilbage, er en 16‑lag Conformer‑encoder trænet med connectionist temporal classification, et dekodingsskema der kortlægger lyd‑rammer direkte til output‑tokens i et enkelt ikke‑autoregressivt trin med greedy‑dekodning.
To yderligere ændringer udfører det meste af arbejdet. Hvor tidligere Granite‑encodere udsendte 50 tegn per sekund, udsender de nye modeller 12,5 tokens per sekund, opnået gennem tre trin med 2× tidsmæssig undersampling fra den 100‑frames‑per‑sekund log‑Mel‑front‑end. Og output‑ordforrådet skiftede fra tegn til 16.384 trænede sub‑ord‑enheder, SentencePiece i den ikke‑kommercielle model og BPE i Apache‑modellen. Færre, længere tokens ved en fjerdedel af rammehastigheden er det, der driver gennemstrømningen til over 20‑gange den tidligere Granite Speech‑modellers, ifølge IBM.
Handelen er bredde i funktionalitet til fordel for transskriptionsfokus. Uden sprogmodellen mister disse modeller tale‑oversættelse og nøgleords‑bias fra den tidligere version. Det, de får, er en fodaftryk, der passer til laptops og edge‑hardware: IBM placerer parret til erhvervs‑speech‑to‑text, hvor latenstid og gennemstrømning betyder mere end en model, der også kan ræsonnere om, hvad den hørte.
Hvad evalueringerne viser og ikke viser
Det stærkeste uafhængige signal indtil nu kommer fra fjernfelt‑audio. På FFASR Leaderboard, som måler genkendelse af støjende, efterklangfyldt tale, rapporterer IBM officielle resultater pr. 25. august 2026, hvor den ikke‑kommercielle model placeres som femte i nøjagtighed og Apache‑modellen som niende — mens begge er de to hurtigste indlæg på boardet, med gennemstrømning målt på en enkelt NVIDIA L4. FFASR evaluerer modeller på støjende, efterklangfyldt og bevægende kilde‑audio ved flere SNR‑niveauer, forhold hvor fjernfeltgenkendelse forringes, ifølge leaderboard‑ens egen beskrivelse.
Det fremtrædende tal på 12.600 RTFx kræver dog kontekst. Det er et batch‑inference‑tal på en af de hurtigste datacenter‑GPU’er, der sælges, og ikke hvad en laptop, der kører WebGPU‑streaming‑demoen, vil opleve. De samlede WER‑tal dækker kun kortform‑engelsk, og OpenASR Leaderboard‑ens officielle rangeringer, som inkluderer private testsæt, havde ved udgivelsen endnu ikke integreret de nye modeller. IBM's egen indramning er den ærlige her: dette er stærke leverandør‑rapporterede resultater, der afventer bekræftelse fra leaderboardet.
Trænings‑opskriften fortjener også bemærkning for, hvad den siger om dataåbenhed. Alle datasæt i begge modellernes korpus er offentligt tilgængelige, og de 2.740 timers syntetiske tilføjelser består af 2.500 timers multi‑speaker‑audio sammenkædet fra enkelt‑speaker‑segmenter plus 240 timers udtalelser genereret af OpenAI's open‑weight gpt‑oss‑modeller og syntetiseret med StyleTTS2, målrettet tal, valutaer og adresser, der forvirrer genkendere. Træningen tog 10 dage på 8 NVIDIA H100 GPU’er på IBM's Blue Vela‑klynge, ifølge model‑cardet.
Begge modeller er nu live på Hugging Face med indbygget support i transformers‑biblioteket — installeret fra kilde indtil næste udgivelse — under Granite Speech‑samlingen, og en browser‑baseret streaming‑demo kører i Chrome og Edge. For at få en fornemmelse af, hvor dedikerede transskriptionsmodeller placerer sig i forhold til kommercielle tjenester, se vores oversigt over AI transcription software.












