AI-mallit ja alustat
IBM:n mukaan Granite Speech 5.0 transkriboi 3,5 tuntia puhetta yhdessä sekunnissa

IBM julkaisi kaksi kompaktia englanninkielistä puheentunnistusmallia 25. elokuuta 2026 väittäen transkription läpivientinopeutta, jota mikään avoin malli ei ole ennen saavuttanut: yli 3,5 tuntia puhetta käsiteltynä yhdessä sekunnissa. Mallipari, Granite Speech 5.0 TurboCTC ja sen ei‑kaupallinen vastine, sisältää vain 470 miljoonaa parametria, ja yritys raportoi yhteenlasketun läpiviennin olevan yli 12 600 RTFx yhdellä NVIDIA H200‑GPU:lla, mikä tarkoittaa, että ääni kulkee mallien läpi yli kaksitoista tuhatta kertaa nopeammin kuin reaaliaikaisesti.
Nopeus tulee kilpailukykyisen tarkkuuden kanssa, ainakin IBM:n omien lukujen mukaan. Julkisilla englanninkielisillä lyhytmuotoisilla testijoukoilla OpenASR Leaderboard ei‑kaupallinen versio saavuttaa 4,85 % kokonaisvirheprosentin ja avoimesti lisensoitu versio 5,00 %, IBM:n ilmoituksen mukaan. Molemmat luvut ovat toimittajalta raportoituja: IBM merkitsee ne epävirallisiksi, vaikka inferenssi ajettiin Hugging Face:n omassa jobs‑infrastruktuurissa ja pisteytys tehtiin leaderboardin työkalulla, joten yritys odottaa niiden vastaavan virallista taulukkoa päivitettäessä.
Kaksi mallia ovat kooltaan ja arkkitehtuuriltaan identtisiä, mutta eroavat koulutusdatassa ja lisenssissä. Apache 2.0 -malli on koulutettu noin 60 000 tunnin englanninkielisellä äänidatalla ja se on hyväksytty kaupalliseen käyttöön. Ei‑kaupallinen versio lisää GigaSpeech- ja SPGI Speech -aineistoja, noin 15 000 lisätuntia, jolloin sen korpus lähestyy 75 000 tuntia CC‑BY‑NC‑SA‑4.0 -lisenssin alla. IBM:n mukaan lisädatasetti tuo pienen tarkkuusetumatuksen useimmissa testijoukoissa, huomattavampi etu SPGI Speech -aineistossa ja selkeä haitta leaderboardin uudessa pilkottavassa Earnings22‑testissä.
Enkooderi ilman kielimallia
Nopeusväite perustuu siihen, mitä IBM jätti pois. Aikaisemmat Granite Speech -julkaisut (versiot 3.3 ja 4.x, jotka on dokumentoitu IBM:n Granite Speech -paperissa) liittivät Conformer‑akustisen enkooderin Granite‑kielimalliin projektorin ja LoRA‑adapterien avulla, tuottaen tekstiä autoregressiivisesti kuten keskustelumalli. Versioissa 5.0 kielimalli poistetaan kokonaan. Jäljelle jää 16‑kerroksinen Conformer‑enkooderi, joka on koulutettu yhteyksellinen‑aikaluokittelulla (CTC), ja dekoodausmenetelmä, joka kartoittaa äänikehykset suoraan lähtötokeniksi yhdessä ei‑autoregressiivisessa läpivaiheessa ahneella dekoodauksella.
Kaksi muuta muutosta tekevät suurimman osan työstä. Aikaisemmissa Granite‑enkoodereissa tuotettiin 50 merkkiä sekunnissa, kun taas uudet mallit tuottavat 12,5 tokenia sekunnissa, mikä saavutetaan kolmessa 2‑kerran aikapudotuksen vaiheessa 100‑kehyksen‑sekunnissa log‑Mel‑etuprosessorista. Lisäksi lähtösanasto siirtyi merkeistä 16 384:een koulutettuun alisanojen yksikköön: SentencePiece ei‑kaupallisessa mallissa ja BPE Apache‑mallissa. Vähemmän, pidempiä tokenia neljänneksen kehyksitiheydellä on se, mikä nostaa läpiviennin yli 20‑kertaiseksi aikaisempien Granite Speech -mallien verrattuna IBM:n mukaan.
Vaihto on kyvykkyyden laajuus transkriptiokeskeisyyteen. Ilman kielimallia nämä mallit menettävät puheen käännöksen ja avainsanojen painotuksen, joita aikaisempi versio tuki. Saavuttavat ne kuitenkin pienemmän jalanjäljen, joka sopii kannettaville tietokoneille ja reunalaitteille: IBM asemoi parin yritysten puhe‑tekstiksi, jossa latenssi ja läpivienti ovat tärkeämpiä kuin malli, joka pystyy myös pohtimaan kuulemaansa.
Mitä arvioinnit näyttävät ja mitä ne eivät näytä
Vahvin itsenäinen signaali tähän mennessä tulee kaukokenttä‑äänestä. FFASR Leaderboard mittaa meluisan, kaikuavan puheen tunnistamista, ja IBM raportoi virallisista tuloksista 25. elokuuta 2026, joissa ei‑kaupallinen malli sijoittui viidenneksi tarkkuudessa ja Apache‑malli yhdeksänneksi — vaikka molemmat ovat kaksi nopeinta merkintää taululla, läpivienti mitattu yhdellä NVIDIA L4:lla. FFASR arvioi malleja meluisassa, kaikuavassa ja liikkuvan lähteen äänessä useilla SNR‑tasolla, olosuhteissa joissa kaukokenttä‑tunnistus heikkenee leaderboardin oman kuvauksen mukaan.
Otsikkoluku 12 600 RTFx vaatii kuitenkin kontekstin. Se on eräajoinference‑luku yhdellä nopeimmista datakeskus‑GPU:ista, eikä se vastaa sitä, mitä kannettava tietokone, joka ajaa WebGPU‑suoratoistodemoa, näkee. Yhteensä WER‑luvut kattavat vain lyhytmuotoisen englannin, ja OpenASR Leaderboardin viralliset sijoitukset, jotka sisältävät yksityisiä testijoukkoja, eivät olleet vielä sisällyttäneet uusia malleja julkaisuajankohtana. IBM:n oma esitys on rehellinen: nämä ovat vahvoja toimittajalta raportoituja tuloksia, jotka odottavat leaderboard‑vahvistusta.
Koulutusresepti ansaitsee myös huomion avoimuuden osalta. Kaikki molempien mallien korpuksissa käytetyt datasetit ovat julkisesti saatavilla, ja 2 740 tuntia synteettisiä lisäyksiä koostuvat 2 500 tunnista monipuheista ääntä, joka on yhdistetty yksipuheisista segmenteistä, sekä 240 tunnista lausumia, jotka on generoitu OpenAI:n avoimen painon gpt-oss -malleilla ja synteettisesti tuotettu StyleTTS2:lla, kohdistuen numeroihin, valuuttoihin ja osoitteisiin, jotka hämmentävät tunnistimia. Koulutus kesti 10 päivää 8 NVIDIA H100 -GPU:ssa IBM:n Blue Vela -klusterissa, mallikortin mukaan.
Molemmat mallit ovat nyt saatavilla Hugging Facessa natiivituella tuella transformers‑kirjastossa — asennettu lähdekoodista seuraavaan julkaisuun asti — Granite Speech -kokoelman alla, ja selainpohjainen suoratoistodemo toimii Chrome‑ ja Edge‑selaimissa. Saadaksesi käsityksen siitä, miten omistautuneet transkriptio‑mallit sijoittuvat kaupallisiin palveluihin, katso yhteenvetomme AI transcription software.












