Modely a platformy AI

IBM uvádí, že Granite Speech 5.0 přepisuje 3,5 hodiny řeči během jedné sekundy

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

IBM vydala dva kompaktní modely pro rozpoznávání anglické řeči dne 25. srpna 2026 a tvrdí, že jejich propustnost přepisu převyšuje vše, co doposud zveřejnil jakýkoli otevřený model: více než 3,5 hodiny řeči zpracované během jedné sekundy. Pár, Granite Speech 5.0 TurboCTC a nekomerční protějšek, má jen 470 milionů parametrů a společnost uvádí celkovou propustnost přes 12 600 RTFx na jedné grafické kartě NVIDIA H200, což znamená, že audio prochází modely více než dvanáct tisícikrát rychleji než v reálném čase.

Tato rychlost přichází s konkurenceschopnou přesností, alespoň podle IBM. Na veřejných anglických krátkých testovacích sadách žebříčku OpenASR dosahuje nekomerční varianta celkové chybovosti slov 4,85 % a otevřeně licencovaná varianta 5,00 %, podle oznámení IBM. Obě čísla jsou uváděna výrobcem: IBM je označuje za neoficiální, i když inference proběhla na infrastruktuře Hugging Face a byla vyhodnocena pomocí nástrojů žebříčku, takže společnost očekává, že se po aktualizaci shodnou s oficiální tabulkou.

Oba modely jsou shodné co do velikosti a architektury, liší se však tréninkovými daty a licencí. Model s licencí Apache 2.0 byl natrénován na přibližně 60 000 hodin anglického audia a je schválen pro komerční použití. Nekomerní varianta přidává GigaSpeech a SPGI Speech, což představuje dalších asi 15 000 hodin a přibližuje korpus na téměř 75 000 hodin pod licencí CC‑BY‑NC‑SA‑4.0. IBM uvádí, že tato dodatečná data poskytují mírnou výhodu v přesnosti na většině testovacích sad, s výraznějším přínosem u samotného SPGI Speech a s patrnou nevýhodou u nového segmentovaného testu Earnings22 v žebříčku.

Kodér bez jazykového modelu

Tvrzení o rychlosti spočívá v tom, co IBM vynechala. Dřívější verze Granite Speech (řady 3.3 a 4.x dokumentované v IBM‑ově článku o Granite Speech) připojily akustický kodér Conformer k jazykovému modelu Granite pomocí projektoru a LoRA adaptérů, čímž generovaly text autoregresivně, podobně jako chatovací model. Modely 5.0 zcela odstraňují jazykový model. Zůstává 16‑vrstvý kodér Conformer trénovaný pomocí connectionist temporal classification, dekódovací schéma, které mapuje audio‑rámce přímo na výstupní tokeny v jediném ne‑autoregresivním průchodu s chamtivým dekódováním.

Další dvě změny vykonávají většinu práce. Zatímco předchozí kodéry Granite produkovaly 50 znaků za sekundu, nové modely produkují 12,5 tokenu za sekundu, což je dosaženo třemi stupni 2‑násobného časového podvzorkování z frontendu log‑Mel s 100 rámcemi za sekundu. Navíc se výstupní slovník posunul ze znaků na 16 384 natrénovaných subslovních jednotek, SentencePiece v nekomerčním modelu a BPE v modelu s licencí Apache. Méně, ale delší tokeny při čtvrtinové rychlosti snímání jsou tím, co podle IBM zvyšuje propustnost na více než 20‑násobek oproti dřívějším modelům Granite Speech.

Obchod je mezi šířkou schopností a zaměřením na přepis. Bez jazykového modelu tyto modely ztrácejí schopnost překladu řeči a biasování klíčových slov, které předchozí řada podporovala. Získávají však menší nároky na výpočetní zdroje, vhodné pro notebooky a okrajový hardware: IBM umisťuje tento pár jako řešení pro podnikové převody řeči na text, kde je latence a propustnost důležitější než model, který dokáže také uvažovat o tom, co slyšel.

Co hodnocení ukazují a co neukazují

Nejpevnější nezávislý signál zatím pochází z dálkového zvuku. V žebříčku FFASR, který měří rozpoznávání šumové a reverberantní řeči, IBM uvádí oficiální výsledky k 25. srpnu 2026, kde nekomerční model dosáhl pátého místa v přesnosti a model s licencí Apache devátého — přičemž oba jsou dva nejrychlejší záznamy v žebříčku, s propustností měřenou na jedné grafické kartě NVIDIA L4. FFASR hodnotí modely na šumovém, reverberantním a pohybujícím se zdroji zvuku při různých SNR, podmínkách, při nichž se rozpoznávání na dálku zhoršuje, podle popisu žebříčku.

Hlavní číslo 12 600 RTFx však potřebuje kontext. Jedná se o hodnotu při dávkovém inferencování na jedné z nejrychlejších datových GPU, nikoli o to, co by viděl notebook běžící s ukázkou streamování WebGPU. Celkové hodnoty WER zahrnují pouze krátkou angličtinu a oficiální žebříček OpenASR, který zahrnuje soukromé testovací sady, dosud neabsorboval nové modely při publikaci. IBM zde poskytuje upřímný pohled: jedná se o silné výsledky hlášené výrobcem, které čekají na potvrzení v žebříčku.

Tréninkový postup také zasluhuje zmínku ohledně otevřenosti dat. Každý datový soubor v korpusu obou modelů je veřejně dostupný a 2 740 hodin syntetických doplňků zahrnuje 2 500 hodin vícehláskového audia složeného z jednohlasých segmentů a 240 hodin výroků vygenerovaných modely gpt‑oss s otevřenou vahou od OpenAI a syntetizovaných pomocí StyleTTS2, zaměřených na čísla, měny a adresy, které rozpoznávače zaskočí. Trénink trval 10 dnů na 8 GPU NVIDIA H100 v IBM‑skupině Blue Vela, podle modelové karty.

Oba modely jsou nyní dostupné na Hugging Face s nativní podporou v knihovně transformers — instalováno ze zdrojového kódu až do další verze — v kolekci Granite Speech a ukázka streamování v prohlížeči běží v Chrome i Edge. Pro představu, jak si samostatné modely pro přepis stojí vedle komerčních služeb, si přečtěte náš přehled AI transcription software.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.