Моделі та платформи ШІ

IBM стверджує, що Granite Speech 5.0 транскрибуює 3,5 години мови за одну секунду

mm
Додайте Unite.AI до бажаних джерел у Google

IBM випустила два компактних англійських моделі розпізнавання мови 25 серпня 2026 року, заявивши про швидкість транскрипції, якої жодна відкрита модель раніше не досягала: більше 3,5 години аудіо обробляється за одну секунду. Пара моделей — Granite Speech 5.0 TurboCTC та її некомерційний варіант — містить лише 470 мільйонів параметрів, а компанія повідомляє про сумарну пропускну здатність понад 12 600 RTFx на одному GPU NVIDIA H200, що означає, що аудіо проходить через моделі більш ніж дванадцять тисяч разів швидше за реальний час.

Швидкість супроводжується конкурентоспроможною точністю, принаймні за даними IBM. На публічних англійських тестових наборах коротких форм OpenASR Leaderboard некомерційний варіант досяг 4,85 % сумарної помилки слів, а відкрито ліцензований варіант — 5,00 %, згідно оголошення IBM. Обидві цифри подані постачальником: IBM позначає їх як неофіційні, хоча інференс був виконаний через інфраструктуру Hugging Face і оцінений інструментами лідерборду, тому компанія очікує їх збіг із офіційною таблицею після оновлення.

Обидві моделі ідентичні за розміром і архітектурою, відрізняються лише навчальними даними та ліцензією. Модель Apache 2.0 навчена на приблизно 60 000 годин англійського аудіо і дозволена для комерційного використання. Некомерційний варіант додає GigaSpeech та SPGI Speech, ще близько 15 000 годин, що піднімає його корпус майже до 75 000 годин під ліцензією CC‑BY‑NC‑SA‑4.0. IBM стверджує, що додаткові дані забезпечують скромне підвищення точності на більшості тестових наборів, з більш виразною перевагою на SPGI Speech та помітним недоліком у новому тесті Earnings22 з розбитими фрагментами.

Кодер без мовної моделі

Твердження про швидкість базується на тому, що IBM не згадала. Попередні випуски Granite Speech (лінії 3.3 і 4.x, задокументовані у статті про Granite Speech) прикріплювали акустичний кодер Conformer до мовної моделі Granite через проектор і LoRA‑адаптери, генеруючи текст автогенеративно, як це робить чат‑модель. Моделі 5.0 повністю відмовляються від мовної моделі. Залишається 16‑шаровий Conformer‑кодер, навчений за допомогою Connectionist Temporal Classification, схеми декодування, що безпосередньо перетворює аудіофрейми у вихідні токени в одному не‑авторегресивному проході з жадібним декодуванням.

Дві подальші зміни виконують основну частину роботи. У попередніх кодерах Granite генерувалося 50 символів за секунду, нові моделі виводять 12,5 токенів за секунду, досягнуті через три етапи 2‑кратного часових субсемплінгів від 100‑кадрового в секунду лог‑Мел фронтенду. А словник вихідних даних перейшов від символів до 16 384 навчальних субсловних одиниць: SentencePiece у некомерційному варіанті та BPE у варіанті Apache. Менша кількість, довші токени при чверті частоти кадрів — це те, що підштовхує пропускну здатність вище в 20‑кратному порівнянні з попередніми моделями Granite Speech, за словами IBM.

Компроміс полягає у широті можливостей заради фокусування на транскрипції. Без мовної моделі ці моделі втрачають можливість перекладу мови та ключового слова, які підтримували попередні версії. Те, що вони набувають, — це компактний розмір, придатний для ноутбуків та периферійного обладнання; IBM позиціонує цю пару для корпоративного перетворення мови в текст, де важливі затримка та пропускна здатність, а не здатність моделі розмірковувати над почутим.

Що показують оцінки, а що — ні

Найсильніший незалежний сигнал наразі надходить від аудіо далекого поля. На FFASR Leaderboard, який вимірює розпізнавання шумного, ревербераційного мовлення, IBM повідомляє офіційні результати станом на 25 серпня 2026 року: некомерційна модель посідає п’яте місце за точністю, а модель Apache — дев’яте — при цьому обидві є двома найшвидшими учасниками, вимірюючи пропускну здатність на одному GPU NVIDIA L4. FFASR оцінює моделі на шумному, ревербераційному та рухомому джерелі аудіо при різних SNR, умовах, у яких розпізнавання далекого поля погіршується, згідно з описом лідерборду.

Заголовкова цифра 12 600 RTFx потребує контексту. Це показник пакетної інференції на одному з найшвидших дата‑центричних GPU, а не те, що побачить ноутбук, що запускає демонстрацію потокового WebGPU. Сумарні показники WER охоплюють лише короткі англійські форми, а офіційні рейтинги OpenASR Leaderboard, які включають приватні тестові набори, ще не врахували нові моделі на момент публікації. Своє формулювання IBM подає чесно: це сильні результати, повідомлені постачальником, які чекають підтвердження лідербордом.

Рецепт навчання також варто зазначити за його відкритість даних. Кожен набір даних у корпусах обох моделей доступний публічно, а 2 740 годин синтетичних доповнень складаються з 2 500 годин багатоголосого аудіо, склеєного з одноголосих сегментів, плюс 240 годин реплік, згенерованих відкритими моделями gpt‑oss від OpenAI та синтезованих за допомогою StyleTTS2, орієнтованих на числа, валюти та адреси, які часто плутають розпізнавачі. Навчання тривало 10 днів на 8 GPU NVIDIA H100 у кластері IBM Blue Vela, згідно з карткою моделі.

Обидві моделі зараз доступні на Hugging Face з рідною підтримкою у бібліотеці transformers — встановлюються з вихідного коду до наступного випуску — у колекції Granite Speech, а браузерна демонстрація потокової роботи працює в Chrome та Edge. Щоб зрозуміти, де спеціалізовані моделі транскрипції стоять щодо комерційних сервісів, перегляньте наш огляд програмного забезпечення AI‑транскрипції.

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.