Модели и платформы ИИ

IBM заявляет, что Granite Speech 5.0 транскрибирует 3,5 часа речи за одну секунду

mm
Добавьте Unite.AI в избранные источники в Google

IBM выпустила два компактных английских распознающих речь модели 25 августа 2026 года, заявив о пропускной способности транскрипции, которой не достигала ни одна открытая модель: более 3,5 часа речи обрабатывается за одну секунду. Пара, Granite Speech 5.0 TurboCTC и её некоммерческий аналог, содержит всего 470 млн параметров, а компания сообщает о совокупной пропускной способности выше 12 600 RTFx на одной видеокарте NVIDIA H200, что означает, что аудио проходит через модели более чем в двенадцать тысяч раз быстрее, чем в реальном времени.

Скорость сопоставима с конкурентной точностью, по крайней мере согласно данным IBM. На публичных английских коротких тестовых наборах OpenASR Leaderboard некоммерческий вариант достигает совокупного уровня ошибок слов 4,85 % и открытая лицензированная версия 5,00 %, согласно анонсу IBM. Оба показателя предоставлены поставщиком: IBM помечает их как неофициальные, хотя вывод был выполнен через инфраструктуру задач Hugging Face и оценён с помощью инструментов лидерборда, поэтому компания ожидает, что они совпадут с официальной таблицей после её обновления.

Обе модели одинаковы по размеру и архитектуре, различаются лишь обучающими данными и лицензией. Модель Apache 2.0 обучалась примерно на 60 000 часов английского аудио и допускает коммерческое использование. Некоммерческий вариант добавляет наборы GigaSpeech и SPGI Speech, около 15 000 дополнительных часов, доводя корпус почти до 75 000 часов под лицензией CC‑BY‑NC‑SA‑4.0. IBM утверждает, что дополнительные данные дают небольшое преимущество в точности на большинстве тестов, более заметное преимущество на SPGI Speech и заметный недостаток на новом фрагментированном тесте Earnings22 лидерборда.

Кодировщик без языковой модели

Утверждение о скорости опирается на то, что IBM опустила. Ранние версии Granite Speech (линии 3.3 и 4.x, описанные в статье Granite Speech) соединяли акустический кодировщик Conformer с языковой моделью Granite через проектор и адаптеры LoRA, генерируя текст автрегрессивно, как делает чат‑модель. Модели 5.0 полностью отказываются от языковой модели. Остаётся 16‑слойный кодировщик Conformer, обученный с помощью Connectionist Temporal Classification, схема декодирования, которая сопоставляет аудио‑кадры напрямую с выходными токенами за один неавторегрессивный проход с жадным декодированием.

Два дополнительных изменения делают большую часть работы. Где предыдущие кодировщики Granite выдавали 50 символов в секунду, новые модели выдают 12,5 токенов в секунду, достигая этого через три стадии 2× временного субдискретизирования от фронтенда log‑Mel с частотой 100 кадров в секунду. Кроме того, словарь вывода переключился с символов на 16 384 обученных субсловных единиц: SentencePiece в некоммерческой модели и BPE в версии Apache. Меньшее, но более длинное токенизирование при четверти частоты кадров и есть то, что, по словам IBM, повышает пропускную способность более чем в 20 раз по сравнению с предыдущими моделями Granite Speech.

Компромисс заключается в широте возможностей в пользу фокуса на транскрипцию. Без языковой модели эти модели теряют возможности перевода речи и смещения по ключевым словам, которые поддерживала предыдущая версия. Что они получают, так это компактный размер, подходящий для ноутбуков и периферийного оборудования: IBM позиционирует эту пару для корпоративных решений «речь‑в‑текст», где важнее низкая задержка и высокая пропускная способность, чем возможность рассуждать о услышанном.

Что показывают и чего не показывают оценки

Самый убедительный независимый показатель пока поступает из аудио дальнего поля. На FFASR Leaderboard, измеряющем распознавание шумного, реверберационного голоса, IBM сообщает официальные результаты по состоянию на 25 августа 2026 года: некоммерческая модель заняла пятое место по точности, а модель Apache — девятое, при этом обе оказались двумя самыми быстрыми записями в таблице, измеренными на одной видеокарте NVIDIA L4. FFASR оценивает модели на шумном, реверберационном и движущемся источнике аудио при различных уровнях SNR, где распознавание в дальнем поле ухудшается, согласно собственному описанию лидерборда.

Однако цифра в 12 600 RTFx требует контекста. Это показатель пакетного вывода на одной из самых быстрых дата‑центрических GPU, а не то, что увидит ноутбук, запускающий демонстрацию потоковой трансляции WebGPU. Совокупные показатели WER охватывают только короткие английские фрагменты, а официальные ранжирования OpenASR Leaderboard, включающие закрытые тестовые наборы, ещё не учли новые модели на момент публикации. Формулировка IBM здесь честна: это сильные результаты, предоставленные поставщиком, которые ждут подтверждения со стороны лидерборда.

Рецепт обучения также заслуживает внимания с точки зрения открытости данных. Каждый набор данных в корпусах обеих моделей публично доступен, а 2 740 часов синтетических добавлений состоят из 2 500 часов многоголосого аудио, полученного склейкой одноголосых сегментов, плюс 240 часов высказываний, сгенерированных открытыми моделями gpt‑oss от OpenAI и синтезированных с помощью StyleTTS2, ориентированных на числа, валюты и адреса, которые часто сбивают распознаватели. Обучение заняло 10 дней на 8 видеокартах NVIDIA H100 в кластере IBM Blue Vela, согласно карточке модели.

Обе модели сейчас доступны на Hugging Face с нативной поддержкой в библиотеке transformers — установленной из исходников до следующего релиза — в коллекции Granite Speech, а браузерная демонстрация потоковой трансляции работает в Chrome и Edge. Чтобы понять, где специализированные модели транскрипции находятся по сравнению с коммерческими сервисами, см. наш обзор программного обеспечения для AI‑транскрипции.

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.