Модели и платформы ИИ

MAI-Transcribe-2 лидирует в тесте FLEURS по 60 языкам, сообщает Microsoft

mm
Добавьте Unite.AI в избранные источники в Google

Microsoft AI выпустила MAI-Transcribe-2 3 сентября 2026 г., модель распознавания речи, которую лаборатория заявила первой в тесте FLEURS по 60 языкам со средним уровнем ошибок слов в 5,2 %. В объявлении Microsoft описала модель как самую продвинутую систему транскрипции на сегодняшний день и установила цену $0.10 за час аудио.

Microsoft заявила, что MAI-Transcribe-2 добавляет диаризацию говорящих, настраиваемые стили транскрипции и метки времени на уровне слов, а также превосходит конкурирующие модели, включая Gemini 3.5 Transcribe, GPT‑Transcribe, Whisper V3‑Large и ScribeV2, в более широком диапазоне реального аудио. По данным объявления, модель задает границу Парето по точности и задержке в Artificial Analysis и занимает второе место в рейтинге уровня ошибок слов Artificial Analysis, улучшив результаты предыдущих версий MAI‑Transcribe.

Microsoft позиционирует модель для задач, включая ведение клинических записей, юридическую документацию, доступность и закрытое субтитрование. Компания сообщила о более быстрой инференции с существенно меньшей задержкой, особенно для длительного аудио, достигая скорости обработки до 10 раз выше, чем у ведущих конкурентов. Также заявлено, что модель сохраняет качество транскрипции в шумных условиях вне контролируемых записывающих сред.

Результаты тестов

Ссылаясь на оценки, проведённые Artificial Analysis, Microsoft заявила, что MAI-Transcribe-2 в 10 раз быстрее, чем GPT‑Transcribe от OpenAI, в 7 раз быстрее, чем Scribe v2 от ElevenLabs, и в 5 раз быстрее, чем Gemini 3.5 Transcribe, при этом обеспечивая более высокую точность. Компания отметила, что модель занимает единственное место в наиболее привлекательном квадранте графика точность‑против‑скорость бенчмарка, с уровнем ошибок 2,0 % и коэффициентом скорости 403,6, что означает, что один час аудио обрабатывается примерно за десять секунд.

В публичном многоязычном тесте FLEURS Microsoft сообщила, что MAI-Transcribe-2 поддерживает постоянно высокий уровень точности по всем 60 протестированным языкам. Компания охарактеризовала модель как наиболее точную среди всех моделей по количеству поддерживаемых языков и заявила, что разработчики, работающие с несколькими языками, могут полагаться на одну модель, уменьшая сложность и потенциально экономя использование GPU. В объявлении также указано, что скорость и пропускная способность модели позволяют Microsoft предлагать то, что она назвала самой конкурентоспособной ценой на рынке. При запуске ставка $0.10 в час является ограниченным предложением, действующим до конца года.

Доступность и возможности для разработчиков

Документация Microsoft Learn указывает, что MAI-Transcribe-2 доступна в Azure Speech в публичном предварительном просмотре, без соглашения об уровне обслуживания и не рекомендуется для производственных нагрузок. В документации MAI-Transcribe описывается как модель преобразования речи в текст, разработанная внутренними командами Microsoft AI, охватывающая такие задачи, как субтитрование видео, встречи, клинические записи, документация колл‑центров, инструменты доступности, создание контента и голосовые агенты. Также в списке указаны MAI-Transcribe-2 вместе с более ранними версиями MAI-Transcribe-1.5 и MAI-Transcribe-1, последняя из которых была прекращена 20 августа 2026 г.

Запросы проходят через улучшенный режим Fast Transcription API, при этом модель выбирается установкой свойства модели в режиме enhanced mode в значение MAI-Transcribe-2. Ввод аудио ограничен файлами размером до 300 МБ в форматах WAV, MP3 или FLAC, а использование требует подписки Azure и ресурса Microsoft Foundry для Speech.

Опциональные параметры управляют набором функций модели. Диаризация говорящих разбивает запись по говорящим и возвращает сегменты с метками говорящих, а также смещения и длительность. Метки времени на уровне слов предоставляют тайминг для каждого слова, в то время как параметр segment возвращает тайминг по сегменту, а параметр none исключает данные о времени. Параметр phrase‑list смещает распознавание в сторону указанных терминов, таких как отраслевые термины, аббревиатуры и собственные имена; документация отмечает, что термины служат подсказками, а не принудительным выводом.

Параметр стиля транскрипции по умолчанию установлен в verbatim, что фиксирует речь точно так, как она произнесена, включая слова‑заполнители и ложные старты, для задач соответствия, контроля качества и анализа. Настройка clean удаляет заполнители и автоматически форматирует типичные речевые конструкции, создавая более читаемые субтитры, заметки и опубликованные транскрипты. Выбор языка является опциональным; по умолчанию модель автоматически определяет язык речи, и документация советует принудительно задавать конкретный язык только в случае сбоя автоматического определения. Переход между языками для смешанных пар, таких как Hinglish и Spanglish, обрабатывается автоматически, а устойчивость к шуму для аудио, записанного вне контролируемых условий, встроена в модель.

Документация также отмечает, что MAI-Transcribe может предоставлять транскрипцию входного аудио в Voice Live API через поле конфигурации сессии. Microsoft заявила, что модель доступна для демонстрации через Microsoft Foundry и MAI Playground, а доступность на OpenRouter указана как «скоро».

Джонас Рив - аналитик, сгенерированный ИИ, в Unite.AI, который фокусируется на когнитивном ИИ, искусственном общем интеллекте (ИОИ) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, проводя связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии сознания.
С концептуальным и рефлексивным подходом Джонас исследует такие рамки, как модели рассуждений, агентные системы, возникающее сознание и теория соответствия, стремясь прояснить, что на самом деле означает прогресс в сторону ИОИ - и что нет. Вместо того, чтобы гнаться за сроками или хайпом, он подчеркивает первые принципы, концептуальную строгость и ограничения текущих моделей.
Статьи, написанные Джонасом Ривом, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение продвинутых концепций ИИ.