Модели и платформы ИИ

Microsoft запускает MAI-Transcribe-2-Streaming и две модели MAI-Voice

mm
Добавьте Unite.AI в избранные источники в Google

Microsoft AI 1 октября 2026 года запустила MAI-Transcribe-2-Streaming, свою первую модель потоковой транскрипции, а также две новые модели преобразования текста в речь — MAI-Voice-2.1 и MAI-Voice-2.1-Flash, при этом все три доступны через Microsoft Foundry.

MAI-Transcribe-2-Streaming и бенчмарк Artificial Analysis

Microsoft описывает MAI-Transcribe-2-Streaming как обеспечивающий низкую задержку и транскрипцию в реальном времени на 60 языках с автоматическим непрерывным определением языка. Компания заявила, что модель занимает первое место по точности как для окончательных, так и для частичных транскрипций в Artificial Analysis, и что она находится на границе Парето оценки точность‑против‑задержка бенчмарка, что означает, что более высокая точность не требует значительного увеличения задержки. Диаграмма лидерборда в посте, ссылающаяся на потоковый лидерборд Artificial Analysis от 28 сентября 2026 года, показывает модель с конечным уровнем ошибок слов 2,5 %, уровнем ошибок первых частичных транскрипций 2,8 % и временем 0,13 секунды до окончательной транскрипции.

Вместо того чтобы ждать завершения речи перед выдачей текста, модель генерирует свои первые гипотезы, известные как частичные транскрипции, чуть более чем через 100 мс после получения аудио, а затем корректирует их по мере поступления дополнительного контекста, прежде чем сформировать окончательную транскрипцию. Microsoft заявила, что это позволяет приложениям с поддержкой голоса реагировать на речь ещё до завершения её произнесения: голосовые агенты могут начинать рассуждения или вызывать инструменты в середине предложения, а живые транскрипции могут появляться по мере разговора. Для диктовки и субтитрования в реальном времени компания отметила, что её внутренние оценки показывают, что слова появляются в транскрипции в два раза быстрее, чем у ближайшего конкурента.

Artificial Analysis сообщает, что его индекс AA‑WER Streaming измеряет точность транскрипции для моделей, где аудио передаётся в реальном времени, кусок за куском, на протяжении примерно восьми часов аудио из трёх наборов данных: AA‑AgentTalk — 50 %, VoxPopuli — 25 % и Earnings22 — 25 %. Наборы данных охватывают реальную речь с разнообразными акцентами, отраслевым языком и сложными акустическими условиями, а измерения Time to Final и Time to First Partial в бенчмарке начинаются после окончания речи, обнаруженной детектором голосовой активности SileroVAD.

MAI-Transcribe-2-Streaming доступен по вводной цене $0.54 за час аудио до конца года. Эта модель расширяет аудио‑линейку MAI от Microsoft, в которую уже входит MAI-Transcribe-2, предыдущая модель распознавания речи без потоковой обработки, которую компания позиционировала как самую быструю, точную и дешевую в мире.

MAI-Voice-2.1 и MAI-Voice-2.1-Flash

MAI-Voice-2.1 поддерживает 23 языка и 26 локалей, и Microsoft заявила, что один голос может использовать их все с естественным акцентом, сохраняя идентичность говорящего при переключении языков. В примере компании приложение для репетиторства может менять язык в середине урока без замены учителя, а многоязычный помощник может отвечать на любом языке, на котором к нему обращаются, при этом звуча так же, как один и тот же голос. Стоимость модели составляет $22 за 1 млн символов.

MAI-Voice-2.1-Flash поддерживает те же языки и возможность переключения между языками, но разработан для задач с высоким объёмом и чувствительностью к задержке. Он может генерировать до 45 секунд аудио с конечной задержкой 150 мс, и Microsoft заявила, что обеспечивает инференс модели на 55 % быстрее и примерно на 60 % дешевле, чем сопоставимые модели. Стоимость составляет $15 за 1 млн символов.

Обе голосовые модели поддерживают клонирование голоса на всех поддерживаемых языках, используя несколько секунд референсного аудио, с встроенными механизмами согласия, которые, по словам Microsoft, предотвращают злоупотребления. В тесте Тьюринга с 4 000 слушателями, объединяющем две новые голосовые модели, 50,3 % слушателей оценили MAI-Voice как столь же или более похожий на человеческий, чем реальные человеческие записи, сообщила Microsoft.

Microsoft представила сочетание MAI-Transcribe-2-Streaming и MAI-Voice-2.1-Flash как способ «выкупить» время на обоих концах цикла голосового агента — последовательности прослушивания, понимания, принятия решения и речи в пределах окна, когда человек всё ещё воспринимает взаимодействие как разговор. Среди перечисленных сценариев использования для разработчиков — агенты службы поддержки, которые транскрибируют запросы в режиме реального времени и отвечают естественной речью; многоязычные помощники, которые определяют язык речи и отвечают на любом из 23 поддерживаемых языков MAI-Voice; а также интерактивные обучающие и медиаприложения, использующие разных говорящих для репетиторства, ролевых игр, симуляций, озвучивания и разговорного контента.

Доступность и демонстрация Chatter

MAI-Voice-2.1 и MAI-Voice-2.1-Flash доступны через OpenRouter. Все три модели доступны через Microsoft Foundry, MAI Playground, Vercel и Azure Voice Live, при этом LiveKit указана как скоро появится.

Чтобы продемонстрировать совместную работу моделей в живом агенте, Microsoft создала Chatter, новую демонстрацию в MAI Playground, позволяющую пользователям общаться с голосовым помощником, работающим на основе моделей транскрипции и синтеза речи.

Jonas Reeve является аналитиком, созданным ИИ, в Unite.AI, специализирующимся на когнитивном ИИ, искусственном общем интеллекте (AGI) и теоретических основах машинного интеллекта. Его работа исследует, как обучение, рассуждение, память и абстракция возникают как в биологических, так и в искусственных системах, устанавливая связи между современными архитектурами ИИ и давними вопросами когнитивной науки и философии разума.

Подходя концептуально и рефлексивно, Jonas исследует такие рамки, как модели рассуждения, агентные системы, возникшее познание и теория выравнивания, стремясь прояснить, что на самом деле означает прогресс в направлении AGI — и чего он не означает. Вместо того чтобы гнаться за сроками или ажиотажем, он подчеркивает фундаментальные принципы, концептуальную строгость и ограничения текущих моделей.

Статьи, написанные Jonas Reeve, генерируются ИИ и проверяются редакционной командой Unite.AI, чтобы обеспечить точность, ясность и ответственное обсуждение передовых концепций ИИ.