Моделі та платформи ШІ
Microsoft запускає MAI-Transcribe-2-Streaming та два MAI-Voice моделі

Microsoft AI 1 жовтня 2026 року запустив MAI-Transcribe-2-Streaming, свою першу модель потокової транскрипції, разом із двома новими моделями текст‑у‑мову, MAI-Voice-2.1 та MAI-Voice-2.1-Flash, причому всі три доступні через Microsoft Foundry.
MAI-Transcribe-2-Streaming і бенчмарк Artificial Analysis
Microsoft описує MAI-Transcribe-2-Streaming як модель, що забезпечує низьколатентні, реальні‑часові транскрипції 60 мовами з автоматичним, безперервним визначенням мови. Компанія заявила, що модель займає перше місце за точністю як для остаточних, так і для часткових транскрипцій у Artificial Analysis, і що вона розташована на фронтирі Парето оцінки точність‑проти‑латентність бенчмарку, що означає, що підвищення точності не вимагає значного збільшення затримки. Діаграма лідерборду у дописі, що посилається на стрім‑лідерборд Artificial Analysis від 28 вересня 2026 року, показує модель з 2,5 % остаточною помилкою слів, 2,8 % помилкою першого часткового транскрипту та 0,13 секунди до остаточної транскрипції.
Замість того, щоб чекати, доки доповідач завершить висловлювання, перед поверненням тексту, модель генерує свої перші гіпотези, відомі як часткові транскрипції, всього за трохи більше 100 мілісекунд після отримання аудіо, а потім коригує їх, коли надходить більше контексту, перед створенням стабільного транскрипту. Microsoft заявила, що це дозволяє застосункам з голосовим інтерфейсом реагувати на мову ще до завершення промови: голосові агенти можуть починати міркувати або викликати інструменти посеред речення, а живі транскрипції можуть з’являтися під час розмови. Для реального‑часового диктування та субтитрування компанія зазначила, що її внутрішні оцінки показують, що слова з’являються у транскрипції вдвічі швидше, ніж у найближчого конкурента.
Artificial Analysis стверджує, що його індекс AA-WER Streaming вимірює точність транскрипції для моделей, у яких аудіо передається в реальному часі, частина за частиною, протягом приблизно восьми годин аудіо з трьох наборів даних: AA-AgentTalk — 50 %, VoxPopuli — 25 %, і Earnings22 — 25 %. Набори даних охоплюють реальну мову з різноманітними акцентами, галузевою специфічною лексикою та складними акустичними умовами, а вимірювання Time to Final та Time to First Partial у бенчмарку обидва починаються з кінця мовлення, визначеного детектором голосової активності SileroVAD.
MAI-Transcribe-2-Streaming доступна за вступною ціною $0.54 за годину аудіо до кінця року. Модель розширює аудіо‑лінійку Microsoft MAI, яка вже включає MAI-Transcribe-2, попередню модель розпізнавання мови без потоковості, яку компанія позиціонувала як найшвидшу, найточнішу та найдешевшу у світі.
MAI-Voice-2.1 та MAI-Voice-2.1-Flash
MAI-Voice-2.1 підтримує 23 мови та 26 локалей, і Microsoft заявила, що один голос може використовувати їх усі з рідним акцентом, зберігаючи ідентичність доповідача при переході між мовами. У прикладі компанії, репетиторський застосунок може переключати мови під час уроку без заміни викладачів, а багатомовний асистент може відповідати будь‑якою мовою, якою до нього звертаються, залишаючись при цьому звучати як той самий голос. Модель оцінюється у $22 за 1 млн символів.
MAI-Voice-2.1-Flash підтримує ті ж мови та крос‑мовних спікерів, проте створена для високих навантажень та чутливих до затримки завдань. Вона може генерувати до 45 секунд аудіо з кінцевою затримкою 150 мілісекунд, і Microsoft заявила, що вона забезпечує інференс моделі на 55 % швидше та приблизно на 60 % дешевше, ніж порівнянні моделі. Її вартість становить $15 за 1 млн символів.
Обидві голосові моделі підтримують клонування голосу для всіх підтримуваних мов, використовуючи кілька секунд референтного аудіо, з вбудованими захисними механізмами згоди, які, за словами Microsoft, запобігають зловживанню. У тесті Тюрінга з 4 000 слухачів, що об’єднав дві нові голосові моделі, 50,3 % слухачів оцінили MAI-Voice як таку ж або більш схожу на людську, ніж людські записи, повідомила Microsoft.
Microsoft представила поєднання MAI-Transcribe-2-Streaming з MAI-Voice-2.1-Flash як спосіб «повернути час» на обох етапах циклу голосового агента — послідовності слухання, розуміння, прийняття рішення та мовлення у вікні, коли людина все ще сприймає взаємодію як розмову. Серед перелічених сценаріїв використання для розробників — агенти служби підтримки, які транскрибують запити в режимі реального часу та відповідають природною мовою, багатомовні асистенти, що визначають мову мовлення та відповідають будь‑якою з 23 підтримуваних мов MAI-Voice, а також інтерактивні навчальні та медіа‑застосунки, що використовують різних спікерів для репетиторства, рольових ігор, симуляцій, озвучення та розмовного контенту.
Доступність та демо Chatter
MAI-Voice-2.1 та MAI-Voice-2.1-Flash доступні через OpenRouter. Усі три моделі доступні через Microsoft Foundry, MAI Playground, Vercel та Azure Voice Live, при цьому LiveKit зазначено як «незабаром».
Щоб продемонструвати спільну роботу моделей у живому агенті, Microsoft створила Chatter, нову демонстрацію в MAI Playground, яка дозволяє користувачам спілкуватися з голосовим асистентом, що працює на базі моделей транскрипції та голосу.












