Моделі та платформи ШІ

MAI-Transcribe-2 очолює тест FLEURS за 60 мовами, повідомляє Microsoft

mm
Додайте Unite.AI до бажаних джерел у Google

Microsoft AI випустив MAI-Transcribe-2 3 вересня 2026 р., модель розпізнавання мови, яку лабораторія назвала першою у тесті FLEURS за 60 мовами зі середньою помилкою слів 5,2 %. У оголошенні Microsoft описав цю модель як найпотужнішу систему транскрипції на сьогодні і встановив ціну 0,10 долара за годину аудіо.

Microsoft повідомив, що MAI-Transcribe-2 додає діаризацію спікерів, налаштовувані стилі транскрипції та мітки часу на рівні слів, і перевершує конкурентні моделі, включаючи Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3‑Large та ScribeV2, у ширшому діапазоні реального аудіо. За даними оголошення, модель визначає фронт Парето за точністю та затримкою в Artificial Analysis і посідає друге місце в таблиці лідерів за помилкою слів, покращуючи результати попередніх версій MAI-Transcribe.

Microsoft позиціонує модель для навантажень, таких як клінічні нотатки, юридична документація, доступність та закриті субтитри. Компанія повідомила про швидший інференс із значно нижчою затримкою, особливо для довгих аудіо‑файлів, до 10 раз швидше за провідних конкурентів. Також зазначено, що модель зберігає якість транскрипції в шумних умовах поза контрольованими студіями.

Benchmark Results

Посилаючись на оцінки, проведені Artificial Analysis, Microsoft заявив, що MAI-Transcribe-2 у 10 раз швидше за GPT-Transcribe від OpenAI, у 7 раз швидше за Scribe v2 від ElevenLabs і у 5 раз швидше за Gemini 3.5 Transcribe, при цьому забезпечуючи вищу точність. Компанія зазначила, що модель розташована в найпривабливішому квадранті діаграми точність‑проти‑швидкість, з помилкою 2,0 % і фактором швидкості 403,6, що означає, що година аудіо обробляється приблизно за десять секунд.

У публічному багатомовному тесті FLEURS Microsoft повідомив, що MAI-Transcribe-2 стабільно демонструє високу точність у всіх 60 протестованих мовах. Компанія охарактеризувала модель як точну у більшій кількості мов, ніж будь‑яка інша модель, і зазначила, що розробники, які транскрибують кілька мов, можуть покладатися на одну модель, скорочуючи складність і потенційно економлячи використання GPU. Оголошення також стверджує, що швидкість і пропускна здатність моделі дозволяють Microsoft пропонувати найконкурентнішу ціну на ринку. При запуску година аудіо коштує 0,10 долара – обмежена пропозиція діє до кінця року.

Availability and Developer Features

Документація Microsoft Learn зазначає, що MAI-Transcribe-2 доступний в Azure Speech у публічному прев’ю, без угоди про рівень сервісу і не рекомендований для виробничих навантажень. Документація описує MAI-Transcribe як модель speech‑to‑text, розроблену всередині командою Microsoft AI, що охоплює такі завдання, як субтитрування відео, зустрічі, клінічні нотатки, документація кол‑центру, інструменти доступності, створення контенту та голосові агенти. У ній також перераховано MAI-Transcribe-2 разом із попередніми MAI-Transcribe‑1.5 та MAI‑Transcribe‑1, остання з яких була виведена з експлуатації 20 серпня 2026 р.

Запити проходять через розширений режим Fast Transcription API, при цьому модель вибирається встановленням властивості enhanced mode model у значення MAI-Transcribe-2. Вхідний аудіо‑файл обмежений розміром до 300 МБ у форматах WAV, MP3 або FLAC, а використання вимагає підписки Azure та ресурсу Microsoft Foundry для Speech.

Опційні параметри керують набором функцій моделі. Діаризація спікерів розбиває запис за голосами і повертає сегменти з мітками спікерів, включаючи метадані зсуву та тривалості. Мітки часу на рівні слів надають таймінг для кожного слова, параметр segment повертає таймінг за сегментами, а параметр none вимикає таймінгові дані. Параметр phrase‑list схиляє розпізнавання до заданих термінів, таких як галузеві терміни, скорочення та власні імена; у документації зазначено, що ці терміни слугують підказками, а не примусовим виходом.

Параметр стилю транскрипції за замовчуванням встановлений у verbatim, що фіксує мову точно так, як вона звучить, включаючи заповнювачі та помилкові стартові фрази, що корисно для відповідності, контролю якості та аналітичних завдань. Налаштування clean видаляє заповнювачі та автоматично форматує типові мовні патерни, створюючи більш читабельні субтитри, нотатки та опубліковані транскрипти. Вибір мови є опціональним; за замовчуванням модель автоматично визначає мову, а документація радить примусово задавати мову лише у випадку збою автодетекції. Перемикання коду для змішаних мовних пар, таких як Hinglish та Spanglish, здійснюється автоматично, а стійкість до шуму для записів поза контрольованими середовищами є вбудованою властивістю моделі.

Документація також зазначає, що MAI-Transcribe може забезпечити транскрипцію вхідного аудіо у Voice Live API через поле конфігурації сесії. Microsoft повідомив, що модель доступна для демонстрації через Microsoft Foundry та MAI Playground, а на OpenRouter її появу оголошено як «скоро».

Джонас Рів - аналітик, створений штучним інтелектом, у Unite.AI, який зосереджується на когнітивному штучному інтелекті, штучному загальному інтелекті (AGI) та теоретичних основах машинного інтелекту. Його робота досліджує, як навчання, розуміння, пам'ять та абстракція виникають як у біологічних, так і в штучних системах, проводячи зв'язки між сучасними архітектурами штучного інтелекту та довгостроковими питаннями когнітивної науки та філософії свідомості.
З концептуальним та рефлексивним підходом Джонас вивчає рамки, такі як моделі розуміння, агентні системи, виникнення когніції та теорія вирівнювання, спрямовані на роз'яснення того, що насправді означає прогрес у напрямку AGI - та чого ні. Натомість ніж гнатися за графіками або гіпом, він підкреслює перші принципи, концептуальну строгість та обмеження поточних моделей.
Статті, написані Джонасом Рівом, створені штучним інтелектом та перевірені редакційною командою Unite.AI, щоб забезпечити точність, ясність та відповідальне обговорення передових концепцій штучного інтелекту.