Modele i platformy AI
MAI-Transcribe-2 zdobywa pierwsze miejsce w benchmarku FLEURS w 60 językach, twierdzi Microsoft

Microsoft AI wydało MAI-Transcribe-2 3 września 2026 r., model rozpoznawania mowy, który według laboratorium zajmuje pierwsze miejsce w benchmarku FLEURS w 60 językach, osiągając średni wskaźnik błędów słów na poziomie 5,2 %. W ogłoszeniu Microsoft opisał model jako najpotężniejszy dotychczasowy system transkrypcji i wycenił go na 0,10 $ za godzinę audio.
Microsoft poinformowało, że MAI-Transcribe-2 dodaje diarozję mówcy, konfigurowalne style transkrypcji oraz znaczniki czasowe na poziomie słowa, i przewyższa konkurencyjne modele, w tym Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3‑Large oraz ScribeV2, w szerszym zakresie rzeczywistych nagrań audio. Według ogłoszenia model wyznacza granicę Pareto pod względem dokładności i opóźnienia w Artificial Analysis oraz zajmuje drugie miejsce w rankingu wskaźnika błędów słów Artificial Analysis, poprawiając wyniki wcześniejszych wersji MAI-Transcribe.
Microsoft przeznaczyło model do obciążeń takich jak tworzenie notatek klinicznych, dokumentacja prawna, dostępność oraz napisy zamknięte. Firma poinformowała o szybszym wnioskowaniu przy znacznie niższym opóźnieniu, szczególnie w przypadku długich nagrań audio, osiągając nawet 10‑krotność prędkości przetwarzania wiodących konkurentów. Dodano również, że model utrzymuje jakość transkrypcji w hałaśliwych warunkach poza kontrolowanymi środowiskami nagraniowymi.
Wyniki benchmarku
Cytując oceny przeprowadzone przez Artificial Analysis, Microsoft stwierdziło, że MAI-Transcribe-2 jest 10‑krotnie szybszy niż GPT-Transcribe firmy OpenAI, 7‑krotnie szybszy niż Scribe v2 firmy ElevenLabs oraz 5‑krotnie szybszy niż Gemini 3.5 Transcribe, przy jednoczesnym zapewnieniu wyższej dokładności. Firma podkreśliła, że model znajduje się sam w najbardziej atrakcyjnym kwadrancie wykresu dokładność‑prędkość benchmarku, z wskaźnikiem błędów 2,0 % i współczynnikiem prędkości 403,6, co oznacza, że godzina audio przetwarzana jest w około dziesięć sekund.
W publicznym, wielojęzycznym benchmarku FLEURS Microsoft poinformowało, że MAI-Transcribe-2 utrzymuje konsekwentnie wysoki poziom dokładności we wszystkich 60 testowanych językach. Firma opisała model jako dokładny w większej liczbie języków niż jakikolwiek inny model i zaznaczyła, że programiści transkrybujący w wielu językach mogą polegać na jednym modelu, co redukuje złożoność i potencjalnie oszczędza zużycie GPU. Ogłoszenie podkreśla również, że prędkość i przepustowość modelu pozwalają Microsoftowi zaoferować to, co nazwano najkonkurencyjniejszą ceną na rynku. Przy uruchomieniu stawka 0,10 $ za godzinę jest ofertą czasowo ograniczoną, obowiązującą do końca roku.
Dostępność i funkcje dla deweloperów
Dokumentacja Microsoft Learn wymienia MAI-Transcribe-2 jako dostępny w Azure Speech w publicznej wersji podglądowej, bez umowy SLA i niezalecany do obciążeń produkcyjnych. Dokumentacja opisuje MAI-Transcribe jako model zamiany mowy na tekst opracowany wewnętrznie przez zespół Microsoft AI, obejmujący obciążenia takie jak napisy wideo, spotkania, notatki kliniczne, dokumentacja call center, narzędzia dostępności, tworzenie treści oraz agenci głosowi. Wymienia również MAI-Transcribe-2 obok wcześniejszych MAI-Transcribe-1.5 i MAI-Transcribe-1, przy czym ten ostatni został wycofany 20 sierpnia 2026 r.
Żądania są kierowane przez tryb rozszerzony Fast Transcription API, przy czym model wybiera się ustawiając właściwość modelu trybu rozszerzonego na MAI-Transcribe-2. Wejście audio jest ograniczone do plików poniżej 300 MB w formacie WAV, MP3 lub FLAC, a korzystanie wymaga subskrypcji Azure oraz zasobu Microsoft Foundry dla usługi Speech.
Opcjonalne parametry sterują zestawem funkcji modelu. Diarozja mówcy segmentuje nagranie według mówcy i zwraca segmenty oznaczone etykietą mówcy wraz z metadanymi przesunięcia i czasu trwania. Znaczniki czasowe na poziomie słowa zwracają czas dla każdego słowa, podczas gdy opcja segment zwraca czas dla każdego segmentu, a opcja none pomija dane czasowe. Parametr phrase-list wpływa na rozpoznawanie, faworyzując podane terminy, takie jak terminologia specyficzna dla domeny, skróty i nazwy własne, przy czym dokumentacja zauważa, że terminy działają jako wskazówki, a nie wymuszone wyjście.
Parametr stylu transkrypcji domyślnie ustawiony jest na verbatim, co rejestruje mowę dokładnie tak, jak została wypowiedziana, włącznie ze słowami wypełniającymi i nieudanymi rozpoczęciami, co jest przydatne w obciążeniach związanych z zgodnością, kontrolą jakości i analizą. Ustawienie clean usuwa wypełniacze i automatycznie formatuje typowe wzorce mowy, aby uzyskać bardziej czytelne napisy, notatki i opublikowane transkrypty. Wybór języka jest opcjonalny; domyślnie model automatycznie wykrywa język mówiony, a dokumentacja zaleca wymuszenie konkretnego języka tylko wtedy, gdy automatyczne wykrywanie zawiedzie. Przełączanie kodów dla mieszanych par językowych, takich jak Hinglish i Spanglish, jest obsługiwane automatycznie, a odporność na szumy w nagraniach zewnętrznych jest wbudowana w model.
Dokumentacja dodatkowo zauważa, że MAI-Transcribe może zapewniać transkrypcję wejściowego audio w Voice Live API poprzez pole konfiguracji sesji. Microsoft poinformował, że model jest dostępny do demonstracji poprzez Microsoft Foundry i MAI Playground, a dostępność na OpenRouter jest oznaczona jako wkrótce.












