Modele i platformy AI

Microsoft wprowadza MAI-Transcribe-2-Streaming oraz dwa modele MAI-Voice

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Microsoft AI 1 października 2026 uruchomił MAI-Transcribe-2-Streaming, swój pierwszy model transkrypcji strumieniowej, wraz z dwoma nowymi modelami zamiany tekstu na mowę, MAI-Voice-2.1 i MAI-Voice-2.1-Flash, przy czym wszystkie trzy są dostępne w Microsoft Foundry.

MAI-Transcribe-2-Streaming i benchmark Artificial Analysis

Microsoft opisuje MAI-Transcribe-2-Streaming jako dostarczający transkrypcje o niskim opóźnieniu i w czasie rzeczywistym w 60 językach z automatycznym, ciągłym wykrywaniem języka. Firma podała, że model zajmuje miejsce nr 1 pod względem dokładności zarówno końcowych, jak i częściowych transkrypcji w benchmarku Artificial Analysis oraz że znajduje się na granicy Pareto oceny dokładność‑vs‑opóźnienie, co oznacza, że wyższa dokładność nie wymaga dużego kompromisu w opóźnieniu. Wykres rankingu w poście, przywołujący ranking strumieniowy Artificial Analysis z dnia 28 września 2026, wykazuje, że model osiąga 2,5 % końcowego wskaźnika błędów słów, 2,8 % wskaźnika pierwszych częściowych oraz 0,13 s do końcowej transkrypcji.

Zamiast czekać, aż mówca zakończy wypowiedź, model generuje pierwsze hipotezy, zwane częściowymi transkrypcjami, nieco ponad 100 milisekund po otrzymaniu dźwięku, a następnie koryguje je w miarę napływu dalszego kontekstu, zanim zatwierdzi stabilną transkrypcję. Microsoft stwierdził, że umożliwia to aplikacjom obsługującym głos reagowanie na mowę zanim mówca skończy: agenci głosowi mogą rozpocząć rozumowanie lub wywoływanie narzędzi w środku zdania, a transkrypcje na żywo mogą pojawiać się w trakcie rozmowy. W przypadku dyktowania i napisów w czasie rzeczywistym firma podała, że wewnętrzne testy wykazują, iż słowa pojawiają się w transkrypcji dwa razy szybciej niż w przypadku najbliższego konkurenta.

Artificial Analysis stwierdza, że jego wskaźnik AA-WER Streaming mierzy dokładność transkrypcji dla modeli, w których dźwięk jest strumieniowany w czasie rzeczywistym, kawałek po kawałku, na przestrzeni około ośmiu godzin audio z trzech zestawów danych: AA-AgentTalk (50 %), VoxPopuli (25 %) i Earnings22 (25 %). Zestawy danych obejmują rzeczywistą mowę z różnorodnymi akcentami, językiem specyficznym dla dziedzin oraz trudnymi warunkami akustycznymi, a pomiary benchmarku „Time to Final” i „Time to First Partial” rozpoczynają się od momentu wykrycia końca mowy przez detektor aktywności głosu SileroVAD.

MAI-Transcribe-2-Streaming jest dostępny w cenie wprowadzającej 0,54 $ za godzinę audio do końca roku. Model rozszerza linię audio MAI firmy Microsoft, która już zawiera MAI-Transcribe-2, wcześniejszy model rozpoznawania mowy bez strumieniowania, reklamowany przez firmę jako najszybszy, najdokładniejszy i najtańszy na świecie.

MAI-Voice-2.1 i MAI-Voice-2.1-Flash

MAI-Voice-2.1 obsługuje 23 języki i 26 lokalizacji, a Microsoft podkreślił, że pojedynczy głos może korzystać ze wszystkich z natywnym akcentem, zachowując tę samą tożsamość mówcy przy zmianie języka. Przykładowa aplikacja edukacyjna może zmieniać język w trakcie lekcji bez konieczności zmiany nauczyciela, a wielojęzyczny asystent może odpowiadać w dowolnym języku, w którym zostanie zwrócony, zachowując jednocześnie ten sam głos. Model kosztuje 22 $ za 1 M znaków.

MAI-Voice-2.1-Flash obsługuje te same języki i mówców wielojęzycznych, ale jest przeznaczony do obciążeń o dużej przepustowości i wrażliwych na opóźnienia. Może generować do 45 sekund audio przy całkowitym opóźnieniu 150 ms, a Microsoft poinformował, że zapewnia 55 % szybsze wnioskowanie modelu i jest około 60 % tańszy niż porównywalne modele. Jego cena wynosi 15 $ za 1 M znaków.

Oba modele głosowe obsługują klonowanie głosu we wszystkich obsługiwanych językach przy użyciu kilku sekund dźwięku referencyjnego, z wbudowanymi zabezpieczeniami zgody, które Microsoft twierdzi, że zapobiegają nadużyciom. W teście Turinga z udziałem 4 000 słuchaczy, łączącym oba nowe modele głosowe, 50,3 % słuchaczy oceniło MAI-Voice jako równie lub bardziej podobny do człowieka niż nagrania ludzkie, podaje Microsoft.

Microsoft przedstawił połączenie MAI-Transcribe-2-Streaming z MAI-Voice-2.1-Flash jako odzyskiwanie czasu po obu stronach pętli agenta głosowego, czyli sekwencji słuchania, rozumienia, podejmowania decyzji i mówienia w oknie, w którym człowiek nadal postrzega interakcję jako rozmowę. Wymienione przypadki użycia dla deweloperów obejmują agentów obsługi klienta, którzy transkrybują prośby w czasie ich wypowiadania i odpowiadają naturalnym głosem, wielojęzycznych asystentów wykrywających język mówiony i odpowiadających w dowolnym z 23 obsługiwanych języków MAI-Voice oraz interaktywne aplikacje edukacyjne i medialne wykorzystujące różnych mówców do nauczania, odgrywania ról, symulacji, narracji i treści konwersacyjnych.

Dostępność i demonstracja Chatter

MAI-Voice-2.1 i MAI-Voice-2.1-Flash są dostępne poprzez OpenRouter. Wszystkie trzy modele są dostępne w Microsoft Foundry, MAI Playground, Vercel oraz Azure Voice Live, a LiveKit jest wymieniony jako wkrótce dostępny.

Aby pokazać współpracę modeli w czasie rzeczywistym, Microsoft stworzył Chatter, nową demonstrację w MAI Playground, która umożliwia użytkownikom rozmowę z asystentem głosowym napędzanym przez modele transkrypcji i głosu.

Jonas Reeve jest analitykiem generowanym przez SI w Unite.AI, koncentrującym się na kognitywnej SI, sztucznej ogólnej inteligencji (AGI) oraz teoretycznych podstawach inteligencji maszynowej. Jego praca bada, jak uczenie się, rozumowanie, pamięć i abstrakcja wyłaniają się zarówno w systemach biologicznych, jak i sztucznych, tworząc powiązania między współczesnymi architekturami SI a długoletnimi pytaniami w naukach kognitywnych i filozofii umysłu.

Z koncepcyjnym i refleksyjnym podejściem Jonas bada ramy takie jak modele rozumowania, systemy agentowe, emergentna kognicja i teoria zgodności, dążąc do wyjaśnienia, co tak naprawdę oznacza postęp w kierunku AGI — a czego nie. Zamiast gonić za terminami czy hype’em, podkreśla pierwsze zasady, rygor konceptualny oraz ograniczenia obecnych modeli.

Artykuły autorstwa Jonasa Reeve są generowane przez SI i recenzowane przez zespół redakcyjny Unite.AI, aby zapewnić dokładność, przejrzystość i odpowiedzialną dyskusję zaawansowanych koncepcji SI.