Modele și platforme AI
Microsoft lansează MAI-Transcribe-2-Streaming și două modele MAI-Voice

Microsoft AI, pe 1 octombrie 2026, a lansat MAI-Transcribe-2-Streaming, primul său model de transcriere în flux, alături de două noi modele de text‑to‑speech, MAI-Voice-2.1 și MAI-Voice-2.1-Flash, toate trei fiind disponibile prin Microsoft Foundry.
MAI-Transcribe-2-Streaming și benchmarkul Artificial Analysis
Microsoft descrie MAI-Transcribe-2-Streaming ca oferind transcrieri în timp real, cu latență scăzută, în 60 de limbi, cu detectare automată și continuă a limbii. Compania a declarat că modelul se clasează pe locul 1 în acuratețe atât pentru transcrierile finale, cât și pentru cele parțiale pe Artificial Analysis și că se află pe frontiera Pareto a evaluării benchmarkului privind acuratețea versus latență, ceea ce înseamnă că o acuratețe mai mare nu impune un compromis semnificativ de latență. Graficul cu clasamentul din postare, care citează clasamentul streaming al Artificial Analysis din 28 septembrie 2026, arată că modelul are o rată de eroare finală de cuvânt de 2,5 % și o rată de primă parte parțială de 2,8 %, precum și 0,13 secunde până la transcrierea finală.
În loc să aștepte ca vorbitorul să termine înainte de a returna textul, modelul generează primele ipoteze, cunoscute sub denumirea de parțiale, la puțin peste 100 de milisecunde de la primirea sunetului, apoi le revizuiește pe măsură ce apare mai mult context, înainte de a produce o transcriere stabilă. Microsoft a afirmat că acest lucru permite aplicațiilor cu suport vocal să reacționeze la vorbire înainte ca vorbitorul să termine: agenții vocali pot începe să raționeze sau să invoce instrumente în mijlocul unei propoziții, iar transcrierile în timp real pot apărea pe măsură ce oamenii vorbesc. Pentru dictare și subtitrare în timp real, compania a declarat că evaluările interne arată că cuvintele apar în transcriere de două ori mai repede decât la cel mai apropiat concurent.
Artificial Analysis afirmă că indicele său AA-WER Streaming măsoară acuratețea transcrierii pentru modele în care audio-ul este transmis în timp real, bucată cu bucată, pe aproximativ opt ore de înregistrări din trei seturi de date: AA-AgentTalk la 50 %, VoxPopuli la 25 % și Earnings22 la 25 %. Seturile de date acoperă vorbire din viața reală cu accente diverse, limbaj specific domeniului și condiții acustice dificile, iar măsurătorile Time to Final și Time to First Partial ale benchmarkului încep ambele la sfârșitul vorbirii detectat de detectorul de activitate vocală SileroVAD.
MAI-Transcribe-2-Streaming este disponibil la un preț introductiv de $0.54 pe oră de audio până la sfârșitul anului. Modelul extinde gama audio MAI a Microsoft, care include deja MAI-Transcribe-2, modelul anterior de recunoaștere a vorbirii fără flux, pe care compania l-a descris ca fiind cel mai rapid, cel mai precis și cel mai ieftin din lume.
MAI-Voice-2.1 și MAI-Voice-2.1-Flash
MAI-Voice-2.1 suportă 23 de limbi și 26 de locale, iar Microsoft a declarat că o singură voce poate utiliza toate acestea cu un accent nativ, menținând aceeași identitate a vorbitorului la schimbarea limbii. O aplicație de tutoriat, în exemplul companiei, poate schimba limba în timpul lecției fără a schimba profesorii, iar un asistent multilingv poate răspunde în orice limbă i se adresează, păstrând în continuare aceeași voce. Modelul are un preț de $22 pe 1 M de caractere.
MAI-Voice-2.1-Flash suportă aceleași limbi și vorbitori interlingvi, dar este conceput pentru sarcini cu volum mare și sensibilitate la latență. Poate genera până la 45 de secunde de audio cu o latență de cap la cap de 150 de milisecunde, iar Microsoft a afirmat că oferă inferență a modelului cu 55 % mai rapidă și este aproximativ cu 60 % mai ieftin decât modelele comparabile. Are un preț de $15 pe 1 M de caractere.
Ambele modele vocale suportă clonarea vocii în toate limbile suportate, utilizând câteva secunde de audio de referință, cu bariere de consimțământ încorporate, pe care Microsoft le-a declarat că previn utilizarea abuzivă. Într-un test Turing cu 4.000 de ascultători care a combinat cele două noi modele vocale, 50,3 % dintre ascultători au evaluat MAI-Voice ca fiind la fel sau mai asemănător cu înregistrările umane, conform Microsoft.
Microsoft a prezentat asocierea MAI-Transcribe-2-Streaming cu MAI-Voice-2.1-Flash ca o modalitate de a recâștiga timp la ambele capete ale buclei unui agent vocal, secvența de ascultare, înțelegere, decizie și vorbire în intervalul în care un om percepe încă interacțiunea ca pe o conversație. Cazurile de utilizare enumerate pentru dezvoltatori includ agenți de servicii pentru clienți care transcriu cererile pe măsură ce sunt rostite și răspund în vorbire naturală, asistenți multilingvi care detectează limba vorbită și răspund în oricare dintre cele 23 de limbi suportate de MAI-Voice, și aplicații interactive de învățare și media care utilizează vorbitori distincti pentru tutoriat, joc de rol, simulări, narațiune și conținut conversațional.
Disponibilitate și demonstrația Chatter
MAI-Voice-2.1 și MAI-Voice-2.1-Flash sunt disponibile prin OpenRouter. Toate cele trei modele sunt disponibile prin Microsoft Foundry, MAI Playground, Vercel și Azure Voice Live, iar LiveKit este listat ca urmare în curând.
Pentru a demonstra modelele lucrând împreună într-un agent live, Microsoft a creat Chatter, o nouă demonstrație în MAI Playground care permite utilizatorilor să converseze cu un asistent vocal alimentat de modelele de transcriere și voce.












