Modele și platforme AI

MAI-Transcribe-2 ocupă primul loc în benchmark-ul FLEURS în 60 de limbi, spune Microsoft

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Microsoft AI a lansat MAI-Transcribe-2 pe 3 septembrie 2026, un model de recunoaștere vocală pe care laboratorul l-a declarat primul în benchmark-ul FLEURS în 60 de limbi, cu o rată medie de eroare a cuvintelor de 5,2 %. În anunțul său, Microsoft a descris modelul ca fiind cel mai capabil sistem de transcriere de până acum și l-a prețuit la $0.10 pe oră de audio.

Microsoft a declarat că MAI-Transcribe-2 adaugă diarizare a vorbitorilor, stiluri de transcriere configurabile și marcaje temporale la nivel de cuvânt și depășește modelele concurente, inclusiv Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large și ScribeV2, pe o gamă mai largă de audio din viața reală. Conform anunțului, modelul definește frontiera Pareto pentru acuratețe și latență pe Artificial Analysis și se clasează pe locul al doilea în clasamentul ratei de eroare a cuvintelor de pe Artificial Analysis, îmbunătățind rezultatele versiunilor anterioare ale MAI-Transcribe.

Microsoft a poziționat modelul pentru sarcini precum luarea de note clinice, documentație juridică, accesibilitate și subtitrare în timp real. Compania a raportat inferență mai rapidă cu latență semnificativ mai mică, în special pentru audio de lungă durată, până la 10 ori viteza de procesare a principalilor concurenți. De asemenea, a afirmat că modelul menține calitatea transcrierii în condiții zgomotoase, în afara mediilor de înregistrare controlate.

Rezultatele benchmark-ului

Citat evaluările efectuate de Artificial Analysis, Microsoft a declarat că MAI-Transcribe-2 este de 10 ori mai rapid decât GPT-Transcribe de la OpenAI, de 7 ori mai rapid decât Scribe v2 de la ElevenLabs și de 5 ori mai rapid decât Gemini 3.5 Transcribe, oferind în același timp o acuratețe superioară. Compania a afirmat că modelul ocupă singur cel mai atractiv cadran al graficului benchmark-ului acuratețe‑față‑de‑viteză, având o rată de eroare de 2,0 % și un factor de viteză de 403,6, ceea ce înseamnă că o oră de audio este procesată în aproximativ zece secunde.

Pe benchmark-ul public multilingv FLEURS, Microsoft a raportat că MAI-Transcribe-2 menține un nivel de acuratețe constant ridicat în toate cele 60 de limbi testate. Compania a descris modelul ca fiind precis în mai multe limbi decât orice alt model și a afirmat că dezvoltatorii care transcriu în mai multe limbi pot conta pe un singur model, reducând complexitatea și, eventual, economisind utilizarea GPU‑urilor. Anunțul precizează, de asemenea, că viteza și debitul modelului permit Microsoft să ofere ceea ce a numit cel mai competitiv preț de pe piață. La lansare, tariful de $0.10 pe oră este o ofertă limitată, valabilă până la sfârșitul anului.

Disponibilitate și caracteristici pentru dezvoltatori

Documentația Microsoft Learn enumeră MAI-Transcribe-2 ca fiind disponibil în Azure Speech în previzualizare publică, fără acord de nivel de serviciu și nu este recomandat pentru sarcini de producție. Documentația descrie MAI-Transcribe ca un model de vorbire‑text dezvoltat intern de echipa Microsoft AI, acoperind sarcini precum subtitrarea video, întâlniri, note clinice, documentație pentru centre de apel, instrumente de accesibilitate, creare de conținut și agenți vocali. De asemenea, enumeră MAI-Transcribe-2 alături de versiunile anterioare MAI-Transcribe-1.5 și MAI-Transcribe-1, aceasta din urmă fiind depreciată la data de 20 august 2026.

Solicitările trec prin modul îmbunătățit al Fast Transcription API, modelul fiind selectat prin setarea proprietății modelului în modul îmbunătățit la MAI-Transcribe-2. Intrarea audio este limitată la fișiere sub 300 MB în format WAV, MP3 sau FLAC, iar utilizarea necesită un abonament Azure și o resursă Microsoft Foundry pentru Speech.

Parametrii opționali controlează setul de funcționalități ale modelului. Diarizarea vorbitorilor segmentează o înregistrare pe vorbitori și returnează segmente etichetate cu vorbitorul, împreună cu metadatele de offset și durată. Marcajele temporale la nivel de cuvânt oferă sincronizarea fiecărui cuvânt, în timp ce opțiunea segment returnează sincronizarea pe segment, iar opțiunea none omite datele temporale. Parametrul phrase-list influențează recunoașterea spre termeni furnizați, cum ar fi terminologia specifică domeniului, abrevieri și substantive proprii, documentația menționând că termenii funcționează ca sugestii, nu ca ieșire impusă.

Parametrul de stil de transcriere are ca valoare implicită verbatim, care captează vorbirea exact așa cum este rostită, incluzând cuvinte de umplutură și începuturi false, pentru sarcini de conformitate, QA și analiză. Setarea clean elimină umpluturile și formatează automat tiparele comune de vorbire pentru a produce subtitrări, note și transcrieri publicate mai ușor de citit. Selecția limbii este opțională; implicit modelul detectează automat limba vorbită, iar documentația recomandă impunerea unei limbi specifice numai când detectarea automată eșuează. Comutarea de cod pentru perechi de limbi mixte, cum ar fi Hinglish și Spanglish, este gestionată automat, iar rezistența la zgomot pentru audio înregistrat în afara mediilor controlate este încorporată în model.

Documentația mai menționează că MAI-Transcribe poate furniza transcrierea audio de intrare în Voice Live API printr-un câmp de configurare a sesiunii. Microsoft a declarat că modelul este disponibil pentru demonstrație prin Microsoft Foundry și MAI Playground, iar disponibilitatea pe OpenRouter este listată ca „în curând”.

Jonas Reeve este un analist generat de IA la Unite.AI, axat pe inteligența artificială cognitivă, inteligența artificială generală (AGI) și fundamentele teoretice ale inteligenței mașinilor. Lucrările sale explorează modul în care învățarea, raționamentul, memoria și abstractizarea emerg în sisteme atât biologice, cât și artificiale, stabilind legături între arhitecturile moderne de IA și întrebările de lungă durată din știința cognitivă și filosofia minții.
Cu o abordare conceptuală și reflexivă, Jonas examinează cadre precum modelele de raționament, sistemele agenților, cogniția emergentă și teoria alinierii, având ca scop clarificarea progresului către AGI și a ceea ce nu reprezintă. Mai degrabă decât a urmări termene limită sau a fi influențat de tendințe, el subliniază principiile de bază, rigurozitatea conceptuală și limitele modelelor actuale.
Articolele scrise de Jonas Reeve sunt generate de IA și revizuite de echipa editorială a Unite.AI pentru a asigura acuratețea, claritatea și discuția responsabilă a conceptelor avansate de IA.