AI-modeller og plattformer
MAI-Transcribe-2 topper FLEURS‑benchmark på 60 språk, sier Microsoft

Microsoft AI lanserte MAI-Transcribe-2 den 3. september 2026, en talegjenkjenningsmodell som laboratoriet hevder rangerer først på FLEURS‑benchmark over 60 språk med en gjennomsnittlig ordfeilrate på 5,2 %. I kunngjøringen beskrev Microsoft modellen som sitt mest kapable transkripsjonssystem hittil og satte prisen til $0,10 per time med lyd.
Microsoft oppga at MAI-Transcribe-2 legger til taler‑diarisering, konfigurerbare transkripsjonsstiler og tidsstempler på ordnivå, og overgår konkurrerende modeller som Gemini 3.5 Transcribe, GPT‑Transcribe, Whisper V3‑Large og ScribeV2 over et bredere spekter av virkelige lydopptak. Ifølge kunngjøringen definerer modellen Pareto‑fronten for nøyaktighet og latenstid på Artificial Analysis og rangerer som nummer to på Artificial Analysis sin rangliste for ordfeilrate, og forbedrer resultatene fra tidligere MAI‑Transcribe‑versjoner.
Microsoft plasserer modellen for arbeidsbelastninger som klinisk notatskriving, juridisk dokumentasjon, tilgjengelighet og underteksting. Selskapet rapporterte raskere inferens med betydelig lavere latenstid, spesielt for langtidslyd, opptil ti ganger høyere behandlingshastighet enn ledende konkurrenter. Det ble også oppgitt at modellen opprettholder transkripsjonskvalitet under støyende forhold utenfor kontrollerte opptaksmiljøer.
Benchmark‑resultater
Med henvisning til evalueringer utført av Artificial Analysis, oppga Microsoft at MAI-Transcribe-2 er ti ganger raskere enn OpenAI sin GPT‑Transcribe, syv ganger raskere enn ElevenLabs sin Scribe v2, og fem ganger raskere enn Gemini 3.5 Transcribe, samtidig som den leverer høyere nøyaktighet. Selskapet sa at modellen står alene i den mest attraktive kvadranten i benchmark‑diagrammet for nøyaktighet versus hastighet, med en feilrate på 2,0 % og en hastighetsfaktor på 403,6, noe som betyr at en time med lyd kan behandles på omtrent ti sekunder.
På den offentlige flerspråklige FLEURS‑benchmarken rapporterte Microsoft at MAI-Transcribe-2 opprettholder et jevnt høyt nøyaktighetsnivå på alle de 60 testede språkene. Selskapet beskrev modellen som nøyaktig på flere språk enn noen annen modell, og sa at utviklere som transkriberer på flere språk kan stole på én enkelt modell, noe som reduserer kompleksitet og potensielt sparer GPU‑bruk. Kunngjøringen bemerker også at modellens hastighet og gjennomstrømning gjør det mulig for Microsoft å tilby det de kaller den mest konkurransedyktige prisen på markedet. Ved lansering er timeprisen på $0,10 et tidsbegrenset tilbud som varer til årsskiftet.
Tilgjengelighet og utviklerfunksjoner
Microsoft Learn‑dokumentasjonen viser at MAI-Transcribe-2 er tilgjengelig i Azure Speech som offentlig forhåndsvisning, uten en tjenestenivåavtale og ikke anbefalt for produksjonsarbeidsbelastninger. Dokumentasjonen beskriver MAI-Transcribe som en tale‑til‑tekst‑modell utviklet internt av Microsoft AI‑teamet, som dekker arbeidsbelastninger som videoteksting, møter, kliniske notater, dokumentasjon for kundesentre, tilgjengelighetsverktøy, innholdsproduksjon og stemmeagenter. Den lister også MAI‑Transcribe‑2 sammen med de tidligere MAI‑Transcribe‑1.5 og MAI‑Transcribe‑1, sistnevnte avviklet 20. august 2026.
Forespørsler går via Fast Transcription API‑ens forbedrede modus, der modellen velges ved å sette modell‑egenskapen for forbedret modus til MAI‑Transcribe‑2. Lydinnspill er begrenset til filer under 300 MB i WAV-, MP3‑ eller FLAC‑format, og bruk krever et Azure‑abonnement samt en Microsoft Foundry‑ressurs for Speech.
Valgfrie parametere styrer modellens funksjonssett. Taler‑diarisering deler et opptak etter taler og returnerer segmenter merket med taler, samt offset‑ og varighetsmetadata. Tidsstempler på ordnivå gir tidsinformasjon for hvert ord, mens et segment‑alternativ gir tidsinformasjon per segment, og alternativet none utelater tidsdata. En phrase‑list‑parameter påvirker gjenkjenning mot angitte termer som domenespesifikk terminologi, forkortelser og egennavn, og dokumentasjonen bemerker at disse termene fungerer som hint snarere enn påtvunget output.
Transkripsjonsstil‑parameteren er som standard verbatim, som fanger talen nøyaktig som den blir uttalt, inkludert fyllord og feilstart, for overholdelse, QA og analyse‑arbeidsbelastninger. En clean‑innstilling fjerner fyllord og auto‑formaterer vanlige talemønstre for å produsere mer lesbare undertekster, notater og publiserte transkripsjoner. Språkvalg er valgfritt; som standard oppdager modellen automatisk det talte språket, og dokumentasjonen anbefaler å tvinge et bestemt språk kun når automatisk gjenkjenning mislykkes. Kodeskifting for blandede språkpar som Hinglish og Spanglish håndteres automatisk, og støydemping for lyd innspilt utenfor kontrollerte miljøer er innebygd i modellen.
Dokumentasjonen bemerker også at MAI‑Transcribe kan levere transkripsjon av innkommende lyd i Voice Live‑API‑en via et sesjonskonfigurasjonsfelt. Microsoft oppga at modellen er tilgjengelig for demonstrasjon via Microsoft Foundry og MAI Playground, med tilgjengelighet på OpenRouter oppført som kommende snart.












