AI-modeller og platforme
MAI-Transcribe-2 topper FLEURS-benchmark over 60 sprog, siger Microsoft

Microsoft AI udgav MAI-Transcribe-2 den 3. september 2026, en talegenkendelsesmodel som laboratoriet sagde rangerer først på FLEURS-benchmarket på tværs af 60 sprog med en gennemsnitlig ordfejlrate på 5,2 %. I annonceringen beskrev Microsoft modellen som deres mest kapable transskriptionssystem til dato og prissatte den til $0,10 pr. time lyd.
Microsoft oplyste, at MAI-Transcribe-2 tilføjer taler‑diarisering, konfigurerbare transskriptionsstile og ord‑niveau tidsstempler, og at den overgår konkurrerende modeller inklusive Gemini 3.5 Transcribe, GPT‑Transcribe, Whisper V3‑Large og ScribeV2 på et bredere udvalg af virkelige lydoptagelser. Ifølge annoncen definerer modellen Pareto‑fronten for nøjagtighed og latenstid på Artificial Analysis og rangerer som nummer to på Artificial Analysis‑leaderboardet for ordfejlrate, hvilket forbedrer resultaterne fra tidligere MAI‑Transcribe‑versioner.
Microsoft placerede modellen til arbejdsbelastninger såsom klinisk notatskrivning, juridisk dokumentation, tilgængelighed og undertekster. Virksomheden rapporterede hurtigere inferens med væsentligt lavere latenstid, især for langtidslyd, med op til 10 gange højere behandlingshastighed end førende konkurrenter. Den oplyste også, at modellen bevarer transskriptionskvaliteten under støjende forhold uden for kontrollerede optagelsesmiljøer.
Benchmark‑resultater
Med henvisning til evalueringer udført af Artificial Analysis sagde Microsoft, at MAI-Transcribe-2 er 10 gange hurtigere end OpenAI’s GPT‑Transcribe, 7 gange hurtigere end ElevenLabs’ Scribe v2 og 5 gange hurtigere end Gemini 3.5 Transcribe, samtidig med at den leverer højere nøjagtighed. Virksomheden oplyste, at modellen står alene i den mest attraktive kvadrant i benchmarkens nøjagtighed‑mod‑hastighed‑diagram, med en fejlrate på 2,0 % og en hastighedsfaktor på 403,6, hvilket betyder, at en time lyd returneres på omkring ti sekunder.
På den offentlige flersprogede FLEURS-benchmark rapporterede Microsoft, at MAI-Transcribe-2 opretholder et konsekvent højt nøjagtighedsniveau på tværs af alle 60 testede sprog. Virksomheden beskrev modellen som præcis på flere sprog end nogen anden model og sagde, at udviklere, der transskriberer på flere sprog, kan stole på en enkelt model, hvilket reducerer kompleksitet og potentielt sparer GPU‑udnyttelse. Annoncen angiver også, at modellens hastighed og gennemløb gør det muligt for Microsoft at tilbyde, hvad de kaldte den mest konkurrencedygtige pris på markedet. Ved lanceringen er den timelige sats på $0,10 et tidsbegrænset tilbud, der løber indtil årets udgang.
Tilgængelighed og udviklerfunktioner
Microsoft Learn‑dokumentationen angiver, at MAI-Transcribe-2 er tilgængelig i Azure Speech i offentlig forhåndsvisning, uden en service‑level‑aftale og ikke anbefalet til produktionsarbejdsbelastninger. Dokumentationen beskriver MAI‑Transcribe som en tale‑til‑tekst‑model udviklet internt af Microsoft AI‑teamet, der dækker arbejdsbelastninger såsom video‑undertekster, møder, kliniske noter, call‑center‑dokumentation, tilgængelighedsværktøjer, indholdsoprettelse og stemme‑agenter. Den lister også MAI‑Transcribe‑2 sammen med de tidligere MAI‑Transcribe‑1.5 og MAI‑Transcribe‑1, sidstnævnte udfaset den 20. august 2026.
Forespørgsler går gennem Fast Transcription API’ens forbedrede tilstand, hvor modellen vælges ved at sætte egenskaben for den forbedrede tilstandsmodel til MAI‑Transcribe‑2. Lydinput er begrænset til filer under 300 MB i WAV‑, MP3‑ eller FLAC‑format, og brug kræver et Azure‑abonnement samt en Microsoft Foundry‑ressource for Speech.
Valgfrie parametre styrer modellens funktionssæt. Taler‑diarisering opdeler en optagelse efter taler og returnerer taler‑mærkede segmenter med offset‑ og varighedsmetadata. Ord‑niveau tidsstempler giver timing for hvert ord, mens en segment‑indstilling giver timing per segment, og en ingen‑indstilling udelader tidsdata. En frase‑liste‑parameter påvirker genkendelsen mod leverede termer såsom domænespecifik terminologi, forkortelser og egennavne, hvor dokumentationen bemærker, at termer fungerer som hints snarere end tvungen output.
Transskriptionsstil‑parameteren har som standard verbatim, hvilket fanger talen præcis som den er udtalt, inklusive fyldord og fejltagelser, til overholdelse, QA og analyse‑arbejdsbelastninger. En ren indstilling fjerner fyldord og auto‑formaterer almindelige talemønstre for at producere mere læselige undertekster, noter og offentliggjorte transskriptioner. Sprogvalg er valgfrit; som standard opdager modellen automatisk det talte sprog, og dokumentationen anbefaler at tvinge et specifikt sprog kun når automatisk genkendelse fejler. Kodeskift for blandede sprogpar som Hinglish og Spanglish håndteres automatisk, og støjrobusthed for lyd optaget uden for kontrollerede miljøer er indbygget i modellen.
Dokumentationen bemærker også, at MAI‑Transcribe kan levere input‑lydtransskription i Voice Live API gennem et sessions‑konfigurationsfelt. Microsoft oplyste, at modellen er tilgængelig til demonstration via Microsoft Foundry og MAI Playground, med tilgængelighed på OpenRouter angivet som kommende snart.












