AI-modellen en platforms
MAI-Transcribe-2 behaalt hoogste score op FLEURS-benchmark in 60 talen, meldt Microsoft

Microsoft AI heeft op 3 september 2026 MAI-Transcribe-2 uitgebracht, een spraakherkenningsmodel waarvan het lab zegt dat het als eerste eindigt op de FLEURS-benchmark in 60 talen met een gemiddelde woordfoutpercentage van 5,2 %. In de aankondiging beschreef Microsoft het model als tot nu toe het meest capabele transcriptiesysteem en stelde de prijs op $0.10 per uur audio.
Microsoft meldde dat MAI-Transcribe-2 sprekerdiarisatie, configureerbare transcriptiestijlen en tijdstempels op woordniveau toevoegt, en beter presteert dan concurrerende modellen zoals Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3‑Large en ScribeV2 over een breder scala aan real‑world audio. Volgens de aankondiging definieert het model de Pareto‑grens voor nauwkeurigheid en latentie bij Artificial Analysis en staat het tweede op de ranglijst voor woordfoutpercentage van Artificial Analysis, waarmee het de resultaten van eerdere MAI-Transcribe‑versies verbetert.
Microsoft positioneert het model voor workloads zoals klinische notities, juridische documentatie, toegankelijkheid en ondertiteling. Het bedrijf meldde snellere inferentie met aanzienlijk lagere latentie, vooral voor lange audio, tot wel tien keer de verwerkingssnelheid van toonaangevende concurrenten. Daarnaast gaf het aan dat het model de transcriptiekwaliteit behoudt onder rumoerige omstandigheden buiten gecontroleerde opnametoepassingen.
Benchmarkresultaten
Op basis van evaluaties uitgevoerd door Artificial Analysis verklaarde Microsoft dat MAI-Transcribe-2 tien keer sneller is dan OpenAI’s GPT-Transcribe, zeven keer sneller dan ElevenLabs’ Scribe v2, en vijf keer sneller dan Gemini 3.5 Transcribe, terwijl het een hogere nauwkeurigheid levert. Het bedrijf zei dat het model alleen staat in het meest aantrekkelijke kwadrant van de nauwkeurigheid‑tegen‑snelheid grafiek van de benchmark, met een foutpercentage van 2,0 % en een snelheidsfactor van 403,6, wat betekent dat een uur audio in ongeveer tien seconden wordt teruggegeven.
Op de openbare meertalige FLEURS-benchmark meldde Microsoft dat MAI-Transcribe-2 consequent een hoge nauwkeurigheid behaalt in alle 60 geteste talen. Het bedrijf beschreef het model als nauwkeurig in meer talen dan elk ander model en stelde dat ontwikkelaars die in meerdere talen transcriberen op één model kunnen vertrouwen, waardoor complexiteit wordt verminderd en mogelijk GPU‑gebruik wordt bespaard. De aankondiging vermeldt bovendien dat de snelheid en doorvoersnelheid van het model Microsoft in staat stelt de volgens hen meest concurrerende prijs op de markt te bieden. Bij de lancering is het tarief van $0.10 per uur een tijdelijke aanbieding die loopt tot het einde van het jaar.
Beschikbaarheid en ontwikkelaarsfuncties
De Microsoft Learn‑documentatie vermeldt MAI-Transcribe-2 als beschikbaar in Azure Speech in publieke preview, zonder service‑level agreement en niet aanbevolen voor productie‑workloads. De documentatie beschrijft MAI-Transcribe als een door Microsoft AI intern ontwikkeld spraak‑naar‑tekst‑model, dat workloads omvat zoals video‑ondertiteling, vergaderingen, klinische notities, callcenter‑documentatie, toegankelijkheidstools, contentcreatie en spraak‑agents. Daarnaast staat MAI-Transcribe-2 vermeld naast de eerdere MAI-Transcribe‑1.5 en MAI‑Transcribe‑1, waarvan de laatste op 20 augustus 2026 werd uitgefaseerd.
Verzoeken worden geleid via de Enhanced‑mode van de Fast Transcription API, waarbij het model wordt geselecteerd door de eigenschap ‘enhanced mode model’ in te stellen op MAI-Transcribe-2. Audio‑invoer is beperkt tot bestanden onder de 300 MB in WAV-, MP3- of FLAC‑formaat, en gebruik vereist een Azure‑abonnement en een Microsoft Foundry‑resource voor Speech.
Optionele parameters regelen de functieset van het model. Sprekerdiarisatie splitst een opname per spreker en levert spreker‑gelabelde segmenten met offset‑ en duur‑metadata. Tijdstempels op woordniveau geven de timing van elk woord weer, terwijl een segmentoptie de timing per segment levert en een ‘none’-optie timinggegevens weghaalt. Een ‘phrase‑list’-parameter beïnvloedt de herkenning ten gunste van opgegeven termen zoals domeinspecifieke terminologie, afkortingen en eigennamen, waarbij de documentatie aangeeft dat termen als hints fungeren in plaats van als dwingende output.
De parameter ‘transcription style’ staat standaard op ‘verbatim’, waardoor spraak exact wordt vastgelegd zoals uitgesproken, inclusief vulwoorden en valse starts, voor compliance‑, QA‑ en analyse‑workloads. Een ‘clean’-instelling verwijdert vulwoorden en formatteert veelvoorkomende spreekpatronen automatisch om beter leesbare ondertitels, notities en gepubliceerde transcripties te produceren. Taalkeuze is optioneel; standaard detecteert het model automatisch de gesproken taal, en de documentatie raadt aan een specifieke taal af te dwingen alleen wanneer automatische detectie faalt. Code‑switching voor gemengde taalkoppels zoals Hinglish en Spanglish wordt automatisch afgehandeld, en geluidsrobustheid voor audio opgenomen buiten gecontroleerde omgevingen is inherent aan het model.
De documentatie vermeldt bovendien dat MAI-Transcribe audio‑invoer kan transcriberen via de Voice Live API met een sessie‑configuratieveld. Microsoft zei dat het model beschikbaar is voor demonstratie via Microsoft Foundry en de MAI Playground, en dat beschikbaarheid op OpenRouter binnenkort wordt verwacht.












