AI-modellen en platforms
Microsoft lanceert MAI-Transcribe-2-Streaming en twee MAI-Voice-modellen

Microsoft AI op 1 oktober 2026 lanceerde MAI-Transcribe-2-Streaming, zijn eerste streaming-transcriptiemodel, naast twee nieuwe tekst-naar-spraakmodellen, MAI-Voice-2.1 en MAI-Voice-2.1-Flash, die alle drie beschikbaar zijn via Microsoft Foundry.
MAI-Transcribe-2-Streaming en de Artificial Analysis-benchmark
Microsoft beschrijft MAI-Transcribe-2-Streaming als een model dat lage‑latentie, realtime transcripties levert in 60 talen met automatische, continue taaldetectie. Het bedrijf zei dat het model nummer 1 staat voor nauwkeurigheid voor zowel definitieve als gedeeltelijke transcripties op Artificial Analysis, en dat het zich bevindt op de Pareto‑voorkant van de nauwkeurigheid‑tegen‑latentie‑evaluatie van de benchmark, wat betekent dat een hogere nauwkeurigheid geen zware latentie‑compromis vereist. De ranglijstgrafiek in de post, met verwijzing naar de Artificial Analysis streaming‑ranglijst van 28 september 2026, toont het model met een definitieve woord‑foutpercentage van 2,5 procent, een eerste‑partial‑percentage van 2,8 procent, en 0,13 seconden tot definitieve transcriptie.
In plaats van te wachten tot een spreker klaar is voordat tekst wordt geretourneerd, produceert het model zijn eerste hypothesen, bekend als partials, in iets meer dan 100 milliseconden na ontvangst van audio, en herziet deze vervolgens zodra er meer context beschikbaar is voordat een stabiele transcriptie wordt vastgelegd. Microsoft zei dat dit spraak‑geactiveerde toepassingen in staat stelt te reageren op spraak voordat de spreker klaar is: spraak‑agents kunnen al halverwege een zin redeneren of tools aanroepen, en live‑transcripties kunnen verschijnen terwijl mensen praten. Voor realtime dicteren en ondertiteling zei het bedrijf dat interne evaluaties aantonen dat woorden twee keer zo snel in de transcriptie verschijnen als bij de dichtstbijzijnde concurrent.
Artificial Analysis stelt dat zijn AA‑WER Streaming‑index de transcriptienauwkeurigheid meet voor modellen waarbij audio realtime, stuk voor stuk, wordt gestreamd over ongeveer acht uur audio uit drie datasets: AA‑AgentTalk met 50 procent, VoxPopuli met 25 procent en Earnings22 met 25 procent. De datasets omvatten spraak uit de echte wereld met diverse accenten, domeinspecifieke taal en uitdagende akoestische omstandigheden, en de benchmark‑metingen Time to Final en Time to First Partial beginnen beide bij het einde van spraak dat wordt gedetecteerd door de SileroVAD stem‑activiteit‑detector.
MAI-Transcribe-2-Streaming is beschikbaar tegen een introductieprijs van $0,54 per uur audio tot het einde van het jaar. Het model breidt Microsoft’s MAI‑audio‑lijn uit, die al MAI-Transcribe-2 omvat, het eerdere niet‑streaming spraakherkenningsmodel dat het bedrijf aanprijst als het snelste, meest nauwkeurige en goedkoopste ter wereld.
MAI-Voice-2.1 en MAI-Voice-2.1-Flash
MAI-Voice-2.1 ondersteunt 23 talen en 26 locale‑instellingen, en Microsoft zei dat één enkele stem ze allemaal kan gebruiken met een native accent, waarbij dezelfde sprekeridentiteit behouden blijft bij het wisselen van talen. Een tutoring‑app, volgens het voorbeeld van het bedrijf, kan van taal wisselen midden in een les zonder van docent te wisselen, en een meertalige assistent kan antwoorden in welke taal dan ook waarin hij wordt aangesproken, terwijl hij nog steeds klinkt als dezelfde stem. Het model kost $22 per 1 M tekens.
MAI-Voice-2.1-Flash ondersteunt dezelfde talen en cross‑language sprekers, maar is gebouwd voor workloads met hoog volume en latentie‑gevoeligheid. Het kan tot 45 seconden audio genereren met een end‑to‑end‑latentie van 150 milliseconden, en Microsoft zei dat het 55 procent snellere model‑inference levert en ongeveer 60 procent goedkoper is dan vergelijkbare modellen. Het kost $15 per 1 M tekens.
Beide stemmodellen ondersteunen stem‑cloning over alle ondersteunde talen met behulp van enkele seconden referentie‑audio, met ingebouwde toestemmings‑guardrails die Microsoft zegt misbruik te voorkomen. In een Turing‑test met 4.000 luisteraars waarin de twee nieuwe stemmodellen werden gecombineerd, beoordeelden 50,3 procent van de luisteraars MAI-Voice als even of meer menselijk dan menselijke opnamen, aldus Microsoft.
Microsoft positioneerde het combineren van MAI-Transcribe-2-Streaming met MAI-Voice-2.1-Flash als het terugwinnen van tijd aan beide uiteinden van een voice‑agent‑lus, de reeks van horen, begrijpen, beslissen en spreken binnen het venster waarin een mens de interactie nog steeds als een gesprek ervaart. Vermelde ontwikkelaars‑use‑cases omvatten klantenservice‑agents die verzoeken transcriberen terwijl ze worden uitgesproken en reageren met natuurlijke spraak, meertalige assistenten die de gesproken taal detecteren en in een van de 23 ondersteunde MAI-Voice‑talen antwoorden, en interactieve leer‑ en media‑toepassingen die verschillende sprekers gebruiken voor tutoring, rollenspel, simulaties, narratie en conversationele inhoud.
Beschikbaarheid en de Chatter-demo
MAI-Voice-2.1 en MAI-Voice-2.1-Flash zijn beschikbaar via OpenRouter. Alle drie de modellen zijn beschikbaar via Microsoft Foundry, de MAI Playground, Vercel en Azure Voice Live, waarbij LiveKit vermeld wordt als binnenkort beschikbaar.
Om de modellen samenwerkend in een live‑agent te demonstreren, heeft Microsoft Chatter gebouwd, een nieuwe demo in de MAI Playground waarmee gebruikers kunnen praten met een spraakassistent die wordt aangedreven door de transcriptie‑ en stemmodellen.












