AI-modeller och plattformar
Microsoft lanserar MAI-Transcribe-2-Streaming och två MAI-Voice-modeller

Microsoft AI den 1 oktober 2026 lanserade MAI-Transcribe-2-Streaming, sin första strömmande transkriptionsmodell, tillsammans med två nya text‑till‑tal‑modeller, MAI-Voice-2.1 och MAI-Voice-2.1-Flash, med alla tre tillgängliga via Microsoft Foundry.
MAI-Transcribe-2-Streaming och Artificial Analysis‑benchmarken
Microsoft beskriver MAI-Transcribe-2-Streaming som levererar låglatens, realtidsutskrifter på 60 språk med automatisk, kontinuerlig språkdetection. Företaget sade att modellen rankas som nr 1 för noggrannhet för både slutliga och partiella utskrifter på Artificial Analysis, och att den ligger på Pareto‑fronten i benchmarkens noggrannhet‑mot‑latens‑utvärdering, vilket innebär att högre noggrannhet inte kräver en tung latensuppoffring. Leaderboard‑diagrammet i inlägget, med hänvisning till Artificial Analysis streaming‑leaderboard daterad 28 september 2026, visar modellen med en slutlig ordfelssats på 2,5 procent, en första‑partial‑sats på 2,8 procent och 0,13 sekunder till slutlig transkription.
Istället för att vänta på att en talare ska avsluta innan text returneras, producerar modellen sina första hypoteser, kallade partiella, på strax över 100 millisekunder efter att ljud mottagits, och reviderar dem när mer kontext anländer innan en stabil transkription fastställs. Microsoft sade att detta gör det möjligt för röstaktiverade applikationer att agera på tal innan talaren är färdig: röstagenter kan börja resonera eller anropa verktyg mitt i en mening, och levande transkriptioner kan visas medan folk talar. För realtidsdiktering och undertextning uppgav företaget att interna utvärderingar visar att ord dyker upp i transkriptionen dubbelt så snabbt som med dess närmaste konkurrent.
Artificial Analysis uppger att dess AA-WER Streaming‑index mäter transkriptionsnoggrannhet för modeller där ljud strömmas i realtid, del för del, över ungefär åtta timmar ljud från tre dataset: AA-AgentTalk på 50 procent, VoxPopuli på 25 procent och Earnings22 på 25 procent. Datasets täcker verkligt tal med olika accenter, domänspecifik språkbruk och utmanande akustiska förhållanden, och benchmarkens Time to Final och Time to First Partial‑mätningar startar båda vid talets slut som detekteras av SileroVAD röstaktivitetsdetektor.
MAI-Transcribe-2-Streaming är tillgänglig till ett introduktionspris på $0,54 per timme ljud fram till årets slut. Modellen utökar Microsofts MAI‑ljudserie, som redan inkluderar MAI-Transcribe-2, den tidigare icke‑strömmande taligenkänningsmodellen som företaget marknadsförde som den snabbaste, mest exakta och billigaste i världen.
MAI-Voice-2.1 och MAI-Voice-2.1-Flash
MAI-Voice-2.1 stödjer 23 språk och 26 lokaler, och Microsoft sade att en enda röst kan använda dem alla med en naturlig accent, och behålla samma talaridentitet när språk byts. En handledningsapp, i företagets exempel, kan byta språk mitt i lektionen utan att byta lärare, och en flerspråkig assistent kan svara på vilket språk den tilltalas på samtidigt som den låter som samma röst. Modellen kostar $22 per 1 M tecken.
MAI-Voice-2.1-Flash stödjer samma språk och korsspråkande talare men är byggd för högvolym‑ och latenskänsliga arbetsbelastningar. Den kan generera upp till 45 sekunder ljud med en end‑to‑end‑latens på 150 millisekunder, och Microsoft sade att den levererar 55 procent snabbare modellinferens och är ungefär 60 procent billigare än jämförbara modeller. Den kostar $15 per 1 M tecken.
Båda röstmodellerna stödjer röstkloning på alla stödda språk med några sekunders referensljud, med inbyggda samtyckesgrindar som Microsoft sade förhindrar missbruk. I ett Turing‑test med 4 000 lyssnare som kombinerade de två nya röstmodellerna, bedömde 50,3 procent av lyssnarna MAI-Voice som lika eller mer människolik än mänskliga inspelningar, enligt Microsoft.
Microsoft presenterade kombinationen av MAI-Transcribe-2-Streaming med MAI-Voice-2.1-Flash som att återvinna tid i båda ändarna av en röst‑agent‑loop, sekvensen av att höra, förstå, besluta och tala inom det fönster där en människa fortfarande upplever interaktionen som ett samtal. Listade utvecklarfall inkluderar kundtjänstagenter som transkriberar förfrågningar när de uttalas och svarar med naturligt tal, flerspråkiga assistenter som upptäcker det talade språket och svarar på något av de 23 stödda MAI-Voice-språken, samt interaktiva lär‑ och medieapplikationer som använder olika talare för handledning, rollspel, simuleringar, berättarröst och konversationsinnehåll.
Tillgänglighet och Chatter‑demo
MAI-Voice-2.1 och MAI-Voice-2.1-Flash är tillgängliga via OpenRouter. Alla tre modellerna är tillgängliga via Microsoft Foundry, MAI Playground, Vercel och Azure Voice Live, med LiveKit angivet som kommande.
För att demonstrera modellerna i samverkan i en live‑agent byggde Microsoft Chatter, en ny demo i MAI Playground som låter användare prata med en röstassistent driven av transkriptions‑ och röstmodellerna.












