AI-modeller og plattformer

Microsoft lanserer MAI-Transcribe-2-Streaming og to MAI-Voice-modeller

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Microsoft AI den 1. oktober 2026 lanserte MAI-Transcribe-2-Streaming, sin første strømmende transkripsjonsmodell, sammen med to nye tekst‑til‑tale‑modeller, MAI-Voice-2.1 og MAI-Voice-2.1-Flash, hvor alle tre er tilgjengelige via Microsoft Foundry.

MAI-Transcribe-2-Streaming og Artificial Analysis‑benchmarken

Microsoft beskriver MAI-Transcribe-2-Streaming som leverer lav‑latens, sanntids‑transkripsjoner på 60 språk med automatisk, kontinuerlig språkgjenkjenning. Selskapet opplyser at modellen rangerer nr. 1 for nøyaktighet både for endelige og delvise transkripsjoner på Artificial Analysis, og at den befinner seg på Pareto‑fronten i benchmarkens nøyaktighet‑mot‑latens‑evaluering, noe som betyr at høyere nøyaktighet ikke krever en tung latens‑kompromiss. Ranglistediagrammet i innlegget, som refererer til Artificial Analysis streaming‑ranglisten datert 28. september 2026, viser modellen med en endelig ord‑feilrate på 2,5 prosent, en første‑delvis rate på 2,8 prosent, og 0,13 sekunder til endelig transkripsjon.

I stedet for å vente på at en taler skal bli ferdig før teksten returneres, produserer modellen sine første hypoteser, kalt delvise transkripsjoner, på litt over 100 millisekunder etter at lyd mottas, og reviderer dem etter hvert som mer kontekst kommer før den fastslår en stabil transkripsjon. Microsoft sier at dette gjør det mulig for stemmeaktiverte applikasjoner å reagere på tale før taleren er ferdig: stemmeagenter kan begynne å resonere eller kalle verktøy midt i en setning, og live‑transkripsjoner kan vises mens folk snakker. For sanntids‑diktering og underteksting oppgir selskapet at interne tester viser at ord dukker opp i transkripsjonen dobbelt så raskt som med den nærmeste konkurrenten.

Artificial Analysis oppgir at dens AA‑WER Streaming‑indeks måler transkripsjonsnøyaktighet for modeller der lyd strømmer i sanntid, del for del, over omtrent åtte timer lyd fra tre datasett: AA‑AgentTalk på 50 prosent, VoxPopuli på 25 prosent, og Earnings22 på 25 prosent. Datasettene dekker ekte tale med ulike aksenter, domene‑spesifikt språk og utfordrende akustiske forhold, og benchmarkens målinger for Time to Final og Time to First Partial starter begge ved slutten av tale oppdaget av SileroVAD‑stemme‑aktivitetsdetektor.

MAI-Transcribe-2-Streaming er tilgjengelig til en introduksjonspris på $0.54 per time med lyd frem til årsskiftet. Modellen utvider Microsofts MAI‑lydlinje, som allerede inkluderer MAI-Transcribe-2, den tidligere ikke‑strømmende talegjenkjenningsmodellen som selskapet markerte som den raskeste, mest nøyaktige og billigste i verden.

MAI-Voice-2.1 og MAI-Voice-2.1-Flash

MAI-Voice-2.1 støtter 23 språk og 26 lokaler, og Microsoft sier at en enkelt stemme kan bruke dem alle med en naturlig aksent, og beholder samme taleridentitet ved språkbytte. En veiledningsapp, i selskapets eksempel, kan bytte språk midt i en leksjon uten å bytte lærer, og en flerspråklig assistent kan svare på hvilket som helst språk den blir tiltalt på samtidig som den høres ut som samme stemme. Modellen har en pris på $22 per 1M tegn.

MAI-Voice-2.1-Flash støtter de samme språkene og tverrspråklige talere, men er bygget for høy‑volum, latens‑følsomme arbeidsbelastninger. Den kan generere opptil 45 sekunder lyd med en ende‑til‑ende‑latens på 150 millisekunder, og Microsoft oppgir at den gir 55 prosent raskere modell‑infernse og er omtrent 60 prosent billigere enn sammenlignbare modeller. Den har en pris på $15 per 1M tegn.

Begge stemmemodellene støtter stemmekloning på tvers av alle støttede språk ved hjelp av noen sekunders referanselyd, med innebygde samtykkesperrer som Microsoft sier forhindrer misbruk. I en Turing‑test med 4 000 lyttere som kombinerte de to nye stemmemodellene, vurderte 50,3 prosent av lytterne MAI-Voice som like eller mer menneskelig enn menneskelige opptak, oppgir Microsoft.

Microsoft presenterte kombinasjonen av MAI-Transcribe-2-Streaming med MAI-Voice-2.1-Flash som en måte å kjøpe tilbake tid i begge ender av en stemme‑agent‑sløyfe, sekvensen av å høre, forstå, beslutte og snakke innenfor tidsvinduet hvor et menneske fortsatt opplever interaksjonen som en samtale. Oppførte utvikler‑brukstilfeller inkluderer kundeservicerepresentanter som transkriberer forespørsler mens de blir uttalt og svarer med naturlig tale, flerspråklige assistenter som oppdager det talte språket og svarer på et av de 23 støttede MAI-Voice-språkene, samt interaktive lærings‑ og medieapplikasjoner som bruker ulike talere for veiledning, rollespill, simuleringer, fortelling og samtaleinnhold.

Tilgjengelighet og Chatter‑demoen

MAI-Voice-2.1 og MAI-Voice-2.1-Flash er tilgjengelige via OpenRouter. Alle tre modellene er tilgjengelige gjennom Microsoft Foundry, MAI Playground, Vercel og Azure Voice Live, med LiveKit oppført som kommende.

For å demonstrere modellene i samarbeid i en live‑agent, bygde Microsoft Chatter, en ny demo i MAI Playground som lar brukere snakke med en stemmeassistent drevet av transkripsjons‑ og stemmemodellene.

Jonas Reeve er en AI-generert analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generell intelligens (AGI) og de teoretiske grunnlagene for maskinintelligens. Arbeidet hans utforsker hvordan læring, resonnering, hukommelse og abstraksjon oppstår i både biologiske og kunstige systemer, og trekker forbindelser mellom moderne AI-arkitekturer og langvarige spørsmål innen kognitiv vitenskap og sinnets filosofi.

Med en konseptuell og reflekterende tilnærming undersøker Jonas rammeverk som resonneringsmodeller, agentbaserte systemer, emergent kognisjon og justeringsteori, med mål om å klargjøre hva fremgang mot AGI faktisk betyr – og hva det ikke betyr. I stedet for å jage tidslinjer eller hype, legger han vekt på første prinsipper, konseptuell grundighet og begrensningene i dagens modeller.

Artikler skrevet av Jonas Reeve er AI-genererte og gjennomgås av Unite.AI sitt redaksjonsteam for å sikre nøyaktighet, klarhet og ansvarlig diskusjon av avanserte AI-konsepter.