AI-modeller og platforme

Microsoft lancerer MAI-Transcribe-2-Streaming og to MAI-Voice-modeller

mm
Føj Unite.AI til dine foretrukne kilder på Google

Microsoft AI den 1. oktober 2026 lancerede MAI-Transcribe-2-Streaming, sin første streaming-transskriptionsmodel, sammen med to nye tekst‑til‑tale‑modeller, MAI-Voice-2.1 og MAI-Voice-2.1-Flash, hvor alle tre er tilgængelige via Microsoft Foundry.

MAI-Transcribe-2-Streaming og Artificial Analysis‑benchmarken

Microsoft beskriver MAI-Transcribe-2-Streaming som leverer lav‑latens, realtids‑transskriptioner på 60 sprog med automatisk, kontinuerlig sprogdetektion. Virksomheden sagde, at modellen rangerer nr. 1 i nøjagtighed for både endelige og delvise transskriptioner på Artificial Analysis, og at den befinder sig på Pareto‑fronten af benchmarkens nøjagtighed‑mod‑latens‑evaluering, hvilket betyder, at højere nøjagtighed ikke kræver en tung latens‑kompromis. Ranglisten i indlægget, der citerer Artificial Analysis streaming‑ranglisten dateret 28. september 2026, viser modellen med en endelig ord‑fejlrate på 2,5 %, en første‑partial‑rate på 2,8 % og 0,13 sekunder til endelig transskription.

I stedet for at vente på, at en taler er færdig, før teksten returneres, producerer modellen sine første hypoteser, kendt som partialer, på lidt over 100 millisekunder efter modtagelse af lyd, hvorefter de revideres, efterhånden som mere kontekst ankommer, før en stabil transskription fastlægges. Microsoft sagde, at dette gør det muligt for stemmeaktiverede applikationer at reagere på tale, før taleren er færdig: stemmeagenter kan begynde at ræsonnere eller kalde værktøjer midt i en sætning, og live‑transskriptioner kan vises, mens folk taler. Til realtids‑diktering og undertekster sagde virksomheden, at interne evalueringer viser, at ord dukker op i transskriptionen dobbelt så hurtigt som hos den nærmeste konkurrent.

Artificial Analysis siger at dens AA-WER Streaming‑indeks måler transskriptionsnøjagtighed for modeller, hvor lyd strømmer i realtid, stykke for stykke, over cirka otte timer lyd fra tre datasæt: AA-AgentTalk på 50 %, VoxPopuli på 25 % og Earnings22 på 25 %. Datasættene dækker tale fra den virkelige verden med forskellige accenter, domænespecifik sprogbrug og udfordrende akustiske forhold, og benchmarkens målinger for Time to Final og Time to First Partial starter begge ved slutningen af tale, som detekteres af SileroVAD stemme‑aktivitet‑detektoren.

MAI-Transcribe-2-Streaming er tilgængelig til en introduktionspris på $0,54 pr. time lyd frem til årets udgang. Modellen udvider Microsofts MAI‑lydløsning, som allerede omfatter MAI-Transcribe-2, den tidligere ikke‑streamende talegenkendelsesmodel, som virksomheden beskrev som den hurtigste, mest nøjagtige og billigste i verden.

MAI-Voice-2.1 og MAI-Voice-2.1-Flash

MAI-Voice-2.1 understøtter 23 sprog og 26 lokaler, og Microsoft sagde, at en enkelt stemme kan bruge dem alle med en naturlig accent, mens den bevarer den samme taleridentitet ved sprogskift. En tutor‑app, i virksomhedens eksempel, kan skifte sprog midt i en lektion uden at udskifte undervisere, og en flersproget assistent kan svare på det sprog, den adresseres på, mens den stadig lyder som den samme stemme. Modellen koster $22 pr. 1 M tegn.

MAI-Voice-2.1-Flash understøtter de samme sprog og tvær‑sproglige talere, men er bygget til høj‑volumen‑ og latens‑følsomme arbejdsbelastninger. Den kan generere op til 45 sekunder lyd med en ende‑til‑ende‑latens på 150 millisekunder, og Microsoft sagde, at den leverer 55 % hurtigere model‑inference og er cirka 60 % billigere end tilsvarende modeller. Den koster $15 pr. 1 M tegn.

Begge stemmemodeller understøtter stemmekloning på tværs af alle understøttede sprog ved hjælp af nogle få sekunders reference‑lyd, med indbyggede samtykkesikringer, som Microsoft sagde forhindrer misbrug. I en Turing‑test med 4.000 lyttere, der kombinerede de to nye stemmemodeller, vurderede 50,3 % af lytterne MAI-Voice som lige så eller mere menneskelig end menneskelige optagelser, sagde Microsoft.

Microsoft beskrev kombinationen af MAI-Transcribe-2-Streaming med MAI-Voice-2.1-Flash som at købe tid tilbage i begge ender af en stemme‑agent‑sløjfe, sekvensen af at høre, forstå, beslutte og tale inden for det tidsrum, hvor et menneske stadig oplever interaktionen som en samtale. Angivne udvikler‑brugsscenarier omfatter kundeservice‑agenter, der transskriberer anmodninger, mens de udtales, og svarer i naturlig tale, flersprogede assistenter, der opdager det talte sprog og svarer på ethvert af de 23 understøttede MAI-Voice‑sprog, samt interaktive lærings‑ og medie‑applikationer, der bruger forskellige talere til undervisning, rollespil, simuleringer, fortælling og samtaleindhold.

Tilgængelighed og Chatter‑demoen

MAI-Voice-2.1 og MAI-Voice-2.1-Flash er tilgængelige via OpenRouter. Alle tre modeller er tilgængelige via Microsoft Foundry, MAI Playground, Vercel og Azure Voice Live, med LiveKit angivet som kommende snart.

For at demonstrere modellerne i samarbejde i en live‑agent byggede Microsoft Chatter, en ny demo i MAI Playground, som lader brugere tale med en stemmeassistent drevet af transskriptions‑ og stemmemodellerne.

Jonas Reeve er en AI-genereret analytiker hos Unite.AI, med fokus på kognitiv AI, kunstig generel intelligens (AGI) og de teoretiske grundlag for maskinintelligens. Hans arbejde undersøger, hvordan læring, ræsonnement, hukommelse og abstraktion opstår i både biologiske og kunstige systemer, og trækker forbindelser mellem moderne AI-arkitekturer og langvarige spørgsmål inden for kognitiv videnskab og sindets filosofi.

Med en konceptuel og reflekterende tilgang undersøger Jonas rammer som ræsonneringsmodeller, agentbaserede systemer, emergent kognition og justeringsteori, med det formål at tydeliggøre, hvad fremskridt mod AGI faktisk betyder – og hvad det ikke gør. I stedet for at jagte tidslinjer eller hype lægger han vægt på første principper, konceptuel stringens og begrænsningerne i de nuværende modeller.

Artikler skrevet af Jonas Reeve er AI-genererede og gennemgået af Unite.AI’s redaktionsteam for at sikre nøjagtighed, klarhed og ansvarlig diskussion af avancerede AI-koncept.