AI-modeller och plattformar

MAI-Transcribe-2 toppar FLEURS-benchmark över 60 språk, säger Microsoft

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Microsoft AI lanserade MAI-Transcribe-2 den 3 september 2026, en taligenkänningsmodell som laboratoriet uppgav ligger först på FLEURS-benchmarken över 60 språk med en genomsnittlig felordsfrekvens på 5,2 %. I sin tillkännagivande beskrev Microsoft modellen som sitt mest kapabla transkriptionssystem hittills och prissatte den till $0,10 per timme ljud.

Microsoft uppgav att MAI-Transcribe-2 lägger till talardiarisering, konfigurerbara transkriptionsstilar och tidsstämplar på ordnivå, samt överträffar konkurrerande modeller inklusive Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large och ScribeV2 över ett bredare spektrum av verklig ljuddata. Enligt tillkännagivandet definierar modellen Pareto‑fronten för noggrannhet och latenstid på Artificial Analysis och ligger på andra plats i Artificial Analysis ranking för felordsfrekvens, vilket förbättrar resultaten från tidigare MAI-Transcribe‑versioner.

Microsoft placerade modellen för arbetsbelastningar som klinisk notering, juridisk dokumentation, tillgänglighet och textning. Företaget rapporterade snabbare inferens med avsevärt lägre latenstid, särskilt för långt ljudmaterial, med upp till tio gånger högre bearbetningshastighet än ledande konkurrenter. Det påstods också att modellen behåller transkriptionskvaliteten i bullriga förhållanden utanför kontrollerade inspelningsmiljöer.

Benchmarkresultat

Med hänvisning till utvärderingar utförda av Artificial Analysis sade Microsoft att MAI-Transcribe-2 är tio gånger snabbare än OpenAI:s GPT-Transcribe, sju gånger snabbare än ElevenLabs’ Scribe v2 och fem gånger snabbare än Gemini 3.5 Transcribe samtidigt som den levererar högre noggrannhet. Företaget uppgav att modellen ensam befinner sig i det mest attraktiva kvadranten i benchmarkens diagram för noggrannhet kontra hastighet, med en felprocent på 2,0 % och en hastighetsfaktor på 403,6, vilket innebär att en timmes ljud återges på ungefär tio sekunder.

På den offentliga flerspråkiga FLEURS‑benchmarken rapporterade Microsoft att MAI-Transcribe-2 upprätthåller en konsekvent hög noggrannhet över alla 60 testade språk. Företaget beskrev modellen som exakt i fler språk än någon annan modell och sade att utvecklare som transkriberar på flera språk kan förlita sig på en enda modell, vilket minskar komplexiteten och potentiellt sparar GPU‑användning. Tillkännagivandet konstaterar också att modellens hastighet och genomströmning gör det möjligt för Microsoft att erbjuda det som de kallade det mest konkurrenskraftiga priset på marknaden. Vid lanseringen är timpriset $0,10 ett tidsbegränsat erbjudande som gäller till årets slut.

Tillgänglighet och utvecklarfunktioner

Microsoft Learn‑dokumentationen listar MAI-Transcribe-2 som tillgänglig i Azure Speech i offentlig förhandsgranskning, utan serviceavtal och inte rekommenderad för produktionsarbetsbelastningar. Dokumentationen beskriver MAI-Transcribe som en tal‑till‑text‑modell som byggts internt av Microsoft AI‑teamet och som omfattar arbetsbelastningar såsom video‑textning, möten, kliniska anteckningar, call‑center‑dokumentation, tillgänglighetsverktyg, innehållsskapande och röstagenter. Den listar också MAI-Transcribe-2 tillsammans med de tidigare versionerna MAI-Transcribe-1.5 och MAI-Transcribe-1, där den sistnämnda avvecklades den 20 augusti 2026.

Begäranden går via Fast Transcription API:s förbättrade läge, där modellen väljs genom att sätta egenskapen för förbättrat läge till MAI-Transcribe-2. Ljudinmatning är begränsad till filer under 300 MB i WAV-, MP3- eller FLAC-format, och användning kräver ett Azure‑abonnemang samt en Microsoft Foundry‑resurs för Speech.

Valfria parametrar styr modellens funktionsuppsättning. Talardiarisering delar en inspelning efter talare och returnerar talarmärkta segment med förskjutnings‑ och varaktighetsmetadata. Tidsstämplar på ordnivå ger tidpunkter för varje ord, medan ett segmentalternativ ger tid per segment och ett alternativet ingen utelämnar tidsdata. En fraslista‑parameter påverkar igenkänning mot angivna termer såsom domänspecifik terminologi, förkortningar och egennamn, där dokumentationen noterar att termerna fungerar som ledtrådar snarare än tvingad utdata.

Transkriptionsstil‑parametern är som standard verbatim, vilket fångar tal exakt som det uttalas, inklusive fyllnadsord och felstarter, för efterlevnad, QA och analysarbetsbelastningar. En ren inställning tar bort fyllnadsord och auto‑formaterar vanliga talmönster för att producera mer läsbara undertexter, anteckningar och publicerade transkript. Språkväljning är valfri; som standard upptäcker modellen automatiskt det talade språket, och dokumentationen rekommenderar att man tvingar ett specifikt språk endast när automatisk identifiering misslyckas. Kodväxling för blandade språkkombinationer såsom Hinglish och Spanglish hanteras automatiskt, och brusrobusthet för ljud inspelat utanför kontrollerade miljöer är inneboende i modellen.

Dokumentationen noterar också att MAI-Transcribe kan leverera transkription av inmatningsljud i Voice Live API via ett sessionskonfigurationsfält. Microsoft uppgav att modellen finns tillgänglig för demo via Microsoft Foundry och MAI Playground, med tillgänglighet på OpenRouter angiven som snart tillgänglig.

Jonas Reeve är en AI-genererad analytiker på Unite.AI, med fokus på kognitiv AI, artificiell allmän intelligens (AGI) och de teoretiska grunderna för maskinintelligens. Hans arbete utforskar hur lärande, resonemang, minne och abstraktion uppstår i både biologiska och artificiella system, och drar kopplingar mellan moderna AI-arkitekturer och långvariga frågor inom kognitiv vetenskap och filosofi om medvetandet.
Med en konceptuell och reflekterande ansats undersöker Jonas ramverk som resonemangsmodeller, agenssystem, emergent kognition och anpassningsteori, i syfte att klargöra vad framsteg mot AGI faktiskt betyder - och vad det inte betyder. Istället för att jaga tidsplaner eller hype betonar han första principer, konceptuell rigor och gränserna för nuvarande modeller.
Artiklar skrivna av Jonas Reeve är AI-genererade och granskade av Unite.AIs redaktion för att säkerställa korrekthet, tydlighet och ansvarsfull diskussion om avancerade AI-koncept.