Modely a platformy AI

MAI-Transcribe-2 vede benchmark FLEURS ve 60 jazycích, uvádí Microsoft

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Microsoft AI uvedl MAI-Transcribe-2 dne 3. září 2026, model rozpoznávání řeči, o němž laboratoř uvádí, že je na benchmarku FLEURS ve 60 jazycích na první příčce s průměrnou chybovostí slov 5,2 %. Ve svém oznámení Microsoft popsal model jako svůj dosud nejvýkonnější transkripční systém a stanovil cenu 0,10 $ za hodinu audia.

Microsoft uvedl, že MAI-Transcribe-2 přidává diarizaci řečníků, konfigurovatelné styly transkripce a časové značky na úrovni slov, a překonává konkurenční modely včetně Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large a ScribeV2 v širším spektru reálných zvukových nahrávek. Podle oznámení model definuje Pareto‑frontu pro přesnost a latenci v rámci Artificial Analysis a obsazuje druhé místo v žebříčku chybovosti slov v Artificial Analysis, čímž zlepšuje výsledky předchozích verzí MAI-Transcribe.

Microsoft model zaměřil na úlohy jako jsou klinické zapisování poznámek, právní dokumentace, zpřístupnění a uzavřené titulkování. Společnost uvedla rychlejší inferenci s podstatně nižší latencí, zejména u dlouhých audiozáznamů, až desetinásobně rychlejší než u předních konkurentů. Dále uvedla, že model zachovává kvalitu transkripce i v hlučných podmínkách mimo kontrolované nahrávací prostředí.

Výsledky benchmarku

Na základě hodnocení provedených společností Artificial Analysis Microsoft uvedl, že MAI-Transcribe-2 je desetkrát rychlejší než GPT-Transcribe od OpenAI, sedmkrát rychlejší než Scribe v2 od ElevenLabs a pětkrát rychlejší než Gemini 3.5 Transcribe, přičemž dosahuje vyšší přesnosti. Společnost uvedla, že model stojí sám v nejatraktivnějším kvadrantu grafu přesnost‑vs‑rychlost benchmarku, s chybovostí 2,0 % a rychlostním faktorem 403,6, což znamená, že hodina audia je zpracována za přibližně deset sekund.

Na veřejném vícejazyčném benchmarku FLEURS Microsoft oznámil, že MAI-Transcribe-2 udržuje konzistentně vysokou úroveň přesnosti ve všech 60 testovaných jazycích. Společnost model popsala jako přesný ve více jazycích než kterýkoli jiný model a uvedla, že vývojáři transkribující v několika jazycích mohou spoléhat na jediný model, což snižuje složitost a potenciálně šetří využití GPU. Oznámení také uvádí, že rychlost a propustnost modelu umožňují Microsoftu nabídnout to, co nazval nejkonkurenceschopnější cenou na trhu. Při spuštění je hodinová sazba 0,10 $ časově omezená nabídka platná do konce roku.

Dostupnost a vývojářské funkce

Dokumentace Microsoft Learn uvádí, že MAI-Transcribe-2 je k dispozici v Azure Speech v rámci veřejného preview, bez smlouvy o úrovni služby a není doporučen pro produkční úlohy. Dokumentace popisuje MAI-Transcribe jako model převodu řeči na text vyvinutý interně týmem Microsoft AI, který pokrývá úlohy jako titulkování videí, schůzky, klinické poznámky, dokumentaci call center, nástroje pro zpřístupnění, tvorbu obsahu a hlasové agenty. Také uvádí MAI-Transcribe-2 vedle starších verzí MAI-Transcribe-1.5 a MAI-Transcribe-1, přičemž poslední byl zrušen 20. srpna 2026.

Požadavky jsou směrovány přes rozšířený režim Fast Transcription API, přičemž model je vybrán nastavením vlastnosti modelu v rozšířeném režimu na MAI-Transcribe-2. Vstupní audio je omezeno na soubory do 300 MB ve formátech WAV, MP3 nebo FLAC a jeho použití vyžaduje předplatné Azure a zdroj Microsoft Foundry pro Speech.

Volitelné parametry řídí sadu funkcí modelu. Diarizace řečníků segmentuje nahrávku podle řečníka a vrací segmenty označené řečníkem s metadaty posunu a délky. Časové značky na úrovni slov poskytují časování každého slova, zatímco volba segment vrací časování podle segmentu a volba none vynechává časová data. Parametr phrase‑list upřednostňuje rozpoznávání podle dodaných termínů, jako jsou doménově specifické výrazy, zkratky a vlastní jména, přičemž dokumentace uvádí, že termíny fungují jako nápovědy, nikoli jako vynucený výstup.

Parametr stylu transkripce je ve výchozím nastavení verbatim, který zachycuje řeč přesně tak, jak je vyslovena, včetně výplňových slov a falešných začátků, pro účely shody, QA a analytických úloh. Nastavení clean odstraňuje výplňové slova a automaticky formátuje běžné vzorce řeči, aby vytvořilo čitelnější titulky, poznámky a publikované přepisy. Výběr jazyka je volitelný; ve výchozím nastavení model automaticky detekuje mluvený jazyk a dokumentace doporučuje vynutit konkrétní jazyk pouze v případě selhání automatické detekce. Přepínání kódu mezi smíšenými jazykovými páry, jako jsou Hinglish a Spanglish, je zpracováváno automaticky a odolnost vůči šumu u nahrávek pořízených mimo kontrolované prostředí je inherentní modelu.

Dokumentace také uvádí, že MAI-Transcribe může poskytovat transkripci vstupního audia v rámci Voice Live API prostřednictvím pole konfigurace relace. Microsoft uvedl, že model je k dispozici k demonstraci prostřednictvím Microsoft Foundry a MAI Playground, přičemž dostupnost na OpenRouter je uvedena jako brzy.

Jonas Reeve je analytikum generovaným pomocí AI ve společnosti Unite.AI, zaměřujícím se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojového učení. Jeho práce zkoumá, jak se učí, reasoning, paměť a abstrakce objevují v biologických i umělých systémech, a to tím, že spojuje moderní architektury AI s dlouholetými otázkami kognitivní vědy a filozofie mysli.
S konceptuálním a reflexivním přístupem Jonas zkoumá rámce, jako jsou modely uvažování, agentic systémy, emergentní kognice a teorie sladění, s cílem objasnit, co skutečně znamená pokrok směrem k AGI - a co ne. Místo toho, aby sledoval termíny nebo hype, zdůrazňuje první principy, konceptuální rigor a limity současných modelů.
Články napsané Jonasem Reeveem jsou generovány pomocí AI a recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, jasnost a odpovědnou diskusi o pokročilých konceptech AI.