Modely a platformy AI

Microsoft uvádí MAI-Transcribe-2-Streaming a dva modely MAI-Voice

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Microsoft AI dne 1. října 2026 spustil MAI-Transcribe-2-Streaming, svůj první model pro streamování přepisů, spolu se dvěma novými modely převodu textu na řeč, MAI-Voice-2.1 a MAI-Voice-2.1-Flash, přičemž všechny tři jsou k dispozici prostřednictvím Microsoft Foundry.

MAI-Transcribe-2-Streaming a benchmark Artificial Analysis

Microsoft popisuje MAI-Transcribe-2-Streaming jako poskytující přepisy v reálném čase s nízkou latencí ve 60 jazycích s automatickým, kontinuálním rozpoznáváním jazyka. Společnost uvedla, že model je na první příčce co do přesnosti jak pro konečné, tak pro částečné přepisy v benchmarku Artificial Analysis, a že se nachází na Pareto frontě hodnocení přesnosti versus latence, což znamená, že vyšší přesnost nevyžaduje výraznou latenci. Graf žebříčku v příspěvku, citující streamingový žebříček Artificial Analysis ze dne 28. září 2026, ukazuje model s konečnou chybovostí slov 2,5 %, první‑částečnou chybovostí 2,8 % a 0,13 sekundy do konečného přepisu.

Místo čekání, až mluvčí dokončí, než se vrátí text, model vytváří své první hypotézy, známé jako částečné, už za pouhých 100 milisekund od zachycení audia a poté je upravuje, jakmile přichází více kontextu, předtím než vytvoří stabilní přepis. Microsoft uvedl, že to umožňuje aplikacím s podporou hlasu reagovat na řeč ještě před tím, než mluvčí skončí: hlasoví agenti mohou začít uvažovat nebo volat nástroje uprostřed věty a živé přepisy se mohou zobrazovat během rozhovoru. Pro reálné diktování a titulkování společnost uvedla, že její interní hodnocení ukazují, že slova se v přepisu objevují dvakrát rychleji než u nejbližšího konkurenta.

Artificial Analysis uvádí, že jeho index AA-WER Streaming měří přesnost přepisu pro modely, kde audio proudí v reálném čase po částech, přibližně po osm hodin audia ze tří datových sad: AA-AgentTalk s 50 %, VoxPopuli s 25 % a Earnings22 s 25 %. Datové sady zahrnují reálnou řeč s různorodými přízvuky, doménově specifickým jazykem a náročnými akustickými podmínkami a měření benchmarku Time to Final a Time to First Partial začínají na konci řeči detekované detektorem hlasové aktivity SileroVAD.

MAI-Transcribe-2-Streaming je k dispozici za úvodní cenu $0,54 za hodinu audia až do konce roku. Model rozšiřuje řadu audio produktů MAI od Microsoftu, která již zahrnuje MAI-Transcribe-2, dřívější model rozpoznávání řeči bez streamování, který společnost označila za nejrychlejší, nejpřesnější a nejlevnější na světě.

MAI-Voice-2.1 a MAI-Voice-2.1-Flash

MAI-Voice-2.1 podporuje 23 jazyků a 26 lokalit a Microsoft uvedl, že jediný hlas může všechny tyto jazyky používat s rodilým přízvukem a zachovat stejnou identitu mluvčího při přepínání jazyků. V příkladu společnosti může výuková aplikace během lekce přepínat jazyky bez výměny učitelů a vícejazyčný asistent může odpovídat v jakémkoli jazyce, ve kterém je osloven, a přitom stále zněl jako stejný hlas. Model má cenu $22 za 1 M znaků.

MAI-Voice-2.1-Flash podporuje stejné jazyky a mluvčí napříč jazyky, ale je určen pro vysoký objem a latenci citlivé úlohy. Dokáže vygenerovat až 45 sekund audia s end‑to‑end latencí 150 milisekund a Microsoft uvedl, že poskytuje o 55 % rychlejší inferenci modelu a je přibližně o 60 % levnější než srovnatelné modely. Model má cenu $15 za 1 M znaků.

Oba hlasové modely podporují klonování hlasu ve všech podporovaných jazycích pomocí několika sekund referenčního audia a mají vestavěné ochranné zábrany souhlasu, které podle Microsoftu zabraňují zneužití. V Turingově testu s 4 000 posluchači, který kombinoval oba nové hlasové modely, 50,3 % posluchačů ohodnotilo MAI-Voice jako stejně nebo více lidský než lidské nahrávky, uvedl Microsoft.

Microsoft představil spárování MAI-Transcribe-2-Streaming s MAI-Voice-2.1-Flash jako získání času na obou koncích smyčky hlasového agenta, tedy sekvence poslouchání, porozumění, rozhodování a mluvení v rámci okna, kde člověk stále vnímá interakci jako konverzaci. Uvedené případy použití pro vývojáře zahrnují zákaznické agenty, kteří přepisují požadavky během jejich výslovnosti a odpovídají v přirozené řeči, vícejazyčné asistenty, kteří rozpoznají mluvený jazyk a odpoví v libovolném ze 23 podporovaných jazyků MAI-Voice, a interaktivní výukové a mediální aplikace využívající odlišné mluvčí pro výuku, hraní rolí, simulace, vyprávění a konverzační obsah.

Dostupnost a demo Chatter

MAI-Voice-2.1 a MAI-Voice-2.1-Flash jsou k dispozici prostřednictvím OpenRouter. Všechny tři modely jsou k dispozici přes Microsoft Foundry, MAI Playground, Vercel a Azure Voice Live, přičemž LiveKit je uveden jako brzy dostupný.

Aby ukázal, jak modely spolupracují v živém agentovi, Microsoft vytvořil Chatter, nové demo v MAI Playground, které umožňuje uživatelům mluvit s hlasovým asistentem poháněným transkripčními a hlasovými modely.

Jonas Reeve je analytik vytvořený umělou inteligencí ve Unite.AI, zaměřuje se na kognitivní AI, umělou obecnou inteligenci (AGI) a teoretické základy strojové inteligence. Jeho práce zkoumá, jak se učení, uvažování, paměť a abstrakce objevují jak v biologických, tak v umělých systémech, a vytváří spojení mezi moderními architekturami AI a dlouhodobými otázkami kognitivní vědy a filozofie mysli.

S konceptuálním a reflexivním přístupem Jonas zkoumá rámce jako modely uvažování, agentické systémy, emergentní kognice a teorii zarovnání, s cílem objasnit, co skutečně znamená pokrok směrem k AGI – a co ne. Místo honby za termíny nebo hype zdůrazňuje první principy, konceptuální přísnost a limity současných modelů.

Články napsané Jonasem Reeve jsou generovány AI a jsou recenzovány redakčním týmem Unite.AI, aby zajistily přesnost, srozumitelnost a odpovědnou diskusi o pokročilých konceptech AI.