Modely a platformy AI
Spuštění CNTXT AI Munsit: Nejpřesnější arabština Rozpoznávání Řeči, Které Bylo Vytvořeno
V okamžiku, který definuje arabskou umělou inteligenci, CNTXT AI představilo Munsit, model rozpoznávání arabštiny, který je nejen nejpreciznější, jaký byl kdy vytvořen pro arabštinu, ale také výrazně překonává globální giganty, jako je OpenAI, Meta, Microsoft (MSFT ) a ElevenLabs v standardních benchmarcích. Vyvinutý ve Spojených arabských emirátech a přizpůsobený pro arabštinu od základu, Munsit představuje mocný krok vpřed v tom, co CNTXT nazývá „suverénní AI“ – technologií vyvinutou v regionu, pro region, ale s globální konkurenceschopností.
Vědecké základy tohoto úspěchu jsou popsány v nově zveřejněné práci, “Rozvoj arabštiny Rozpoznávání Řeči Skrze Velkým Měřítkem Slabě Dozorované Učení“, která představuje škálovatelnou, datově efektivní metodu školení, která řeší dlouhodobý nedostatek označených arabštinových dat o řeči. Tato metoda – slabě dozorované učení – umožnila týmu vytvořit systém, který nastavuje novou laťku pro kvalitu přepisu napříč moderní standardní arabštinou (MSA) a více než 25 regionálními dialekty.
Překonání Sucha Dat v Arabštině ASR
Arabština, navzdory tomu, že je jedním z nejvíce mluvených jazyků na světě a úředním jazykem Organizace spojených národů, byla dlouho považována za jazyk s nízkými zdroji v oblasti rozpoznávání řeči. To pramení z její morfoologické složitosti a nedostatku velkých, rozmanitých, označených speech dat. Na rozdíl od angličtiny, která profituje z nekonečných hodin ručně přepisovaného audiozáznamu, bohatost arabštiny a její fragmentovaná digitální přítomnost představovaly významné výzvy pro budování robustních automatických systémů rozpoznávání řeči (ASR).
Místo čekání na pomalý a nákladný proces ručního přepisu se CNTXT AI vydal radikálnější cestou: slabou supervizi. Jejich přístup začal s obrovskou sbírkou více než 30 000 hodin neznačených arabštinových audiozáznamů shromážděných z různých zdrojů. Prostřednictvím vlastního softwaru pro zpracování dat byl tento surový audiozáznam vyčištěn, segmentován a automaticky označen, aby se vytvořila vysoce kvalitní 15 000hodinová trénovací data – jedna z největších a nejreprezentativnějších arabštinových speech korpusů, které byly kdy sestaveny.
Tento proces se neopíral o lidské označení. Místo toho CNTXT vyvinul vícestupňový systém pro generování, hodnocení a filtrování hypotéz z více modelů ASR. Tyto přepisy byly porovnány pomocí Levenshteinovy vzdálenosti, aby se vybraly nejvíce konzistentní hypotézy, a poté prošly jazykovým modelem, aby se vyhodnotila jejich gramatická pravděpodobnost. Segmenty, které nesplnily stanovené prahové hodnoty kvality, byly vyřazeny, čímž se zajistilo, že i bez lidského ověření zůstala trénovací data spolehlivá. Tým tento pipeline vylepšil prostřednictvím několika iterací, přičemž každá iterace zlepšovala přesnost označení tím, že se systém ASR sám znovu trénoval a opětovně zapojil do procesu označení.
Pohon Munsit: Architektura Conformer
V srdci Munsitu je architektura Conformer, hybridní neuronová síť, která kombinuje lokální citlivost konvolučních vrstev s globální sekvencí modelování transformátorů. Tento design činí Conformer zvláště vhodným pro zpracování nuancí mluveného jazyka, kde jsou důležité jak dlouhodobé závislosti (jako je struktura vět), tak i jemné fonetické detaily.
CNTXT AI implementoval velkou variantu Conformeru, kterou trénoval od základu pomocí 80kanálových mel-spektrogramů jako vstupu. Model se skládá z 18 vrstev a obsahuje přibližně 121 milionů parametrů. Trénování se provádělo na high-performance clusteru pomocí osmi NVIDIA A100 GPU s bfloat16 přesností, což umožnilo efektivní zpracování velkých dávek a vysoce dimenzionálních prostor funkcí. Pro tokenizaci arabštiny s morfologicky bohatou strukturou tým použil tokenizér SentencePiece, který byl speciálně trénován na jejich vlastním korpusu, což vedlo k slovníku o 1 024 subword jednotkách.
Na rozdíl od konvenčního dohledovaného trénování ASR, které obvykle vyžaduje, aby každý audiozáznam byl spárován s pečlivě přepsanou etiketou, metoda CNTXT fungovala zcela na slabých etiketách. Tyto etikety, i když šumivější než lidsky ověřené, byly optimalizovány prostřednictvím zpětné vazby, která upřednostňovala konsenzus, gramatickou koherenci a lexikální pravděpodobnost. Model byl trénován pomocí Connectionist Temporal Classification (CTC) loss funkce, která je vhodná pro modelování nezarovnaných sekvencí – kritické pro úkoly rozpoznávání řeči, kde je časování mluvených slov variabilní a nepředvídatelné.
Dominance v Benchmarcích
Výsledky samy o sobě hovoří. Munsit byl testován proti vedoucím open-source a komerčním modelům ASR na šesti benchmarkových arabštinových datech: SADA, Common Voice 18.0, MASC (čisté a šumové), MGB-2 a Casablanca. Tyto datové sady pokrývají desítky dialektů a přízvuků napříč arabským světem, od Saúdské Arábie po Maroko.
V rámci všech benchmarků dosáhl Munsit-1 průměrné chybovosti slova (WER) 26,68 a chybovosti znaku (CER) 10,05. Pro srovnání, nejlepší verze OpenAI Whisper dosáhla průměrné WER 36,86 a CER 17,21. Meta’s SeamlessM4T, další špičkový multilingvální model, dosáhl ještě vyšších hodnot. Munsit překonal každý jiný systém na čistých i šumových datech a prokázal zvláště silnou odolnost vůči šumu, což je kritický faktor pro reálné aplikace, jako jsou call centra a veřejné služby.
Rozdíl byl stejně markantní proti proprietárním systémům. Munsit překonal modely Microsoft Azure pro arabštinu, ElevenLabs Scribe a dokonce i funkci OpenAI GPT-4o transkript. Tyto výsledky nejsou marginálními zlepšeními – představují průměrné relativní zlepšení o 23,19 % v WER a 24,78 % v CER ve srovnání se silným otevřeným benchmarkem, čímž se Munsit stal jasným lídrem v arabštině rozpoznávání řeči.
Platforma pro Budoucnost Arabštiny Voice AI
Zatímco Munsit-1 již transformuje možnosti přepisu, titulkování a zákaznické podpory na arabských trzích, CNTXT AI vidí tento launch jako pouze začátek. Společnost si představuje plnou škálu arabštinových hlasových technologií, včetně text-to-speech, hlasových asistentů a systémů pro reálný překlad – všechny založené na suverénní infrastruktuře a regionálně relevantní AI.
„Munsit je víc než jen průlom v rozpoznávání řeči,“ řekl Mohammad Abu Sheikh, CEO CNTXT AI. „Je to prohlášení, že arabština patří do čela globální AI. Prokázali jsme, že špičková AI nemusí být importována – může být vyvinuta zde, v arabštině, pro arabštinu.”
S růstem regionálně specifických modelů, jako je Munsit, se průmysl AI vstupuje do nové éry – éry, ve které se jazyková a kulturní relevance nesacrifikují ve prospěch technické excelence. Skutečně, s Munsitem, CNTXT AI prokázal, že jsou jedno a totéž.












