Modele i platformy AI
CNTXT AI uruchamia Munsit: Najdokładniejszy system rozpoznawania mowy arabskiej kiedykolwiek zbudowany
W momencie definiującym dla arabskojęzycznej sztucznej inteligencji, CNTXT AI ujawnił Munsit, model rozpoznawania mowy arabskiej, który nie tylko jest najdokładniejszy kiedykolwiek stworzony dla języka arabskiego, ale także zdecydowanie przewyższa globalne gigantów takich jak OpenAI, Meta, Microsoft (MSFT ) i ElevenLabs w standardowych benchmarkach. Opracowany w Zjednoczonych Emiratach Arabskich i dostosowany do języka arabskiego od podstaw, Munsit reprezentuje potężny krok naprzód w tym, co CNTXT nazywa „suwerenną sztuczną inteligencją” – technologią zbudowaną w regionie, dla regionu, a jednocześnie konkurencyjną na arenie międzynarodowej.
Naukowe podstawy tego osiągnięcia zostały przedstawione w nowo opublikowanym artykule “Rozwój rozpoznawania mowy arabskiej za pomocą dużej skali słabo nadzorowanego uczenia“, który wprowadza skalowalną, efektywną metodę szkolenia, która rozwiązuje długoletni problem braku oznaczonych danych mowy arabskiej. Ta metoda – słabo nadzorowane uczenie – umożliwiła zespołowi stworzenie systemu, który ustanawia nowy standard jakości transkrypcji w języku arabskim, zarówno w odmianie standardowej (MSA), jak i w ponad 25 dialektach regionalnych.
Pokonanie suszy danych w arabskim rozpoznawaniu mowy
Język arabski, pomimo że jest jednym z najbardziej rozpowszechnionych języków na świecie i jednym z języków urzędowych Organizacji Narodów Zjednoczonych, długo był uważany za język o niskich zasobach w dziedzinie rozpoznawania mowy. Wynika to z jego złożoności morfologicznej oraz braku dużych, zróżnicowanych, oznaczonych zbiorów danych mowy. W przeciwieństwie do języka angielskiego, który korzysta z niezliczonych godzin ręcznie transkrybowanych danych audio, bogactwo dialektów języka arabskiego i jego fragmentaryczna obecność cyfrowa stanowiły znaczne wyzwania dla budowy solidnych systemów automatycznego rozpoznawania mowy (ASR).
Zamiast czekać na powolny i kosztowny proces ręcznej transkrypcji, CNTXT AI obrał radykalnie bardziej skalowalną drogę: słabo nadzorowane uczenie. Ich podejście rozpoczęło się od ogromnego korpusu ponad 30 000 godzin nieoznaczonych danych audio w języku arabskim, zebranych z różnych źródeł. Przy użyciu niestandardowej pipeliny przetwarzania danych, surowe dane audio zostały oczyszczone, podzielone i automatycznie oznaczone, w wyniku czego powstał wysokiej jakości zbiór szkoleniowy o objętości 15 000 godzin – jeden z największych i najbardziej reprezentatywnych zbiorów mowy arabskiej kiedykolwiek zebranych.
Proces ten nie opierał się na annotacji ludzkiej. Zamiast tego, CNTXT opracował wieloetapowy system generowania, oceniania i filtrowania hipotez z wielu modeli ASR. Transkrypcje te zostały porównane przy użyciu odległości Levenshteina w celu wyboru najbardziej spójnych hipotez, a następnie przekazane do modelu językowego w celu oceny ich gramatycznej prawdopodobieństwa. Segmenty, które nie spełniały określonych progów jakości, zostały odrzucone, co pozwoliło na to, aby nawet bez weryfikacji ludzkiej dane szkoleniowe pozostały niezawodne. Zespół udoskonalił tę pipelinę poprzez wiele iteracji, każdy raz poprawiając dokładność etykietowania przez ponowne szkolenie systemu ASR i wprowadzanie go z powrotem do procesu etykietowania.
Napędzanie Munsit: Architektura Conformer
Serce Munsit stanowi model Conformer, hybrydowa architektura sieci neuronowej, która łączy lokalną wrażliwość warstw konwolucyjnych z globalnymi możliwościami modelowania sekwencji transformatorów. Ten projekt sprawia, że Conformer jest szczególnie uzdolniony do radzenia sobie z subtelnościami mowy, gdzie zarówno dalekosiężne zależności (takie jak struktura zdania), jak i drobne szczegóły fonetyczne są kluczowe.
CNTXT AI zaimplementował dużą wersję Conformer, szkoląc go od podstaw przy użyciu 80-kanałowych mel-spektrogramów jako danych wejściowych. Model składa się z 18 warstw i zawiera około 121 milionów parametrów. Szkolenie przeprowadzono na wysokowydajnym klastrze przy użyciu ośmiu kart graficznych NVIDIA A100 z precyzją bfloat16, co pozwoliło na efektywne radzenie sobie z dużymi rozmiarami partii i wysokowymiarowymi przestrzeniami cech. W celu tokenizacji morfologicznie bogatej struktury języka arabskiego, zespół użył tokenizatora SentencePiece wyszkolonego specjalnie na ich niestandardowym korpusie, co dało słownictwo składające się z 1 024 jednostek podwyrazowych.
W przeciwieństwie do konwencjonalnego nadzorowanego szkolenia ASR, które zwykle wymaga, aby każdy klip audio był sparowany z starannie przepisaną etykietą, metoda CNTXT działała całkowicie na słabych etykietach. Etykiety te, chociaż gorszej jakości niż weryfikowane przez ludzi, zostały zoptymalizowane za pomocą pętli sprzężenia zwrotnego, która priorytetowo traktowała zgodność, spójność gramatyczną i prawdopodobieństwo leksykalne. Model został wyszkolony przy użyciu funkcji straty Connectionist Temporal Classification (CTC), która jest dobrze przystosowana do modelowania sekwencji niezgodnych – kluczowego dla zadań rozpoznawania mowy, gdzie czasowanie wypowiadanych słów jest zmienne i nieprzewidywalne.
Dominacja w benchmarkach
Wyniki mówią same za siebie. Munsit został przetestowany wobec wiodących modeli ASR open-source i komercyjnych na sześciu benchmarkowych zbiorach danych arabskich: SADA, Common Voice 18.0, MASC (czysty i hałasowy), MGB-2 i Casablanca. Zbiory te łącznie obejmują dziesiątki dialektów i akcentów z całego świata arabskiego, od Arabii Saudyjskiej po Maroko.
We wszystkich benchmarkach Munsit-1 osiągnął średni wskaźnik błędu słowa (WER) na poziomie 26,68 i średni wskaźnik błędu znaku (CER) na poziomie 10,05. Dla porównania, najlepsza wersja OpenAI Whisper zanotowała średni WER na poziomie 36,86 i CER na poziomie 17,21. Meta SeamlessM4T, inny model wielojęzyczny, uzyskał jeszcze gorsze wyniki. Munsit przewyższył każdy inny system zarówno w danych czystych, jak i hałasowych, i wykazał szczególnie silną wytrzymałość w warunkach hałasowych, co jest kluczowym czynnikiem w aplikacjach rzeczywistych, takich jak centra telefoniczne i usługi publiczne.
Przewaga była równie wyraźna w stosunku do systemów własnościowych. Munsit przewyższył modele rozpoznawania mowy arabskiego języka Microsoft Azure, ElevenLabs Scribe, a nawet funkcję transkrypcji OpenAI GPT-4o. Te wyniki nie są marginalnymi zyskami – reprezentują one średnią względną poprawę o 23,19% w WER i 24,78% w CER w porównaniu z najmocniejszą bazą otwartą, ustanawiając Munsit jako wyraźnego lidera w rozpoznawaniu mowy arabskiej.
Platforma dla przyszłości arabskiej sztucznej inteligencji głosowej
Podczas gdy Munsit-1 już teraz przekształca możliwości transkrypcji, napisów i obsługi klienta na rynkach arabskojęzycznych, CNTXT AI widzi ten start jako tylko początek. Firma wyobraża sobie pełny zakres technologii głosowych w języku arabskim, w tym syntezę mowy, asystentów głosowych i systemy tłumaczenia w czasie rzeczywistym – wszystko oparte na suwerennej infrastrukturze i regionalnie istotnej sztucznej inteligencji.
„Munsit to więcej niż przełom w rozpoznawaniu mowy”, powiedział Mohammad Abu Sheikh, dyrektor generalny CNTXT AI. „To deklaracja, że język arabski należy do przodu globalnej sztucznej inteligencji. Udowodniliśmy, że światowej klasy sztuczna inteligencja nie musi być importowana – może być zbudowana tutaj, w języku arabskim, dla języka arabskiego”.
Wraz ze wzrostem modeli specyficznych dla regionu, takich jak Munsit, przemysł sztucznej inteligencji wkracza w nową erę – erę, w której relewancja językowa i kulturowa nie są poświęcane w pogoni za doskonałością techniczną. W istocie, z Munsit, CNTXT AI udowodnił, że są one jednym i tym samym.












