AI-modellen en platforms

CNTXT AI lanceert Munsit: het meest nauwkeurige Arabische spraakherkenningsysteem ooit gebouwd

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

In een beslissend moment voor de Arabische taal en kunstmatige intelligentie, heeft CNTXT AI Munsit onthuld, een next-generation Arabisch spraakherkenningsmodel dat niet alleen het meest nauwkeurige is dat ooit voor het Arabisch is gemaakt, maar dat ook duidelijk beter presteert dan wereldwijde giganten zoals OpenAI, Meta, Microsoft (MSFT ) en ElevenLabs op standaardbenchmarks. Ontwikkeld in de Verenigde Arabische Emiraten en speciaal ontworpen voor het Arabisch vanaf het begin, vertegenwoordigt Munsit een krachtige stap voorwaarts in wat CNTXT “soevereine AI” noemt – technologie die in de regio wordt gebouwd, voor de regio, maar met wereldwijde concurrentiekracht.

De wetenschappelijke basis voor deze prestatie wordt uiteengezet in het onlangs gepubliceerde artikel van het team, Advancing Arabic Speech Recognition Through Large-Scale Weakly Supervised Learning, dat een schaalbare, data-efficiënte trainingsmethode introduceert die het langdurige gebrek aan gelabelde Arabische spraakgegevens aanpakt. Deze methode – zwakke supervisie – heeft het team in staat gesteld om een systeem te bouwen dat een nieuwe standaard zet voor transcriptiekwaliteit in zowel Modern Standard Arabic (MSA) als meer dan 25 regionale dialecten.

Het overwinnen van de datadroogte in Arabische spraakherkenning

Arabisch, ondanks het feit dat het een van de meest gesproken talen ter wereld is en een officiële taal van de Verenigde Naties, is lange tijd beschouwd als een taal met weinig middelen in het veld van spraakherkenning. Dit komt zowel door de morfologische complexiteit als door een gebrek aan grote, diverse, gelabelde spraakdatasets. In tegenstelling tot het Engels, dat profiteert van ontelbare uren aan handmatig getranscribeerde audiogegevens, hebben de dialectale rijkdom en de gefragmenteerde digitale aanwezigheid van het Arabisch aanzienlijke uitdagingen opgeleverd voor het bouwen van robuuste automatische spraakherkenningsystemen (ASR).

In plaats van te wachten tot het langzame en dure proces van handmatige transcriptie op gang komt, heeft CNTXT AI een radicaal meer schaalbare route gevolgd: zwakke supervisie. Hun aanpak begon met een enorm corpus van meer dan 30.000 uur aan ongelabelde Arabische audio, verzameld uit diverse bronnen. Door een aangepaste datapipeline werd deze ruwe audio schoongemaakt, gesegmenteerd en automatisch gelabeld om een hoogwaardige 15.000-uur trainingsdataset te produceren – een van de grootste en meest representatieve Arabische spraakcorpora ooit samengesteld.

Dit proces was niet afhankelijk van menselijke annotatie. In plaats daarvan ontwikkelde CNTXT een meerstapsysteem voor het genereren, evalueren en filteren van hypothesen uit meerdere ASR-modellen. Deze transcripties werden vergeleken met behulp van Levenshtein-afstand om de meest consistente hypothesen te selecteren, vervolgens doorgegeven aan een taalmodel om hun grammaticale plausibiliteit te evalueren. Segmenten die niet voldeden aan de gedefinieerde kwaliteitsdrempels werden verworpen, waardoor de trainingsgegevens zelfs zonder menselijke verificatie betrouwbaar bleven. Het team verfijnde deze pipeline door meerdere iteraties, waarbij de labelnauwkeurigheid telkens werd verbeterd door het ASR-systeem zelf opnieuw te trainen en terug te voeren in het labelproces.

Munsit aandrijven: de Conformer-architectuur

Het hart van Munsit is de Conformer, een hybride neurale netwerkarchitectuur die de lokale gevoeligheid van convolutionele lagen combineert met de globale sequentiële modellering van transformatoren. Deze ontwerp maakt de Conformer bijzonder geschikt voor het omgaan met de nuances van gesproken taal, waar zowel langeafstandsafhankelijkheden (zoals zinsstructuur) als fijne fonetische details cruciaal zijn.

CNTXT AI heeft een grote variant van de Conformer geïmplementeerd, getraind vanaf het begin met 80-kanaals mel-spectrogrammen als invoer. Het model bestaat uit 18 lagen en bevat ongeveer 121 miljoen parameters. De training werd uitgevoerd op een high-performance-cluster met acht NVIDIA A100-GPU’s met bfloat16-nauwkeurigheid, waardoor efficiënte verwerking van grote batchgroottes en hoge dimensionale functieruimten mogelijk werd. Voor het tokeniseren van de morfologisch rijke structuur van het Arabisch, gebruikte het team een SentencePiece-tokenizer getraind op hun aangepaste corpus, resulterend in een vocabulaire van 1.024 subwoord-eenheden.

In tegenstelling tot conventionele begeleide ASR-training, die typisch vereist dat elke audioclip wordt gekoppeld aan een zorgvuldig getranscribeerde label, werkte CNTXT’s methode geheel op zwakke labels. Deze labels, hoewel lawaaieriger dan door mensen geverifieerde labels, werden geoptimaliseerd via een feedbacklus die consensus, grammaticale coherentie en lexicale plausibiliteit prioriteerde. Het model werd getraind met de Connectionist Temporal Classification (CTC)-verliesfunctie, die goed geschikt is voor niet-uitgelijnde sequentiële modellering – kritisch voor spraakherkennings taken waar de timing van gesproken woorden variabel en onvoorspelbaar is.

Domineren op de benchmarks

De resultaten spreken voor zich. Munsit werd getest tegen leidende open-source- en commerciële ASR-modellen op zes benchmark-Arabische datasets: SADA, Common Voice 18.0, MASC (schoon en lawaaierig), MGB-2 en Casablanca. Deze datasets omvatten collectief tientallen dialecten en accenten uit de Arabische wereld, van Saoedi-Arabië tot Marokko.

Over alle benchmarks behaalde Munsit-1 een gemiddelde Woordfoutpercentage (WER) van 26,68 en een Karakterfoutpercentage (CER) van 10,05. In vergelijking daarmee behaalde de beste presterende versie van OpenAI’s Whisper een gemiddelde WER van 36,86 en CER van 17,21. Meta’s SeamlessM4T, een andere state-of-the-art multilinguale model, kwam nog hoger uit. Munsit overtrof elk ander systeem op zowel schone als lawaaierige gegevens en toonde bijzondere robuustheid in lawaaierige omstandigheden, een kritische factor voor real-world-toepassingen zoals callcenters en openbare diensten.

De kloof was eveneens groot tegenover propriëtaire systemen. Munsit overtrof Microsoft Azure’s Arabische ASR-modellen, ElevenLabs Scribe en zelfs OpenAI’s GPT-4o-transcribe-functie. Deze resultaten zijn geen marginale verbeteringen – ze vertegenwoordigen een gemiddelde relatieve verbetering van 23,19% in WER en 24,78% in CER ten opzichte van de sterkste open baseline, waardoor Munsit duidelijk de leider wordt in Arabische spraakherkenning.

Een platform voor de toekomst van Arabische spraak-AI

Terwijl Munsit-1 al de mogelijkheden voor transcriptie, ondertiteling en klantenservice op Arabischsprekende markten transformeert, ziet CNTXT AI deze lancering als slechts het begin. Het bedrijf voorziet een complete reeks Arabisch-talige spraaktechnologieën, waaronder tekst-naar-spraak, spraakassistenten en real-time vertaalsystemen – allemaal gebaseerd op soevereine infrastructuur en regionaal relevante AI.

“Munsit is meer dan alleen een doorbraak in spraakherkenning,” zei Mohammad Abu Sheikh, CEO van CNTXT AI. “Het is een verklaring dat Arabisch thuishoort aan de voorzijde van de wereldwijde AI. We hebben bewezen dat wereldklasse-AI niet geïmporteerd hoeft te worden – het kan hier worden gebouwd, in het Arabisch, voor het Arabisch.”

Met de opkomst van regiospecifieke modellen zoals Munsit, betreedt de AI-industrie een nieuwe era – een era waarin linguïstische en culturele relevantie niet worden opgeofferd in de strijd naar technische excellentie. In feite heeft CNTXT AI met Munsit aangetoond dat ze één en hetzelfde zijn.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.