AI-modeller og plattformer

CNTXT AI lanserer Munsit: Det mest nøyaktige arabisk talegjenkjenningssystem noensinne bygget

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

I et avgjørende øyeblikk for arabisk språk kunstig intelligens, har CNTXT AI avduket Munsit, en neste generasjons arabisk talegjenkjenningmodell som ikke bare er den mest nøyaktige noensinne skapt for arabisk, men også utkonkurrerer globale giganter som OpenAI, Meta, Microsoft (MSFT ) og ElevenLabs på standard benchmark. Utviklet i UAE og tilpasset arabisk fra bunnen av, representerer Munsit et kraftig skritt fremover i det CNTXT kaller “suveren AI” – teknologi bygget i regionen, for regionen, men med global konkurranse.

De vitenskapelige grunnlagene for denne prestasjonen er lagt frem i teamets nylig publiserte papir, Fremme av arabisk talegjenkjenning gjennom stor skala svak overvåking, som introduserer en skalerbar, data-efektiv treningsmetode som håndterer den langvarige mangelen på merket arabisk taledata. Denne metoden – svak overvåking – har enablet teamet å konstruere et system som setter en ny standard for transkripsjonskvalitet over både moderne standard arabisk (MSA) og over 25 regionale dialekter.

Overvinning av data-tørken i arabisk ASR

Arabisk, til tross for å være ett av de mest talte språkene globalt og et offisielt språk i De forente nasjoner, har lenge vært betraktet som et lav-resurs-språk i feltet talegjenkjenning. Dette skyldes både dens morfologiske kompleksitet og en mangelen på store, diverse, merkte tale-datasett. I motsetning til engelsk, som har fordelen av talløse timer med manuelt transkribert lyd-data, har arabiskens dialektiske rikdom og fragmenterte digitale tilstedeværelse vært betydelige utfordringer for å bygge robuste automatisk talegjenkjenning (ASR) systemer.

I stedet for å vente på den langsomme og dyre prosessen med manuell transkripsjon for å fange opp, forfulgte CNTXT AI en radikalt mer skalerbar vei: svak overvåking. Deres tilnærming begynte med en massiv korpus av over 30 000 timer med umerkede arabisk lyd samlet fra diverse kilder. Gjennom en tilpasset data-prosessering-pipeline, ble denne rå lyden renset, segmentert og automatisk merket for å gi en høykvalitets 15 000-timers treningsdatasett – ett av de største og mest representative arabisk tale-korpus noensinne samlet.

Denne prosessen avhengig ikke av menneskelig annotering. I stedet utviklet CNTXT en multi-trinns system for å generere, evaluere og filtrere hypoteser fra flere ASR-modeller. Disse transkripsjonene ble sammenlignet ved hjelp av Levenshtein-avstand for å velge de mest konsistente hypoteser, deretter sendt gjennom en språkmodell for å evaluere deres grammatikalske plausibilitet. Segmenter som ikke møtte kvalitets-kriterier ble forkastet, slik at selv uten menneskelig verifisering, forblev treningsdataene pålitelige. Teamet forbedret denne pipeline gjennom flere iterasjoner, hver gang forbedret label-nøyaktigheten ved å trenere ASR-systemet selv og føre det tilbake i merking-prosessen.

Powering Munsit: Conformer-arkitekturen

I hjertet av Munsit ligger Conformer-modellen, en hybrid neural nettverksarkitektur som kombinerer den lokale sensitiviteten til konvolusjonslag med den globale sekvens-modelleringsevnen til transformatorer. Denne designen gjør Conformer spesielt egnet til å håndtere nyansene i tale, hvor både lange avhengigheter (slik som setningsstruktur) og fine-grained fonetiske detaljer er avgjørende.

CNTXT AI implementerte en stor variant av Conformer, trenet fra scratch ved hjelp av 80-kanals mel-spectrograms som inndata. Modellen består av 18 lag og inkluderer omtrent 121 millioner parametre. Treningsprosessen ble utført på en høy-ytelseskluster ved hjelp av åtte NVIDIA A100-GPUer med bfloat16-presisjon, hvilket muliggjorde effektiv håndtering av store batch-størrelser og høy-dimensjonale egenskapsrom. For å håndtere tokenisering av arabiskens morfologisk rike struktur, brukte teamet en SentencePiece-tokenizer trenet spesielt på deres eget korpus, resulterende i en ord-forråd på 1 024 sub-ord-enheter.

I motsetning til konvensjonell overvåket ASR-treningsprosess, som vanligvis krever at hver lyd-klipp er parret med en nøye transkribert merke, opererte CNTXTs metode helt på svake merker. Disse merkene, selv om de var mer støyende enn menneskelig-verifiserte, ble optimert gjennom en tilbakemeldings-løkke som prioriteterte konsensus, grammatisk kohens og leksikalsk plausibilitet. Modellen ble trenet ved hjelp av Connectionist Temporal Classification (CTC)-tap-funksjonen, som er godt egnet for ualignert sekvens-modellering – avgjørende for tale-gjenkjenning-oppgaver hvor tiden for tale-ord er variabel og uforutsigbar.

Dominating the Benchmarks

Resultatene taler for seg selv. Munsit ble testet mot ledende åpne kilde- og kommersielle ASR-modeller på seks benchmark-arabiske datasett: SADA, Common Voice 18.0, MASC (rent og støyende), MGB-2 og Casablanca. Disse datasettene kollektivt omfatter dusinvis av dialekter og aksenter over hele den arabiske verden, fra Saudi-Arabia til Marokko.

Over alle benchmarkene oppnådde Munsit-1 en gjennomsnittlig Ord-feil-rate (WER) på 26,68 og en Karakter-feil-rate (CER) på 10,05. I sammenligning oppnådde den beste utførende versjonen av OpenAI’s Whisper en gjennomsnittlig WER på 36,86 og CER på 17,21. Meta’s SeamlessM4T, en annen state-of-the-art multilingual modell, kom inn enda høyere. Munsit overgikk hver enkelt system på både rene og støyende data, og viste spesielt sterk robusthet i støyende forhold, en kritisk faktor for virkelige verden-applikasjoner som call-sentere og offentlige tjenester.

Gapet var like tydelig mot proprietære systemer. Munsit overgikk Microsoft Azure’s arabiske ASR-modeller, ElevenLabs Scribe og sogar OpenAI’s GPT-4o transkriber-funksjon. Disse resultater er ikke marginale forbedringer – de representerer en gjennomsnittlig relativ forbedring på 23,19% i WER og 24,78% i CER sammenlignet med den sterkeste åpne baseline, og etablerer Munsit som den klare lederen i arabisk tale-gjenkjenning.

En plattform for fremtiden av arabisk tale-AI

Mens Munsit-1 allerede transformerer mulighetene for transkripsjon, underteksting og kundesupport i arabisk-talende markeder, ser CNTXT AI på denne lanseringen som bare begynnelsen. Selskapet forestiller seg en fullstendig rekke av arabisk-språklige tale-teknologier, inkludert tekst-til-tale, tale-assistenter og sanntids-oversettelsessystemer – alle grunnlagt i suveren infrastruktur og regionalt relevante AI.

“Munsit er mer enn bare et gjennombrudd i tale-gjenkjenning,” sa Mohammad Abu Sheikh, CEO av CNTXT AI. “Det er en erklæring om at arabisk hører til i fremtiden av global AI. Vi har bevist at verdensklasse-AI ikke trenger å importeres – det kan bygges her, på arabisk, for arabisk.”

Med oppkomsten av regionsspesifikke modeller som Munsit, går AI-industrien inn i en ny æra – en hvor lingvistisk og kulturell relevans ikke ofres i jakten på teknisk eksellens. Faktisk, med Munsit, har CNTXT AI vist at de er ett og det samme.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.