AI-modeller och plattformar

CNTXT AI lanserar Munsit: Det mest exakta arabiska taligenkänningssystemet som någonsin byggts

mm
Lägg till Unite.AI bland dina föredragna källor på Google

I en avgörande stund för arabiskt språkig konstgjord intelligens har CNTXT AI presenterat Munsit, en nästa generations arabisk taligenkänning som inte bara är den mest exakta som någonsin skapats för arabiska, utan också överträffar globala jättar som OpenAI, Meta, Microsoft (MSFT ) och ElevenLabs på standardmässiga benchmark-tester. Utvecklat i Förenade Arabemiraten och anpassat för arabiska från grunden, representerar Munsit ett kraftfullt steg framåt i vad CNTXT kallar “suverän AI” – teknik som byggs i regionen, för regionen, men med global konkurrenskraft.

De vetenskapliga grunderna för denna prestation presenteras i teamets nyligen publicerade artikel, Framsteg inom arabisk taligenkänning genom storskalig svag övervakad inlärning, som introducerar en skalbar, dataeffektiv träningsmetod som hanterar den långvariga bristen på märkt arabiskt taldata. Den metoden – svag övervakad inlärning – har möjliggjort för teamet att konstruera ett system som sätter en ny standard för transkriptionskvalitet över både modern standardarabiska (MSA) och mer än 25 regionala dialektaler.

Övervinna datatorken i arabisk ASR

Arabiska, trots att det är ett av de mest talade språken globalt och ett officiellt språk i Förenta Nationerna, har länge ansetts vara ett lågresurs-språk inom området taligenkänning. Detta beror på både dess morfologiska komplexitet och bristen på stora, varierade, märkta taldata. Till skillnad från engelska, som har nytta av otaliga timmar av manuellt transkriberat ljudmaterial, har arabiskans dialektala rikedom och fragmenterade digitala närvaro utgjort betydande utmaningar för att bygga robusta automatiska taligenkänningssystem (ASR).

I stället för att vänta på den långsamma och dyra processen med manuell transkription för att komma ikapp, valde CNTXT AI en radikalt mer skalbar väg: svag övervakning. Deras tillvägagångssätt började med en massiv korpus på över 30 000 timmar av omärkt arabiskt ljudmaterial som samlats in från varierade källor. Genom en anpassad datahanteringspipeline rensades det råa ljudmaterialet, segmenterades och märktes automatiskt för att ge ett högkvalitativt 15 000-timmars träningsdataset – ett av de största och mest representativa arabiska talcorpus som någonsin samlats in.

Denna process byggde inte på mänsklig annotering. I stället utvecklade CNTXT en flerstegsprocess för att generera, utvärdera och filtrera hypoteser från flera ASR-modeller. Dessa transkriptioner jämfördes med Levenshtein-avstånd för att välja de mest konsekventa hypoteserna, sedan skickades de genom en språkmodell för att utvärdera deras grammatiska sannolikhet. Segment som inte uppfyllde definierade kvalitetsgränser kasserades, vilket säkerställde att även utan mänsklig verifikation, träningsdata förblev tillförlitliga. Teamet förbättrade denna pipeline genom flera iterationer, var och en förbättrade etikettens noggrannhet genom att omträna ASR-systemet och mata tillbaka det i märkningsprocessen.

Drivande Munsit: Conformer-arkitekturen

I hjärtat av Munsit ligger Conformer-modellen, en hybrid neural nätverksarkitektur som kombinerar den lokala känsligheten hos konvolutionslager med den globala sekvensmodelleringsförmågan hos transformer. Denna design gör Conformer särskilt lämplig för att hantera nyanserna i talat språk, där både långväga beroenden (såsom meningsstruktur) och fina fonetiska detaljer är avgörande.

CNTXT AI implementerade en stor variant av Conformer, tränad från scratch med 80-kanals mel-spectrograms som indata. Modellen består av 18 lager och innehåller cirka 121 miljoner parametrar. Träning genomfördes på en högpresterande kluster med åtta NVIDIA A100 GPU:er med bfloat16 precision, vilket möjliggjorde effektiv hantering av stora batchstorlekar och högdimensionella funktionella utrymmen. För att hantera tokenisering av arabiskans morfologiskt rika struktur använde teamet en SentencePiece-tokenizer tränad specifikt på deras anpassade korpus, vilket resulterade i en ordförråd på 1 024 subordförslag.

Till skillnad från konventionell övervakad ASR-träning, som vanligtvis kräver att varje ljudklipp är parat med en noggrant transkriberad etikett, fungerade CNTXT:s metod helt på svaga etiketter. Dessa etiketter, även om de var bullrigare än mänskligt verifierade, optimerades genom en återkopplingsloop som prioriterade konsensus, grammatisk sammanhängighet och lexikal sannolikhet. Modellen tränades med Connectionist Temporal Classification (CTC)-förlustfunktionen, som är väl lämpad för oanpassad sekvensmodellering – avgörande för taligenkänningssuppgifter där tiden för talade ord är variabel och oförutsägbar.

Dominerande benchmark

Resultaten talar för sig själva. Munsit testades mot ledande öppen källkod och kommersiella ASR-modeller på sex benchmark-arabiska dataset: SADA, Common Voice 18.0, MASC (rent och bullrigt), MGB-2 och Casablanca. Dessa dataset omfattar kollektivt dussintals dialektaler och accenter över hela den arabiska världen, från Saudiarabien till Marocko.

Över alla benchmark-tester uppnådde Munsit-1 en genomsnittlig ordfelrate (WER) på 26,68 och en teckenfelrate (CER) på 10,05. I jämförelse uppnådde den bäst presterande versionen av OpenAI:s Whisper en genomsnittlig WER på 36,86 och CER på 17,21. Meta:s SeamlessM4T, en annan state-of-the-art multilingual modell, kom in ännu högre. Munsit överträffade varje annat system på både rent och bullrigt data och visade särskilt stark robusthet i bullriga förhållanden, en avgörande faktor för verkliga tillämpningar som callcenter och offentliga tjänster.

Klyftan var lika tydlig mot proprietära system. Munsit överträffade Microsoft Azure:s arabiska ASR-modeller, ElevenLabs Scribe och till och med OpenAI:s GPT-4o transkriberingsfunktion. Dessa resultat är inte marginella vinster – de representerar en genomsnittlig relativ förbättring på 23,19 % i WER och 24,78 % i CER jämfört med den starkaste öppna baslinjen, vilket etablerar Munsit som den tydliga ledaren inom arabisk taligenkänning.

En plattform för arabisk röst-AI:s framtid

Medan Munsit-1 redan förvandlar möjligheterna för transkription, undertextning och kundsupport på arabiska marknader, ser CNTXT AI denna lansering som bara början. Företaget ser en fullständig svit av arabiska röstteknologier, inklusive text-till-tal, röstassistenter och realtidsöversättnings-system – alla grundade på suverän infrastruktur och regionalt relevant AI.

“Munsit är mer än bara ett genombrott inom taligenkänning”, sa Mohammad Abu Sheikh, VD för CNTXT AI. “Det är en deklaration om att arabiska hör hemma i framkanten av global AI. Vi har bevisat att världsklass-AI inte behöver importeras – det kan byggas här, på arabiska, för arabiska.”

Med uppkomsten av regionsspecifika modeller som Munsit inträder AI-branschen en ny era – en era där lingvistisk och kulturell relevans inte offras i jakten på teknisk excellens. I själva verket har CNTXT AI med Munsit visat att de är en och samma sak.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.