AI-mallit ja alustat
CNTXT AI julkaisee Munsitin: Tarkin arabiankielisen puheentunnistusjärjestelmän koskaan rakennettu
Arabiankielisen tekoälyn määrittävässä hetkessä CNTXT AI on esitellyt Munsitin, seuraavan sukupolven arabiankielisen puheentunnistusmallin, joka on sekä tarkin koskaan luotu arabian kielelle että selvästi parempi kuin maailmanlaajuiset jätit kuten OpenAI, Meta, Microsoft (MSFT ) ja ElevenLabs standardibenchmarkkeissa. Yhdistyneissä arabiemiirikunnissa kehitetty ja arabian kielelle alusta alkaen suunniteltu Munsit edustaa voimallista askelta eteenpäin siinä, mitä CNTXT kutsuu ”suvereeniksi tekoälyksi” – teknologiaksi, joka on rakennettu alueella, alueen asukkaiden tarpeisiin, mutta jolla on myös globaali kilpailukyky.
Tieteelliset perusteet tässä saavutuksessa on esitetty tiimin uudessa tutkimusartikkelissa, “Arabiankielisen puheentunnistuksen edistäminen suuren mittakaavan heikosti valvottujen oppimismenetelmien avulla“, joka esittelee skaalautuvan, data-tehokkaan koulutusmenetelmän, joka ratkaisee pitkään jatkuneen arabiankielisen puheen merkintätiedon niukkuuden ongelman. Tämä menetelmä – heikko valvonta – on mahdollistanut tiimille järjestelmän rakentamisen, joka asettaa uuden viiteen transkriptiotason sekä modernin standardiarabian (MSA) että yli 25 alueellisen murteen osalta.
Puheentunnistuksen datapula arabian kielellä
Arabia, vaikka se on yksi maailmanlaajuisesti puhutuimmista kielistä ja Yhdistyneiden Kansakuntien virallinen kieli, on pitkään ollut matalaresurssinen kieli puheentunnistuksen alalla. Tämä johtuu sekä kielen morfologisesta monimutkaisuudesta että suurten, monipuolisten, merkityillä puheaineistojen puutteesta. Toisin kuin englanti, josta on saatavilla lukemattomia tunteja manuaalisesti transkriboitua äänitiedostoa, arabian murteellinen rikkaus ja sirpaleinen digitaalinen läsnäolo ovat asettaneet merkittäviä haasteita kestävien automaattisten puheentunnistusjärjestelmien (ASR) rakentamiselle.
Sen sijaan, että odottaisi hitaasti ja kalliisti etenevää manuaalisen transkription prosessia, CNTXT AI valitsi radikaalisti skaalautuvamman tien: heikon valvonnan. Heidän lähestymistapansa alkoi massiivisesta yli 30 000 tunnin arabiankielisestä ääniaineistosta, joka kerättiin monista lähteistä. Omalla datakäsittelyputkella tämä raaka ääni puhdistettiin, jaettiin segmentteihin ja merkittiin automaattisesti, jolloin saatiin laadukas 15 000 tunnin koulutusaineisto – yksi laajin ja edustavin arabiankielinen puhekorpus koskaan kootuista.
Tässä prosessissa ei luotettu ihmisten annotointiin. Sen sijaan CNTXT kehitti monivaiheisen järjestelmän hypoteesien luomiseksi, arvioimiseksi ja suodattamiseksi useista ASR-malleista. Nämä transkriptiot verrattiin toisiinsa Levenshtein-etäisyyden avulla valitakseen yhdenmukaisimmat hypoteesit, ja ne lähetettiin kielimallille arvioida niiden kieliopillista uskottavuutta. Segmentit, jotka eivät täyttäneet määriteltyjä laatuvaatimuksia, hylättiin, jolloin varmistettiin, että vaikka ihmisten vahvistusta ei käytetty, koulutusaineisto pysyi luotettavana. Tiimi paransi tätä putkia useiden iteraatioiden kautta, ja jokaisella kertaa parannettiin merkintätarkkuutta kouluttamalla ASR-järjestelmää uudelleen ja syöttämällä se takaisin merkintäprosessiin.
Munsitin voimanlähde: Conformer-arkkitehtuuri
Munsitin ydin on Conformer-malli, joka yhdistää konvoluutiokerrosten paikallisen herkkyyden ja transformerien globaalin järjestysmallintamiskyvyn. Tämä suunnittelu tekee Conformerista erityisen soveltuvan puheen hienouksien käsittelyyn, jossa sekä pitkät riippuvuudet (kuten lauseen rakenne) että hienot fonetiikkaan liittyvät yksityiskohdat ovat tärkeitä.
CNTXT AI toteutti Conformerin suuren version, jota koulutettiin alusta alkaen 80-kanavaisilla mel-spectrogrameilla syötteenä. Malli koostuu 18 kerroksesta ja sisältää noin 121 miljoonaa parametria. Koulutus suoritettiin suorituskykyisellä klusterilla käyttäen kahdeksaa NVIDIA A100 -näytönohjainta bfloat16 -tarkkuudella, mikä mahdollisti suurten eräiden ja korkean dimensionaalisuuden ominaisuuksien tehokkaan käsittelyn. Arabialaisen morfologisesti rikkaan rakenteen tokenisointiin tiimi käytti SentencePiece-tokenoitinta, joka oli koulutettu erityisesti heidän mukautetussa aineistossaan, mikä johti 1 024 alasanaston yksikköön.
Toisin kuin perinteinen valvottu ASR-koulutus, joka yleensä edellyttää, että jokainen ääniklippi on pariskunnutettu huolellisesti transkriboituun merkintään, CNTXT:n menetelmä toimi kokonaan heikoilla merkinnoilla. Nämä merkinntä, vaikka meluisampia kuin ihmisten vahvistamat, optimoitiin palautekehän kautta, joka priorisoi konsensuksen, kieliopillisen johdonmukaisuuden ja leksikaalisen uskottavuuden. Malli koulutettiin Connectionist Temporal Classification (CTC) -hävikko-funktiolla, joka on hyvin soveltuva epäsuorasti suunnatun sekvenssimallinnuksen – avainpuheentunnistustehtävissä, joissa puhutun sanan ajoitus on muuttuva ja arvaamaton.
Hallitseminen benchmarkkeissa
Tulokset puhuvat itsestään. Munsit testattiin johtavien avoimen lähdekoodin ja kaupallisten ASR-mallien kanssa kuudella arabiankielisellä benchmark-aineistolla: SADA, Common Voice 18.0, MASC (puhdas ja meluisa), MGB-2 ja Casablanca. Nämä aineistot kattavat yhteensä kymmeniä murteita ja aksentteja arabimaailmassa, Saudi-Arabiasta Marokkoon.
Kaikilla benchmarkkeilla Munsit-1 saavutti keskimääräisen sanavirheen (WER) 26,68 ja merkkivirheen (CER) 10,05. Vertailukelpoisesti OpenAI:n Whisperin paras versio saavutti keskimääräisen WER:n 36,86 ja CER:n 17,21. Meta:n SeamlessM4T, toinen valtavirta-monnikielinen malli, oli vielä korkeampi. Munsit oli parempi kuin kaikki muut järjestelmät sekä puhtaissa että meluisissa olosuhteissa ja osoitti erityisen vankkaa kestävyyttä meluisissa olosuhteissa, mikä on kriittinen tekijä todellisen maailman sovelluksissa, kuten asiakaspalvelukeskuksissa ja julkisissa palveluissa.
Ero oli yhtä selkeä omistajajärjestelmiin nähden. Munsit oli parempi kuin Microsoft Azure:n arabiankieliset ASR-mallit, ElevenLabs Scribe ja jopa OpenAI:n GPT-4o transkriptio-ominaisuus. Nämä tulokset eivät ole marginaalisia parannuksia – ne edustavat keskimääräistä suhteellista parannusta 23,19 %:ssa WER:ssä ja 24,78 %:ssa CER:ssä verrattuna vahvimpaan avoimeen vertailukohteeseen, mikä vakiinnuttaa Munsitin arabiankielisen puheentunnistuksen johtajaksi.
Alusta tulevaisuuden arabiankieliselle älypuhelimelle
Vaikka Munsit-1 on jo muuttamassa transkriptio-, tekstitys- ja asiakastukimahdollisuuksia arabiankielisillä markkinoilla, CNTXT AI näkee tämän julkaisun vain alkuna. Yritys kuvaa täydellisen arabiankielisen älypuhelimen sarjaa, mukaan lukien teksti-puhe, älyavustajat ja reaaliaikaiset käännösjärjestelmät – kaikki perustuvat suvereeniin infrastruktuuriin ja alueellisesti relevanttiin tekoälyyn.
”Munsit on enemmän kuin vain läpimurto puheentunnistuksessa”, sanoi Mohammad Abu Sheikh, CNTXT AI:n toimitusjohtaja. ”Se on julistus siitä, että arabia kuuluu maailmanlaajuisen tekoälyn eturintamaan. Olemme osoittaneet, että maailmanluokan tekoälyä ei tarvitse tuoda – se voidaan rakentaa täällä, arabian kielelle, arabian kielestä.”
Aluekohtaisilla malleilla, kuten Munsitilla, tekoälyteollisuus on siirtymässä uuteen aikakauteen – aikakauteen, jossa kielellinen ja kulttuurinen merkitys eivät uhraa teknisen erinomaisuuden pyrkimyksessä. Itse asiassa Munsitin kautta CNTXT AI on osoittanut, että ne ovat yhtä ja samaa.












