Haastattelut
Mohammad Abu Sheikh, CNTXT AI:n perustaja ja toimitusjohtaja – Haastattelusarja

Mohammad Abu Sheikh muuttaa tekoälymaisemaan Lähi-idän ja Pohjois-Afrikan alueella, ajamalla muutosta passiivisesta kuluttamisesta suvereeniin innovaatioon. CNTXT AI:n toimitusjohtajana ja 10 miljoonan dollarin tekoälyrahaston perustajana hän on johtanut kolmea onnistunutta ulosmittausta ja hankkinut yli miljardin dollarin rahoitusta. Hänen työnsä luo perustan tekoälyekosysteemille, joka perustuu kieleen, kulttuuriin ja tietosuvereniteettiin.
Me näimme tämän alueen tietojen runsauden. Monet ongelmista tekoälyn skaalauttamisessa johtuivat tietojen valmiuden puutteesta — mikä lopulta tarkoitti tekoälyn valmiuden puutetta. Siksi aloimme CNTXT AI:n.
Aluksi ratkaisimme samoja ongelmia, joita koimme rakennettaessa LocAI:ta… Näimme nämä haasteet omakohtaisesti työskennellessämme AI71:n, TII:n ja G42:n (IIAI) kanssa. Kun auttoimme näitä yksiköitä ratkaisemaan näitä ongelmia, visio selkeni ja liike kasvoi.
Olet ollut avainasemassa rakennettaessa suurinta arabiankielistä digitaalista kirjastoa tekoälyn koulutukseen. Mitkä olivat suurimmat haasteet tämän tekemisessä, ja miten niitä voitiin voittaa?
Laatu oli yksi suurimmista haasteista. Toinen oli korkealaatuisen arabiankielisen datan vähäinen saatavuus verkossa: arabia on vakavasti aliedustettu. Vain pieni osa arabiankielisistä sisällöistä on digitisoitu, ja vain 3–5 % kaikista verkossa olevista sisällöistä on arabiaa. Se on melkein mitätön. Ratkaisimme tämän ongelman lähettämällä data-merkinnänantajia, annotoijia ja data-tieteilijöitä digitoidakseen, luodakseen ja kuratoimaan datan itse.
CNTXT AI toimii kulttuurin ja laskennan leikkauspisteessä. Miten tasapainotat tekoälyn innovaatiota kulttuurisesti merkityksellisten ratkaisujen luomisen kanssa Lähi-idän ja Pohjois-Afrikan alueella?
Rakennamme kulttuurisesti perustuvia malleja alusta alkaen. Infrastruktuurista lopputuotteeseen, kulttuuri on upotettu alusta alkaen — se ei ole jotain, mitä lisäämme myöhemmin. Suunnittelemme, innovoimme ja rakennamme tiettyjä kulttuureja, murteita ja tarpeita silmällä pitäen alusta alkaen. Arabia on yksi kieli, mutta se kantaa monia murteita ja kulttuurisia konteksteja alueella, joten rakennamme paikallisia tuotteita paikallisille maille. Ja teemme sen työskentelemällä paikallisten annotoijien, maanpäällisten ihmisten kanssa omassa maassaan.
Olet myös perustanut LocAI:n ja johtanut SMPL AI -rahastoa. Miten nämä yritykset täydentävät CNTXT AI:n tehtävää?
LocAI on sovelluskerros — se osa, johon ihmiset todella vuorovaikuttavat. Se on suoraan CNTXT AI:n tarjoaman datan ja infrastruktuurin päällä. Se teki siitä menestyneen: se muuttaa CNTXT AI:n tarjoamat tekoälyperustat todellisiksi ratkaisuiksi, joita ihmiset voivat käyttää.
SMPL AI taas on antamisesta yhteisölle. Se keskittyy varhaisen vaiheen startup-yritysten sijoittamiseen ja avaa alueellisen tekoälyekosysteemin rakentamista. Jaamme työkalut ja opit, jotka olemme oppineet itse tekoälyn rakentamisesta, jotta perustajat voivat kasvaa nopeammin ja välttää yleisiä loukkaantumisia.
Munsit on kutsuttu maailman tarkin arabiankieliseksi puheentunnistusmalliksi. Mikä ajoi tämän mallin kehittämistä, ja miksi nyt?
Se, mikä ajoi tämän mallin kehittämistä, oli yksinkertainen: tarve.
Aina rakennamme tarpeen mukaan. Katselimme markkinaa ja näimme, että maisema oli kypsä — hallitukset ja yksityiset asiakkaat pyysivät kaikkia ratkaisuja tältä alueelta.
Olemassa olevat mallit eivät olleet tehtävän tasolla. Useimmat on rakennettu englanninkieliselle teknologialle ja sovitettu siihen. Ne eivät ole suunniteltu arabiaa varten alusta alkaen, ja eivät todellakaan ratkaista samoja ongelmia, joita me ratkaamme.
Päätimme rakentaa oman. Se on arabiankielinen suunnittelun mukaan.
Tutkimus Munsitin kehittämiseksi esittelee heikosti valvotun oppimismenetelmän. Voitko selittää, mitä se tarkoittaa, ja miksi se oli välttämätöntä arabiankielisen ASR:n kouluttamiseksi laajassa mittakaavassa?
Merkintä on kallista. Joten meidän oli siirryttävä perinteisten menetelmien ulkopuolelle, jotka riippuvat suurista määristä manuaalista transkriptiota. Heikosti valvottu oppiminen auttoi meitä skaalautumaan ilman, että jokaisen äänitiedoston on merkittävä käsin — mikä on erityisen tärkeää arabian kielelle, jolla on rajoitettu määrä dataa ja monia eri murteita.
Sen sijaan, että käytimme ammattimaisesti transkriboituja äänitallenteita, aloimme 30 000 tunnin arabiankielisellä puheella. Rakensimme merkintäputken, joka generoi, suodattaa ja puhdistaa parhaat käyttämällä automaattisia tarkastuksia. Tämä antoi meille laadukkaan 15 000 tunnin tietojoukon — kaiken ilman manuaalista transkriptiota.
Tämä lähestymistapa mahdollisti kouluttaa mallimme alusta, ja se sai kiinni puhutun arabian rikkautta eri tilanteissa nopeasti ja kustannustehokkaasti. Ilman tätä menetelmää arabiankielisen ASR-järjestelmän rakentaminen tässä mittakaavassa olisi kestänyt vuosia ja miljoonia manuaalista työtä.
Munsit suoritti paremmin kuin OpenAI:n, Microsoftin ja Metan mallit useilla mittareilla. Mitä tämä saavutus sanoo arabiankielisen tekoälyn tulevaisuudesta?
Arabiankielisen tekoälyn tulevaisuus on meidän käsissämme; ja tämä saavutus osoittaa sen. Emme voi enää riippua tekniikoista, joita emme omista, tai kolmansien osapuolien teknologioista, jotka eivät priorisoi aluettamme.
Munsit osoittaa, että voimme rakentaa maailmanluokan tekoälyä alueelta alueelle — käyttäen paikallista osaamista paikallisten ongelmien ratkaisemiseen. Se on selkeä signaali, että seuraava aalto arabiankielisen tekoälyn innovaatioita tulee sisältä.
Miten näet Munsitin kehittyvän tulevissa versioissa, ja mitkä ovat seuraavat rintamat arabiankieliselle äänitekoälylle CNTXT:ssä?
Vain odota ja näe. Sen, mitä voin sanoa, on, että meillä on uusi, tuore sarja arabiankielisiä tekoälyratkaisuja tulossa — kaikki Munsitin ja muiden mallien voimin, joita kehitämme tällä hetkellä CNTXT AI:ssa. Tämä on vasta alku.
Puhut usein “suvereenista tekoälystä”. Mitä tämä termi merkitsee sinulle, ja miksi se on kriittinen Persianlahdelle ja laajemmalle Lähi-idän ja Pohjois-Afrikan alueelle?
Minulle suvereeni tekoäly tarkoittaa täydellistä omistamista ja hallintaa datan, infrastruktuurin ja mallien yllä, jotka muokkaavat tulevaisuuttamme. Se on kriittinen, koska meidän on omistettava oma kohtalomme, ja se alkaa datalla.
Datansuvereniteetti on kaikki. Data on arvokasta, ja meidän on varmistettava, että se pysyy käsissämme.
Emme voi antaa tulevaisuuttamme toisten rakentamaksi ja istua toimettomina, kun toiset rakentavat teknologian meille. Tämän alueen tekoälyn tulevaisuus tulee tästä alueesta. Se on juuri sitä, mitä teemme.
Miten näet CNTXT AI:n muokkaavan tekoälyekosysteemiä Lähi-idän ja Pohjois-Afrikan alueella seuraavien viiden vuoden aikana?
Toteuttamalla todellisen tekoälyvalmiuden. Menemme sisään, ymmärrämme, mitä yrityksillä ja hallituksilla on tarve, rakennamme datan ja tekoälystrategiat, ja sitten autamme heitä rakentamaan, testaamaan, käyttöönottoon ja skaalaamaan.
Jos data on uusi öljy, niin strukturoimaton data on öljy, jota ei ole jalostettu — täynnä potentiaalia, mutta käyttökelvotonta, kunnes se on prosessoitu. Siksi olemme rakentaneet CNTXT AI:n avuksi organisaatioita puhdistamaan, rakentamaan ja aktivoimaan dataa. Koska siinä alkaa todellinen tekoälymuutos.
Milka ovat neuvosi muille perustajille, jotka rakentavat tekoälystartuppeja nousujohtavilla markkinoilla?
Aloita nyt. Liiku nopeasti. Epäonnistu nopeasti, opi nopeammin ja jatka iterointia.
Ennen kaikkea, rakenna oikeisiin ongelmiin. Pysy lähellä maata — kuuntele käyttäjiä, ei vain hypeä. Nousujohtavilla markkinoilla relevanttius ja sopeutumiskyky ovat avainasemassa.
Kiitos haastattelusta, lukijat, jotka haluavat oppia lisää, voivat vierailla CNTXT AI.












