Modele și platforme AI
Noul model de inteligență artificială funcționează cu o varietate mai largă de limbi umane
Cercetătorii de la Universitatea Waterloo au dezvoltat un model de inteligență artificială care permite calculatoarelor să proceseze o varietate mai largă de limbi umane. Acesta este un pas important înainte în domeniu, având în vedere cât de multe limbi sunt adesea lăsate în urmă în procesul de programare. Limbile africane nu sunt adesea luate în considerare de către oamenii de știință din domeniul calculatoarelor, ceea ce a dus la limitarea capacităților de procesare a limbajului natural (NLP) pe continent.
Noul model de limbaj a fost dezvoltat de o echipă de cercetători de la Școala de științe computaționale David R. Cheriton a Universității Waterloo.
Cercetarea a fost prezentată la Atelierul de învățare a reprezentărilor multilingve la Conferința din 2021 privind metodele empirice în procesarea limbajului natural.
Modelul joacă un rol cheie în ajutarea calculatoarelor să analizeze textul în limbile africane pentru multe sarcini utile și este numit AfriBERTa. Acesta utilizează tehnici de învățare profundă pentru a obține rezultate impresionante pentru limbile cu resurse reduse.
Lucrul cu 11 limbi africane
AfriBERTa funcționează cu 11 limbi africane specifice în acest moment, inclusiv amharică, hausa și swahili, care sunt vorbite de aproximativ 400 de milioane de oameni. Modelul a demonstrat o calitate a ieșirii comparabilă cu cea a celor mai bune modele existente și a făcut acest lucru învățând din doar un gigabyte de text. Alte modele similare necesită adesea de mii de ori mai multe date.
Kelechi Ogueji este student masterand în științe computaționale la Waterloo.
„Modelele de limbaj preîncărcate au transformat modul în care calculatoarele procesează și analizează datele textuale pentru sarcini care variază de la traducerea mașinilor la răspunsurile la întrebări”, a spus Ogueji. „Din nefericire, limbile africane au primit puțină atenție din partea comunității de cercetare.”
„Una dintre provocări este că rețelele neuronale sunt uluitor de text- și calculator-intensivă pentru a construi. Și, spre deosebire de engleză, care are cantități uriașe de text disponibil, majoritatea celor 7.000 de limbi vorbite în lume pot fi caracterizate ca având resurse reduse, întrucât există o lipsă de date disponibile pentru a alimenta rețelele neuronale foarte flămânde de date.”
Tehnica de pre-antrenare
Majoritatea acestor modele se bazează pe o tehnică de pre-antrenare, care implică prezentarea modelului cu text care are unele cuvinte ascunse sau mascate. Modelul trebuie apoi să ghicească cuvintele ascunse și să continue să repete acest proces miliarde de ori. Acesta învață în cele din urmă asocierile statistice dintre cuvinte, care este similară cu cunoașterea umană a limbajului.
Jimmy Lin este șeful catedrei de științe computaționale Cheriton și consilierul lui Ogueji.
„A fi capabil să pre-antrenezi modele care sunt la fel de precise pentru anumite sarcini descendente, dar care utilizează cantități mult mai mici de date, are multe avantaje”, a spus Lin. „Necesitând mai puține date pentru a antrena modelul de limbaj înseamnă că se necesită mai puțină computație și, în consecință, emisii de carbon mai mici asociate cu funcționarea centrelor de date masive. Seturile de date mai mici fac, de asemenea, curățarea datelor mai practică, ceea ce este o abordare pentru a reduce prejudecățile prezente în modele.”
„Această lucrare reprezintă un pas mic, dar important, pentru a aduce capacitățile de procesare a limbajului natural la peste 1,3 miliarde de oameni de pe continentul african.”
Cercetarea a implicat, de asemenea, Yuxin Zhu, care a terminat recent o diplomă de licență în științe computaționale la universitate.












