Modele și platforme AI
Starea modelelor de limbaj multilingve LLM: Depășirea limbii engleze
Conform cercetărilor Microsoft (MSFT ), aproximativ 88% din limbile lumii, vorbite de 1,2 miliarde de oameni, nu au acces la Modele de limbaj mari (LLM). Acest lucru se datorează faptului că majoritatea LLM-urilor sunt centrate pe limba engleză, adică sunt construite în principal cu date în limba engleză și pentru vorbitorii de limba engleză. Această dominanță a limbii engleze prevalează și în dezvoltarea LLM-urilor și a dus la o lacună digitală a limbilor, care ar putea exclude majoritatea oamenilor de la beneficiile LLM-urilor. Pentru a rezolva această problemă pentru LLM-uri, este nevoie de un LLM care să poată fi antrenat în diferite limbi și să poată efectua sarcini în diferite limbi. Intră în scenă LLM-urile multilingve!
Ce sunt LLM-urile multilingve?
Un LLM multilingv poate înțelege și genera text în mai multe limbi. Acestea sunt antrenate pe seturi de date care conțin diferite limbi și pot efectua diverse sarcini în mai multe limbi, pe baza unei comenzi din partea utilizatorului.
Aplicațiile LLM-urilor multilingve sunt uriașe, incluzând traducerea literaturii în dialecte locale, comunicarea multilingvă în timp real, crearea de conținut multilingv, etc. Acestea ar ajuta pe toată lumea să aibă acces la informații și să comunice ușor, indiferent de limba vorbită.
De asemenea, LLM-urile multilingve abordează provocări precum lipsa de nuanțe culturale și context, limitările datelor de antrenare și posibila pierdere a cunoștințelor în timpul traducerii.
Cum funcționează LLM-urile multilingve?
Construirea unui LLM multilingv implică pregătirea atentă a unui corpus echilibrat de texte în diverse limbi și selectarea unei arhitecturi și tehnici de antrenare potrivite pentru antrenarea modelului, de preferință un model Transformer, care este perfect pentru învățarea multilingvă.

Sursă: Imagine de autor
O tehnică constă în împărtășirea embeddings-urilor, care captează sensul semantic al cuvintelor în diferite limbi. Acest lucru face ca LLM-ul să învețe asemănările și deosebirile fiecărei limbi, permițându-i să înțeleagă mai bine limbile diferite.
Această cunoaștere îi dă și LLM-ului puterea de a se adapta la diverse sarcini lingvistice, precum traducerea limbilor, scrierea în diferite stiluri, etc. O altă tehnică utilizată este învățarea transferului cross-lingual, în care modelul este pre-antrenat pe un corpus mare de date multilingve înainte de a fi ajustat pentru sarcini specifice.
Acest proces în două etape asigură că modelul are o bază solidă în înțelegerea limbilor multilingve, făcându-l adaptabil pentru diverse aplicații downstream.
Exemple de Modele de limbaj mari multilingve

Sursă: Ruder.io
Au apărut mai multe exemple notabile de LLM-uri multilingve, fiecare adresând nevoi lingvistice și contexte culturale specifice. Să explorăm câteva dintre ele:
1. BLOOM
BLOOM este un LLM multilingv cu acces deschis, care prioritizează limbile diverse și accesibilitatea. Cu 176 de miliarde de parametri, BLOOM poate efectua sarcini în 46 de limbi naturale și 13 limbi de programare, făcându-l unul dintre cele mai mari și mai diverse LLM-uri.
Natura deschisă a BLOOM permite cercetătorilor, dezvoltatorilor și comunităților lingvistice să beneficieze de capacitățile sale și să contribuie la îmbunătățirea sa.
2. YAYI 2
YAYI 2 este un LLM cu sursă deschisă, proiectat în mod special pentru limbile asiatice, luând în considerare complexitățile și nuanțele culturale ale regiunii. A fost pre-antrenat de la zero pe un corpus multilingv de peste 16 limbi asiatice, conținând 2,65 trilioane de tokeni filtrați.
Acest lucru face ca modelul să ofere rezultate mai bune, îndeplinind cerințele specifice ale limbilor și culturilor din Asia.
3. PolyLM
PolyLM este un LLM „poliglot” cu sursă deschisă, care se axează pe abordarea provocărilor limbilor cu resurse limitate, oferind capacități de adaptare. A fost antrenat pe un set de date de aproximativ 640 de miliarde de tokeni și este disponibil în două dimensiuni de model: 1,7 miliarde și 13 miliarde. PolyLM cunoaște peste 16 limbi diferite.
Acesta permite modelelor antrenate pe limbile cu resurse mari să fie ajustate pentru limbile cu resurse limitate și date limitate. Această flexibilitate face ca LLM-urile să fie mai utile în diverse situații lingvistice și sarcini.
4. XGLM
XGLM, cu 7,5 miliarde de parametri, este un LLM multilingv antrenat pe un corpus care acoperă un set divers de peste 20 de limbi, utilizând tehnica de învățare cu puține exemple. Face parte dintr-o familie de LLM-uri multilingve mari, antrenate pe un set masiv de texte și cod.
Acesta își propune să acopere multe limbi în întregime, ceea ce explică de ce se axează pe incluzivitate și diversitate lingvistică. XGLM demonstrează potențialul de a construi modele care să răspundă nevoilor diverselor comunități lingvistice.
5. mT5
mT5 (Text-to-Text Transfer Transformer multilingv) a fost dezvoltat de Google (GOOGL ) AI. Antrenat pe setul de date Common Crawl, mT5 este un LLM multilingv de ultimă generație, care poate gestiona 101 limbi, de la limbile vorbite pe scară largă, cum ar fi spaniola și chineza, până la limbile mai puțin resurse, cum ar fi basca și quechua.
De asemenea, acesta excelează în sarcini multilingve, precum traducerea, rezumarea, răspunsurile la întrebări, etc.
Este posibil un LLM universal?
Conceptul unui LLM neutru din punct de vedere lingvistic, capabil să înțeleagă și să genereze limbaj fără a fi influențat de o anumită limbă, este intrigant.
Deși dezvoltarea unui LLM universal adevărat este încă departe, LLM-urile multilingve actuale au demonstrat succese semnificative. Odată dezvoltate pe deplin, acestea pot răspunde nevoilor limbilor subreprezentate și comunităților diverse.
De exemplu, cercetările arată că majoritatea LLM-urilor multilingve pot facilita transferul cross-lingual zero-shot de la o limbă cu resurse bogate la una săracă în resurse, fără date de antrenare specifice sarcinii.
De asemenea, modele precum YAYI și BLOOM, care se axează pe limbile și comunitățile specifice, au demonstrat potențialul abordărilor centrate pe limbă în promovarea progresului și incluzivității.
Pentru a construi un LLM universal sau pentru a îmbunătăți LLM-urile multilingve actuale, indivizii și organizațiile trebuie să facă următoarele:
- Să atragă vorbitori nativi pentru implicarea comunitară și curățarea seturilor de date lingvistice.
- Să sprijine eforturile comunitare privind contribuțiile cu sursă deschisă și finanțarea cercetărilor și dezvoltărilor multilingve.
Provocările LLM-urilor multilingve
Deși conceptul de LLM-uri multilingve universale are un potențial mare, acestea se confruntă și cu provocări care trebuie abordate înainte de a putea beneficia de ele:
1. Cantitatea de date
Modelele multilingve necesită un vocabular mai mare pentru a reprezenta tokeni în multe limbi decât modelele monolingve, dar multe limbi lipsesc seturi de date pe scară largă. Acest lucru face dificilă antrenarea eficientă a acestor modele.
2. Probleme de calitate a datelor
Asigurarea acurateței și adecvării culturale a ieșirilor LLM-urilor multilingve în limbile respective este o preocupare semnificativă. Modelele trebuie antrenate și ajustate cu atenție la nuanțele lingvistice și culturale pentru a evita prejudecățile și inexactitățile.
3. Limitări de resurse
Antrenarea și rularea modelelor multilingve necesită resurse computaționale substanțiale, cum ar fi GPU-uri puternice (de exemplu, NVIDIA A100 GPU). Costul ridicat prezintă provocări, în special pentru limbile și comunitățile cu resurse limitate și acces limitat la infrastructura computațională.
4. Arhitectura modelului
Adaptarea arhitecturilor de modele pentru a acomoda structurile și complexitățile lingvistice diverse este o provocare în curs. Modelele trebuie să poată gestiona limbile cu ordine diferite de cuvinte, variații morfologice și sisteme de scriere, menținând în același timp performanța și eficiența.
5. Complexitățile evaluării
Evaluarea performanței LLM-urilor multilingve dincolo de standardele în limba engleză este critică pentru măsurarea eficacității lor reale. Acest lucru necesită luarea în considerare a nuanțelor culturale, particularităților lingvistice și cerințelor specifice domeniului.
LLM-urile multilingve au potențialul de a sparge barierele lingvistice, de a împuternici limbile subreprezentate și de a facilita comunicarea eficientă în cadrul comunităților diverse.
Nu ratați ultimele știri și analize în domeniul AI și ML – vizitați unite.ai astăzi.












