Modele și platforme AI
Facebook Creează Un Model De Traducere Mașină Care Poate Traduce Direct Între 100 De Limbi Diferite
Facebook (META ) a dezvoltat recent un nou model de traducere mașină care poate traduce texte între orice pereche de limbi dintr-un set de 100 de limbi. În timp ce există și alte sisteme de traducere mașină, majoritatea sistemelor de traducere AI funcționează prin traducerea textului în limba engleză și apoi convertirea textului de acolo. Așa cum a raportat Engadget, traducătorul AI al Facebook funcționează fără a folosi limba engleză ca intermediar și este capabil să obțină o acuratețe de aproximativ 90%.
Datele de antrenare pentru modelul AI al Facebook au fost compuse din aproximativ 7,5 miliarde de perechi de propoziții, distribuite în 100 de limbi diferite. Datele au fost colectate de pe web folosind o serie de crawlere web și limbile prezente în datele colectate au fost identificate folosind un model de limbă numit FastText. Odată ce datele au fost colectate, au fost rulate printr-un instrument numit LASER 2.0 pentru a extrage sensul diferitelor mostre de propoziții și a le potrivi împreună pe baza sensului lor. LASER 2.0 a fost dezvoltat de Facebook și utilizează algoritmi de învățare nesupravegheată pentru a crea încorporări. Încorporările de propoziții conțin informații despre relațiile dintre diferitele propoziții pe baza caracteristicilor precum frecvența de utilizare și cât de aproape se află propozițiile unele de altele. LASER 2.0 poate crea perechi de propoziții care au sensuri foarte asemănătoare.
Datele de antrenare nu au fost doar perechi pe baza sensului propozițiilor. Limbile însele au fost grupate împreună. Scopul a fost de a proiecta un sistem care să nu necesite limba engleză ca mediu între două limbi, cu Angela Fan de la Facebook, care a condus proiectul, notând că multe regiuni din lume vorbesc două limbi care nu sunt engleza. Inginerii de la Facebook au efectuat antrenamentul prin focalizarea pe perechi de limbi care sunt traduse în mod obișnuit unele în altele. Au fost create paisprezece grupuri de limbi diferite, pe baza unor variabile precum cultură, asemănări lingvistice și geografie. De exemplu, unul dintre grupurile lingvistice create de cercetători conținea limbile cele mai comune din India, care includ limbile urdu, tamil, hindi și bengali. Acest lucru a fost făcut astfel încât limbile perechi comune să primească traduceri de înaltă calitate.
Metoda de antrenare axată pe grupurile de limbi a condus la unele rezultate interesante. S-a constatat că modelul de traducere rezultat a avut o acuratețe mai mare decât modelele existente pentru anumite perechi de limbi. De exemplu, atunci când se traduce din engleză în bielorusă, AI a putut aplica anumite modele pe care le-a învățat atunci când traducea rusa, deoarece bielorusa are asemănări lingvistice cu rusa. În mod similar, eforturile de traducere între spaniolă și portugheză s-au îmbunătățit, deoarece spaniola este a doua limbă vorbită în lume și a existat un volum substanțial de date de antrenare pentru această sarcină.
Există aproximativ șaizeci de limbi pe care sistemul de traducere nu le acoperă încă, și acuratețea modelului pentru limbile cu puține date de antrenare trebuie îmbunătățită înainte de a fi gata pentru utilizare. Multe limbi din Asia de Sud-Est și Africa lipsesc volumul de date necesar pentru a antrena un model fiabil. Echipa de cercetare trebuie să determine o modalitate de a compensa această lipsă de date. Echipa de cercetare trebuie să determine, de asemenea, cum să controleze orice modele rasiste, sexiste sau altfel profane pe care modelul le-ar fi putut învăța. Deși echipa de cercetare a folosit un filtru de profanitate, filtrul funcționează în principal pe datele în limba engleză.
Sistemul de traducere mașină nu a fost încă utilizat pe platforma de socializare a Facebook. Modelul actual este doar pentru scopuri de cercetare. Cu toate acestea, Facebook se pregătește să proiecteze modele similare și să le facă să gestioneze aproximativ 20 de miliarde de solicitări de traducere pe care site-ul le primește în fiecare zi.












