Lideri de opinie
Impactul Transformer: A fost rezolvată problema traducerii automatice?
Google a anunțat recent lansarea a 110 de limbi noi pe Google Translate, ca parte a inițiativei de 1000 de limbi lansate în 2022. În 2022, la început, au adăugat 24 de limbi. Cu cele 110 de limbi noi, acum sunt 243 de limbi. Această extindere rapidă a fost posibilă datorită traducerii automate cu zero shot, o tehnologie în care modelele de învățare automată învață să traducă într-o altă limbă fără exemple anterioare. Dar, în viitor, vom vedea împreună dacă acest progres poate fi soluția finală pentru problema traducerii automate, și, între timp, putem explora modurile în care poate fi realizat. Dar, mai întâi, să îi spunem povestea.
Cum a fost înainte?
Traducerea automată statistică (SMT)
Acesta a fost metoda originală folosită de Google Translate. A depins de modele statistice. Au analizat corpora paralele mari, colecții de traduceri de propoziții aliniate, pentru a determina traducerile cele mai probabile. Mai întâi, sistemul a tradus textul în engleză ca un pas intermediar, înainte de a-l converti în limba țintă, și a trebuit să coreleze fraze cu seturi de date extinse din transcrierile Organizației Națiunilor Unite și ale Parlamentului European. Este diferit de abordările tradiționale care necesitau compilarea unor reguli gramaticale exhaustive. Și abordarea sa statistică i-a permis să se adapteze și să învețe din date fără a se baza pe cadre lingvistice statice care ar fi putut deveni rapid complet inutile.
Dar există și unele dezavantaje ale acestei abordări. Mai întâi, Google Translate a folosit traducerea bazată pe fraze, unde sistemul a divizat propozițiile în fraze și le-a tradus individual. Acesta a fost o îmbunătățire față de traducerea cuvânt cu cuvânt, dar a avut totuși limitări, cum ar fi frazarea ciudată și erorile de context. Pur și simplu, nu a înțeles pe deplin nuanțele, așa cum o facem noi. De asemenea, SMT se bazează puternic pe existența corpora paralele, și orice limbă relativ rară ar fi greu de tradus, deoarece nu are suficiente date paralele.
Traducerea automată neuronală (NMT)
În 2016, Google a trecut la traducerea neuronală. Acesta folosește modele de învățare profundă pentru a traduce propoziții întregi deodată, oferind traduceri mai fluente și mai precise. NMT funcționează similar cu un asistent multilingv sofisticat din computerul dvs. Folosind o arhitectură secvențială (seq2seq), NMT procesează o propoziție într-o limbă pentru a înțelege sensul său. Apoi generează o propoziție corespunzătoare într-o altă limbă. Această metodă folosește seturi de date uriașe pentru învățare, în contrast cu traducerea statistică, care se bazează pe modele statistice care analizează corpora paralele mari pentru a determina traducerile cele mai probabile. În contrast cu SMT, care s-a concentrat pe traducerea bazată pe fraze și a necesitat mult efort manual pentru a dezvolta și a menține reguli și dicționare lingvistice, puterea NMT de a procesa secvențe întregi de cuvinte îi permite să capteze mai eficient contextul nuanțat al limbajului. Așadar, a îmbunătățit calitatea traducerii în diverse perechi de limbi, ajungând adesea la niveluri de fluență și acuratețe comparabile cu cele ale traducătorilor umani.
În fapt, modelele tradiționale de NMT au folosit rețele neuronale recurente (RNN) ca arhitectură de bază, deoarece acestea sunt proiectate pentru a procesa date secvențiale, menținând un stat ascuns care evoluează pe măsură ce se procesează fiecare nouă intrare (cuvânt sau token). Acest stat ascuns servește ca o sortare de memorie care captează contextul intrărilor precedente, permițând modelului să învețe dependențe în timp. Dar RNN-urile au fost computațional costisitoare și greu de paralelizat eficient, ceea ce limita scalabilitatea lor.
Introducerea transformatorilor
În 2017, Google Research a publicat articolul intitulat “Atenția este tot ce ai nevoie,” introducând transformatorii lumii și marcând o schimbare pivotantă de la RNN-uri în arhitectura rețelelor neuronale.
Transformatorii se bazează doar pe mecanismul de atenție, – atenția de sine, care permite modelelor de traducere automată neuronală să se concentreze selectiv asupra părților cele mai critice ale secvențelor de intrare. În contrast cu RNN-urile, care procesează cuvintele într-o secvență în propoziții, atenția de sine evaluează fiecare token pe întregul text, determinând care dintre acestea sunt esențiale pentru înțelegerea contextului său. Această calculare simultană a tuturor cuvintelor permite transformatorilor să capteze eficient atât dependențele scurte, cât și pe cele lungi, fără a se baza pe conexiuni recurente sau filtre convolutionale.
Așadar, prin eliminarea recurenței, transformatorii oferă câteva beneficii cheie:
- Paralelizabilitate: Mecanismele de atenție pot fi calculate în paralel pe diferite segmente ale secvenței, ceea ce accelerează antrenamentul pe hardware modern, cum ar fi GPU-urile.
- Eficiență a antrenamentului: Acestea necesită, de asemenea, un timp de antrenament semnificativ mai scurt în comparație cu modelele tradiționale bazate pe RNN sau CNN, oferind o performanță mai bună în sarcini precum traducerea automată.
Traducerea automată cu zero shot și PaLM 2
În 2022, Google a lansat suport pentru 24 de limbi noi folosind traducerea automată cu zero shot, marcând un moment semnificativ în tehnologia traducerii automate. De asemenea, au anunțat inițiativa de 1.000 de limbi, menită să sprijine cele 1.000 de limbi vorbite în lume. Acum au lansat încă 110 limbi. Traducerea automată cu zero shot permite traducerea fără date paralele între limba sursă și limba țintă, eliminând nevoia de a crea date de antrenament pentru fiecare pereche de limbi — un proces anterior costisitor și consumator de timp, și pentru unele perechi de limbi, imposibil.
Acest progres a devenit posibil datorită arhitecturii și mecanismelor de atenție ale transformatorilor. Capacitatea modelului de transformator de a învăța relații contextuale între limbi, combinată cu scalabilitatea sa de a gestiona multiple limbi simultan, a permis dezvoltarea unor sisteme de traducere multilingvă mai eficiente și mai eficace. Cu toate acestea, modelele cu zero shot arată, în general, o calitate mai scăzută decât cele antrenate pe date paralele.
Apoi, pe baza progresului transformatorilor, Google a introdus PaLM 2 în 2023, care a deschis calea pentru lansarea a 110 de limbi noi în 2024. PaLM 2 a îmbunătățit semnificativ capacitatea Translate de a învăța limbi strâns legate, cum ar fi Awadhi și Marwadi (legate de hindi) și creole franceze, cum ar fi Seychellois și Mauritian Creole. Îmbunătățirile din PaLM 2, cum ar fi scalarea optimă a calculului, seturile de date îmbunătățite și proiectarea rafinată — au permis o învățare a limbilor mai eficientă și au sprijinit eforturile continue ale Google de a face suportul lingvistic mai bun și mai mare, și de a se adapta la nuanțele lingvistice diverse.
Putem afirma că provocarea traducerii automate a fost abordată complet cu transformatorii?
Evoluția despre care vorbim a durat 18 ani, de la adoptarea de către Google a SMT până la cele 110 de limbi suplimentare folosind traducerea automată cu zero shot. Acesta reprezintă un salt uriaș care poate reduce nevoia de colecție extinsă de corpora paralele — o sarcină istorică și foarte laborioasă pe care industria a urmărit-o timp de două decenii. Dar, afirmarea că traducerea automată este complet abordată ar fi prematură, luând în considerare atât aspectele tehnice, cât și pe cele etice.
Modelele actuale încă se luptă cu contextul și coerența și fac greșeli subtile care pot schimba sensul pe care l-ați intenționat pentru un text. Aceste probleme sunt foarte prezente în propoziții mai lungi și mai complexe, unde menținerea fluxului logic și înțelegerea nuanțelor este necesară pentru rezultate. De asemenea, nuanțele culturale și expresiile idiomatice sunt adesea pierdute sau își pierd sensul, provocând traduceri care pot fi corecte din punct de vedere gramatical, dar nu au impactul dorit sau sună nefirește.
Date pentru pre-antrenament: PaLM 2 și modele similare sunt pre-antrenate pe un corpus de text multilingv divers, depășindu-și predecesorul PaLM. Această îmbunătățire îi permite PaLM 2 să excelleze în sarcini multilingve, subliniind importanța continuă a seturilor de date tradiționale pentru îmbunătățirea calității traducerii.
Limbi specializate sau rare: În domenii specializate, cum ar fi cele legale, medicale sau tehnice, corpora paralele asigură ca modelele să întâlnească terminologii și nuanțe lingvistice specifice. Modelele avansate pot lupta cu jargonul specific domeniului sau cu tendințele lingvistice în evoluție, ceea ce prezintă provocări pentru traducerea automată cu zero shot. De asemenea, limbile cu resurse reduse sunt încă traduse prost, deoarece nu au datele necesare pentru a antrena modele precise.
Testare: Corpora paralele rămân esențiale pentru evaluarea și testarea performanței modelelor de traducere, în special pentru limbi care nu au suficiente date paralele. Metricele automate, cum ar fi BLEU, BLERT și METEOR, au limitări la evaluarea nuanțelor calității traducerii, în afara gramaticii. Dar, apoi, suntem limitați de prejudecățile noastre. De asemenea, nu există suficienți evaluatori calificați, și găsirea evaluatorului bilingv perfect pentru fiecare pereche de limbi pentru a prinde erorile subtile.
Intensitatea resurselor: Natura consumatoare de resurse a antrenamentului și a implementării LLM-urilor rămâne o barieră, limitând accesibilitatea pentru unele aplicații sau organizații.
Prezervarea culturală. Dimensiunea etică este profundă. Așa cum descrie Isaac Caswell, cercetător științific la Google Translate, traducerea automată cu zero shot: “Poți să o consideri ca pe un poliglot care cunoaște multe limbi. Dar, apoi, în plus, el ajunge să vadă texte în 1.000 de limbi care nu sunt traduse. Poți să-ți imaginezi dacă ești un poliglot mare și apoi începi să citești romane într-o altă limbă, poți să începi să înțelegi ce ar putea să însemne pe baza cunoștințelor tale generale despre limbaj.” Cu toate acestea, este crucial să considerăm impactul pe termen lung asupra limbilor minore lipsite de corpora paralele, care ar putea afecta prezervarea culturală atunci când se îndepărtează de la limbile însele.












