Modele și platforme AI
Soluția Apple pentru traducerea limbilor cu gen

Apple (AAPL ) a publicat recent un articol, în colaborare cu USC, care explorează metodele de învățare automată utilizate pentru a oferi utilizatorilor sistemului de operare iOS18 mai multe opțiuni cu privire la gen atunci când vine vorba de traducere.

În iOS18, utilizatorii pot selecta sugestii alternative de gen pentru un cuvânt tradus în aplicația Translate nativă. Sursă: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Deși problemele abordate în acest studiu (pe care Apple le-a anunțat aici) se implică, într-o anumită măsură, în dezbaterile actuale despre definițiile genului, se concentrează pe o problemă mult mai veche: faptul că 84 din cele 229 de limbi cunoscute din lume utilizează un sistem de gen bazat pe sex.

Punctele roșii indică limbi care utilizează un sistem de gen bazat pe sex. Sursă: https://wals.info/feature/31A#map
În mod surprinzător, limba engleză se încadrează în categoria bazată pe sex, deoarece atribuie pronume masculine sau feminine singulare.
În contrast, toate limbile romanice (inclusiv peste jumătate de miliard de vorbitori de spaniolă) – și multe alte limbi populare, cum ar fi rusa – necesită acorduri de gen care obligă sistemele de traducere să abordeze atribuirea sexului în limbaj.
Noul articol ilustrează acest lucru prin observarea tuturor traducerilor posibile ale propoziției Secretarul a fost supărat pe șef:

Din noul articol, un exemplu de atribuire de gen posibilă în propoziția ‘Secretarul a fost supărat pe șef’, tradusă din engleză în spaniolă. Sursă: https://arxiv.org/pdf/2407.20438
Traducerea naivă este departe de a fi suficientă pentru texte mai lungi, care pot stabili genul la început (El, Ea, etc.) și nu se referă la gen din nou. Cu toate acestea, traducerea trebuie să-și amintească genul atribuit participantului pe tot parcursul textului.
Acest lucru poate fi dificil pentru abordările bazate pe tokeni care abordează traducerile în bucăți discrete și riscă să piardă contextul de gen pe parcursul conținutului.
Mai rău, sistemele care oferă traduceri alternative pentru atribuirile de gen biasate nu pot face acest lucru în mod indiscriminat, adică prin simpla înlocuire a substantivului de gen, ci trebuie să se asigure că toate celelalte părți ale limbajului sunt de acord cu substantivul de gen modificat.
În acest exemplu din articolul Apple/USC, vedem că deși Secretarul a fost atribuit un gen masculin, verbul a fost a fost lăsat în forma feminină (era):

Înlocuirile brute de gen pot neglija acordurile de gen necesare. În acest exemplu, cuvântul ‘supărată’ ar trebui să fie ‘supărat’, pentru a fi de acord cu ‘El secretar’.
Un sistem de traducere trebuie să facă față și excentricităților particulare ale anumitor limbi în ceea ce privește genul. Așa cum subliniază articolul, pronumele Eu este genat în hindi, ceea ce oferă o pistă neobișnuită pentru gen.
Probleme de gen
În noul articol, intitulat Generarea de alternative de gen în traducerea automată, cercetătorii Apple și USC propun o metodă semi-supervizată pentru a converti entități ambigue de gen într-o matrice de alternative la nivel de entitate.
Sistemul, care a fost utilizat pentru a informa traducerea din aplicația Apple Translate în iOS18, construiește un schema de limbaj prin utilizarea modelelor de limbaj mari (LLM) și prin reglarea fină a modelelor de traducere automată pre-antrenate.
Rezultatele traducerilor din aceste sisteme au fost antrenate într-o arhitectură care conține structuri de gen – grupuri de fraze care conțin diverse forme de substantive genate reprezentând aceeași entitate.
Articolul afirmă*:
‘Prejudecățile de gen prezente în datele de antrenare sunt cunoscute că se răspândesc în sistemele de procesare a limbajului natural (NLP), rezultând în diseminarea și amplificarea acestor prejudecăți. Astfel de prejudecăți sunt adesea și cauza erorilor.’
‘Un sistem de traducere automată (MT) poate, de exemplu, traduce medic în termenul spaniol médico (masculin) în loc de médica (feminin), dată fiind intrarea “Medicul a cerut asistentei să-l ajute în procedură”.’
‘Pentru a evita atribuirea greșită a genului, sistemele MT trebuie să disambigueze genul prin context. Când genul corect nu poate fi determinat prin context, oferirea unor traduceri alternative care acoperă toate alegerile valabile de gen este o abordare rezonabilă.’
Abordarea la care au ajuns cercetătorii se traduce, în esență, prin transformarea unei traduceri dintr-un singur token într-o matrice controlată de utilizator.
(Deși articolul nu menționează acest lucru, acesta deschide posibilitatea, fie în Apple Translate, fie în portale similare care oferă servicii de traducere, ca alegerile utilizatorului să fie feedback-uite în iterațiile ulterioare ale modelului)
Modelul dezvoltat de Apple și USC a fost evaluat pe seturile de test GATE și MT-GenEval. GATE conține propoziții sursă cu până la 3 entități ambigue de gen, în timp ce MT-GenEval conține material în care genul nu poate fi dedus, ceea ce, după cum afirmă autorii, ajută la înțelegerea momentului în care nu ar trebui să se ofere alternative de gen utilizatorului.
În ambele cazuri, seturile de test au trebuit să fie re-annotate pentru a se alinia cu obiectivele proiectului.
Pentru a antrena sistemul, cercetătorii s-au bazat pe un algoritm de augmentare a datelor inovator, în contrast cu seturile de test menționate anterior, care au fost annotate de către oameni.
Seturile de date care au contribuit la curația Apple au fost Europarl; WikiTitles; și WikiMatrix. Corpusul a fost împărțit în G-Tag (cu 12.000 de propoziții), care cuprinde propoziții cu cuvinte principale pentru toate entitățile, împreună cu o anotare ambiguă de gen; și G-Trans (cu 50.000 de propoziții), care conține entități ambigue de gen și alinieri de gen.
Autorii afirmă*:
‘După cunoștința noastră, acesta este primul corpus la scară largă care conține ambiguități de gen și modul în care acestea afectează formele genate în traducere.’
Seturile de date și datele diverse pentru proiect au fost puse la dispoziție pe GitHub. Datele prezintă cinci perechi de limbi, opunând engleza împotriva rusă, germană, franceză, portugheză și spaniolă.
Cercetătorii au utilizat o abordare anterioară din 2019 pentru a dota modelul cu capacitatea de a oferi alinieri de gen, antrenând cu pierdere de entropie cruzată și o pierdere de aliniere suplimentară.
Pentru rutina de augmentare a datelor, autorii au evitat metodele tradiționale bazate pe reguli în favoarea unei abordări centrate pe date, reglând fin un model de limbaj pre-antrenat BERT pe setul de date G-Tag.
Reevaluare
Pentru cazurile în care sunt detectate entități ambigue de gen, Apple și USC au explorat două metode – reglarea fină a modelelor de limbaj pre-antrenate și utilizarea modelelor LLM.
În ceea ce privește prima metodă, articolul afirmă:
‘Am reglat fin un model MT pre-antrenat M pe un bitext extras din setul de date G-Trans. Propozițiile sursă ale acestui bitext conțin entități ambigue marcate ca masculine sau feminine folosind etichete <M>/<F>, și traducerea țintă are inflecții de gen corecte date etichetelor de gen.’

O ilustrare a schemei de extragere a bitextului din setul de date G-Trans.
În imaginea de mai sus, vedem textul reglat fin în coloana din mijloc, și ieșirea dorită în coloana din dreapta, cu raționamentul subiacent ilustrat mai sus.
Pentru această abordare, autorii au utilizat o metodă de reevaluare a latticelui dintr-o lucrare anterioară din 2020. Pentru a se asigura că doar domeniul țintă (genul) a fost abordat, s-a utilizat o căutare cu fascicul constrânsă ca filtru.
Pentru abordarea LLM, autorii au conceput o strategie care utilizează un LLM ca editor, rescriind traducerile furnizate pentru a oferi atribuiri de gen.

LLM-ul este promptat folosind un exemplu în context pentru a atribui gen.
Rezultatele concatenate din ambele abordări, modelul a fost ulterior reglat fin pentru a clasifica tokenii sursă ca aliniați (indicați de ‘1’ în schema de mai jos) sau nealiniați (indicați de ‘2’ mai jos).

O schemă pentru concatenarea rezultatelor din ambele abordări.
Date și teste
Detectorul de entitate ambiguă utilizat pentru proiect a fost dezvoltat prin reglarea fină a modelului xlm-roberta-large al Facebook AI, utilizând transformatori. Pentru aceasta, s-a utilizat setul de date G-Tag combinat pentru toate cele cinci perechi de limbi.
În prima dintre cele două abordări menționate, modelul M2M 1.2B a fost antrenat pe Fairseq, împreună cu date bi-text din setul de date G-Trans, cu inflecții de gen furnizate de Wikționar.
Pentru abordarea LLM, autorii au utilizat GPT-3.5-turbo. Pentru alinierea structurilor de gen, xlm-roberta-large a fost utilizat din nou, de data aceasta cu alinieri de gen extrase din G-Trans.
Metrici pentru evaluarea alternativelor, structură (cu precizie și recal), și acuratețe de aliniere.
Deși primele două dintre acestea sunt auto-explicative, acuratețea de aliniere măsoară procentul de structuri de gen de ieșire care se conformează identității sursă corecte cunoscute și utilizează metoda δ-BLEU, în conformitate cu metodologia pentru MT-GenEval.
Rezultatele pentru pipeline-ul de augmentare a datelor sunt prezentate mai jos:

Rezultatele testelor de augmentare a datelor. Săgețile în sus indică ‘mai bine’, iar cele în jos ‘mai slab’.
Aici, autorii comentează*:
‘Ambele modele M2M și GPT funcționează în mare parte la fel, cu excepția engleză-rusă, unde GPT obține o recalare a alternativelor mult mai mică (58,7 comparativ cu 89,3). Calitatea structurilor de gen generate este mai bună pentru GPT pe engleză-germană și engleză-portugheză și mai bună pentru M2M pe engleză-spaniolă și engleză-rusă, așa cum se poate vedea din metricile structurii.’
‘Trebuie remarcat că nu avem date G-Trans pentru engleză-italiană, astfel încât rezultatele modelului M2M și acuratețea de aliniere pe engleză-italiană sunt pur și simplu datorate generalizării zero-shot a modelelor M2M și XLM.’
Cercetătorii au comparat, de asemenea, performanța sistemului de augmentare a datelor, prin M2M, împotriva re-scrierii la nivel de propoziție a GATE, pe termenii specificați de GATE.

Pipeline-ul de augmentare a datelor Apple/USC comparat cu metoda la nivel de propoziție a GATE.
Aici, articolul afirmă:
‘Observăm îmbunătățiri semnificative în recal la costul unei degradări relativ mici a preciziei (cu excepția engleză-italiană). Sistemul nostru este capabil să depășească GATE pe metrica F.5 propusă de ei pe toate cele 3 perechi de limbi.’
În final, autorii au antrenat diverse modele multilingve ‘vanilla’ în bi-text vanilla. Seturile de date care au contribuit au fost WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, și Tilde.
Doi modele ‘vanilla’ suplimentare au fost antrenați, unul care incorporează setul de date G-Trans cu eticheta prefixată <gen>, care a fost utilizat ca bază de referință supervizată; și un al treilea, care incorporează structura de gen și alinierile (pe modelul local mai mic, deoarece utilizarea serviciilor API GPT ar fi fost foarte costisitoare pentru acest scop).
Modelele au fost testate împotriva setului de date FloRes din 2022.

Modele de traducere automată ‘vanilla’ testate de la capăt la capăt (P = precizie, R = recal).
Articolul rezumă aceste rezultate:
‘Modelul ‘vanilla’ nu poate genera alternative și arată o biasă uriașă către generarea formelor masculine (δ-BLEU variind de la 5,3 la 12,5 puncte).’
‘Această biasă este puternic redusă de baza de referință supervizată. Modelul antrenat pe date augmentate reduce și mai mult biasa și obține cea mai bună performanță în ceea ce privește metricile alternative, acuratețea de aliniere și δ-BLEU.
‘Acest lucru demonstrează eficacitatea pipeline-ului de augmentare a datelor. Datele augmentate permit, de asemenea, antrenarea unui sistem competitiv pentru engleză-italiană, care lipsește date supervizate.’
Autorii concluzionează prin a remarca că succesul modelului trebuie considerat în contextul mai larg al luptei NLP de a raționaliza atribuirea genului într-o metodă de traducere; și ei remarcă faptul că aceasta rămâne o problemă deschisă.
Deși cercetătorii consideră că rezultatele obținute nu realizează pe deplin obiectivul generării de traduceri neutre de gen la nivel de entitate și/sau disambiguizări cu privire la gen, ei cred că lucrarea este un ‘instrument puternic’ pentru explorări viitoare în una dintre cele mai provocatoare domenii ale traducerii automate.
* Conversia mea a citărilor inline ale autorilor în legături hipertext
Publicat pentru prima dată marți, 8 octombrie 2024












