Andersons vinkel
Apples løsning til oversættelse af kønsbestemte sprog

Apple har lige udgivet en rapport i samarbejde med USC, der udforsker de maskinlæringsmetoder, der anvendes til at give brugerne af deres iOS18-operativsystem flere valgmuligheder, når det kommer til oversættelse af køn.

I iOS18 kan brugere vælge alternative kønsforslag for en oversat ord i den native Translate-app. Kilde: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios
Selv om de problemer, der håndteres i arbejdet (som Apple har annonceret her), i visse omfang deltager i nuværende aktuelle debatter om kønsdefinitioner, handler det om et langt ældre problem: det faktum, at 84 af de 229 kendte sprog i verden bruger et kønsbaseret kønssystem.

De røde prikker indikerer sprog, der bruger et kønsbaseret kønssystem. Kilde: https://wals.info/feature/31A#map
Overraskende nok falder det engelske sprog ind i den kønsbaserede kategori, fordi det tildeler maskuline eller feminine entalpronominer.
Til gengæld kræver alle romanske sprog (herunder over halv en milliard spansktalende) – og andre populære sprog, såsom russisk – kønsenighed på måder, der tvinger oversættelsessystemer til at håndtere kønsbestemmelse i sproget.
Den nye rapport illustrerer dette ved at observere alle mulige spanske oversættelser af sætningen Secretary var vred på chefen:

Fra den nye rapport, et eksempel på de potentielle kønsbestemmelser i sætningen ‘Secretary var vred på chefen’, oversat fra engelsk til spansk. Kilde: https://arxiv.org/pdf/2407.20438
Naiv oversættelse er langt fra tilstrækkelig til længere tekster, der kan fastlægge køn i starten (‘Han’, ‘Hun’ osv.) og derefter ikke henviser til køn igen. Alligevel skal oversættelsen huske den tildelte køn for deltagere gennem hele teksten.
Dette kan være udfordrende for tokenbaserede tilgange, der behandler oversættelser i separate blokke, og risikerer at miste den tildelte kønskontekst gennem hele indholdet.
Endnu værre er systemer, der tilbyder alternative oversættelser for fordomsfulde kønsbestemmelser, ikke kan gøre dette uden diskrimination, dvs. ved blot at erstatte kønsnavnet, men skal sikre, at alle andre dele af sproget er enige med det ændrede kønsnavn.
I dette eksempel fra Apple/USC-rapporten ser vi, at selv om Secretary er tildelt et mandligt køn, er den enkelte fortid var blevet efterladt som feminin (estaba):

Brute-force kønsersættelser kan negligerer nødvendig kønsenighed. I dette eksempel skal ordet ‘enojada’ være ‘enojado’, for at være enig med det maskuline ‘El secretario’.
Et oversættelsessystem skal også håndtere de særlige egenskaber af bestemte sprog i forhold til køn. Som rapporten påpeger, er pronomenet jeg kønsbestemt på hindi, hvilket giver en usædvanlig ledetråd til køn.
Kønsproblemer
I den nye rapport, med titlen Generering af kønsalternativer i maskinoversættelse, foreslår Apple- og USC-forskerne en semi-overvåget metode til at omdanne kønsambiguøse enheder til en matrix af enhedsniveau-alternativer.
Systemet, der blev brugt til at informere oversættelse fra Apple Translate-appen i iOS18, opbygger en sprogskema ved både brug af store sprogmodeller (LLM’er) og ved at fine-tune forudtrænede åbne kildesprog-oversættelsesmodeller.
Resultaterne fra oversættelserne fra disse systemer blev derefter trænet ind i en arkitektur, der indeholder kønsstrukturer – grupper af sætninger, der indeholder forskellige former af kønsbestemte navne, der repræsenterer samme enhed.
Rapporten siger*:
‘Kønsfordomme, der er til stede i træningsdata, er kendt for at blive overført til naturligsprogsbehandlings-systemer (NLP), hvilket resulterer i spredning og mulig forstærkning af disse fordomme. Sådanne fordomme er ofte også årsagen til fejl.
‘Et maskinoversættelsessystem kan f.eks. oversætte læge til det spanske ord médico (maskulint) i stedet for médica (feminint), givet input “Lægen bad sygeplejersken om at hjælpe hende i proceduren”.
‘For at undgå at foreskrive forkert kønsbestemmelse, skal maskinoversættelsessystemer disambiguere køn gennem kontekst. Når det korrekte køn ikke kan bestemmes gennem kontekst, er det en rimelig tilgang at tilbyde multiple oversættelsesalternativer, der dækker alle gyldige kønsvalg.’
Tilgangen, som forskerne kommer frem til, omdanner effektivt en oversættelse fra en enkelt token til en brugerstyret matrix.
(Selv om rapporten ikke nævner det, åbner dette mulighed for, at brugerens valg kan føres tilbage til senere iterationer af modellen)
Modellen, som Apple og USC udviklede, blev evaluueret på GATE og MT-GenEval testsettet. GATE indeholder kilde-sætninger med op til 3 kønsambiguøse enheder, mens MT-GenEval indeholder materiale, hvor køn ikke kan sluttes, hvilket, ifølge forfatterne, hjælper med at forstå, når alternative kønsmuligheder ikke skal tilbydes brugeren.
I begge tilfælde skulle testsettet gen-annoteres for at være i overensstemmelse med projektets mål.
Til at træne systemet anvendte forskerne en ny automatisk dataforstærkningsalgoritme, i modsætning til de ovennævnte testsettet, som var annoteret af mennesker.
Bidragende datasæt til Apple-kureringen var Europarl; WikiTitles; og WikiMatrix. Korpusset blev inddelt i G-Tag (med 12.000 sætninger), der omfatter sætninger med hovedord for alle enheder, samt en kønsambiguøs annotation; og G-Trans (med 50.000 sætninger), der indeholder kønsambiguøse enheder og kønsaligneringer.
Forfatterne hævder*:
‘Til vores bedste viden er dette det første store korpus, der indeholder kønsambiguøse og hvordan de påvirker kønsbestemte former i oversættelsen.’
Datasæt og diverse data til projektet er blevet gjort tilgængelige på GitHub. Dataene omfatter fem sprogpar, der sætter engelsk op mod russisk, tysk, fransk, portugisisk og spansk.
Forskerne udnyttede en tidligere tilgang fra 2019 til at give modellen evnen til at udgive kønsaligneringer, ved at træne med cross-entropy tab og en ekstra alignerings-tab.
Til dataforstærkningsrutinen valgte forfatterne at afvise traditionelle regelbaserede metoder til fordel for en datacentreret tilgang, ved at fine-tune en BERT forudtrænet sprogmodel på G-Tag-datasættet.
Dobbelt-tjek
For tilfælde, hvor kønsambiguøse enheder er detekteret, udforskede Apple og USC to metoder – fine-tuning af forudtrænede sprogmodeller og brug af LLM’er.
I forhold til den første metode siger rapporten*:
‘Vi fine-tune en forudtrænet MT-model M på en bi-tekst, der er udtrukket fra G-Trans-datasættet. Kilde-sætningerne i denne bi-tekst indeholder ambigue enheder, der er markeret som maskuline eller feminine ved hjælp af <M>/<F>-tags, og mål-oversættelsen har korrekte kønsbøjninger, givet køns-tags.’

En illustration af skemaet for at udtrække bi-tekst fra G-Trans-datasættet.
I billedet ovenfor ser vi den fine-tuned tekst i den nederste midterste kolonne, og den ønskede output i højre kolonne, med den underliggende rationale illustreret ovenfor.
Til denne tilgang anvendte forfatterne en lattice-rescoring metode fra et tidligere arbejde fra 2020. For at sikre, at kun mål-domænet (køn) blev behandlet, blev en begrænset strålingssøgning brugt som filter.
Til LLM-tilgangen udviklede forfatterne en strategi, der anvender en LLM som redaktør, ved at omskrive de leverede oversættelser for at give kønsbestemmelser.

LLM’en bliver promptet ved hjælp af et kontekst-eksempel for at tilděle køn.
Med resultater fra begge tilgange konkateneret, blev modellen herefter fine-tuned til at klassificere kilde-token som aligneret (indikeret af ‘1’ i skemaet nedenfor) eller non-aligneret (indikeret af ‘2’ nedenfor).

Et skema for konkatenering af resultater fra begge tilgange.
Data og tests
Den kønsambiguøse enhed-detektor, der blev brugt til projektet, blev udviklet ved at fine-tune Facebook AI’s xlm-roberta-large model, ved hjælp af transformatorer. Til dette blev det kombinerede G-Tag brugt på tværs af alle fem sprogpar.
I den første af de to ovennævnte tilgange blev M2M 1.2B modellen trænet på Fairseq, sammen med bi-tekstdata fra G-Trans-datasættet, med kønsbøjninger leveret af Wiktionary.
Til LLM-tilgangen anvendte forfatterne GPT-3.5-turbo. Til alignment af kønsstrukturer blev xlm-roberta-large igen brugt, denne gang med kønsaligneringer udtrukket fra G-Trans.
Mål for evaluering af alternativer, struktur (med præcision og recall), og aligneringsnøjagtighed.
Selv om de to første af disse er selvforklarende, måler aligneringsnøjagtighed procentdelen af output-kønsstrukturer, der overensstemmer med den kendte korrekte kildeidentitet, og anvender δ-BLEU-metoden, i overensstemmelse med metoden for MT-GenEval.
Ovenfor er resultaterne for dataforstærkningspipeline:

Resultater fra dataforstærkningstestene. Opadpegende pile indikerer ‘højere-er-bedre’, nedadpegende ‘lavere-er-bedre’.
Her kommenterer forfatterne*:
‘Både M2M og GPT opfører sig stort set ens, med undtagelse af engelsk-russisk, hvor GPT opnår meget lavere alternativ recall (58,7 i forhold til 89,3). Kvaliteten af genererede kønsstrukturer er bedre for GPT på engelsk-tysk og engelsk-portugisisk og bedre for M2M på engelsk-spansk og engelsk-russisk, som kan ses fra struktur-målene.
‘Bemærk, at vi ikke har nogen G-Trans-data for engelsk-italiensk, så resultaterne fra M2M-modellen og aligneringsnøjagtigheden på engelsk-italiensk er kun på grund af zero-shot generalisering af M2M og XLM-modeller.’
Forskerne sammenlignede også dataforstærkningspipeline-systemets ydeevne via M2M mod GATE’s sætningsniveau-køns-omskriver, på GATE’s egne betingelser.

Apple/USC dataforstærkningspipeline sammenlignet med GATE’s sætningsniveau-metode.
Her siger rapporten*:
‘Vi ser betydelige forbedringer i recall til en relativt lille forringelse i præcision (undtagen engelsk-italiensk). Vores system kan overgå GATE på deres foreslåede F.5-mål på alle 3 sprogpar.’
Til sidst trænede forfatterne diverse ‘vanilla’ flersprogede modeller ind i vanilla bi-tekst. Bidragende datasæt var WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, og Tilde.
To yderligere ‘vanilla’-modeller blev trænet, en der inkorporerede G-Trans-datasættet med den forspændte tag <gender>, der blev anvendt som den overvågede baseline; og en tredje, der inkorporerede kønsstruktur og -aligneringer (på den mindre lokale model, da brug af GPT’s API-baserede tjenester ville have været meget dyrt til dette formål).
Modellerne blev testet mod 2022 FloRes datasættet.

End-to-end ‘vanilla’ maskinoversættelsesmodeller testet (P = præcision, R = recall).
Rapporten sammenfatter disse resultater:
‘Den ‘vanilla’-model kan ikke generere alternativer og viser en stor fordom til at generere maskuline former (δ-BLEU varierer fra 5,3 til 12,5 point).
‘Denne fordom reduceres betydeligt af den overvågede baseline. Modellen, der er trænet på forstærket data, reducerer yderligere fordommen og opnår den bedste ydeevne i forhold til alternativ-mål, aligneringsnøjagtighed og δ-BLEU.
‘Dette viser effekten af dataforstærkningspipeline. Forstærket data tillader os også at træne et konkurrencedygtigt system for engelsk-italiensk, som mangler overvåget data.’
Forfatterne konkluderer med at bemærke, at succesen med modellen skal ses i bredere sammenhæng med NLP’s kamp for at rationalisere kønsbestemmelse i en oversættelsesmetode; og de bemærker, at dette fortsat er et åbent problem.
Selv om forskerne mener, at resultaterne ikke fuldt ud opnår målet om at generere enhedsniveau-kønsneutrale oversættelser og/eller disambiguiseringer i forhold til køn, mener de, at arbejdet er et ‘kraftfuldt instrument’ for fremtidige udforskninger ind i et af de mest udfordrende områder for maskinoversættelse.
* Min konvertering af forfatternes inline-citationer til hyperlinks
Først udgivet tirsdag, 8. oktober 2024












