Andersons vinkel

Apples løsning for å oversette kjønnsbaserte språk

mm
Legg til Unite.AI blant dine foretrukne kilder på Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Apple har nettopp publisert en rapport, i samarbeid med USC, som utforsker maskinlæringsmetodene som brukes for å gi brukerne av deres iOS18-operativsystem mer valgmuligheter når det gjelder kjønn ved oversettelse.

I iOS18 kan brukerne velge alternative kjønnsforslag for en oversatt ord i den native Translate-appen. Kilde: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

I iOS18 kan brukerne velge alternative kjønnsforslag for en oversatt ord i den native Translate-appen. Kilde: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Selv om problemene som behandles i arbeidet (som Apple har annonsert her) delvis engasjrer i nåværende aktuelle debatter om definisjoner av kjønn, handler det om et mye eldre problem: det faktum at 84 av de 229 kjente språkene i verden bruker et kjønnsbasert kjønnssystem.

De røde punktene indikerer språk som bruker et kjønnsbasert kjønnssystem. Kilde: https://wals.info/feature/31A#map

De røde punktene indikerer språk som bruker et kjønnsbasert kjønnssystem. Kilde: https://wals.info/feature/31A#map

Overraskende nok faller det engelske språket inn i den kjønnsbaserte kategorien, fordi det tilordner maskuline eller feminine entall pronomen.

I motsetning til dette er alle romanske språk (inkludert over halv en milliard spansktalende) – og flere andre populære språk, som russisk – krever kjønnsenighet på måter som tvinger oversettelsessystemer til å håndtere kjønnstilordning i språket.

Den nye rapporten illustrerer dette ved å observere alle mulige spanske oversettelser av setningen Sekretæren var sint på sjefen:

Fra den nye rapporten, et eksempel på de potensielle kjønns tilordningene i setningen 'Sekretæren var sint på sjefen', oversatt fra engelsk til spansk. Kilde: https://arxiv.org/pdf/2407.20438

Fra den nye rapporten, et eksempel på de potensielle kjønns tilordningene i setningen ‘Sekretæren var sint på sjefen’, oversatt fra engelsk til spansk. Kilde: https://arxiv.org/pdf/2407.20438

Naiv oversettelse er langt ifra tilstrekkelig for lengre tekster, som kan etablere kjønn i begynnelsen (‘Han’, ‘Hun’, osv.) og deretter ikke referere til kjønn igjen. Likevel må oversettelsen huske den tilordnede kjønnet til deltakeren gjennom hele teksten.

Dette kan være utfordrende for tokenbaserte tilnærminger som håndterer oversettelser i diskrete blokker, og risikerer å miste den tilordnede kjønnskonteksten gjennom hele varighet av innholdet.

Verre, systemer som tilbyr alternative oversettelser for fordomsfulle kjønnstilordninger kan ikke gjøre dette udiskriminerende, dvs. ved bare å erstatte kjønnsnavnet, men må sikre at alle andre deler av språket er i overensstemmelse med det endrede kjønnsnavnet.

I dette eksemplet fra Apple/USC-rapporten ser vi at selv om sekretær er tilordnet et mannskjønn, er den enkelte fortid var blitt etterlatt som feminin (estaba):

Bruteforce-kjønnsersettinger kan overse nødvendig kjønnsenighet. I dette eksemplet burde ordet 'enojada' vært 'enojado', for å være i overensstemmelse med det mannskjønns 'El secretario'.

Bruteforce-kjønnsersettinger kan overse nødvendig kjønnsenighet. I dette eksemplet burde ordet ‘enojada’ vært ‘enojado’, for å være i overensstemmelse med det mannskjønns ‘El secretario’.

Et oversettelsessystem må også håndtere de spesielle trekkene til bestemte språk i forhold til kjønn. Som rapporten påpeker, er pronomenet jeg kjønnsbestemt på hindi, som gir en uvanlig ledetråd til kjønn.

Kjønnsproblemer

I den nye rapporten, med tittelen Generering av kjønnsalternativer i maskinoversettelse, foreslår Apple- og USC-forskerne en semi-overvåket metode for å konvertere kjønnsambigue enheter til en rekke enhetsnivå-alternativer.

Systemet, som ble brukt til å informere oversettelse fra Apple Translate-appen i iOS18, konstruerer en språkskema ved både å bruke store språkmodeller (LLM-er), og ved å fine-tune forhånds trenede åpne kildekode maskinoversettelsesmodeller.

Resultatene fra oversettelser fra disse systemene ble deretter trenet inn i en arkitektur som inneholdt kjønnsstrukturer – grupper av fraser som inneholder forskjellige former av kjønnsbestemte substantiv som representerer samme enhet.

Rapporten sier*:

‘Kjønnsfordommer som finnes i treningsdata er kjent for å bli overført til naturlig språkbehandling (NLP)-systemer, og resulterer i spredning og mulig forsterkning av disse fordommene. Slike fordommer er ofte også årsaken til feil.

‘Et maskinoversettelsessystem kan for eksempel oversette lege til det spanske ordet médico (maskulint) i stedet for médica (feminint), gitt innputt “Legen spurte sykepleieren om å hjelpe henne i prosedyren”.

‘For å unngå å foreskrive feil kjønnstilordning, må maskinoversettelsessystemer klargjøre kjønn gjennom kontekst. Når det korrekte kjønnet ikke kan bestemmes gjennom kontekst, er det en rimelig tilnærming å tilby flere oversettelsesalternativer som dekker alle gyldige kjønnsvalg.’

Tilnærmingen som forskerne kommer frem til, effektivt omdanner en oversettelse fra en enkelt token til en brukerstyrt rekke.

(Selv om rapporten ikke nevner det, åpner dette opp muligheten, enten i Apple Translate eller i lignende portalene som tilbyr oversettelsestjenester, for at brukerens valg kan bli gjenbrukt i senere iterasjoner av modellen)

Modellen Apple og USC utviklet, ble evaluert på GATE og MT-GenEval testsett. GATE inneholder kilde-setninger med opptil 3 kjønnsambigue enheter, mens MT-GenEval inneholder materiale hvor kjønn ikke kan sluttes, hvilket, ifølge forfatterne, hjelper med å forstå når alternative kjønnsalternativer ikke bør tilbys brukeren.

I begge tilfeller måtte testsettene bli annotert på nytt, for å være i overensstemmelse med prosjektets mål.

For å trene systemet, la forskerne til en ny automatisk dataforsterkningsalgoritme, i motsetning til de ovennevnte testsettene, som var annotert av mennesker.

Bidragende datasett for Apples kurasjon var Europarl; WikiTitles; og WikiMatrix. Korpusene ble delt inn i G-Tag (med 12 000 setninger), som omfatter setninger med hodeord for alle enheter, sammen med en kjønnsambig annotering; og G-Trans (med 50 000 setninger), som inneholder kjønnsambigue enheter og kjønnsjusteringer.

Forfatterne hevder*:

‘Så langt vi vet, er dette den første store korpusen som inneholder kjønnsambiguiteter og hvordan de påvirker kjønnsbestemte former i oversettelsen.’

Datasettene og diverse data for prosjektet er gjort tilgjengelige på GitHub. Dataene omfatter fem språkpar, der engelsk møter russisk, tysk, fransk, portugisisk og spansk.

Forskerne la til en tidligere tilnærming fra 2019 for å gi modellen evnen til å utgangsjustere kjønn, og trente med kryssentropitap tap og en ekstra justeringsfeil.

For dataforsterkningsrutinen, valgte forfatterne å forkaste tradisjonelle regelbaserte metoder til fordel for en data-sentrert tilnærming, og fine-tunet en BERT forhånds trenet språkmodell på G-Tag-datasettet.

Dobbeltsjekk

For tilfeller hvor ambigue kjønnsenheter er detektert, utforsket Apple og USC to metoder – fine-tuning av forhånds trenede språkmodeller, og bruk av LLM-er.

I forhold til den første metoden, sier rapporten:

‘Vi fine-tuner en forhånds trenet MT-modell M på en bi-tekst ekstrahert fra G-Trans-datasettet. Kilde-setningene i denne bi-teksten inneholder ambigue enheter merket som maskuline eller feminine ved hjelp av <M>/<F> -tagger, og mål-oversettelsen har korrekte kjønnsbøyninger gitt kjønnstaggene.’

En illustrasjon av skjemaet for å ekstrahere bi-tekst fra G-Trans-datasettet.

En illustrasjon av skjemaet for å ekstrahere bi-tekst fra G-Trans-datasettet.

I bildet over ser vi den fine-tunede teksten i den nedre midtkolonnen, og den ønskede utgangen i høyre kolonnen, med den underliggende begrunnelsen illustrert over.

For denne tilnærmingen, brukte forfatterne en gitter-gjenrating metode fra et tidligere arbeid fra 2020. For å sikre at bare måldomen (kjønn) ble behandlet, ble en begrenset strålesøk brukt som en filter.

For LLM-tilnærmingen, utviklet forfatterne en strategi som bruker en LLM som en redaktør, ved å omskrive de tilbudte oversettelsene for å gi kjønnstilordninger.

LLM-en blir promptet med et kontekst-eksempel for å tilordne kjønn.

LLM-en blir promptet med et kontekst-eksempel for å tilordne kjønn.

Med resultater fra begge tilnærminger sammenføyet, ble modellen deretter fine-tunet for å klassifisere kilde-token som justert (indikert av ‘1’ i skjemaet under) eller ikke-justert (indikert av ‘2’ under).

Et skjema for sammenføyning av resultater fra begge tilnærminger.

Et skjema for sammenføyning av resultater fra begge tilnærminger.

Data og tester

Den ambigue enhet detektor som ble brukt i prosjektet, ble utviklet ved å fine-tune Facebook AI sin xlm-roberta-large modell, ved hjelp av transformatorer. For dette, ble den kombinerte G-Tag brukt over alle fem språkpar.

I den første av de ovennevnte to tilnærminger, ble M2M 1.2B modellen trenet på Fairseq, sammen med bi-tekst data fra G-Trans-datasettet, med kjønnsbøyninger gitt av Wiktionary.

For LLM-tilnærmingen, brukte forfatterne GPT-3.5-turbo. For justering av kjønnsstrukturer, ble xlm-roberta-large brukt på nytt, denne gangen med kjønnsjusteringer ekstrahert fra G-Trans.

Mål for evaluering av alternativer, struktur (med presisjon og tilbakekall), og justeringsnøyaktighet.

Selv om de to første av disse er selvforklarende, måler justeringsnøyaktighet prosentandelen av utgangs-kjønnsstrukturer som samsvarer med den kjente korrekte kildeidentiteten, og bruker δ-BLEU-metoden, i samsvar med metoden for MT-GenEval.

Nedenfor er resultater fra dataforsterkningspipelinen:

Resultater fra dataforsterkningstestene. Oppadpegende piler indikerer 'høyere-er-bedre', nedadpegende 'lavere-er-bedre'.

Resultater fra dataforsterkningstestene. Oppadpegende piler indikerer ‘høyere-er-bedre’, nedadpegende ‘lavere-er-bedre’.

Her kommenterer forfatterne*:

‘Både M2M og GPT utfører hovedsakelig like godt, med unntak av engelsk-russisk, hvor GPT oppnår mye lavere alternativtilbakekall (58,7 sammenlignet med 89,3). Kvaliteten på genererte kjønnsstrukturer er bedre for GPT på engelsk-tysk og engelsk-portugisisk og bedre for M2M på engelsk-spansk og engelsk-russisk, som kan ses fra struktur-målene.

‘Merke deg at vi ikke har noen G-Trans-data for engelsk-italiensk, så resultater fra M2M-modellen og justeringsnøyaktigheten på engelsk-italiensk er ren nullskudd generalisering av M2M og XLM-modeller.’

Forskerne sammenlignet også dataforsterkningspipelinen, via M2M, mot GATEs setningsnivå-kjønnsomskriver, på GATEs egne uttalede vilkår.

Apple/USC dataforsterkningspipelinen sammenlignet med GATEs setningsnivå-metode.

Apple/USC dataforsterkningspipelinen sammenlignet med GATEs setningsnivå-metode.

Her sier rapporten:

‘Vi ser betydelige forbedringer i tilbakekall på bekostning av relativt små nedgraderinger i presisjon (unntatt engelsk-italiensk). Vår pipeline er i stand til å overgå GATE på deres foreslåtte F.5-mål på alle 3 språkpar.’

Til slutt trenet forfatterne diverse ‘vanilla’ flerspråklige modeller inn i vanilla bi-tekst. Bidragende datasett var WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, og Tilde.

To ekstra ‘vanilla’-modeller ble trenet, en som inkorporerte G-Trans-datasettet med den forhånds-satt <gender> -taggen, som ble brukt som den overvåkede baseline; og en tredje, som inkorporerte kjønnsstruktur og justeringer (på den mindre lokale modellen, ettersom å bruke GPTs API-baserte tjenester ville ha vært svært dyrt for dette formålet).

Modellene ble testet mot 2022 FloRes datasettet.

End-to-end 'vanilla' maskinoversettelsesmodeller testet (P = presisjon, R = tilbakekall).

End-to-end ‘vanilla’ maskinoversettelsesmodeller testet (P = presisjon, R = tilbakekall).

Rapporten summerer disse resultater:

‘Den ‘vanilla’-modellen kan ikke generere alternativer og viser en stor fordom mot å generere maskuline former (δ-BLEU varierer fra 5,3 til 12,5 poeng).

‘Denne fordommen blir kraftig redusert av den overvåkede baseline. Modellen trenet på forsterket data reduserer ytterligere fordommen og oppnår beste ytelse i forhold til alternativ-mål, justeringsnøyaktighet og δ-BLEU.

‘Dette viser effekten av dataforsterkningspipelinen. Forsterket data tillater oss også å trene en konkurrerende modell for engelsk-italiensk, som mangler overvåket data.’

Forfatterne konkluderer med å bemerke at suksessen til modellen må vurderes i sammenheng med NLPs kamp for å rasjonalisere kjønnstilordning i en oversettelsesmetode; og de bemerker at dette fortsatt er et åpent problem.

Selv om forskerne mener at resultater ikke fullt ut oppnår målet om å generere enhetsnivå-kjønnsnøytrale oversettelser og/eller klargjøring av kjønn, mener de at arbeidet er et ‘kraftig instrument’ for fremtidige utforskninger innen ett av de mest utfordrende områdene i maskinoversettelse.

 

* Min konvertering av forfatternes inline-citater til hyperlenker

Først publisert tirsdag, 8. oktober 2024

Forfatter innen maskinlæring, domenespesialist i menneskeskapesynthese. Tidligere sjef for forskningsinnhold i Metaphysic.ai, til det ble oppløst i DNEG's Brahma.ai.
Portfolio nettsted: martinanderson.ai
Kontakt: martin@martinanderson.ai