Andersons vinkel

Apples lösning för att översätta könsrelaterade språk

mm
Lägg till Unite.AI bland dina föredragna källor på Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Apple har just publicerat en rapport, i samarbete med USC, som undersöker de maskinlärningsmetoder som används för att ge användare av dess iOS18-operativsystem mer valmöjligheter när det gäller kön vid översättning.

I iOS18 kan användare välja alternativa könssuggestioner för en översatt ord i den inbyggda Översättningsappen. Källa: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

I iOS18 kan användare välja alternativa könssuggestioner för en översatt ord i den inbyggda Översättningsappen. Källa: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Även om de problem som tas upp i arbetet (som Apple har tillkännagett här) engagerar sig i aktuella debatter om kön, handlar det om ett mycket äldre problem: det faktum att 84 av de 229 kända språken i världen använder ett könssystem baserat på kön.

De röda prickarna indikerar språk som använder ett könssystem baserat på kön. Källa: https://wals.info/feature/31A#map

De röda prickarna indikerar språk som använder ett könssystem baserat på kön. Källa: https://wals.info/feature/31A#map

Förvånansvärt nog tillhör det engelska språket könssystemskategorin, eftersom det tilldelar maskulina eller feminina singulara pronomen.

I kontrast till detta kräver alla romanska språk (inklusive över en halv miljard spansktalande) – och flera andra populära språk, som ryska – könssamstämmighet på sätt som tvingar översättningssystem att hantera könstilldelning i språk.

Den nya rapporten illustrerar detta genom att observera alla möjliga spanska översättningar av meningen Chefen var arg på chefen:

Från den nya rapporten, ett exempel på de potentiella könstilldelningarna i meningen 'Chefen var arg på chefen', översatt från engelska till spanska. Källa: https://arxiv.org/pdf/2407.20438

Från den nya rapporten, ett exempel på de potentiella könstilldelningarna i meningen ‘Chefen var arg på chefen’, översatt från engelska till spanska. Källa: https://arxiv.org/pdf/2407.20438

Naiv översättning är långt ifrån tillräcklig för längre texter, som kan etablera kön i början (‘Han’, ‘Hon’, etc.) och därefter inte hänvisa till kön igen. Trots detta måste översättningen komma ihåg det tilldelade könet för deltagaren under hela texten.

Detta kan vara utmanande för tokenbaserade tillvägagångssätt som hanterar översättningar i diskreta chunkar och riskerar att förlora könssammanhanget under textens längd.

Värre, system som tillhandahåller alternativa översättningar för fördomsfulla könstilldelningar kan inte göra detta ostrukturerat, d.v.s. genom att enbart ersätta könsubstantivet, utan måste säkerställa att alla andra delar av språket överensstämmer med det ändrade könsubstantivet.

I det här exemplet från Apple/USC-rapporten ser vi att även om Chef har tilldelats ett manligt kön, har det singulara förflutna var lämnats som feminint (estaba):

Brutala könsubstitutionsmetoder kan försumma nödvändig könssamstämmighet. I det här exemplet borde ordet 'enojada' vara 'enojado', för att överensstämma med det maskulina 'El secretario'.

Brutala könsubstitutionsmetoder kan försumma nödvändig könssamstämmighet. I det här exemplet borde ordet ‘enojada’ vara ‘enojado’, för att överensstämma med det maskulina ‘El secretario’.

Ett översättningssystem måste också hantera de egenskaperna hos specifika språk när det gäller kön. Som rapporten påpekar är pronomen jag könsbestämt på hindi, vilket ger en ovanlig ledtråd till kön.

Könssproblem

I den nya rapporten, med titeln Att generera könssalternativ i maskinöversättning, föreslår Apple- och USC-forskarna en semiantuerad metod för att omvandla könssambigua entiteter till en mängd entitetsnivåalternativ.

Systemet, som användes för att informera översättning från Apple Translate-appen i iOS18, konstruerar ett språkschema genom användning av stora språkmodeller (LLM) och genom finjustering av förtränade öppna källkodsöversättningsmodeller.

Resultaten från översättningar från dessa system tränades sedan in i en arkitektur som innehåller könssstrukturer – grupper av fraser som innehåller olika former av könsubstantiv som representerar samma entitet.

Rapporten säger*:

‘Könssfördomar som finns i träningsdata är kända för att påverka naturligt språkbehandlingsystem (NLP), vilket resulterar i spridning och potentiell förstärkning av dessa fördomar. Sådana fördomar är ofta också roten till fel.

‘Ett maskinöversättningssystem (MT) kan till exempel översätta läkare till det spanska ordet médico (maskulint) istället för médica (feminint), givet indata “Läkaren bad sjuksköterskan att hjälpa henne i proceduren”.

‘För att undvika att föreskriva fel könstilldelning måste MT-system disambiguerera kön genom sammanhang. När det korrekta könet inte kan bestämmas genom sammanhang är det en rimlig strategi att tillhandahålla flera översättningsalternativ som täcker alla giltiga könval.’

Tillvägagångssättet som forskarna kommer fram till förvandlar effektivt en översättning från en enda token till en användarstyrd mängd.

(Även om rapporten inte nämner det, öppnar detta möjligheten för användarval att matas tillbaka in i senare iterationer av modellen)

Modellen som Apple och USC utvecklade utvärderades på GATE och MT-GenEval testuppsättningar. GATE innehåller källsätningar med upp till 3 könssambigua entiteter, medan MT-GenEval innehåller material där kön inte kan härledas, vilket, enligt författarna, hjälper till att förstå när alternativa könalternativ inte bör erbjudas användaren.

I båda fallen måste testuppsättningarna annoteras om för att motsvara projektets mål.

För att träna systemet förlitade sig forskarna på en ny, automatisk dataförstärkningsalgoritm, till skillnad från de ovannämnda testuppsättningarna, som annoterades av människor.

Bidragande datamängder för Apples kurering var Europarl; WikiTitles; och WikiMatrix. Korpusen delades in i G-Tag (med 12 000 meningar), som omfattar meningar med huvudord för alla entiteter, tillsammans med en könssambig annotation; och G-Trans (med 50 000 meningar), som innehåller könssambigua entiteter och könssamstämmighet.

Författarna hävdar*:

‘Så vitt vi vet är detta den första stora korpusen som innehåller könssambiguiteter och hur de påverkar könsubstantiv i översättning.’

Datamängder och varierad data för projektet har gjorts tillgängliga på GitHub. Datamängderna omfattar fem språkpar, som ställer engelska mot ryska, tyska, franska, portugisiska och spanska.

Författarna utnyttjade ett tidigare tillvägagångssätt från 2019 för att ge modellen förmågan att producera könssamstämmighet, genom att träna med korsentropiförlust och en extra samstämmighetsförlust.

För dataförstärkningsrutinen avstod författarna från traditionella regelbaserade metoder till förmån för en datacentrerad ansats, genom att finjustera en BERT förtränad språkmodell på G-Tag-datamängden.

Dubbelkontroll

För fall där könssambigua entiteter upptäcks, undersökte Apple och USC två metoder – finjustering av förtränade språkmodeller och användning av LLM.

I fråga om den första metoden säger rapporten*:

‘Vi finjusterar en förtränad MT-modell M på en bi-text extraherad från G-Trans-datamängden. Källsätningarna i denna bi-text innehåller könssambigua entiteter märkta som maskulina eller feminina med hjälp av <M>/<F>-taggar, och målöversättningen har korrekt könssamstämmighet givet könstaggen.’

En illustration av schemat för att extrahera bi-text från G-Trans-datamängden.

En illustration av schemat för att extrahera bi-text från G-Trans-datamängden.

I bilden ovan ser vi den finjusterade texten i den nedre mittenkolumnen, och den önskade utdata i högerkolumnen, med den underliggande rationalet illustrerat ovan.

För detta tillvägagångssätt använde författarna en lattreskörningsmetod från ett tidigare arbete 2020. För att säkerställa att endast målområdet (kön) behandlades, användes en begränsad strålsökning som filter.

För LLM-tillvägagångssättet utvecklade författarna en strategi som använder en LLM som redaktör, genom att omformulera de tillhandahållna översättningarna för att tillhandahålla könstilldelningar.

LLM.promptas med ett sammanhangsexempel för att tilldela kön.

LLM.promptas med ett sammanhangsexempel för att tilldela kön.

Med resultat från båda tillvägagångssätten sammanfogade, finjusterades modellen sedan för att klassificera källtokener som samstämmiga (indikerat av ‘1’ i schemat nedan) eller icke-samstämmiga (indikerat av ‘2’ nedan).

Ett schema för sammanfogning av resultat från båda tillvägagångssätten.

Ett schema för sammanfogning av resultat från båda tillvägagångssätten.

Data och tester

Den könssambigua entitetsdetektor som användes för projektet utvecklades genom finjustering av Facebook AI:s xlm-roberta-large-modell, med hjälp av transformatorer. För detta användes den kombinerade G-Tag-datamängden över alla fem språkpar.

I den första av de ovannämnda två tillvägagångssätten tränades M2M 1.2B-modellen på Fairseq, tillsammans med bi-textdata från G-Trans-datamängden, med könssamstämmighet tillhandahållen av Wiktionary.

För LLM-tillvägagångssättet använde författarna GPT-3.5-turbo. För samstämmighet av könssstrukturer användes xlm-roberta-large igen, den här gången med könssamstämmighet extraherad från G-Trans.

Mått för utvärdering av alternativ, struktur (med precision och recall), och samstämmighetsnoggrannhet.

Även om de två första av dessa är självförklarande, mäter samstämmighetsnoggrannhet procentandelen utdatakönssstrukturer som överensstämmer med den kända korrekta källidentiteten, och använder δ-BLEU-metoden, i enlighet med metoden för MT-GenEval.

Nedan följer resultaten för dataförstärkningspipelinen:

Resultat från dataförstärkningstesterna. Uppåtpilarna indikerar 'högre-är-bättre', nedåtpilar 'lägre-är-bättre'.

Resultat från dataförstärkningstesterna. Uppåtpilarna indikerar ‘högre-är-bättre’, nedåtpilar ‘lägre-är-bättre’.

Här kommenterar författarna*:

‘Både M2M och GPT presterar mestadels på samma sätt, med undantag för engelska-ryska, där GPT uppnår mycket lägre alternativåterkallande (58,7 jämfört med 89,3). Kvaliteten på genererade könssstrukturer är bättre för GPT på engelska-tyska och engelska-portugisiska och bättre för M2M på engelska-spanska och engelska-ryska, som kan ses från strukturmetrikerna.

‘Observera att vi inte har någon G-Trans-data för engelska-italienska, så resultaten från M2M-modellen och samstämmighetsnoggrannheten på engelska-italienska beror enbart på nollskottsgeneralisering av M2M och XLM-modeller.’

Forskarna jämförde också dataförstärkningsystemets prestanda, via M2M, mot GATE:s meningnivåkönsskrivare, på GATE:s egna villkor.

Apples/USC:s dataförstärkningspipeline jämförs med GATE:s meningnivåmetod.

Apples/USC:s dataförstärkningspipeline jämförs med GATE:s meningnivåmetod.

Här säger rapporten*:

‘Vi ser en betydande förbättring av återkallande till priset av en relativt liten försämring av precision (förutom engelska-italienska). Vårt system kan överträffa GATE på deras föreslagna F.5-mått på alla 3 språkpar.’

Slutligen tränade författarna olika ‘vanliga’ flerspråkiga modeller i vanlig bi-text. De bidragande datamängderna var WikiMatrix, WikiTitles, Multi-UN, NewsCommentary och Tilde.

Två ytterligare vanliga modeller tränades, en som inkorporerade G-Trans-datamängden med prefixmärket <gender>, som användes som den övervakade baslinjen; och en tredje, som inkorporerade könssstruktur och samstämmighet (på den mindre lokala modellen, eftersom användning av GPT:s API-baserade tjänster skulle ha varit mycket dyrt för detta ändamål).

Modellerna testades mot 2022 års FloRes-datamängd.

Slutliga vanliga maskinöversättningsmodeller testade (P = precision, R = återkallande).

Slutliga vanliga maskinöversättningsmodeller testade (P = precision, R = återkallande).

Rapporten sammanfattar dessa resultat*:

‘Den vanliga modellen kan inte generera alternativ och visar en enorm fördom mot att generera maskulina former (δ-BLEU varierar från 5,3 till 12,5 poäng).

‘Denna fördom minskas avsevärt av den övervakade baslinjen. Modellen som tränats på förstärkt data minskar ytterligare fördomen och uppnår den bästa prestandan i termer av alternativmått, samstämmighetsnoggrannhet och δ-BLEU.

‘Detta visar effektiviteten hos dataförstärkningspipelinen. Förstärkt data möjliggör också att träna ett konkurrenskraftigt system för engelska-italienska, som saknar övervakad data.’

Författarna avslutar med att notera att framgången med modellen måste ses i ett bredare sammanhang av NLP:s kamp för att rationalisera könstilldelning i en översättningsmetod; och de noterar att detta förblir ett öppet problem.

Forskarna anser att resultaten som uppnåtts inte fullt ut uppfyller målet med att generera entitetsnivåkönssneutrala översättningar och/eller disambiguerande av kön, men de tror att arbetet är ett ‘kraftfullt instrument’ för framtida undersökningar inom ett av de mest utmanande områdena inom maskinöversättning.

 

* Min omvandling av författarnas inlinecitat till hyperlänkar

Publicerad första gången tisdag, 8 oktober 2024

Författare på maskinlärning, domänspecialist inom mänsklig bildsyntes. Fd chef för forskningsinnehåll på Metaphysic.ai, till dess upplösning i DNEG:s Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: [email protected]