Andersons hoek

Apples oplossing voor het vertalen van geslachtsgebonden talen

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Apple heeft onlangs een paper gepubliceerd, in samenwerking met USC, waarin de machine learning-methoden worden onderzocht die gebruikers van het iOS18-besturingssysteem meer keuzevrijheid geven over geslacht bij vertaling.

In iOS18 kunnen gebruikers alternatieve geslachtsuggesties selecteren voor een vertaald woord in de native Translate-app. Bron: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

In iOS18 kunnen gebruikers alternatieve geslachtsuggesties selecteren voor een vertaald woord in de native Translate-app. Bron: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Hoewel de problemen die in het werk worden aangepakt (dat Apple heeft aangekondigd hier) tot op zekere hoogte betrokken zijn bij actuele debatten over definities van geslacht, gaat het vooral over een veel oudere probleem: het feit dat 84 van de 229 bekende talen in de wereld een geslachtsgebonden systeem gebruiken.

De rode stippen geven talen aan die een geslachtsgebonden systeem gebruiken. Bron: https://wals.info/feature/31A#map

De rode stippen geven talen aan die een geslachtsgebonden systeem gebruiken. Bron: https://wals.info/feature/31A#map

Verwacht wordt dat de Engelse taal in de geslachtsgebonden categorie valt, omdat het mannelijke of vrouwelijke enkelvoudige voornaamwoorden toewijst.

Daarentegen vereisen alle Romance-talen (inclusief meer dan half miljard Spaanse sprekers) – en meerdere andere populaire talen, zoals Russisch – geslachts-overeenstemming op manieren die vertaalsystemen dwingen om geslachts-toewijzing in taal aan te pakken.

De nieuwe paper illustreert dit door alle mogelijke Spaanse vertalingen van de zin De secretaresse was boos op de baas te observeren:

Uit de nieuwe paper, een voorbeeld van de potentiële geslachts-toewijzingen in de zin 'De secretaresse was boos op de baas', vertaald van Engels naar Spaans. Bron: https://arxiv.org/pdf/2407.20438

Uit de nieuwe paper, een voorbeeld van de potentiële geslachts-toewijzingen in de zin ‘De secretaresse was boos op de baas’, vertaald van Engels naar Spaans. Bron: https://arxiv.org/pdf/2407.20438

Naïeve vertaling is verre van voldoende voor langere teksten, die aan het begin ( ‘Hij’, ‘Zij’, enz.) geslacht kunnen vaststellen en vervolgens niet meer naar geslacht verwijzen. Niettemin moet de vertaling het toegewezen geslacht van de deelnemer gedurende de hele tekst onthouden.

Dit kan een uitdaging zijn voor token-gebaseerde benaderingen die vertalingen in discrete brokken aanpakken en het risico lopen om de toegewezen geslachts-context gedurende de duur van de inhoud te verliezen.

Erger nog, systemen die alternatieve vertalingen voor bevooroordeelde geslachts-toewijzingen bieden, kunnen dit niet onbeperkt doen, d.w.z. door eenvoudigweg het geslachts-nomen te vervangen, maar moeten ervoor zorgen dat alle andere delen van de taal overeenkomen met het gewijzigde geslachts-nomen.

In dit voorbeeld uit de Apple/USC-paper zien we dat, hoewel secretaresse een mannelijk geslacht is toegewezen, het enkelvoudige verleden was als vrouwelijk (estaba) is gelaten:

Brute-force geslachts-vervangingen kunnen noodzakelijke geslachts-overeenstemming negeren. In dit voorbeeld zou het woord 'enojada' 'enojado' moeten zijn, om overeen te komen met het mannelijke 'El secretario'.

Brute-force geslachts-vervangingen kunnen noodzakelijke geslachts-overeenstemming negeren. In dit voorbeeld zou het woord ‘enojada’ ‘enojado’ moeten zijn, om overeen te komen met het mannelijke ‘El secretario’.

Een vertaalsysteem moet ook omgaan met de eigenaardigheden van bepaalde talen met betrekking tot geslacht. Zo merkt de paper op dat het voornaamwoord Ik in het Hindi een geslacht heeft, wat een ongebruikelijke aanwijzing voor geslacht biedt.

Geslachtskwesties

In de nieuwe paper, getiteld Genereren van geslachtsalternatieven in machinevertaling, stellen de Apple- en USC-onderzoekers een semi-begeleide methode voor om geslachts-ambigue entiteiten om te zetten in een reeks entiteit-niveau-alternatieven.

Het systeem, dat werd gebruikt om de vertaling van de Apple Translate-app in iOS18 te informeren, bouwt een taalschema op door het gebruik van grote taalmodellen (LLM’s) en door fine-tuning van pre-getrainde open source machinevertalingmodellen.

De resultaten van de vertalingen uit deze systemen werden vervolgens getraind in een architectuur die geslachtsstructuren bevat – groepen van zinnen die diverse vormen van geslachts-nomen vertegenwoordigen die dezelfde entiteit vertegenwoordigen.

De paper stelt*:

‘Geslachtsvooroordeel in trainingsdata is bekend om door te dringen in natuurlijke taalverwerking (NLP) systemen, waardoor ze worden verspreid en mogelijk versterkt worden. Dergelijke vooroordeel zijn vaak ook de oorzaak van fouten.

‘Een machinevertaling (MT) systeem kan bijvoorbeeld arts vertalen naar het Spaanse woord médico (mannelijk) in plaats van médica (vrouwelijk), gegeven de invoer “De arts vroeg de verpleegster om hulp bij de procedure”.

‘Om verkeerde geslachts-toewijzing te voorkomen, moeten MT-systemen geslacht ondubbelzinnig maken via context. Wanneer het juiste geslacht niet kan worden bepaald via context, is het bieden van meerdere vertaalopties die alle geldige geslachtskeuzes dekken een redelijke aanpak.’

De benadering die de onderzoekers bereiken, zet effectief een vertaling van een enkel token om in een door de gebruiker beheerde reeks.

(Hoewel de paper dit niet vermeldt, biedt dit de mogelijkheid, ofwel in Apple Translate of in soortgelijke portals die vertaaldiensten aanbieden, voor gebruikerskeuzes om te worden teruggestuurd naar latere iteraties van het model)

De door Apple en USC ontwikkelde model werd geëvalueerd op de GATE en MT-GenEval testsets. GATE bevat bron-zinnen met maximaal 3 geslachts-ambigue entiteiten, terwijl MT-GenEval materiaal bevat waar geslacht niet kan worden afgeleid, wat, zoals de auteurs stellen, helpt bij het begrijpen wanneer alternatieve geslachts-opties niet aan de gebruiker moeten worden aangeboden.

Beide testsets moesten opnieuw worden geannoteerd om te voldoen aan de doelstellingen van het project.

Om het systeem te trainen, vertrouwden de onderzoekers op een novatieve automatische data-augmentatie algoritme, in tegenstelling tot de eerdergenoemde testsets, die door mensen werden geannoteerd.

De bijdragende datasets voor de Apple-curaties waren Europarl; WikiTitles; en WikiMatrix. De corpora werden opgedeeld in G-Tag (met 12.000 zinnen), die zinnen met hoofdwoorden voor alle entiteiten omvat, samen met een geslachts-ambigue annotatie; en G-Trans (met 50.000 zinnen), die geslachts-ambigue entiteiten en geslachts-overeenstemming bevat.

De auteurs beweren*:

‘Voor zover wij weten, is dit de eerste grote corpus die geslachts-ambiguïteiten bevat en hoe deze invloed hebben op geslachts-vormen in de vertaling.’

Datasets en diverse data voor het project zijn beschikbaar gesteld op GitHub. De data omvat vijf taalparen, waarbij Engels wordt gepit tegen Russisch, Duits, Frans, Portugees en Spaans.

De auteurs maakten gebruik van een eerdere benadering uit 2019 om het model te voorzien van de mogelijkheid om geslachts-overeenstemming uit te voeren, door training met cross-entropie verlies en een extra overeenstemmingsverlies.

Voor de data-augmentatie-routine verkozen de auteurs traditionele regel-gebaseerde methoden boven een data-gecentreerde benadering, door fine-tuning van een BERT pre-getraind taalmodel op de G-Tag dataset.

Tweede blik

Voor gevallen waarin onduidelijke geslachts-entiteiten worden gedetecteerd, onderzochten Apple en USC twee methoden – de fine-tuning van pre-getrainde taalmodellen en het gebruik van LLM’s.

Met betrekking tot de eerste methode, stelt de paper:

‘We fine-tunen een pre-getraind MT-model M op een bi-text die is geëxtraheerd uit de G-Trans dataset. De bron-zinnen van deze bi-text bevatten onduidelijke entiteiten die zijn getagd als mannelijk of vrouwelijk met behulp van <M>/<F> tags, en de doelvertaling heeft correcte geslachts-inflecties gegeven de geslachts-tags.’

Een illustratie van het schema voor het extraheren van bi-text uit de G-Trans dataset.

Een illustratie van het schema voor het extraheren van bi-text uit de G-Trans dataset.

In de afbeelding hierboven zien we de fine-tuned tekst in de onderste middelste kolom, en de gewenste uitvoer in de rechterkolom, met de onderliggende rationale geïllustreerd hierboven.

Voor deze benadering maakten de auteurs gebruik van een lattice rescoring methode uit een eerder werk uit 2020. Om ervoor te zorgen dat alleen het doeldomein (geslacht) werd aangepakt, werd een constrained beam search gebruikt als filter.

Voor de LLM-benadering ontwikkelden de auteurs een strategie die een LLM gebruikt als editor, door de geleverde vertalingen opnieuw te schrijven om geslachts-toewijzingen te bieden.

De LLM wordt geprompt met een voorbeeld in de context om geslacht toe te wijzen.

De LLM wordt geprompt met een voorbeeld in de context om geslacht toe te wijzen.

Met resultaten uit beide benaderingen samengevoegd, werd het model vervolgens fine-tuned om bron-tokens te classificeren als gealigneerd (aangegeven door ‘1’ in het schema hieronder) of niet-gealigneerd (aangegeven door ‘2’ hieronder).

Een schema voor de samenvoeging van resultaten uit beide benaderingen.

Een schema voor de samenvoeging van resultaten uit beide benaderingen.

Gegevens en tests

De onduidelijke entiteit detector die voor het project werd gebruikt, werd ontwikkeld door fine-tuning van Facebook AI’s xlm-roberta-large model, met behulp van transformers. Hiervoor werd de samengevoegde G-Tag gebruikt over alle vijf taalparen.

In de eerste van de twee eerdergenoemde benaderingen, werd het M2M 1.2B model getraind op Fairseq, samen met bi-text data uit de G-Trans dataset, met geslachts-inflecties die werden geleverd door Wiktionary.

Voor de LLM-benadering werd GPT-3.5-turbo gebruikt. Voor de alignering van geslachtsstructuren werd xlm-roberta-large opnieuw gebruikt, deze keer met geslachts-aligneringen die werden geëxtraheerd uit G-Trans.

Metrische gegevens voor de evaluatie van alternatieven, structuur (met precisie en recall), en alignering-nauwkeurigheid.

Hoewel de eerste twee van deze metrische gegevens voor zich spreken, meet alignering-nauwkeurigheid het percentage van uitvoer-geslachtsstructuren dat overeenkomt met de bekende correcte bron-identiteit, en gebruikt de δ-BLEU methode, in overeenstemming met de methodologie voor MT-GenEval.

Hieronder staan de resultaten voor de data-augmentatie-pipeline:

Resultaten van de data-augmentatie-tests. Omhoogwijzende pijlen geven 'hoger-de-beter' aan, omlaagwijzende pijlen 'lager-de-beter'.

Resultaten van de data-augmentatie-tests. Omhoogwijzende pijlen geven ‘hoger-de-beter’ aan, omlaagwijzende pijlen ‘lager-de-beter’.

Hier merken de auteurs op*:

‘Beide M2M en GPT presteren meestal op hetzelfde niveau, met uitzondering van Engels-Russisch, waar GPT een veel lagere alternatieve recall (58,7 versus 89,3) behaalt. De kwaliteit van gegenereerde geslachtsstructuren is beter voor GPT op Engels-Duits en Engels-Portugees en beter voor M2M op Engels-Spaans en Engels-Russisch, zoals te zien is in de structuurmetrische gegevens.

‘Let op dat we geen G-Trans gegevens hebben voor Engels-Italiaans, dus de resultaten van het M2M-model en de alignering-nauwkeurigheid op Engels-Italiaans zijn puur het resultaat van zero-shot generalisatie van M2M en XLM modellen.’

De onderzoekers vergeleken ook de prestaties van het data-augmentatie-systeem, via M2M, met die van GATE’s zin-niveau geslachts-her-schrijver, op GATE’s eigen voorwaarden.

De Apple/USC data-augmentatie-pipeline tegen de GATE zin-niveau methode.

De Apple/USC data-augmentatie-pipeline tegen de GATE zin-niveau methode.

Hier stelt de paper:

‘We zien significante verbeteringen in recall tegen een relatief kleine verslechtering in precisie (behalve Engels-Italiaans). Ons systeem kan GATE overtreffen op hun voorgestelde F.5 metrisch op alle drie taalparen.’

Ten slotte trainden de auteurs diverse ‘vanille’ multilinguale modellen in vanille bi-text. De bijdragende datasets waren WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, en Tilde.

Twee extra ‘vanille’ modellen werden getraind, één met de G-Trans dataset met de voorvoegsel-tag <geslacht>, die werd gebruikt als de begeleide baseline; en een derde, met geslachtsstructuur en -aligneringen (op het kleinere lokale model, aangezien het gebruik van GPT’s API-gebaseerde diensten voor dit doel zeer duur zou zijn).

De modellen werden getest tegen de 2022 FloRes dataset.

Eind-tot-eind 'vanille' machinevertalingmodellen getest (P = precisie, R = recall).

Eind-tot-eind ‘vanille’ machinevertalingmodellen getest (P = precisie, R = recall).

De paper vat deze resultaten samen:

‘Het ‘vanille’ model kan geen alternatieven genereren en vertoont een enorme voorkeur voor het genereren van mannelijke vormen (δ-BLEU variërend van 5,3 tot 12,5 punten).

‘Deze voorkeur wordt sterk verminderd door de begeleide baseline. Het model dat is getraind op geaugmenteerde data vermindert de voorkeur verder en behaalt de beste prestatie in termen van alternatieve metrische gegevens, alignering-nauwkeurigheid en δ-BLEU.

‘Dit toont de effectiviteit van de data-augmentatie-pipeline. Geaugmenteerde data stelt ons ook in staat om een concurrerend systeem te trainen voor Engels-Italiaans, dat ontbreekt aan begeleide data.’

De auteurs concluderen door op te merken dat het succes van het model moet worden beschouwd in de bredere context van de strijd van NLP om geslachts-toewijzing in een vertaalmethodiek te rationaliseren; en zij merken op dat dit nog steeds een open probleem is.

Hoewel de onderzoekers vinden dat de behaalde resultaten het doel van de generatie van entiteit-niveau geslachts-neutrale vertalingen en/of ondubbelzinnigheden met betrekking tot geslacht niet volledig bereiken, geloven zij dat het werk een ‘krachtig instrument’ is voor toekomstige onderzoeken naar een van de meest uitdagende gebieden van machinevertaling.

 

* Mijn conversie van de inline citaten van de auteurs naar hyperlinks

Eerst gepubliceerd op dinsdag 8 oktober 2024

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: [email protected]