Andersonin kulma

Applen ratkaisu sukupuolittain jaettuihin kielivaihtoehtoihin

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Apple on julkaissut yhteistyössä USC:n kanssa tutkimuksen, jossa tarkastellaan koneoppimismenetelmiä, joita käytetään iOS 18 -käyttöjärjestelmän käyttäjille tarjoamaan enemmän valinnanvaraa sukupuolen suhteen käännöksissä.

iOS 18:ssa käyttäjät voivat valita vaihtoehtoisia sukupuolisugestioita käännetylle sanalle alkuperäisessä Translate-sovelluksessa. Lähde: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

iOS 18:ssa käyttäjät voivat valita vaihtoehtoisia sukupuolisugestioita käännetylle sanalle alkuperäisessä Translate-sovelluksessa. Lähde: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Tutkimuksessa käsiteltävät ongelmat liittyvät osittain nykyisiin sukupuolen määrittelyyn liittyviin keskusteluihin, mutta ne keskittyvät vanhempiin ongelmiin: 84:ään maailman 229:stä tunnetusta kielestä, jotka käyttävät sukupuoleen perustuvaa järjestelmää.

Punaiset pisteet osoittavat kieliä, jotka käyttävät sukupuoleen perustuvaa järjestelmää. Lähde: https://wals.info/feature/31A#map

Punaiset pisteet osoittavat kieliä, jotka käyttävät sukupuoleen perustuvaa järjestelmää. Lähde: https://wals.info/feature/31A#map

Yllättäen englannin kieli kuuluu sukupuoleen perustuvaan kategoriaan, koska se määrittää maskuliiniset tai feminiiniset yksikössubjektit.

Toisin kuin kaikki romaaniset kielet (mukaan lukien yli 500 miljoonaa espanjan puhujaa) ja monet muut suositut kielet, kuten venäjä, vaativat sukupuolen sopimista tavoilla, jotka pakottavat käännösjärjestelmiä ottamaan huomioon sukupuolen määrittelyn kielessä.

Tutkimus havainnollistaa tämän tarkastelemalla kaikkia mahdollisia espanjan käännöksiä lauseesta Sihteeri oli vihainen pomolle:

Tutkimuksesta, esimerkki mahdollisista sukupuolen määrittelyistä lauseessa 'Sihteeri oli vihainen pomolle', käännettynä englannista espanjaan. Lähde: https://arxiv.org/pdf/2407.20438

Tutkimuksesta, esimerkki mahdollisista sukupuolen määrittelyistä lauseessa ‘Sihteeri oli vihainen pomolle’, käännettynä englannista espanjaan. Lähde: https://arxiv.org/pdf/2407.20438

Tarkoituksettomat käännökset eivät ole riittäviä pidemmille teksteille, jotka saattavat määritellä sukupuolen alussa (‘Hän’, ‘Hänen’ jne.) ja sen jälkeen ei viitata sukupuoleen uudelleen. Kuitenkin käännös on muistettava määritetyn sukupuolen osallistujan koko tekstin ajan.

Tämä voi olla haasteellista token-pohjaisille lähestymistavoille, jotka käsittelevät käännöksiä erillisinä paloina, ja riski menettää määritetyn sukupuolen kontekstin koko sisällön ajan.

Pahimmassa tapauksessa järjestelmät, jotka tarjoavat vaihtoehtoisia käännöksiä sukupuolen määrittelyyn, eivät voi tehdä tätä satunnaisesti, eli vain korvaamalla sukupuolitermin, vaan on varmistettava, että kaikki kielen osat sopivat muutettuun sukupuolitermiin.

Tässä esimerkissä Apple/USC-tutkimuksesta näemme, että vaikka sihteeri on määritetty maskuliiniseksi, yksikön menneisyys oli on jäänyt feminiiniseksi (estaba):

Brute-force-sukupuolenvaihdot voivat jättää tarpeettoman sukupuolensopimuksen. Tässä esimerkissä sana 'enojada' pitäisi olla 'enojado', jotta se sopisi maskuliinisen 'El secretario' -sanan kanssa.

Brute-force-sukupuolenvaihdot voivat jättää tarpeettoman sukupuolensopimuksen. Tässä esimerkissä sana ‘enojada’ pitäisi olla ‘enojado’, jotta se sopisi maskuliinisen ‘El secretario’ -sanan kanssa.

Käännösjärjestelmän on myös selvitettävä tiettyjen kielten ominaisuuksista sukupuolen suhteen. Tutkimus korostaa, että pronominien minä on sukupuolittainen hindissä, mikä antaa epätavallisen vihjeen sukupuolesta.

Sukupuoliongelmat

Uudessa tutkimuksessa, jonka otsikko on Sukupuolivaihtoehtojen generointi konekäännöksessä, Apple- ja USC-tutkijat ehdottavat puolivaltuuksista menetelmää muuttaa sukupuolittain epäselviä entiteettejä entiteettitasoisten vaihtoehtojen joukoksi.

Järjestelmä, jota käytettiin Apple Translate -sovelluksen käännöksiin iOS 18:ssa, rakentaa kielirakenteen sekä suurten kielimallien avulla että hienosäätöä esikoulutetuilla avoimilla konekäännösmallilla.

Tulokset käännöksistä näistä järjestelmistä koulutettiin arkkitehtuuriin, joka sisälsi sukupuolirakenteita – lauseita, jotka sisälsivät erilaisia sukupuolittaisia substantiiveja, jotka edustivat samaa entiteettiä.

Tutkimus toteaa:

‘Sukupuoliset harhat, jotka ovat läsnä koulutusaineistossa, voivat aiheuttaa luonnollisen kielen prosessointijärjestelmiin, joista seuraa harhaisuuksien leviäminen ja mahdollinen vahvistuminen. Tällaiset harhat ovat usein myös virheiden alkuperä.

‘Konekäännösjärjestelmä saattaa esimerkiksi kääntää lääkärin espanjan kielen maskuliiniseksi médico -sanaa käyttäen, sen sijaan että se käyttäisi feminiinistä médica -sanaa, kun syötteenä on “Lääkäri pyysi hoitajaa auttamaan häntä toimenpiteessä”.’

‘Välttääkseen väärän sukupuolen määrittelyn, konekäännösjärjestelmien on selvitettävä sukupuoli kontekstin kautta. Kun oikea sukupuoli ei voida määritellä kontekstin kautta, tarjoamalla useita käännösvaihtoehtoja, jotka kattavat kaikki voimassa olevat sukupuolivalinnat, on järkevä lähestymistapa.’

Lähestymistapa, johon tutkijat päätyvät, muuttaa käännöksen yhdestä tokenista käyttäjän hallitsemiin vaihtoehtoihin.

(Vaikka tutkimus ei mainitse tätä, tämä avaa mahdollisuuden Apple Translaten kaltaisille portaaleille, joilla on käännöspalveluita, käyttäjien valintoja voidaan palauttaa myöhempään mallin versioon)

Malli, jonka Apple ja USC kehittivät, arvioitiin GATE – ja MT-GenEval -testijoukoissa. GATE sisältää lähdevirheitä, joissa on enintään 3 sukupuolittain epäselvää entiteettiä, kun taas MT-GenEval sisältää aineistoa, josta sukupuolta ei voida päätellä, mikä auttaa ymmärtämään, milloin vaihtoehtoisia sukupuolivaihtoehtoja ei pitäisi tarjota käyttäjille.

Molemmat testijoukot piti uudelleen annotoida tutkimuksen tavoitteiden mukaisesti.

Järjestelmän kouluttamiseen tutkijat luottivat uuteen automaattiseen datan lisäysalgoritmiin, toisin kuin edellä mainitut testijoukot, jotka annotoitiin ihmisten toimesta.

Apple-kokoelmaan osallistuvat aineistot olivat Europarl; WikiTitles; ja WikiMatrix. Aineistot jaettiin G-Tagiin (12 000 lauseella), joka käsittää lauseita, joissa on pääsana kaikille entiteeteille, sekä sukupuolittain epäselvän annotaation; ja G-Transiin (50 000 lauseella), joka sisältää sukupuolittain epäselviä entiteettejä ja sukupuolensopimukset.

Tutkijat toteavat:

‘Meidän tietämyksemme mukaan tämä on ensimmäinen suuri aineisto, joka sisältää sukupuolittaisia epäselvyyksiä ja niiden vaikutusta sukupuolittaisiin muotoihin käännöksissä.’

Aineistot ja monipuoliset tiedot hankkeelle on julkaistu GitHubissa. Aineistot sisältävät viisi kieliparia, joissa englanti verrataan venäjään, saksan, ranskaan, portugaliin ja espanjaan.

Tutkijat hyödynsivät aiempaa lähestymistapaa vuodelta 2019 antaakseen mallille kyvyn tuottaa sukupuolensopimukset, kouluttaen ristientropia -häviksi ja lisäksi sukupuolensopimushäviksi.

Datan lisäysmenetelmässä tutkijat hylkäsivät perinteiset sääntöpohjaiset menetelmät ja suosivat datakeskeistä lähestymistapaa, hienosäätämällä BERT -esikoulutetun kielen mallin G-Tag -aineistolla.

Kaksoistarkastelu

Epäselvien sukupuolien tapauksissa Apple ja USC tutkivat kahta menetelmää: esikoulutettujen kielen mallien hienosäätöä ja suurten kielen mallien (LLM) käyttöä.

Ensimmäisessä menetelmässä tutkimus toteaa:

‘Hienosäätämme esikoulutetun MT-mallin M G-Trans -aineistosta, joka sisältää lähdevirheitä, joissa on epäselviä entiteettejä, maskuliinisia ja feminiinisiä merkintöjä <M>/<F> -merkintöinä, ja kohdekieli on oikein sukupuolittainen käännös, joka vastaa sukupuolimerkintöjä.’

Bi-tekstin ekstraktio G-Trans -aineistosta.

Bi-tekstin ekstraktio G-Trans -aineistosta.

Kuvassa näemme hienosäätötekstin alhaalla keskellä ja toivotun tulosteen oikealla puolella, ja taustalla oleva perustelu on esitetty yllä.

Tässä lähestymistavassa tutkijat käyttivät verkkoreskurssin menetelmää aiemmasta työstä vuodelta 2020. Varmistaakseen, että vain kohdealue (sukupuoli) käsiteltiin, rajoitettu kaarihaun menetelmä käytettiin suodattimena.

LLM-lähestymistavassa tutkijat kehittivät strategian, jossa LLM toimii editoijana uudelleenkirjoittamalla annetut käännökset antaakseen sukupuolen määrittelyn.

LLM ohjataan kontekstiesimerkin avulla määrittämään sukupuoli.

LLM ohjataan kontekstiesimerkin avulla määrittämään sukupuoli.

Molempien lähestymistapojen tulokset yhdistettiin, ja malli hienosäädettiin luokittelemaan lähde tokenit sopiviksi (merkitty ‘1’: lla alla olevassa skeemassa) tai epäsopiviksi (merkitty ‘2’: lla alla).

Molempien lähestymistapojen tulosten yhdistämisen skeema.

Molempien lähestymistapojen tulosten yhdistämisen skeema.

Data ja testit

Epäselvän entiteetin havaitsemiseen käytetty järjestelmä kehitettiin hienosäätämällä Facebook AI:n xlm-roberta-large -mallia transformaattoreiden avulla. Tähän käytettiin yhdistettyä G-Tagia kaikilla viidellä kieliparilla.

Ensimmäisessä lähestymistavassa M2M 1.2B -malli koulutettiin Fairseq: lla yhdessä G-Trans -aineiston bi-tekstin kanssa, jossa sukupuolensopimukset olivat peräisin Wiktionarysta.

LLM-lähestymistavassa tutkijat käyttivät GPT-3.5-turboa. Sukupuolirakenteiden sopimukseen xlm-roberta-large käytettiin uudelleen G-Transista saatujen sukupuolensopimusten kanssa.

Arviointimittareita vaihtoehtojen, rakenteen (jossa tarkkuus ja haun palautus) ja sopimussäännön tarkkuus arvioimiseksi.

Ensimmäiset kaksi ovat itsestään selviä, ja sopimussäännön tarkkuus mittaa prosenttiosuuden tulosteen sukupuolirakenteista, jotka noudattavat tiedettyä oikeaa lähdetunnusta, ja käyttää δ-BLEU -menetelmää MT-GenEvalin metodologiaa noudattaen.

Alempana ovat datan lisäysputken tulokset:

Datan lisäysputken tulokset. Ylöspilkkusivut osoittavat 'korkeampi on parempi', alaspilkkusivut 'alempi on parempi'.

Datan lisäysputken tulokset. Ylöspilkkusivut osoittavat ‘korkeampi on parempi’, alaspilkkusivut ‘alempi on parempi’.

Tutkijat toteavat:

‘M2M ja GPT suorittavat pääosin samalla tasolla, lukuun ottamatta englanti-venäjää, jossa GPT saavuttaa paljon alhaisemman vaihtoehtojen palautuksen (58,7 verrattuna 89,3: een). Sukupuolirakenteiden laadusta GPT on parempi englanti-saksa- ja englanti-portugali -parilla ja M2M on parempi englanti-espanja- ja englanti-venäjä -parilla, kuten voidaan nähdä rakenteen mittareista.’

‘Huomaa, että meillä ei ole G-Trans -aineistoa englanti-italia -parille, joten M2M-mallin ja englanti-italian sopimussäännön tulokset ovat pelkästään M2M- ja XLM-mallien nollakontekstin generalisointia.’

Tutkijat myös vertasivat datan lisäysjärjestelmän suorituskykyä M2M: n kautta GATE:n lausekohtaisen sukupuolien uudelleenkirjoittamisen menetelmää vastaan GATE:n omilla ehdoilla.

Apple/USC:n datan lisäysputki verrattuna GATE:n lausekohtaiseen menetelmään.

Apple/USC:n datan lisäysputki verrattuna GATE:n lausekohtaiseen menetelmään.

Tutkimus toteaa:

‘Havaitsemme merkittäviä parannuksia palautuskyvyssä kohtuullisen pienen tarkkuuden heikentymisen kustannuksella (lukuun ottamatta englanti-italiaa). Järjestelmämme pystyy ylittämään GATE:n heidän ehdottamallaan F.5 -mittarilla kaikilla kolmella kieliparilla.’

Lopulta tutkijat kouluttivat monia ‘perus’ -monikielisiä malleja ‘perus’ -bi-tekstiin. Osallistuvat aineistot olivat WikiMatrix, WikiTitles, Multi-UN, NewsCommentary ja Tilde.

Kaksi perusmallia koulutettiin, yksi, joka sisälsi G-Trans -aineiston etuliitteellä <gender>, jota käytettiin valvotun vertailukohtana; ja kolmas, joka sisälsi sukupuolirakenteen ja -sopimukset (pihemallissa, koska GPT:n API-palvelujen käyttäminen olisi ollut hyvin kallista tätä tarkoitusta varten).

Mallit testattiin 2022 FloRes -aineistoa vastaan.

Lopputuotteena peruskielenkäännösmallit testattiin (P = tarkkuus, R = palautuskyky).

Lopputuotteena peruskielenkäännösmallit testattiin (P = tarkkuus, R = palautuskyky).

Tutkimus yhteenvetää nämä tulokset:

‘Perusmalli ei voi generoida vaihtoehtoja ja osoittaa suurta harhaa maskuliinisten muotojen generoimiseen (δ-BLEU vaihtelee 5,3: sta 12,5: een).

‘Tämä harha vähenee valvotulla vertailukohdalla. Malli, joka on koulutettu datan lisäysaineistolla, vähentää harhaa edelleen ja saavuttaa parhaimman suorituskyvyn vaihtoehtojen, sopimussäännön tarkkuuden ja δ-BLEU:n suhteen.’

‘Tämä osoittaa datan lisäysputken tehokkuuden. Datan lisäys myös mahdollistaa kilpailukykyisen järjestelmän englanti-italian kielelle, jolta puuttuu valvottua aineistoa.’

Tutkijat päättävät toteamalla, että mallin onnistumisen on tarkasteltava laajemmassa kontekstissa, jossa NLP kamppailee sukupuolen määrittelyn kanssa käännösmenetelmissä, ja he huomauttavat, että tämä on edelleen avoin ongelma.

Vaikka tutkijat katsovat, että tulokset eivät täysin saavuta tavoitetta luoda entiteettitasoisia sukupuolittain neutraaleja käännöksiä ja/tai sukupuolittaisia epäselvyyksiä, he uskovat, että työ on ‘voimakas väline’ tuleville tutkimuksille yhdessä konekäännöksen haasteellisimmista aloista.

 

* Minun muunnos tutkijoiden sisäisistä viittauksista hyperlinkkeihin

Julkaistu ensimmäisen kerran tiistaina 8. lokakuuta 2024

Kirjailija tekoälystä, alan erikoismies ihmisen kuvien synteesistä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: [email protected]