Modely a platformy AI

Appleova řešení pro překlad rodově neurčitého jazyka

mm
Přidejte Unite.AI mezi své preferované zdroje na Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Apple (AAPL ) právě zveřejnil článek, ve spolupráci s USC, který zkoumá metody strojového učení používané k poskytování uživatelům operačního systému iOS18 více možností pro výběr rodu při překladu.

V iOS18 mohou uživatelé vybrat alternativní rodové návrhy pro přeložený výraz v nativním aplikaci Překladač. Zdroj: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

V iOS18 mohou uživatelé vybrat alternativní rodové návrhy pro přeložený výraz v nativním aplikaci Překladač. Zdroj: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Problémy, kterým se článek věnuje, se týkají současné debaty o definicích rodu, ale soustředí se na starší problém: fakt, že 84 z 229 známých jazyků na světě používá rodový systém založený na pohlaví.

Červené tečky označují jazyky, které používají rodový systém založený na pohlaví. Zdroj: https://wals.info/feature/31A#map

Červené tečky označují jazyky, které používají rodový systém založený na pohlaví. Zdroj: https://wals.info/feature/31A#map

Anglický jazyk patří do kategorie založené na pohlaví, protože přiřazuje mužské nebo ženské jednotné zájmeno.

Naproti tomu všechny románské jazyky (včetně více než půl miliardy mluvčích španělštiny) – a další populární jazyky, jako je ruština – vyžadují rodovou shodu, která nutí systémy překladu řešit přiřazování pohlaví.

Článek ilustruje tento problém pozorováním všech možných španělských překladů věty Secretary byl naštvaný na šéfa:

Z článku, příklad možných rodových přiřazení ve větě 'Secretary byl naštvaný na šéfa', překladu z angličtiny do španělštiny. Zdroj: https://arxiv.org/pdf/2407.20438

Z článku, příklad možných rodových přiřazení ve větě ‘Secretary byl naštvaný na šéfa’, překladu z angličtiny do španělštiny. Zdroj: https://arxiv.org/pdf/2407.20438

Naivní překlad je daleko od dostatečného pro delší texty, které mohou určit rod na začátku (‘On’, ‘Ona’ atd.) a poté se již nevrátí k rodu. Přestože překlad musí pamatovat přiřazený rod účastníka po celou dobu textu.

To může být náročné pro tokenové přístupy, které řeší překlady v samostatných částech, a riskují ztrátu kontextu rodu po celou dobu textu.

Hůře, systémy, které poskytují alternativní překlady pro přiřazení rodu, nemohou to dělat bez rozdílu, tj. pouze nahrazují rodové podstatné jméno, ale musí zajistit, aby všechny ostatní části jazyka souhlasily s novým rodovým podstatným jménem.

V tomto příkladu z článku Apple/USC vidíme, že i když Secretary byl přiřazen mužský rod, singulární minulý čas byl byl ponechán jako ženský (byla):

Brutální nahrazování rodu může zanedbat nutnou rodovou shodu. V tomto příkladu by mělo být 'enojada' nahrazeno 'enojado', aby souhlasilo s mužským 'El secretario'.

Brutální nahrazování rodu může zanedbat nutnou rodovou shodu. V tomto příkladu by mělo být ‘enojada’ nahrazeno ‘enojado’, aby souhlasilo s mužským ‘El secretario’.

Systém překladu musí také řešit zvláštnosti jednotlivých jazyků v souvislosti s rodem. Jako článek uvádí, že zájmeno Já je v hindštině rodově určené, což poskytuje neobvyklou nápovědu pro rod.

Problémy s rodem

V novém článku, nazvaném Generování alternativ rodu v strojovém překladu, výzkumníci z Apple a USC navrhují semi-dohledovaný přístup k převodu entit s neurčitým rodem na řadu entitních alternativ.

Systém, který byl použit k informování překladu v aplikaci Apple Překladač v iOS18, vytváří jazykovou schéma pomocí velkých jazykových modelů (LLM) a jemného ladění předem trénovaných otevřených modelů strojového překladu.

Výsledky z překladů z těchto systémů byly poté trénovány do architektury obsahující rodové struktury – skupiny frází, které obsahují různé formy rodově neurčených podstatných jmen reprezentujících stejnou entitu.

Článek uvádí*:

‘Rodové předpojatosti v trénovacích datech jsou známy tím, že se dostávají do systémů zpracování přirozeného jazyka (NLP), což vede k šíření a potenciálnímu zesílení těchto předpojatostí. Tyto předpojatosti jsou často také kořenovou příčinou chyb.

‘Systém strojového překladu (MT) může například přeložit lékařku do španělského termínu médico (mužský) místo médica (ženský), pokud je vstupem “Lékařka požádala zdravotní sestru, aby jí pomohla při zákroku”.

‘Aby se zabránilo nesprávnému přiřazení rodu, systémy MT musí rozlišovat rod pomocí kontextu. Pokud nelze určit správný rod pomocí kontextu, poskytování více překladových alternativ, které pokrývají všechny platné rodové volby, je rozumným přístupem.’

Přístup, ke kterému autoři dospěli, efektivně mění překlad z jednoho tokenu na uživatelsky ovládanou řadu.

(Ačkoli článek o tom nemluví, otevírá se možnost, že buď v Apple Překladači, nebo v podobných portálech, které nabízejí překladové služby, mohou být uživatelské volby zpětně zahrnuty do pozdějších iterací modelu)

Model, který vyvinuli Apple a USC, byl vyhodnocen na GATE a MT-GenEval testovacích sadách. GATE obsahuje zdrojové věty s až 3 entitami s neurčitým rodem, zatímco MT-GenEval obsahuje materiál, u kterého nelze určit rod, což, podle autorů, pomáhá pochopit, kdy by neměly být uživateli nabízeny alternativní rodové možnosti.

V obou případech musely být testovací sady re-annotovány, aby odpovídaly cílům projektu.

K trénování systému autoři využili novou automatickou datovou augmentaci, na rozdíl od výše zmíněných testovacích sad, které byly anotovány lidmi.

Kurzorové datové sady pro Apple byly Europarl; WikiTitles; a WikiMatrix. Korpus byl rozdělen do G-Tag (s 12 000 větami), který zahrnuje věty s hlavními slovy pro všechny entity, spolu s anotací neurčitého rodu; a G-Trans (s 50 000 větami), který obsahuje entity s neurčitým rodem a rodovými shodami.

Autoři prohlašují*:

‘Naše znalosti naznačují, že toto je první velká korpus, který obsahuje rodové neurčitosti a jejich vliv na rodové formy v překladu.’

Datové sady a rozmanité údaje pro projekt jsou dostupné na GitHubu. Data zahrnují pět jazykových párů, ve kterých je angličtina porovnávána s ruštinou, němčinou, francouzštinou, portugalštinou a španělštinou.

Autoři využili přístup z roku 2019 k tomu, aby modelu poskytli schopnost generovat rodové shody, a to pomocí křížové entropie ztrát a další shodné ztráty.

Pro rutinu datové augmentace autoři odmítli tradiční pravidlové metody ve prospěch datově orientovaného přístupu, jemného ladění předem trénovaného jazykového modelu BERT na datové sadě G-Tag.

Druhý pohled

Pro případy, kdy jsou detekovány entity s neurčitým rodem, Apple a USC prozkoumali dvě metody – jemné ladění předem trénovaných jazykových modelů a použití LLM.

V souvislosti s první metodou článek uvádí*:

‘Jemně ladíme předem trénovaný model MT M na bi-textu extrahovaném z datové sady G-Trans. Zdrojové věty tohoto bi-textu obsahují entity s neurčitým rodem označené jako mužský nebo ženský pomocí <M>/<F> značek, a cílový překlad má správné rodové ohýbání vzhledem k rodovým značkám.’

Ilustrace schématu pro extrakci bi-textu z datové sady G-Trans.

Ilustrace schématu pro extrakci bi-textu z datové sady G-Trans.

V obrázku výše vidíme jemně laděný text ve spodní střední sloupci a požadovaný výstup ve sloupci vpravo, s podkladovým rámcem ilustrovaným výše.

Pro tento přístup autoři využili metodu lattice rescoring z dřívější práce z roku 2020. K zajištění toho, aby byl řešen pouze cíl (rod), byl použit omezený beam search jako filtr.

Pro přístup LLM autoři navrhli strategii, která využívá LLM jako editora, přepisujícího dodané překlady pro přiřazení rodu.

LLM je vyvolán pomocí kontextového příkladu pro přiřazení rodu.

LLM je vyvolán pomocí kontextového příkladu pro přiřazení rodu.

S výsledky z obou přístupů spojenými byl model poté jemně laděn pro klasifikaci zdrojových tokenů jako shodných (označených ‘1’ ve schématu níže) nebo neshodných (označených ‘2’ níže).

Schéma pro spojení výsledků z obou přístupů.

Schéma pro spojení výsledků z obou přístupů.

Data a testy

Detektor neurčité entity použitý pro projekt byl vyvinut jemným laděním modelu xlm-roberta-large od Facebook AI, pomocí transformerů. K tomu byl použit kombinovaný G-Tag napříč všemi pěti jazykovými páry.

V prvním z výše zmíněných přístupů byl model M2M 1.2B trénován na Fairseq, společně s bi-textovými daty z datové sady G-Trans, s rodovými ohýbáními poskytnutými z Wikcionáře.

Pro přístup LLM autoři využili GPT-3.5-turbo. Pro shodu rodových struktur byl opět použit xlm-roberta-large, tentokrát s rodovými shodami extrahovanými z G-Trans.

Metriky pro hodnocení alternativ, struktury (s precizí a recall) a shodné přesnosti.

Ačkoli první dvě z nich jsou samozřejmé, shodná přesnost měří procento výstupních rodových struktur, které souhlasí se známou správnou zdrojovou identitou, a používá metodu δ-BLEU, v souladu s metodologií pro MT-GenEval.

Níže jsou výsledky pro pipeline datové augmentace:

Výsledky z testů datové augmentace. Šipky nahoru označují 'vyšší je lepší', šipky dolů 'nižší je lepší'.

Výsledky z testů datové augmentace. Šipky nahoru označují ‘vyšší je lepší’, šipky dolů ‘nižší je lepší’.

Zde autoři komentují*:

‘Oba modely M2M a GPT fungují většinou stejně, s výjimkou angličtiny a ruštiny, kde GPT dosahuje mnohem nižšího recallu alternativ (58,7 oproti 89,3). Kvalita generovaných rodových struktur je lepší pro GPT v angličtině a němčině a lepší pro M2M v angličtině a španělštině, jak je vidět z metrik struktur.

‘Poznámka, že nemáme žádné údaje G-Trans pro angličtinu a italštinu, takže výsledky modelu M2M a shodné přesnosti pro angličtinu a italštinu jsou čistě díky nulovému šanci modelů M2M a XLM.’

Výzkumníci také porovnali výkon systému datové augmentace, pomocí M2M, proti metodě GATE na úrovni vět, na vlastních podmínkách GATE.

Srovnání pipeline datové augmentace Apple/USC s metodou GATE na úrovni vět.

Srovnání pipeline datové augmentace Apple/USC s metodou GATE na úrovni vět.

Zde článek uvádí*:

‘Vidíme významné zlepšení recallu za cenu relativně malé degradace precizity (kromě angličtiny a italštiny). Náš systém je schopen překonat GATE na jejich navrhované metrice F.5 ve všech třech jazykových párech.’

Nakonec autoři trénovali rozmanité ‘vanilové’ multijazyčné modely do vanilového bi-textu. Příspěvkové datové sady byly WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, a Tilde.

Dva další vanilové modely byly trénovány, jeden zahrnoval datovou sadu G-Trans s předponou <gender>, která byla použita jako supervizovaný baseline; a třetí, který zahrnoval rodovou strukturu a shody (na menším lokálním modelu, protože použití API GPT by bylo pro tento účel velmi drahé).

Modely byly testovány proti datové sadě FloRes z roku 2022.

Koncové vanilové modely strojového překladu testovány (P = precize, R = recall).

Koncové vanilové modely strojového překladu testovány (P = precize, R = recall).

Článek shrnuje tyto výsledky*:

‘Vanilový model nemůže generovat alternativy a ukazuje obrovskou předpojatost vůči generování mužských forem (δ-BLEU se pohybuje od 5,3 do 12,5 bodů).

‘Tato předpojatost je značně snížena supervizovaným modelem. Model trénovaný na augmentovaných datech dále snižuje předpojatost a dosahuje nejlepších výsledků z hlediska alternativních metrik, shodné přesnosti a δ-BLEU.

‘To ukazuje účinnost pipeline datové augmentace. Augmentovaná data také umožňují trénovat konkurenceschopný systém pro angličtinu a italštinu, které postrádají supervizovaná data.’

Autoři uzavírají tím, že úspěch modelu musí být považován v širším kontextu boje NLP s racionalizací přiřazení rodu v metodě překladu; a poznamenávají, že toto zůstává otevřeným problémem.

Ačkoli výzkumníci považují, že výsledky, které byly získány, plně nedosahují cíle generování entitních rodově neurčitých překladů a/nebo disambiguací týkajících se rodu, věří, že práce je ‘silným nástrojem’ pro budoucí výzkumy jedné z nejobtížnějších oblastí strojového překladu.

 

* Převod autorů inline citací na hypertextové odkazy

První zveřejnění úterý, 8. října 2024

Spisovatel v oblasti strojového učení, odborník na syntézu lidských obrazů. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího sloučení do Brahma.ai společnosti DNEG.
Webová stránka: martinanderson.ai
Kontakt: martin@martinanderson.ai