Modele i platformy AI

Rozwiązanie Apple dla tłumaczeń języków płciowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google
A photo of the Rosetta Stone, with a woman out of focus in the background, looking at the stone. Source: https://smarthistory.org/the-rosetta-stone/

Firma Apple (AAPL ) opublikowała właśnie pracę, we współpracy z USC, która bada metody uczenia maszynowego stosowane w celu zapewnienia użytkownikom systemu operacyjnego iOS18 większego wyboru w kwestii płci podczas tłumaczeń.

W systemie iOS18 użytkownicy mogą wybrać alternatywne sugestie płci dla tłumaczonego słowa w rodzimym aplikacji Translate. Źródło: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

W systemie iOS18 użytkownicy mogą wybrać alternatywne sugestie płci dla tłumaczonego słowa w rodzimym aplikacji Translate. Źródło: https://support.apple.com/guide/iphone/translate-text-voice-and-conversations-iphd74cb450f/ios

Mimo że problemy poruszane w pracy (której Apple ogłosił tutaj) dotykają w pewnym stopniu bieżących debat na temat definicji płci, koncentrują się one na znacznie starszym problemie: fakcie, że 84 spośród 229 znanych języków na świecie używają systemu płci opartego na płci.

Czerwone kropki wskazują języki, które używają systemu płci opartego na płci. Źródło: https://wals.info/feature/31A#map

Czerwone kropki wskazują języki, które używają systemu płci opartego na płci. Źródło: https://wals.info/feature/31A#map

Zaskakująco, język angielski należy do kategorii płci opartej na płci, ponieważ przypisuje męskie lub żeńskie rzeczowniki.

W przeciwieństwie do tego, wszystkie języki romańskie (w tym ponad pół miliarda hiszpańskojęzycznych użytkowników) – oraz wiele innych popularnych języków, takich jak rosyjski – wymagają zgodności płci w sposób, który zmusza systemy tłumaczeń do zajmowania się przypisaniem płci w języku.

Nowy dokument ilustruje to, obserwując wszystkie możliwe hiszpańskie tłumaczenia zdania Sekretarz był zły na szefa:

Z nowego dokumentu, przykład potencjalnych przypisań płci w zdaniu 'Sekretarz był zły na szefa', tłumacząc z angielskiego na hiszpański. Źródło: https://arxiv.org/pdf/2407.20438

Z nowego dokumentu, przykład potencjalnych przypisań płci w zdaniu ‘Sekretarz był zły na szefa’, tłumacząc z angielskiego na hiszpański. Źródło: https://arxiv.org/pdf/2407.20438

Tłumaczenie naiwne jest znacznie niewystarczające dla dłuższych tekstów, które mogą ustalić płeć na początku (‘On’, ‘Ona’ itd.) i nie odnosić się do płci ponownie. Niemniej jednak, tłumaczenie musi pamiętać o przypisanej płci uczestnika przez cały tekst.

To może być wyzwaniem dla podejść opartych na tokenach, które zajmują się tłumaczeniami w dyskretnych fragmentach, i ryzykują utratę kontekstu płciowego w trakcie trwania treści.

Gorzej, systemy, które zapewniają alternatywne tłumaczenia dla tendencyjnych przypisań płci, nie mogą robić tego bez rozróżnienia, tj. poprzez proste zastąpienie rzeczownika płciowego, ale muszą zapewnić, że wszystkie inne części języka zgadzają się z zmienionym rzeczownikiem płciowym.

W tym przykładzie z dokumentu Apple/USC widzimy, że chociaż Sekretarz został przypisany do męskiej płci, czasownik był pozostał w formie żeńskiej (była):

Brutalne zastąpienie płci może zaniedbać konieczną zgodność płci. W tym przykładzie słowo 'była' powinno być 'był', aby zgadzać się z męskim 'Sekretarzem'.

Brutalne zastąpienie płci może zaniedbać konieczną zgodność płci. W tym przykładzie słowo ‘była’ powinno być ‘był’, aby zgadzać się z męskim ‘Sekretarzem’.

System tłumaczeń musi również radzić sobie z wyjątkowościami poszczególnych języków w odniesieniu do płci. Jak dokument wskazuje, zaimek ja jest płciowy w języku hindi, co stanowi niezwykłą wskazówkę dotyczącą płci.

Problemy z płcią

W nowym dokumencie, zatytułowanym Generowanie alternatyw płci w tłumaczeniach maszynowych, badacze z Apple i USC proponują półnadzorowane podejście do konwersji jednostek płciowo niejasnych na tablicę alternatyw na poziomie jednostki.

System, który został wykorzystany do poinformowania tłumaczeń z aplikacji Apple Translate w systemie iOS18, tworzy schemat językowy za pomocą dużych modeli językowych (LLM) oraz dostosowywania wstępnie wytrenowanych modeli tłumaczeń maszynowych.

Wyniki tłumaczeń z tych systemów zostały następnie wytrenowane w architekturze zawierającej struktury płci – grupy fraz zawierających różne formy rzeczowników płciowych reprezentujących tę samą jednostkę.

Dokument stwierdza*:

‘Znane są przypadki, w których przypisanie płci w danych szkoleniowych przenika do systemów przetwarzania języka naturalnego (NLP), powodując rozprzestrzenianie i potencjalne nasilenie tych tendencyjności. Takie tendencyjności są często również przyczyną błędów.

‘System tłumaczeń maszynowych może na przykład tłumaczyć słowo ‘lekarz’ na hiszpańskie ‘médico’ (męskie) zamiast ‘médica’ (żeńskie), biorąc pod uwagę dane wejściowe „Lekarz poprosił pielęgniarkę o pomoc w procedurze”.

‘Aby uniknąć błędnego przypisania płci, systemy tłumaczeń muszą rozróżniać płeć za pomocą kontekstu. Gdy nie można określić prawidłowej płci za pomocą kontekstu, zapewnienie wielu alternatywnych tłumaczeń, które obejmują wszystkie ważne wybory płci, jest rozsądnym podejściem.’

Podejście, do którego dochodzą badacze, skutecznie zmienia tłumaczenie z jednego tokenu na tablicę kontrolowaną przez użytkownika.

(Chociaż dokument nie wspomina o tym, otwiera to możliwość, że w Apple Translate lub w podobnych portalach, które oferują usługi tłumaczeń, wybory użytkownika mogą być wprowadzane do późniejszych iteracji modelu)

Model opracowany przez Apple i USC został oceniony na GATE i MT-GenEval zestawach testowych. GATE zawiera zdania źródłowe z maksymalnie 3 jednostkami płciowo niejasnymi, podczas gdy MT-GenEval zawiera materiały, w których płeć nie może być wnioskowana, co, jak stwierdzają autorzy, pomaga w zrozumieniu, kiedy alternatywne opcje płci nie powinny być oferowane użytkownikowi.

W obu przypadkach zestawy testowe musiały zostać ponownie zaadnotowane, aby dopasować się do celów projektu.

Do szkolenia systemu badacze polegali na nowym algorytmie rozszerzania danych, w przeciwieństwie do wcześniej wymienionych zestawów testowych, które były adnotowane przez ludzi.

Dane przyczyniające się do kuracji Apple pochodziły z Europarl; WikiTitles; i WikiMatrix. Korpus został podzielony na G-Tag (z 12 000 zdań), zawierający zdania z słowami głównymi dla wszystkich jednostek, wraz z adnotacją płci; oraz G-Trans (z 50 000 zdań), zawierający jednostki płciowo niejasne i zgodności płci.

Autorzy twierdzą:

‘Naszym zdaniem jest to pierwszy duży korpus, który zawiera niejasności płci i ich wpływ na formy płciowe w tłumaczeniu.’

Zestawy danych i różne dane dla projektu zostały udostępnione na GitHub. Dane obejmują pięć par językowych, zestawiając angielski z rosyjskim, niemieckim, francuskim, portugalskim i hiszpańskim.

Badacze wykorzystali wcześniejsze podejście z 2019 roku, aby wyposażyć model w możliwość generowania zgodności płci, szkoląc z stratą entropii krzyżowej i dodatkową stratą wyrównania.

Do rutyny rozszerzania danych badacze odrzucili tradycyjne metody oparte na regułach na rzecz podejścia opartego na danych, dostosowując wstępnie wytrenowany model językowy BERT na zestawie danych G-Tag.

Ponowne spojrzenie

W przypadku wykrycia niejasnych jednostek płciowych Apple i USC zbadali dwa podejścia – dostosowanie wstępnie wytrenowanych modeli językowych i użycie LLM.

W odniesieniu do pierwszego podejścia dokument stwierdza:

‘Dostosowujemy wstępnie wytrenowany model tłumaczeń M na bi-tekst wyodrębniony z zestawu danych G-Trans. Zdania źródłowe tego bi-tekstu zawierają niejasne jednostki oznaczone jako męskie lub żeńskie za pomocą tagów <M>/<F>, a tłumaczenie docelowe ma poprawne odmiany płciowe w zależności od tagów płciowych.’

Ilustracja schematu wyodrębniania bi-tekstu z zestawu danych G-Trans.

Ilustracja schematu wyodrębniania bi-tekstu z zestawu danych G-Trans.

Na powyższym obrazie widzimy dostosowany tekst w środkowej kolumnie, a pożądany wynik w prawej kolumnie, z podstawową racjonalizacją ilustrowaną powyżej.

Do tego podejścia badacze wykorzystali metodę ponownego oceniania siatki z wcześniejszej pracy z 2020 roku. Aby upewnić się, że tylko docelowa domena (płeć) była adresowana, zastosowano wymuszoną wyszukiwanie wiązki jako filtr.

W przypadku podejścia LLM badacze opracowali strategię, która wykorzystuje LLM jako edytor, poprzez ponowne napisanie dostarczonych tłumaczeń w celu zapewnienia przypisania płci.

LLM jest uruchamiany przy użyciu przykładu w kontekście w celu przypisania płci.

LLM jest uruchamiany przy użyciu przykładu w kontekście w celu przypisania płci.

Wyniki obu podejść zostały połączone, a następnie model został dostosowany do klasyfikacji tokenów źródłowych jako wyrównane (oznaczone jako ‘1’ w poniższym schemacie) lub niewyrównane (oznaczone jako ‘2’ poniżej).

Schemat łączenia wyników obu podejść.

Schemat łączenia wyników obu podejść.

Dane i testy

Wykrywacz niejasnych jednostek wykorzystany w projekcie został opracowany poprzez dostosowanie modelu xlm-roberta-large firmy Facebook AI, z użyciem transformerów. Do tego wykorzystano połączony zestaw G-Tag we wszystkich pięciu parach językowych.

W pierwszym z wymienionych podejść model M2M 1.2B został wytrenowany na Fairseq, wspólnie z danymi bi-tekstowymi z zestawu G-Trans, z odmianami płciowymi dostarczonymi przez Wiktionary.

Dla podejścia LLM badacze wykorzystali GPT-3.5-turbo. Do wyrównania struktur płciowych ponownie wykorzystano model xlm-roberta-large, tym razem z wyrównaniami płciowymi wyodrębnionymi z G-Trans.

Metryki dla oceny alternatyw, struktury (z dokładnością i odwołaniem), oraz dokładności wyrównania.

Chociaż pierwsze dwa z nich są samoopisujące, dokładność wyrównania mierzy procent struktur płciowych wyjściowych, które są zgodne z znaną poprawną tożsamością źródłową, i wykorzystuje metodę δ-BLEU, zgodnie z metodologią MT-GenEval.

Poniżej znajdują się wyniki potoku rozszerzania danych:

Wyniki testów potoku rozszerzania danych. Strzałki w górę wskazują 'wyższe-lepsze', strzałki w dół 'niższe-lepsze'.

Wyniki testów potoku rozszerzania danych. Strzałki w górę wskazują ‘wyższe-lepsze’, strzałki w dół ‘niższe-lepsze’.

Tutaj autorzy komentują*:

‘Oba modele M2M i GPT wykonują się głównie na równi, z wyjątkiem angielsko-rosyjskiego, gdzie GPT osiąga znacznie niższą odwołalność alternatyw (58,7 w porównaniu z 89,3). Jakość wygenerowanych struktur płciowych jest lepsza dla GPT w parach angielsko-niemiecki i angielsko-portugalski, a lepsza dla M2M w parach angielsko-hiszpański i angielsko-rosyjski, jak widać w metrykach strukturalnych.

‘Należy zauważyć, że nie mamy danych G-Trans dla angielsko-włoskiego, więc wyniki modelu M2M i dokładność wyrównania dla angielsko-włoskiego są wynikiem czystej generalizacji zero-shot modeli M2M i XLM.’

Badacze również porównali wyniki systemu rozszerzania danych, za pomocą M2M, z metodą GATE na poziomie zdania, na warunkach określonych przez GATE.

Potok rozszerzania danych Apple/USC w porównaniu z metodą GATE na poziomie zdania.

Potok rozszerzania danych Apple/USC w porównaniu z metodą GATE na poziomie zdania.

Tutaj dokument stwierdza:

‘Widzimy znaczne poprawy odwołalności przy relatywnie niewielkim pogorszeniu dokładności (z wyjątkiem angielsko-włoskiego). Nasz system jest w stanie przewyższyć GATE w ich proponowanej metryce F.5 we wszystkich trzech parach językowych.’

W końcu autorzy wytrenowali różne modele wielojęzyczne „vanilla” w „vanilla bi-tekst”. Wkładające dane pochodziły z WikiMatrix, WikiTitles, Multi-UN, NewsCommentary, oraz Tilde.

Dwa dodatkowe modele „vanilla” zostały wytrenowane, jeden zawierający zestaw danych G-Trans z prefiksem tagu <gender>, który został wykorzystany jako podstawa nadzorowana; oraz trzeci, zawierający strukturę płci i wyrównania (w mniejszym modelu lokalnym, ponieważ korzystanie z usług API GPT byłoby bardzo kosztowne do tego celu).

Modele zostały przetestowane na zestawie danych FloRes z 2022 roku.

Modele tłumaczeń maszynowych „vanilla” testowane (P = dokładność, R = odwołalność).

Modele tłumaczeń maszynowych „vanilla” testowane (P = dokładność, R = odwołalność).

Dokument podsumowuje te wyniki:

‘Model „vanilla” nie może generować alternatyw i wykazuje ogromną tendencję do generowania form męskich (δ-BLEU waha się od 5,3 do 12,5 punktów).

‘Tę tendencję znacznie redukuje podstawa nadzorowana. Model wytrenowany na danych rozszerzonych dalej redukuje tendencję i osiąga najlepszą wydajność pod względem metryk alternatyw, dokładności wyrównania i δ-BLEU.

‘To pokazuje skuteczność potoku rozszerzania danych. Dane rozszerzone również pozwalają na wytrenowanie konkurencyjnego systemu dla angielsko-włoskiego, który nie ma danych nadzorowanych.’

Autorzy kończą, zauważając, że sukces modelu musi być rozpatrywany w szerszym kontekście walki NLP z racjonalizacją przypisania płci w metodzie tłumaczenia; oraz zauważają, że pozostaje to otwarty problem.

Mimo że badacze uważają, że wyniki nie osiągają w pełni celu generowania tłumaczeń płciowo neutralnych i/lub rozróżniania płci, uważają pracę za „potężne narzędzie” do przyszłych eksploracji jednej z najtrudniejszych dziedzin tłumaczeń maszynowych.

 

* Moja konwersja cytatów wstawionych przez autorów do postaci linków

Pierwotnie opublikowane we wtorek, 8 października 2024

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai