Liderzy opinii
Wpływ transformatora: Czy tłumaczenie maszynowe zostało rozwiązane?
Google niedawno ogłosił wydanie 110 nowych języków w Google Translate w ramach inicjatywy 1000 języków uruchomionej w 2022 roku. W 2022 roku, na początku, dodano 24 języki. Z najnowszymi 110 językami jest to już 243 języki. Ten szybki rozwój był możliwy dzięki tłumaczeniu maszynowemu bez przykładu, technologii, w której modele uczenia maszynowego uczą się tłumaczyć na inny język bez wcześniejszych przykładów. Ale w przyszłości zobaczymy, czy ten postęp może być ostatecznym rozwiązaniem wyzwania tłumaczenia maszynowego, a tymczasem możemy zbadać sposoby, w jakie to może się stać. Ale najpierw jego historia.
Jak to było wcześniej?
Statystyczne tłumaczenie maszynowe (SMT)
To była oryginalna metoda, którą używał Google Translate. Opierała się na modelach statystycznych. Analizowała duże korpusy paralelne, zbiory wyrównanych tłumaczeń zdań, aby określić najbardziej prawdopodobne tłumaczenia. Najpierw system tłumaczył tekst na język angielski jako pośredni krok przed przekonwertowaniem go na język docelowy, a także musiał skonsultować się z obszernymi danymi z transkryptów ONZ i Parlamentu Europejskiego. Różniło się to od tradycyjnych podejść, które wymagały skompilowania wyczerpujących reguł gramatycznych. A jego podejście statystyczne pozwoliło mu dostosować się i nauczyć z danych bez polegania na statycznych ramach językowych, które mogły szybko stać się całkowicie niepotrzebne.
Jednak istnieją pewne wady tego podejścia. Po pierwsze, Google Translate używał tłumaczenia opartego na frazach, gdzie system rozbił zdania na frazy i tłumaczył je oddzielnie. Było to ulepszeniem w stosunku do tłumaczenia słowo po słowie, ale nadal miało ograniczenia, takie jak niezręczne sformułowania i błędy kontekstowe. Po prostu nie w pełni rozumiał nuansów, tak jak my. Ponadto SMT w dużej mierze opiera się na posiadaniu korpusów paralelnych, a każdy stosunkowo rzadki język byłby trudny do tłumaczenia, ponieważ nie ma wystarczających danych paralelnych.
Neuralne tłumaczenie maszynowe (NMT)
W 2016 roku Google przeszedł na Neuralne Tłumaczenie Maszynowe. Używa głębokich modeli uczenia maszynowego do tłumaczenia całych zdań jako całości i jednocześnie, co daje bardziej płynne i dokładne tłumaczenia. NMT działa podobnie do posiadania zaawansowanego asystenta wielojęzycznego w komputerze. Używając architektury sekwencja-do-sekwencji (seq2seq), NMT przetwarza zdanie w jednym języku, aby zrozumieć jego znaczenie. Następnie generuje odpowiednie zdanie w innym języku. Ta metoda używa ogromnych zbiorów danych do nauki, w przeciwieństwie do statystycznego tłumaczenia maszynowego, które opiera się na modelach statystycznych analizujących duże korpusy paralelne, aby określić najbardziej prawdopodobne tłumaczenia. W przeciwieństwie do SMT, który koncentrował się na tłumaczeniu opartym na frazach i wymagał dużej ręcznej pracy, aby rozwijać i utrzymywać reguły językowe i słowniki, NMT ma możliwość przetwarzania całych sekwencji słów, co pozwala mu lepiej uchwycić nuansowe konteksty języka. Więc poprawił jakość tłumaczenia w różnych parach językowych, często osiągając poziomy płynności i dokładności porównywalne z tłumaczami ludzkimi.
W rzeczywistości tradycyjne modele NMT używały sieci neuronowych rekurencyjnych – RNN – jako podstawowej architektury, ponieważ są one zaprojektowane do przetwarzania sekwencyjnych danych, utrzymując ukryty stan, który ewoluuje wraz z każdym nowym wejściem (słowem lub tokenem). Ten ukryty stan służy jako rodzaj pamięci, która uchwycia kontekst poprzednich wejść, pozwalając modelowi nauczyć się zależności w czasie. Ale RNN były obciążone obliczeniowo i trudne do skutecznego równoleglenia, co ograniczało ich skalowalność.
Wprowadzenie transformatorów
W 2017 roku Google Research opublikował artykuł zatytułowany “Attention is All You Need,” wprowadzając transformatory na świat i oznaczając przełomowy zwrot w stronę transformatorów w architekturze sieci neuronowej.
Transformatory opierają się wyłącznie na mechanizmie uwagi, – uwagi samych siebie, co pozwala modelom tłumaczenia maszynowego selektywnie koncentrować się na najważniejszych częściach sekwencji wejściowych. W przeciwieństwie do RNN, które przetwarzają słowa w sekwencji w zdaniach, uwaga sama siebie ocenia każdy token w całym tekście, określając, które z nich są kluczowe dla zrozumienia jego kontekstu. To jednoczesne obliczanie wszystkich słów pozwala transformatorom skutecznie uchwycić zarówno krótkie, jak i długie zależności bez polegania na połączeniach rekurencyjnych lub filtrach konwolucyjnych.
Więc eliminując rekurencję, transformatory oferują kilka kluczowych korzyści:
- Możliwość równoleglenia: Mechanizmy uwagi mogą obliczać równolegle w różnych segmentach sekwencji, co przyspiesza trening na nowoczesnym sprzęcie, takim jak GPU.
- Wydajność treningu: Wymagają również znacznie mniej czasu treningu w porównaniu z tradycyjnymi modelami opartymi na RNN lub CNN, dostarczając lepszą wydajność w zadaniach takich jak tłumaczenie maszynowe.
Tłumaczenie maszynowe bez przykładu i PaLM 2
W 2022 roku Google wydał obsługę 24 nowych języków przy użyciu tłumaczenia maszynowego bez przykładu, co oznaczało znaczący kamień milowy w technologii tłumaczenia maszynowego. Ogłoszono również inicjatywę 1000 języków, mającą na celu wsparcie 1000 najczęściej używanych języków świata. Teraz wdrożono 110 kolejnych języków. Tłumaczenie maszynowe bez przykładu umożliwia tłumaczenie bez danych paralelnych między językiem źródłowym a docelowym, eliminując potrzebę tworzenia danych szkoleniowych dla każdej pary języków — proces wcześniej kosztowny i czasochłonny, a dla niektórych par języków również niemożliwy.
Postęp ten został możliwy dzięki architekturze i mechanizmom uwagi transformatorów. Możliwość transformatora do nauki relacji kontekstowych między językami, w połączeniu z jego skalowalnością do obsługi wielu języków jednocześnie, umożliwiła rozwój bardziej wydajnych i skutecznych systemów tłumaczenia wielojęzycznego. Jednak modele bez przykładu zwykle wykazują niższą jakość niż te szkolone na danych paralelnych.
Następnie, opierając się na postępie transformatorów, Google wprowadził PaLM 2 w 2023 roku, co umożliwiło wydanie 110 nowych języków w 2024 roku. PaLM 2 znacznie poprawił możliwości Translate do nauki języków pokrewnych, takich jak Awadhi i Marwadi (pokrewne z hindi) oraz kreolskich, takich jak Seychellois i Mauritian Creole. Ulepszenia w PaLM 2, takie jak optymalizacja obliczeniowa, ulepszone zestawy danych i udoskonalony projekt, umożliwiły bardziej wydajną naukę języka i wspierały ciągłe starania Google, aby poprawić wsparcie językowe i dostosować się do różnorodnych niuansów językowych.
Czy możemy twierdzić, że wyzwanie tłumaczenia maszynowego zostało w pełni rozwiązane z transformatorami?
Ewolucja, o której mówimy, zajęła 18 lat od przyjęcia przez Google SMT do ostatnich 110 dodatkowych języków przy użyciu tłumaczenia maszynowego bez przykładu. To ogromny skok, który może potencjalnie zmniejszyć potrzebę obszernych zbiorów danych paralelnych — historycznie i bardzo pracochłonnego zadania, które branża śledziła przez ponad dwie dekady. Ale twierdzenie, że tłumaczenie maszynowe jest całkowicie rozwiązane, byłoby przedwczesne, biorąc pod uwagę zarówno techniczne, jak i etyczne rozważania.
Obecne modele nadal mają trudności z kontekstem i spójnością i popełniają subtelne błędy, które mogą zmienić znaczenie tekstu. Te problemy są bardzo widoczne w dłuższych, bardziej złożonych zdaniach, gdzie konieczne jest utrzymanie logicznego przepływu i zrozumienie niuansów, aby osiągnąć wyniki. Ponadto niuanse kulturowe i wyrażenia idiomatyczne często giną lub tracą znaczenie, powodując tłumaczenia, które mogą być gramatycznie poprawne, ale nie mają zamierzonego wpływu lub brzmią nienaturalnie.
Dane do wstępnego treningu: PaLM 2 i podobne modele są wstępnie trenowane na różnorodnym korpusie tekstów wielojęzycznych, przewyższając swojego poprzednika PaLM. To ulepszenie pozwala PaLM 2 wyróżniać się w zadaniach wielojęzycznych, podkreślając nadal ważność tradycyjnych zbiorów danych dla poprawy jakości tłumaczenia.
Języki specjalistyczne lub rzadkie: W specjalistycznych dziedzinach, takich jak prawo, medycyna lub technika, dane paralelne zapewniają, że modele spotykają się z określoną terminologią i niuansami językowymi. Zaawansowane modele mogą mieć trudności z językiem specjalistycznym lub ewoluującymi trendami językowymi, co stanowi wyzwanie dla tłumaczenia maszynowego bez przykładu. Ponadto języki o niskich zasobach są nadal słabo tłumaczone, ponieważ nie mają danych niezbędnych do szkolenia dokładnych modeli
Ocena: Dane paralelne pozostają niezbędne do oceny i porównywania wyników modeli tłumaczenia, szczególnie trudnych dla języków, które nie mają wystarczających danych paralelnych. Automatyczne metryki, takie jak BLEU, BLERT i METEOR, mają ograniczenia w ocenie nuansów jakości tłumaczenia poza gramatyką. Ale potem, my ludzie jesteśmy ograniczeni przez nasze uprzedzenia. Ponadto nie ma zbyt wielu wykwalifikowanych oceniających, a znalezienie idealnego oceniającego dwujęzycznego dla każdej pary języków, aby złapać subtelne błędy.
Natężenie zasobów: Obciążenie zasobami treningu i wdrażania LLM pozostaje barierą, ograniczając dostępność dla niektórych aplikacji lub organizacji.
Zachowanie kulturowe. Wymiar etyczny jest głęboki. Jak opisuje to Isaac Caswell, naukowiec z Google Translate: “Można to uznać za poliglotę, który zna wiele języków. Ale potem dodatkowo widzi tekst w 1000 językach, których nie tłumaczy. Można wyobrazić sobie, że jesteś wielkim poliglotą, a potem zaczynasz czytać powieści w innym języku, możesz zacząć składać, co to może znaczyć na podstawie Twojej wiedzy o języku w ogóle”. Jednak istotne jest, aby rozważyć długoterminowy wpływ na języki mniejszościowe, które nie mają danych paralelnych, co może wpłynąć na zachowanie kulturowe, gdy zależność przenosi się od samych języków.












