Kąt Andersona
Wysoki ślad węglowy modeli tłumaczeń niemieckich

Nowe badania nad śladem węglowym generowanym przez modele tłumaczeń maszynowych wskazują, że język niemiecki może być najbardziej węglowo-nasyconym popularnym językiem do szkolenia, chociaż nie jest całkowicie jasne, dlaczego. Nowy raport ma na celu otwarcie dodatkowych ścieżek badań nad bardziej efektywnymi metodami szkolenia sztucznej inteligencji, w kontekście rosnącej świadomości stopnia, w jakim systemy machine learning zużywają energię elektryczną.
Wstępny artykuł nosi tytuł Ogranicz swoje emisje dwutlenku węgla: ocena emisji dwutlenku węgla w tłumaczeniach maszynowych , i pochodzi od badaczy z Instytutu Technologicznego Manipal w Indiach.
Autorzy przetestowali czasy szkolenia i obliczyli wartości emisji dwutlenku węgla dla różnych możliwych modeli tłumaczeń między językami, i stwierdzili ‘znaczną dysproporcję’ między czasem potrzebnym do tłumaczenia trzech najbardziej węglowo-nasyconych par językowych, a trzema najbardziej węglowo-ekonomicznymi modelami.

Średnia emisji dwutlenku węgla wyemitowanego podczas 10 epok szkolenia. Po lewej, wyniki uzyskane za pomocą ConvSeq (patrz poniżej), po prawej, Transformers. Źródło: https://arxiv.org/pdf/2109.12584.pdf
Artykuł stwierdza, że najbardziej ‘ekologicznymi’ parami językowymi do szkolenia są angielski>francuski, francuski>angielski i paradoksalnie, niemiecki na angielski, podczas gdy niemiecki pojawia się we wszystkich najbardziej zużywających pary: francuski>niemiecki, angielski>niemiecki i niemiecki>francuski.
Odsetki złożone
Wyniki sugerują, że różnorodność leksykalna ‘jest bezpośrednio proporcjonalna do czasu szkolenia, aby osiągnąć odpowiedni poziom wydajności’, i zauważają, że język niemiecki ma najwyższy wynik różnorodności leksykalnej wśród trzech przetestowanych języków, oszacowany przez jego Współczynnik Token-Type (TTR) – miarę wielkości słownictwa opartej na długości tekstu.
Zwiększone wymagania dotyczące przetwarzania języka niemieckiego w modelach tłumaczeń nie są odzwierciedlone w danych źródłowych, które zostały użyte w eksperymencie. W rzeczywistości, tokeny języka niemieckiego wygenerowane z danych źródłowych mają mniej (299445) pochodnych tokenów niż angielski (320108), i znacznie mniej niż francuski (335917).

Wyzwanie, z punktu widzenia przetwarzania języka naturalnego (NLP), polega na rozłożeniu złożonych słów niemieckich na słowa składowe. Systemy NLP często muszą to robić dla języka niemieckiego bez żadnych wstępnych podziałów gramatycznych lub kontekstowych wskazówek, które można znaleźć w językach o niższych wynikach TTR, takich jak angielski. Proces ten nazywa się rozdzielaniem złożonych słów lub dekompozycją.
Język niemiecki ma niektóre z najdłuższych słów na świecie, chociaż w 2013 roku utracił oficjalne uznanie swojego 65-znakowego byłego rekordzisty, który jest wystarczająco długi, aby wymagał własnej linii w tym artykule:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
Słowo odnosi się do prawa delegującego nadzór nad etykietami wołowiny, ale przestało istnieć z powodu zmiany przepisów europejskich w tym roku, ustępując miejsca innym popularnym wyrazom, takim jak ‘wdowa po kapitanie parowca na Dunaju’ (49 znaków):
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
Ogólnie, składnia języka niemieckiego wymaga odejścia od założeń dotyczących kolejności słów, które leżą u podstaw praktyk NLP w wielu językach zachodnich, przy czym popularny (berliński) framework NLP spaCY przyjął swój własny rodzimy język w 2016 roku.

Mapowania projekcyjne w angielskim i niemieckim zdaniu demonstrują złożone relacje między elementami leksykalnymi w języku niemieckim. Źródło: https://explosion.ai/blog/german-model
Dane i testowanie
Dla danych źródłowych badacze użyli zestawu danych Multi30k, zawierającego 30 000 próbek w językach francuskim, niemieckim i angielskim.
Pierwszym z dwóch modeli użytych przez badaczy był Convolutional Sequence to Sequence (ConvSeq) opracowany przez Facebook AI w 2017 roku, sieć neuronową zawierającą warstwy konwolucyjne, ale pozbawioną jednostek rekurencyjnych, i zamiast tego używającą filtrów do pochodzenia funkcji z tekstu. Pozwala to na wszystkie operacje, które mogą być wykonywane w sposób komputacyjnie wydajny i równoległy.
Drugim podejściem był wpływowy model Transformers opracowany przez Google, również z 2017 roku. Model Transformers używa warstw liniowych, mechanizmów uwagi i rutyn normalizacji. Niektórzy twierdzą, że oryginalny model jest niewydajny pod względem emisji dwutlenku węgla, z roszczeniami o późniejszych ulepszeniach kwestionowanych.
Eksperymenty zostały przeprowadzone na Google Colab, jednolicie na karcie graficznej Tesla K80. Języki zostały porównane za pomocą wskaźnika BLEU (Bilingual Evaluation Understudy) i kalkulatora emisji CodeCarbon. Dane były szkolone przez 10 epok.
Wyniki
Badacze stwierdzili, że to przedłużony czas szkolenia dla par językowych związanych z językiem niemieckim wpłynął na wyższe zużycie węgla. Chociaż niektóre inne pary językowe, takie jak angielski>francuski i francuski>angielski, miały jeszcze wyższe zużycie węgla, szkoliły się szybciej i rozwiązywały łatwiej, z tymi wybuchami zużycia określanymi przez badaczy jako ‘relatywnie nieistotne’ w stosunku do zużycia przez pary językowe, które zawierają język niemiecki.

Analiza par językowych według emisji kodera i dekodera.
Badacze stwierdzają:
‘Nasze wyniki dostarczają wyraźnych wskazań, że niektóre pary językowe są bardziej węglowo-intensywne do szkolenia niż inne, tendencja, która przenosi się na różne architektury.’
Kontynuują:
‘Jednak pozostają niewyjaśnione pytania dotyczące tego, dlaczego istnieją tak wyraźne różnice w szkoleniu modeli dla określonej pary językowej, i czy różne architektury mogą być bardziej odpowiednie dla tych węglowo-intensywnych par językowych, i dlaczego tak byłoby, gdyby było to prawdą.’
Artykuł podkreśla, że powody dysproporcji emisji dwutlenku węgla w modelach szkoleniowych nie są całkowicie jasne. Oczekują rozwinięcia tej linii badań z językami niebazy latynoalfabetycznymi.
13.20 – Poprawiono błąd w tekście.












