Andersonův úhel
Vysoká uhlíková stopa německých modelů automatického překladu

Nový výzkum uhlíkové stopy vytvořené modely strojového překladu ukazuje, že němčina může být nejvíce uhlíkově náročným populárním jazykem pro školení, ačkoli není zcela jasné, proč. Nová zpráva má otevřít další směry výzkumu do více uhlíkově efektivních metod školení umělé inteligence, v kontextu rostoucího povědomí o rozsahu, v jakém systémy strojového učení spotřebují elektřinu.
Předtisk článku je nazvaný Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine Translation a pochází od výzkumníků z Indické technické univerzity Manipal.
Autorům testovali časy školení a vypočítali hodnoty emisí uhlíku pro různé možné modely překladu mezi jazyky a zjistili ‘značnou disproporci’ mezi časem potřebným pro překlad tří nejvíce uhlíkově náročných jazykových párů a třemi nejvíce uhlíkově efektivních modely.

Průměr emisí uhlíku uvolněných během 10 epoch školení. Vlevo, výsledky pomocí ConvSeq (viz níže), vpravo, Transformery. Zdroj: https://arxiv.org/pdf/2109.12584.pdf
Článek zjistil, že nejvíce “ekologickými” jazykovými páry pro školení jsou angličtina>francouzština, francouzština>angličtina a, paradoxně, němčina>angličtina, zatímco němčina je součástí všech nejvíce spotřebovávajících párů: francouzština>němčina, angličtina>němčina a němčina>francouzština.
Složitý úrok
Zjištění naznačují, že lexikální rozmanitost ‘je přímo úměrná době školení pro dosažení adekvátní úrovně výkonu’, a uvádějí, že němčina má nejvyšší skóre lexikální rozmanitosti mezi třemi testovanými jazyky, jak je odhadnuto jeho Type-Token Ratio (TTR) – měření velikosti slovní zásoby na základě délky textu.
Zvýšené nároky na zpracování němčiny v modelech překladu nejsou odráženy v zdrojových datech, která byla použita pro experiment. Ve skutečnosti má němčina fewer (299445) odvozených tokenů než angličtina (320108) a mnohem méně než francouzština (335917).

Vyzvem, z pohledu zpracování přirozeného jazyka, je rozložit složitá němčina na složené slova. Systémy NLP často musí tento proces provést pro němčinu bez předchozích gramatických nebo kontextových podnětů, které lze nalézt v jazycích s nižšími skóre TTR, jako je angličtina. Tento proces se nazývá rozložení složitých slov nebo dekompozice.
Němčina má některé z nejdelších jednotlivých slov na světě, ačkoli v roce 2013 ztratila oficiální uznání svého 65znakového bývalého rekordmana, který je dostatečně dlouhý, aby zabíral svou vlastní řádku v tomto článku:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
Slovo se týká zákona delegujícího monitoring štítků masa, ale přestalo existovat kvůli změně evropských předpisů téhož roku, a to ve prospěch jiných populárních slov, jako je ‘vdova kapitána parníku na Dunaji’ (49 znaků):
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
Obecně vyžaduje syntaktická struktura němčiny odchod od předpokladů o slovosledu, které jsou základem postupů NLP ve mnoha západních jazycích, s populární (berlínskou) rámcem spaCY NLP, který přijal svůj vlastní rodilý jazyk v roce 2016.

Projektivní mapování v anglické a německé frázi demonstruje složitou interakci mezi lexikálními prvky v němčině. Zdroj: https://explosion.ai/blog/german-model
Data a testování
Pro zdrojová data výzkumníci použili Multi30k dataset, který obsahuje 30 000 vzorků napříč francouzským, německým a anglickým jazykem.
První z dvou modelů použitých výzkumníky byl Facebook AI’s 2017 Convolutional Sequence to Sequence (ConvSeq), neuronová síť, která obsahuje konvoluční vrstvy, ale postrádá rekurentní jednotky, a místo toho používá filtry pro odvození funkcí z textu. To umožňuje, aby všechny operace probíhaly v komputačně efektivním paralelním režimu.
Druhý přístup použitý Google’s vlivný Transformers architekturu, také z roku 2017. Transformery používá lineární vrstvy, mechanismy pozornosti a normalizační rutiny. Přiznává se, že původně vydáný model přišel pod kritiku za uhlíkovou neefektivitu, s tvrzeními o následujících zlepšeních sporných.
Experimenty byly provedeny na Google Colab, uniformně na Tesla K80 (TSLA ) GPU. Jazyky byly porovnány pomocí BLEU (Bilingual Evaluation Understudy) skóre metriky a CodeCarbon Machine Learning Emissions Calculator. Data byla školená po dobu 10 epoch.
Zjištění
Výzkumníci zjistili, že to byla prodloužená doba školení pro německé jazykové páry, která způsobila vyšší spotřebu uhlíku. Ačkoli některé jiné jazykové páry, jako je angličtina>francouzština a francouzština>angličtina, měly dokonce vyšší spotřebu uhlíku, školovaly se rychleji a vyřešily se snadněji, s těmito výkyvy spotřeby charakterizovanými výzkumníky jako ‘relativně zanedbatelné’ ve vztahu ke spotřebě jazykovými páry, které zahrnují němčinu.

Analýza jazykových párů podle emisí kodéru/dekodéru.
Výzkumníci uzavírají:
‘Naše zjištění poskytují jasnou indikaci, že některé jazykové páry jsou více uhlíkově náročné na školení než ostatní, trend, který přetrvává napříč různými architekturami.’
Pokračují:
‘Nicméně, zůstávají nezodpovězené otázky týkající se toho, proč existují tak výrazné rozdíly ve školení modelů pro určitý jazykový pár oproti jinému, a zda by不同的 architektury mohly být více vhodné pro tyto uhlíkově náročné jazykové páry, a proč by to bylo případ, pokud je to pravda.’
Článek zdůrazňuje, že důvody disproporce spotřeby uhlíku napříč školicími modely nejsou zcela jasné. Předpokládají, že budou rozvíjet tuto linii výzkumu s ne-latinskými jazyky.
1.20pm GMT+2 – Opravena chyba textu.












