Andersons vinkel
Det høje kulstofaftryk fra tyske maskinoversættelsesmodeller

Nyt forskning i kulstofaftrykket fra maskinoversættelsesmodeller viser, at tysk måske er det mest kulstofintensive sprog at træne, selvom det ikke er helt klart, hvorfor. Den nye rapport er beregnet til at åbne op for yderligere forskning i mere kulstofeffektive AI-træningsmetoder i sammenhæng med den voksende bevidsthed om, i hvilken udstrækning maskinlæringsystemer forbruger elektricitet.
Forskningsartiklen har titlen Curb Your Carbon Emissions: Benchmarking Carbon Emissions in Machine Translation og kommer fra forskere ved Indiens Manipal Institute of Technology.
Forfatterne testede træningstider og beregnede kulstofemissionsværdier for en række mulige inter-sprog oversættelsesmodeller og fandt ‘en bemærkelsesværdig ulighed’ mellem tiden, der blev brugt til at oversætte de tre mest kulstofintensive sprogpar og de tre mest kulstoføkonomiske modeller.

Gennemsnit af kulstofemissioner frigivet over 10 epochs af træning. Til venstre, resultater ved hjælp af ConvSeq (se nedenfor), til højre, Transformers. Kilde: https://arxiv.org/pdf/2109.12584.pdf
Artiklen fandt, at de mest ‘økologiske’ sprogpar til træning er engelsk>fransk, fransk>engelsk og, paradoksalt, tysk til engelsk, mens tysk er med i alle de højeste forbrugspar: fransk>tysk, engelsk>tysk og tysk>fransk.
Kompositrente
Forskningen viser, at leksikalsk diversitet ‘er direkte proportional med træningstiden for at opnå et tilstrækkeligt niveau af præstation’, og bemærker, at det tyske sprog har den højeste leksikalske diversitets-score blandt de tre testede sprog, som estimeret af dets Type-Token Ratio (TTR) – en måling af ordforråd baseret på tekstlængde.
De øgede krav til behandling af tysk i oversættelsesmodellerne afspejles ikke i kildedataene, der blev brugt til eksperimentet. Faktisk har det tyske sprog tokens, der er genereret fra kildedataene, færre (299445) afledte tokens end engelsk (320108) og langt færre end fransk (335917).

Udfordringen, fra et naturligt sprogbehandlingsperspektiv, er at dekomponere sammensatte tyske ord i deres bestanddele. NLP-systemer skal ofte gøre dette for tysk uden nogen af de forudgående grammatikalske eller kontekstuelle hints, der kan findes i sprog med lavere TTR-scores, såsom engelsk. Processen kaldes sammensat splitting eller dekomponering.
Det tyske sprog har nogle af de længste enkeltord i verden, selvom det i 2013 mistede den officielle anerkendelse af sin 65-tegn lange tidligere rekordholder, der er lang nok til at kræve sin egen linje i denne artikel:
Rindfleischetikettierungsueberwachungsaufgabenuebertragungsgesetz
Ordet refererer til en lov, der overdrager overvågning af kvægmarke, men forsvandt på grund af en ændring i EU-reglerne det år, og overlod pladsen til andre populære standarder, såsom ‘enke efter en dampskibskaptajn på Donau’ (49 tegn):
Donaudampfschifffahrtsgesellschaftskapitaenswitwe
Generelt kræver det tyske sprogs syntaktiske struktur en afvigelse fra de ordre-antagelser, der ligger til grund for NLP-praksis i mange vestlige sprog, med den populære (Berlin-baserede) spaCy NLP-ramme, der antog sin egen native sprog i 2016.

Projektive afbildninger i en engelsk og tysk sætning demonstrerer de komplekse interrelationer mellem leksikalske elementer i det tyske sprog. Kilde: https://explosion.ai/blog/german-model
Data og test
Til kildedata brugte forskerne Multi30k-datasettet, der indeholder 30.000 eksempler på fransk, tysk og engelsk.
Den første af de to modeller, som forskerne brugte, var Facebook AI’s 2017 Convolutional Sequence to Sequence (ConvSeq), et neuralt netværk, der indeholder convolutionelle lag, men som mangler rekurrente enheder, og i stedet bruger filtre til at udlede funktioner fra tekst. Dette tillader alle operationer at finde sted på en komputationelt effektiv parallel måde.
Den anden tilgang brugte Googles indflydelsesrige Transformers-arkitektur, også fra 2017. Transformers bruger lineære lag, opmærksomhedsmekanismer og normaliseringsrutiner. Det originale udgivne model er kommet under kritik for kulstofformåen, med påstande om efterfølgende forbedringer kontrovers.
Eksperimenterne blev udført på Google Colab, ensartet på en Tesla K80 -GPU. Sprogene blev sammenlignet ved hjælp af en BLEU (Bilingual Evaluation Understudy)-score-måling og CodeCarbon Machine Learning Emissions Calculator. Dataene blev trænet over 10 epochs.
Fund
Forskerne fandt, at det var den forlængede træningstid for tysk-relaterede sprogpar, der tippede balancen over i højere kulstofforbrug. Selvom nogle andre sprogpar, såsom engelsk>fransk og fransk>engelsk havde endnu højere kulstofforbrug, trænede de hurtigere og løste mere let, med disse kulstofforbrugsudbrud karakteriseret af forskerne som ‘relativt insignifikant’ i forhold til forbrug af sprogpar, der indeholder tysk.

Analyse af sprogpar efter encoder/decoder-kulstofemissioner.
Forskerne konkluderer:
‘Vores fund giver en klar indikation af, at nogle sprogpar er mere kulstofintensive at træne end andre, en tendens, der strækker sig over forskellige arkitekturer.’
De fortsætter:
‘Men der er stadig ubesvarede spørgsmål om, hvorfor der er så store forskelle i træning af modeller for et bestemt sprogpar over et andet, og om forskellige arkitekturer måske er mere egnede til disse kulstofintensive sprogpar, og hvorfor dette ville være tilfældet, hvis det er sandt.’
Artiklen understreger, at årsagerne til uligheden i kulstofforbrug over træningsmodeller ikke er helt klare. De forventer at udvikle denne linje af studier med ikke-latinske sprog.
1.20pm GMT+2 – Tekstfejl rettet.












