Andersons vinkel
Begrensning av maskinlærings modellers økende energibehov

I lys av økende bekymring om energikravene til store maskinlæringsmodeller, har en ny studie fra MIT Lincoln Laboratory og Northeastern University undersøkt besparelsene som kan gjøres ved å begrense strømforbruket til GPU-er brukt i modelltrening og inferens, samt flere andre tekniker og metoder for å kutte ned AI-energibruken.
Den nye studien oppfordrer også til at nye AI-artikler skal avsluttes med en ‘Energi-erklæring’ (tilsvarende den nye trenden for ‘etiske implikasjoner’-uttalelser i artikler fra maskinlæringsforskningen).
Hovedforslaget fra studien er at strøm-begrensning (å begrense tilgjengelig strøm til GPU-en som trener modellen) tilbyr verdifulle energibesparende fordeler, spesielt for Masked Language Modeling (MLM), og rammeverk som BERT og dens derivater.

Tre språkmodelleringnettverk som opererer på en prosentdel av de standard 250W-innstillingene (svart linje), i forhold til strømforbruk. Å begrense strømforbruket ikke begrenser treningseffektivitet eller nøyaktighet på en 1-1-basis, og tilbyr strøm-besparelse som er merkbare i størrelsesorden. Kilde: https://arxiv.org/pdf/2205.09646.pdf
For større modeller, som har fått oppmerksomhet de siste årene på grunn av hyperskala-datasett og nye modeller med milliarder eller billioner parameter, kan lignende besparelser oppnås som en avveining mellom treningstid og energibruken.

Trening av mer imponerende NLP-modeller i størrelsesorden under strøm-begrensninger. Gjennomsnittlig relativ tid under en 150W-begrensning er vist i blått, og gjennomsnittlig relativ strømforbruk for 150W i oransje.
For disse større utbredelsene fant forskerne at en 150W-begrensning på strømforbruket resulterte i en gjennomsnittlig 13,7% reduksjon i energibruken sammenlignet med den standard 250W-maksimum, samt en relativt liten 6,8% økning i treningstid.
Forskerne bemerker også at, til tross for overskriftene som kostnadene for modelltrening har fått de siste årene, er energikostnadene for å faktisk bruke de trente modellene mye høyere*.
‘For språkmodellering med BERT, er energibesparelse gjennom strøm-begrensning merkbart større når man utfører inferens enn for trening. Hvis dette er konsistent for andre AI-applikasjoner, kan dette ha betydelige konsekvenser for energiforbruket til større eller sky-baserte plattformer som serverer inferens-applikasjoner for forskning og industri.’
Videre, og kanskje mest kontroversielt, foreslår artikkelen at større trening av maskinlæringsmodeller bør overføres til de kalde månedene av året, og om natten, for å spare på kjøle-kostnader.

Ovenfor, PUE-statistikk for hver dag i 2020 i forfatternes datasenter, med en merkbart og vedvarende økning/plateau i sommermånedene. Under, den gjennomsnittlige timelige variasjonen i PUE for samme sted i løpet av en uke, med energiforbruk som øker mot midten av dagen, da både den interne GPU-kjølehåndtering og den omgivende datasenter-kjøling sliter med å opprettholde en arbeidbar temperatur.
Forfatterne påstår:
‘Det er åpenbart at tungt NLP-arbeid er typisk mye mindre effektivt om sommeren enn de som utføres under vinteren. Gitt den store sesongvariasjonen, hvis det er komputasjonskrevende eksperimenter som kan tidfestes til kjøligere måneder, kan dette tidfestingen betydelig redusere karbonavtrykket.’
Artikkelen erkjenner også de fremvoksende energibesparende mulighetene som er mulige gjennom beskjæring og optimalisering av modellarkitektur og arbeidsflyter – selv om forfatterne overlater videre utvikling av denne veien til andre initiativer.
Til slutt foreslår forfatterne at nye vitenskapelige artikler fra maskinlæringssektoren bør oppmuntres, eller kanskje begrenses, til å avslutte med en uttalelse som erklærer energibruken for arbeidet utført i forskningen, og de potensielle energikonsekvensene av å innføre initiativer foreslått i arbeidet.

Artikkelen, som følger eget eksempel, forklarer energikonsekvensene av sin egen forskning.
Den artikkelen heter Great Power, Great Responsibility: Recommendations for Reducing Energy for Training Language Models, og kommer fra seks forskere på tvers av MIT Lincoln og Northeastern.
Maskinlærings økende energibehov
Ettersom de komputasjonsmessige kravene til maskinlæringsmodeller har økt i takt med nyttene av resultater, liker nåværende ML-kultur energiutgift med forbedret ytelse – til tross for noen bemerkelsesverdige kampanjer, slik som Andrew Ng, som foreslår at datakurering kan være en viktigere faktor.
I en nøkkel-MIT-samarbeid fra 2020, ble det estimert at en ti-dobling av modell-ytelse medfører en 10 000-dobling av komputasjonskrav, samt en tilsvarende mengde energi.
Følgelig har forskning i mindre strøm-intensiv effektiv ML-trening økt de siste årene. Den nye artikkelen, som forfatterne hevder, er den første som tar en dypt blikk på effekten av strøm-begrensninger på maskinlærings-trening og inferens, med fokus på NLP-rammeverk (slik som GPT-serien).
Ettersom kvaliteten på inferens er en hovedbekymring, påstår forfatterne av funnene sine:
‘[Denne] metoden påvirker ikke forutsagnene av trente modeller eller deres ytelse-nøyaktighet på oppgaver. Det vil si, hvis to nettverk med samme struktur, initialverdier og batchede data er trent for samme antall batcher under forskjellige strøm-begrensninger, vil deres resulterende parametre være identiske og kun energien som er nødvendig for å produsere dem kan være forskjellig.’
Kutting ned strømforbruket for NLP
For å vurdere effekten av strøm-begrensninger på trening og inferens, brukte forfatterne nvidia-smi (System Management Interface) kommandolinje-verktøyet, sammen med en MLM-bibliotek fra HuggingFace.
Forfatterne trente NLP-modeller BERT, DistilBERT og Big Bird over MLM, og overvåket deres strømforbruk under trening og utrulling.
Modellene ble trent mot DeepAI’s WikiText-103-datasett for 4 epoker i batcher på åtte, på 16 V100-GPU-er, med fire forskjellige strøm-begrensninger: 100W, 150W, 200W og 250W (standard, eller basis, for en NVIDIA V100-GPU). Modellene hadde scratch-trente parametre og tilfeldige init-verdier, for å sikre sammenlignbare treningsevalueringer.
Som vist i første bildet ovenfor, viser resultater gode energibesparelser ved ikke-lineære, gunstige økninger i treningstid. Forfatterne påstår:
‘Våre eksperimenter indikerer at implementering av strøm-begrensninger kan betydelig redusere energibruken på bekostning av treningstid.’
Slimming Down ‘Big NLP’
Deretter anvendte forfatterne samme metode på en mer krevende scenario: trening av BERT med MLM på distribuerte konfigurasjoner over flere GPU-er – en mer typisk brukssak for godt finansierte og godt omtalte FAANG NLP-modeller.
Hovedforskjellen i dette eksperimentet var at en modell kunne bruke hvor som helst mellom 2-400 GPU-er per treningsinstans. Samme begrensninger for strømbruk ble anvendt, og samme oppgaven ble brukt (WikiText-103). Se andre bildet ovenfor for graf over resultater.
Artikkelen påstår:
‘Gjennomsnittlig over hver valg av konfigurasjon, førte en 150W-begrensning på strømforbruket til en gjennomsnittlig 13,7% reduksjon i energibruken og 6,8% økning i treningstid sammenlignet med standard-maksimum. [Den] 100W-innstillingen har betydelig lengre treningstider (31,4% lengre i gjennomsnitt). En 200W-begrensning korresponderer med nesten samme treningstid som en 250W-begrensning, men mer beskjedne energibesparelser enn en 150W-begrensning.’
Forfatterne foreslår at disse resultater støtter strøm-begrensning på 150W for GPU-arkitekturer og applikasjonene som kjører på dem. De bemerker også at energibesparelsene som oppnås, oversetter seg over hardware-plattformer, og kjørte testene igjen for å sammenligne resultater for NVIDIA K80, T4 og A100-GPU-er.

Besparelser oppnådd over tre forskjellige NVIDIA-GPU-er.
Inferens, ikke trening, spiser strøm
Artikkelen henviser til flere tidligere studier som viser at, til tross for overskriftene, er det inferens (bruk av en ferdig modell, som en NLP-modell) og ikke trening som trekker mest strøm, og foreslår at når populære modeller blir kommersialisert og kommer inn i hovedstrømmen, kan strømforbruket bli et større problem enn det er i dette mer spede stadiet av NLP-utvikling.
Derfor målte forskerne effekten av inferens på strømforbruket, og fant at pålegg av strøm-begrensninger har en merkbart effekt på inferens-forsinkelse:
‘I sammenligning med 250W, krevde en 100W-innstilling dobbel inferenstid (en 114% økning) og forbrukte 11,0% mindre energi, 150W krevde 22,7% mer tid og sparede 24,2% energi, og 200W krevde 8,2% mer tid med 12,0% mindre energi.’
Vinter-trening
Artikkelen foreslår at trening (om ikke inferens, av åpenbare årsaker) kunne planlegges til tider når datasenteret er på toppen av Power Usage Effectiveness (PUE) – effektivt, det vil si om vinteren, og om natten.
‘Betydelige energibesparelser kan oppnås hvis arbeidsbelastninger kan planlegges til tider når en lavere PUE forventes. For eksempel, å flytte en kortvarig jobb fra dagtid til natt kan gi en omtrent 10% reduksjon, og å flytte en lengre, dyrekostet jobb (for eksempel en språkmodell som tar uker å fullføre) fra sommer til vinter kan se en 33% reduksjon.
‘Selv om det er vanskelig å forutsi besparelsene som en enkelt forsker kan oppnå, understreker informasjonen presentert her viktigheten av miljøfaktorer som påvirker den totale energien som forbrukes av arbeidsbelastningene deres.’
Hold det skyt
Til slutt bemerker artikkelen at hjemmelagde prosesseringsressurser er usannsynlig å ha implementert samme effisiensforbedringer som større datasentre og høy-nivå sky-computere, og at miljømessige fordeler kan oppnås ved å overføre arbeidsbelastninger til steder som har investert tungt i god PUE.
‘Selv om det er en komfort å ha private prosesseringsressurser som er tilgjengelige, kommer denne komforten med en kostnad. Generelt sett er energibesparelse og påvirkning lettere å oppnå på større skala. Datasentre og sky-computingleverandører gjør betydelige investeringer i effisiensen av sine fasiliteter.’
* Pertinente lenker gitt av artikkelen.












