Andersons vinkel

Indsætning af maskinlærings energibehov

mm
Føj Unite.AI til dine foretrukne kilder på Google

I lyset af den voksende bekymring omkring energikraven til store maskinlæringsmodeller, har en ny studie fra MIT Lincoln Laboratory og Northeastern University undersøgt besparelserne, der kan opnås ved at begrænse strømforsyningen til GPU’er, der anvendes i modeltræning og inferens, samt flere andre teknikker og metoder til at reducere AI-energiforbrug.

Den nye studie opfordrer også til, at nye AI-artikler skal afsluttes med en ‘Energi-erklæring’ (ligesom den seneste trend for ‘etiske implikationer’ i artikler fra maskinlæringsforskningssektoren).

Hovedforslaget fra studiet er, at begrænsning af strømforsyningen (begrænsning af den tilgængelige strøm til GPU’en, der træner modellen) tilbyder værdifulde energibesparelser, især for Masked Language Modeling (MLM) og rammer som BERT og dets afledte.

Tre sprogmodelleringssystemer, der kører med en procentdel af de standard 250W-indstillinger (sort linje), i forhold til strømforbrug. At begrænse strømforbruget indebærer ikke en begrænsning af træningseffektiviteten eller nøjagtigheden på en 1-1 basis, og tilbyder strømsparelser, der er bemærkelsesværdige på større skala. Kilde: https://arxiv.org/pdf/2205.09646.pdf

Tre sprogmodelleringssystemer, der kører med en procentdel af de standard 250W-indstillinger (sort linje), i forhold til strømforbrug. At begrænse strømforbruget indebærer ikke en begrænsning af træningseffektiviteten eller nøjagtigheden på en 1-1 basis, og tilbyder strømsparelser, der er bemærkelsesværdige på større skala. Kilde: https://arxiv.org/pdf/2205.09646.pdf

For større modeller, der har tiltrukket opmærksomhed i de seneste år på grund af hyperskala-datasets og nye modeller med milliarder eller billioner af parametre, kan lignende besparelser opnås som et kompromis mellem træningstid og energiforbrug.

Træning af mere imponerende NLP-modeller i større skala under strømbegrænsninger. Den gennemsnitlige relative tid under en 150W-begrænsning er vist i blåt, og den gennemsnitlige relative energiforbrug for 150W er vist i orange.

Træning af mere imponerende NLP-modeller i større skala under strømbegrænsninger. Den gennemsnitlige relative tid under en 150W-begrænsning er vist i blåt, og den gennemsnitlige relative energiforbrug for 150W er vist i orange.

For disse større udrulninger fandt forskerne, at en 150W-grænse for strømforbrug resulterede i en gennemsnitlig 13,7% reduktion i energiforbrug sammenlignet med den standard 250W-maksimum, samt en relativt lille 6,8% øgning i træningstid.

Forskerne bemærker også, at selv om overskrifterne om, at omkostningerne ved modeltræning har været på vej op i de seneste år, er energiomkostningerne ved at anvende de trænede modeller langt højere*.

‘For sprogmodellering med BERT, er energibesparelserne gennem strømbegrænsning bemærkelsesværdigt større, når der udføres inferens end under træning. Hvis dette er konsistent for andre AI-anvendelser, kan dette have betydelige konsekvenser for energiforbrug i større eller cloud-baserede platforme, der serverer inferensanvendelser for forskning og industri.’

Yderligere og måske mest kontroversielt foreslår artiklen, at større træning af maskinlæringsmodeller burde overdrages til de koldere måneder og til nat, for at spare på kølingsomkostninger.

Ovenfor, PUE-statistik for hver dag i 2020 i forfatternes datacenter, med en bemærkelsesværdig og vedvarende stigning/plateau i sommermånederne. Nedenfor, den gennemsnitlige timelige variation i PUE for samme sted i løbet af en uge, med energiforbrug, der stiger mod midten af dagen, da både den interne GPU-kølehardware og den omgivende datacenter-køling kæmper for at opretholde en brugbar temperatur.

Ovenfor, PUE-statistik for hver dag i 2020 i forfatternes datacenter, med en bemærkelsesværdig og vedvarende stigning/plateau i sommermånederne. Nedenfor, den gennemsnitlige timelige variation i PUE for samme sted i løbet af en uge, med energiforbrug, der stiger mod midten af dagen, da både den interne GPU-kølehardware og den omgivende datacenter-køling kæmper for at opretholde en brugbar temperatur.

Forfatterne skriver:

‘Det er tydeligt, at tungt NLP-arbejde er typisk meget mindre effektivt om sommeren end under vinteren. Givet den store sæsonbestemte variation, hvis der er computermæssigt dyre eksperimenter, der kan tidsfæstes til de koldere måneder, kan dette betydeligt reducere kulstofaftrykket.’

Artiklen anerkender også de opblomstrende energibesparelsesmuligheder, der er mulige gennem beskæring og optimering af modelarkitektur og arbejdsgange – selv om forfatterne overlader yderligere udvikling af denne vej til andre initiativer.

Til sidst foreslår forfatterne, at nye videnskabelige artikler fra maskinlæringssektoren burde opmuntres eller måske begrænses til at afslutte med en erklæring, der angiver energiforbrug af det arbejde, der er udført i forskningen, og de potentielle energikonsekvenser af at iværksætte initiativer, der er foreslået i artiklen.

Artiklen, der følger sit eget eksempel, forklarer energikonsekvenserne af sin egen forskning.

Artiklen, der følger sit eget eksempel, forklarer energikonsekvenserne af sin egen forskning.

Den artikel hedder Great Power, Great Responsibility: Anbefalinger for reduktion af energi til træning af sprogmodeller, og kommer fra seks forskere på tværs af MIT Lincoln og Northeastern.

Maskinlærings energibehov

Da de computermæssige krav til maskinlæringsmodeller er øget i takt med, at resultaterne er blevet bedre – selv om nogle bemærkelsesværdige kampagner, såsom Andrew Ng, foreslår, at datakurering kan være en vigtigere faktor.

I en vigtig MIT-samarbejde fra 2020, blev det estimeret, at en ti-dobling af modelpræstationen medfører en 10.000-dobling af de computermæssige krav, samt en tilsvarende mængde energi.

Følgelig er forskningen i mindre energikrævende effektiv maskinlærningstræning øget over de seneste år. Den nye artikel, som forfatterne hævder, er den første til at tage et dybt kig på effekten af strømbegrænsninger på maskinlærings-træning og inferens, med fokus på NLP-rammer (såsom GPT-serien).

Da kvaliteten af inferens er en overordnet bekymring, skriver forfatterne om deres fund i indledningen:

‘Denne metode påvirker ikke forudsigelserne af trænede modeller eller deres præstationsnøjagtighed på opgaver. Det vil sige, at hvis to netværk med samme struktur, initialværdier og batchede data trænes for samme antal batch under forskellige strømbegrænsninger, vil deres resulterende parametre være identiske, og kun den energi, der kræves for at producere dem, kan være forskellig.’

Reduktion af strømforbrug til NLP

For at vurdere effekten af strømbegrænsninger på træning og inferens, anvendte forfatterne nvidia-smi (System Management Interface) kommandolinjeværktøj sammen med en MLM-bibliotek fra HuggingFace.

Forfatterne trænede NLP-modeller BERT, DistilBERT og Big Bird over MLM, og overvågede deres strømforbrug under træning og udrulning.

Modellerne blev trænet mod DeepAI’s WikiText-103-dataset i 4 epocher i batch af otte, på 16 V100-GPU’er, med fire forskellige strømbegrænsninger: 100W, 150W, 200W og 250W (standard eller baseline for en NVIDIA V100-GPU). Modellerne havde scratch-trænede parametre og tilfældige init-værdier, for at sikre sammenlignelige træningsvurderinger.

Som vist i det første billede ovenfor, viser resultaterne gode energibesparelser ved ikke-lineære, gunstige øgninger i træningstid. Forfatterne skriver:

‘Vore eksperimenter viser, at implementering af strømbegrænsninger kan reducere energiforbrug betydeligt, på bekostning af træningstid.’

Optimering af ‘Big NLP’

Herefter anvendte forfatterne samme metode på en mere krævende scenario: træning af BERT med MLM på distribuerede konfigurationer på flere GPU’er – en mere typisk brugsanvendelse for velkendte og velkendte FAANG NLP-modeller.

Hovedforskellen i dette eksperiment var, at en model kunne anvende mellem 2-400 GPU’er per træningseksemplar. Samme begrænsninger for strømforbrug blev anvendt, og samme opgave blev anvendt (WikiText-103). Se andet billede ovenfor for grafer over resultaterne.

Artiklen skriver:

‘I gennemsnit over hver valg af konfiguration, førte en 150W-grænse for strømforbrug til en gennemsnitlig 13,7% reduktion i energiforbrug og 6,8% øgning i træningstid sammenlignet med den standardmæssige maksimum. [Den] 100W-indstilling har betydeligt længere træningstider (31,4% længere i gennemsnit). En 200W-grænse svarer til næsten samme træningstid som en 250W-grænse, men med mere beskedne energibesparelser end en 150W-grænse.’

Forfatterne foreslår, at disse resultater støtter strømbegrænsning på 150W for GPU-arkitekturer og de anvendelser, der kører på dem. De bemærker også, at energibesparelserne, der opnås, kan oversættes til andre hardware-platforme, og kørte testene igen for at sammenligne resultaterne for NVIDIA K80, T4 og A100-GPU’er.

Sparelser opnået på tværs af tre forskellige NVIDIA-GPU'er.

Sparelser opnået på tværs af tre forskellige NVIDIA-GPU’er.

Inferens, ikke træning, forbruger strøm

Artiklen citerer flere tidligere studier, der viser, at det, trods overskrifterne, er inferens (anvendelsen af en færdig model, såsom en NLP-model) og ikke træning, der forbruger den største mængde strøm, hvilket antyder, at strømforbrug kan blive et større problem, end det er i øjeblikket, på dette mere udviklede stadium af NLP-udvikling.

Derfor målte forskerne effekten af inferens på strømforbrug og fandt, at pålægning af strømbegrænsninger havde en bemærkelsesværdig effekt på inferens-forsinkelse:

‘I sammenligning med 250W, krævede en 100W-indstilling dobbelt så lang inferenstid (en 114% øgning) og forbrugte 11,0% mindre energi, 150W krævede 22,7% mere tid og sparede 24,2% energi, og 200W krævede 8,2% mere tid med 12,0% mindre energi.’

Vintertræning

Artiklen foreslår, at træning (hvis ikke inferens, af åbenlyse årsager) kunne planlægges til tidspunkter, hvor datacenteret er på toppen af Power Usage Effectiveness (PUE) – effektivt, det er om vinteren og om natten.

‘Betydelige energibesparelser kan opnås, hvis arbejdsbyrden kan planlægges til tidspunkter, hvor en lavere PUE forventes. For eksempel kan flytning af en kortvarig opgave fra dagtid til nat kan give en omtrent 10% reduktion, og flytning af en længere, dyre opgave (f.eks. en sprogmodel, der tager uger at fuldføre) fra sommer til vinter kan se en 33% reduktion. ‘

‘Selv om det er svært at forudsige, hvilke besparelser en enkelt forsker kan opnå, understreger informationen her vigtigheden af miljøfaktorer, der påvirker det samlede energiforbrug af deres arbejdsbyrde.’

Hold det skyet

Til sidst bemærker artiklen, at hjemmeudviklede behandlingsressourcer er usandsynlige at have implementeret samme efficiensforanstaltninger som store datacentre og højt niveau cloud-computere, og at miljømæssige fordele kan opnås ved at overføre arbejdsbyrden til steder, der har investeret kraftigt i god PUE.

‘Selv om der er en bekvemmelighed ved at have private beregningsressourcer, der er tilgængelige, kommer denne bekvemmelighed til en pris. Generelt set er energibesparelser og påvirkning lettere at opnå på større skala. Datacentre og cloud-computingleverandører investerer betydeligt i efficiensen af deres faciliteter.’

 

* Pertinent links givet af artiklen.

Forfatter til maskinlæringsartikler, domæneekspert i menneskesynssyntese. Tidligere leder af forskningsindhold på Metaphysic.ai, indtil opløsningen i DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Kontakt: martin@martinanderson.ai