Andersons vinkel
Begränsa den växande energiförbrukningen för maskinlärning

I ljuset av den växande oron över energibehoven för stora maskinlärningsmodeller har en nyligen studie från MIT Lincoln Laboratory och Northeastern University undersökt de besparingar som kan göras genom att begränsa strömförbrukningen för GPU:er som används för modellträning och inferens, samt flera andra tekniker och metoder för att minska AI-energiförbrukningen.
Den nya studien förespråkar också att nya AI-artiklar bör avslutas med en “Energideklaration” (liknande den senaste trenden för “etiska implikationer” i artiklar från maskinlärningsforskningssektorn).
Huvudförslaget från studien är att strömbegränsning (begränsning av tillgänglig ström till den GPU som tränar modellen) erbjuder värdefulla energibesparingar, särskilt för Masked Language Modeling (MLM) och ramverk som BERT och dess derivat.

Tre språkmodellnätverk som körs vid en procentuell andel av standardinställningarna på 250 W (svart linje), i termer av strömförbrukning. Att begränsa strömförbrukningen påverkar inte träningsEffektivitet eller noggrannhet på ett 1-1-sätt, och erbjuder strömbesparingar som är betydande i stor skala. Källa: https://arxiv.org/pdf/2205.09646.pdf
För större modeller, som har fått uppmärksamhet under de senaste åren på grund av hyperskaledata och nya modeller med miljarder eller biljoner parametrar, kan liknande besparingar erhållas som en avvägning mellan tränings tid och energiförbrukning.

Träning av mer imponerande NLP-modeller i stor skala under strömbegränsningar. Den genomsnittliga relativa tiden under en 150 W-gräns visas i blått, och den genomsnittliga relativa energiförbrukningen för 150 W visas i orange.
För dessa större distributioner fann forskarna att en 150 W-gräns för strömförbrukning resulterade i en genomsnittlig minskning av 13,7% i energiförbrukning jämfört med standardvärdet på 250 W, samt en relativt liten ökning av 6,8% i tränings tid.
Forskarna noterar också att, trots rubrikerna som kostnaden för modellträning har fått under de senaste åren, energikostnaderna för att faktiskt använda de tränade modellerna är mycket högre*.
‘För språkmodellering med BERT är energibesparingarna genom strömbegränsning märkbart större när man utför inferens än för träning. Om detta är konsekvent för andra AI-applikationer, kan detta ha betydande konsekvenser för energiförbrukning för storskaliga eller molnbaserade plattformar som servar inferensapplikationer för forskning och industri.’
Ytterligare, och kanske mest kontroversiellt, föreslår artikeln att stor skala maskinlärningsmodellträning bör delegeras till de kallare månaderna på året, och till nattetid, för att spara på kylkostnader.

Överst, PUE-statistik för varje dag i 2020 i författarnas datacenter, med en betydande och varaktig topp/plateau under sommarmånaderna. Under, den genomsnittliga timvariationen i PUE för samma plats under en vecka, med energiförbrukning som ökar mot mitten av dagen, eftersom både den interna GPU-kylhårdvaran och den omgivande datacenterkylningen kämpar för att upprätthålla en fungerande temperatur.
Författarna skriver:
‘Tydligt, tunga NLP-arbetsbelastningar är vanligtvis mycket mindre effektiva under sommaren än de som utförs under vintern. Givet den stora säsongsvariationen, om det finns dyra experiment som kan tidigareläggas till kallare månader, kan detta betydligt minska kolavtrycket.’
Artikeln erkänner också de framväxande energibesparingsmöjligheterna som är möjliga genom beskärning och optimering av modellarkitektur och arbetsflöden – men lämnar vidare utveckling av denna väg till andra initiativ.
Slutligen föreslår författarna att nya vetenskapliga artiklar från maskinlärningssektorn bör uppmuntras, eller kanske tvingas, att avslutas med en deklaration som förklarar energiförbrukningen av det arbete som utfördes i forskningen, och de potentiella energiimplikationerna av att anta initiativ som föreslås i arbetet.

Artikeln, som följer exemplet, förklarar energiimplikationerna av sin egen forskning.
Artikeln heter Great Power, Great Responsibility: Rekommendationer för att minska energi för språkmodellsträning, och kommer från sex forskare på MIT Lincoln och Northeastern.
Maskinlärningens växande energibehov
Medan de beräkningsmässiga kraven för maskinlärningsmodeller har ökat i takt med användbarheten av resultaten, förknippar nuvarande ML-kultur energiförbrukning med förbättrad prestanda – trots vissa noterbara kampanjer, såsom Andrew Ng, som föreslår att datakurering kan vara en viktigare faktor.
I en viktig MIT-samarbete från 2020, uppskattades att en tiofaldig förbättring av modellprestanda medför en 10 000-faldig ökning av beräkningskraven, tillsammans med en motsvarande mängd energi.
Följaktligen har forskning om mindre energikrävande effektiv ML-träning ökat under de senaste åren. Den nya artikeln, som författarna hävdar, är den första som tar en djup titt på effekten av strömbegränsningar på maskinlärningsträning och inferens, med fokus på NLP-ramverk (såsom GPT-serien).
Eftersom kvaliteten på inferensen är en fråga av största vikt, skriver författarna om sina resultat i början:
‘Denna metod påverkar inte förutsägelserna av tränade modeller eller deras prestanda noggrannhet på uppgifter. Det vill säga, om två nätverk med samma struktur, initiala värden och batchade data tränas för samma antal batchar under olika strömbegränsningar, kommer deras resulterande parametrar att vara identiska och endast den energi som krävs för att producera dem kan skilja sig åt.’
Att minska strömförbrukningen för NLP
För att utvärdera effekten av strömbegränsningar på träning och inferens, använde författarna nvidia-smi (System Management Interface) kommandoradsverktyget, tillsammans med ett MLM-bibliotek från HuggingFace.
Författarna tränade NLP-modeller BERT, DistilBERT och Big Bird över MLM, och övervakade deras strömförbrukning under träning och distribution.
Modellerna tränades mot DeepAI:s WikiText-103 dataset för 4 epoker i batchar om åtta, på 16 V100 GPU:er, med fyra olika strömbegränsningar: 100 W, 150 W, 200 W och 250 W (standard, eller baseline, för en NVIDIA V100 GPU). Modellerna hade scratch-tränade parametrar och slumpmässiga init-värden, för att säkerställa jämförbara träningsutvärderingar.
Som visas i den första bilden ovan, visar resultaten goda energibesparingar vid icke-linjära, fördelaktiga ökningar av tränings tid. Författarna skriver:
‘Våra experiment visar att implementering av strömbegränsningar kan signifikant minska energiförbrukningen till priset av tränings tid.’
Att minska ‘Big NLP’
Nästa steg var att tillämpa samma metod på en mer krävande scenario: träning av BERT med MLM på distribuerade konfigurationer över flera GPU:er – en mer typisk användningsfall för välfinansierade och välpublicerade FAANG NLP-modeller.
Huvudskillnaden i detta experiment var att en modell kunde använda allt från 2-400 GPU:er per träningsinstans. Samma begränsningar för strömförbrukning tillämpades, och samma uppgift användes (WikiText-103). Se den andra bilden ovan för grafer över resultaten.
Artikeln skriver:
‘Genomsnittligt över varje val av konfiguration, ledde en 150 W-gräns för strömförbrukning till en genomsnittlig minskning av 13,7% i energiförbrukning och 6,8% ökning i tränings tid jämfört med standardvärdet. [Den] 100 W-inställningen har betydligt längre tränings tider (31,4% längre i genomsnitt). En 200 W-gräns motsvarar nästan samma tränings tid som en 250 W-gräns, men mer blygsamma energibesparingar än en 150 W-gräns.’
Författarna föreslår att dessa resultat stöder strömbegränsning vid 150 W för GPU-arkitekturer och de applikationer som körs på dem. De noterar också att energibesparingarna som erhålls översätter över hårdvaruplattformar, och körde testerna igen för att jämföra resultaten för NVIDIA K80, T4 och A100 GPU:er.

Besparingar erhållna över tre olika NVIDIA GPU:er.
Inferens, inte träning, slukar ström
Artikeln citerar flera tidigare studier som visar att, trots rubrikerna, det är inferens (användning av en färdig modell, såsom en NLP-modell) och inte träning som drar den största mängden ström, vilket tyder på att när populära modeller kommersialiseras och blir mainstream, kan strömförbrukningen bli ett större problem än det är i detta tidiga skede av NLP-utveckling.
Därför mätte forskarna effekten av inferens på strömförbrukning, och fann att införandet av strömbegränsningar har en märkbar effekt på inferensfördröjning:
‘Jämfört med 250 W, krävde en 100 W-inställning dubbelt så lång inferenstid (en ökning med 114%) och förbrukade 11,0% mindre energi, 150 W krävde 22,7% mer tid och sparade 24,2% energi, och 200 W krävde 8,2% mer tid med 12,0% mindre energi.’
Vinterträning
Artikeln föreslår att träning (om inte inferens, av uppenbara skäl) kunde schemaläggas vid tidpunkter när datacentret är på toppen av sin effektivitet (PUE) – effektivt, det är under vintern, och på natten.
‘Betydande energibesparingar kan erhållas om arbetsbelastningar kan schemaläggas vid tidpunkter när en lägre PUE förväntas. Till exempel, att flytta ett kortvarigt jobb från dagtid till natt kan ge en ungefär 10% minskning, och att flytta ett längre, dyrt jobb (t.ex. en språkmodell som tar veckor att slutföra) från sommar till vinter kan se en 33% minskning.
‘Medan det är svårt att förutsäga de besparingar som en enskild forskare kan uppnå, belyser den information som presenteras här vikten av miljöfaktorer som påverkar den totala energi som förbrukas av deras arbetsbelastningar.’
Håll det molnigt
Slutligen observerar artikeln att hemmagjorda bearbetningsresurser sannolikt inte har implementerat samma effektivitetsåtgärder som stora datacenter och högnivå molnberäkningsaktörer, och att miljöfördelar kan vinnas genom att överföra arbetsbelastningar till platser som har investerat kraftigt i god PUE.
‘Medan det finns en bekvämlighet i att ha privata beräkningsresurser som är tillgängliga, kommer denna bekvämlighet at en kostnad. Generellt sett är energibesparingar och påverkan lättare att uppnå i större skala. Datacenter och molnberäkningsleverantörer investerar betydande resurser i effektiviteten hos sina anläggningar.’
* Pertinenta länkar som ges av artikeln.












