Unghiul lui Anderson
ÃnfrÃĒnarea necesarului tot mai mare de energie al ÃŪnvÄČÄrii automate

Ãn lumina preocupÄrilor crescÃĒnde cu privire la cerinČele de energie ale modelelor mari de ÃŪnvÄČare automatÄ, o studiu recent de la MIT Lincoln Laboratory Či Universitatea Northeastern a investigat economiile care pot fi realizate prin limitarea puterii GPU-urilor utilizate ÃŪn antrenarea Či inferenČa modelului, precum Či prin alte tehnici Či metode de reducere a consumului de energie AI.
Noua lucrare solicitÄ, de asemenea, ca noile lucrÄri ČtiinČifice din domeniul ÃŪnvÄČÄrii automate sÄ se ÃŪncheie cu o âDeclaraČie de energieâ (similarÄ cu tendinČa recentÄ de âdeclaraČii de implicaČii eticeâ ÃŪn lucrÄrile de cercetare din sectorul ÃŪnvÄČÄrii automate).
Principala sugestie a lucrÄrii este cÄ limitarea puterii (limitarea puterii disponibile pentru GPU-ul care antreneazÄ modelul) oferÄ avantaje semnificative de economisire a energiei, ÃŪn special pentru modelarea limbajului mascat (MLM) Či cadre precum BERT Či derivatele sale.

Trei reČele de modelare a limbajului care funcČioneazÄ la un procent din setÄrile implicite de 250W (linie neagrÄ), ÃŪn ceea ce priveČte consumul de energie. Limitarea consumului de energie nu afecteazÄ eficienČa antrenÄrii sau precizia pe o bazÄ 1-la-1 Či oferÄ economii de energie notabile la scarÄ largÄ. SursÄ: https://arxiv.org/pdf/2205.09646.pdf
Pentru modele mai mari, care au atras atenČia ÃŪn ultimii ani datoritÄ seturilor de date hiperscalabile Či a noilor modele cu miliarde sau trilioane de parametri, se pot obČine economii similare ca urmare a unui compromis ÃŪntre timpul de antrenare Či consumul de energie.

Antrenarea unor modele NLP mai puternice la scarÄ, sub constrÃĒngeri de putere. Timpul mediu relativ sub o limitÄ de 150W este afiČat ÃŪn albastru, iar consumul mediu de energie relativ pentru 150W este afiČat ÃŪn portocaliu.
Pentru aceste implementÄri la scarÄ mai mare, cercetÄtorii au constatat cÄ o limitÄ de 150W pentru utilizarea puterii a obČinut o scÄdere medie de 13,7% a consumului de energie, comparativ cu limita maximÄ implicitÄ de 250W, precum Či o creČtere relativ micÄ de 6,8% a timpului de antrenare.
Ãn plus, cercetÄtorii noteazÄ cÄ, ÃŪn ciuda titlurilor care au apÄrut ÃŪn ultimii ani cu privire la costul antrenÄrii modelului, costurile energetice ale utilizÄrii efective a modelelor antrenate sunt mult mai mari*.
âPentru modelarea limbajului cu BERT, cÃĒČtigurile de energie prin limitarea puterii sunt mult mai mari atunci cÃĒnd se efectueazÄ inferenČÄ decÃĒt atunci cÃĒnd se efectueazÄ antrenarea. DacÄ acest lucru este valabil Či pentru alte aplicaČii AI, acesta ar putea avea implicaČii semnificative ÃŪn ceea ce priveČte consumul de energie pentru platformele de calcul la scarÄ largÄ sau cloud care servesc aplicaČii de inferenČÄ pentru cercetare Či industrie.â
Mai mult, Či poate cel mai controversat, articolul sugereazÄ cÄ antrenarea principalÄ a modelelor de ÃŪnvÄČare automatÄ ar trebui sÄ fie delegatÄ lunilor mai reci ale anului Či nopČii, pentru a economisi costurile de rÄcire.

Mai sus, statistici PUE pentru fiecare zi a anului 2020 ÃŪn centrul de date al autorilor, cu un vÃĒrf/platou notabil Či susČinut ÃŪn lunile de varÄ. Mai jos, variaČia medie orarÄ a PUE pentru aceeaČi locaČie ÃŪn cursul unei sÄptÄmÃĒni, cu consumul de energie crescÃĒnd spre mijlocul zilei, pe mÄsurÄ ce atÃĒt hardware-ul de rÄcire intern al GPU-ului, cÃĒt Či rÄcirea ambientalÄ a centrului de date se luptÄ sÄ menČinÄ o temperaturÄ de lucru.
Autorii afirmÄ:
âEvident, sarcinile grele de NLP sunt de obicei mult mai puČin eficiente ÃŪn timpul verii decÃĒt cele executate ÃŪn timpul iernii. AvÃĒnd ÃŪn vedere variaČia sezonierÄ mare, dacÄ existÄ experimente computaČional scumpe care pot fi programate pentru lunile mai reci, acest lucru poate reduce semnificativ amprenta de carbon.â
Articolul recunoaČte, de asemenea, posibilitÄČile emergente de economisire a energiei care pot fi realizate prin ÃŪmbunÄtÄČirea arhitecturii modelului Či a fluxurilor de lucru â deČi autorii lasÄ dezvoltarea ulterioarÄ a acestei direcČii pentru alte iniČiative.
Ãn cele din urmÄ, autorii sugereazÄ cÄ noile lucrÄri ČtiinČifice din sectorul ÃŪnvÄČÄrii automate ar trebui sÄ fie ÃŪncurajate, sau poate constrÃĒnse, sÄ se ÃŪncheie cu o declaraČie care declarÄ consumul de energie al lucrÄrii efectuate ÃŪn cercetare Či implicaČiile potenČiale de energie ale adoptÄrii iniČiativelor sugerate ÃŪn lucrare.

Articolul, dÃĒnd un exemplu, explicÄ implicaČiile de energie ale propriei cercetÄri.
Articolul articolul se intituleazÄ Putere mare, responsabilitate mare: RecomandÄri pentru reducerea energiei pentru antrenarea modelelor de limbaj Či provine de la Čase cercetÄtori de la MIT Lincoln Či Northeastern.
ÃnvÄČarea automatÄ Či necesarul tot mai mare de energie
Pe mÄsurÄ ce cerinČele computaČionale pentru modelele de ÃŪnvÄČare automatÄ au crescut odatÄ cu utilitatea rezultatelor, cultura actualÄ ML echivaleazÄ cheltuielile de energie cu performanČa ÃŪmbunÄtÄČitÄ â ÃŪn ciuda unor campanii notabile, precum Andrew Ng, care sugereazÄ cÄ curÄČarea datelor poate fi un factor mai important.
Ãntr-o lucrare cheie de colaborare MIT din 2020, s-a estimat cÄ o ÃŪmbunÄtÄČire de zece ori a performanČei modelului implicÄ o creČtere de 10.000 de ori a cerinČelor computaČionale, ÃŪmpreunÄ cu o cantitate corespunzÄtoare de energie.
Ãn consecinČÄ, cercetarea ÃŪn domeniul antrenÄrii mai puČin intensive Či eficiente a ÃŪnvÄČÄrii automate a crescut ÃŪn ultimii ani. Noua lucrare, afirmÄ autorii, este prima care examineazÄ ÃŪn profunzime efectul limitÄrii puterii asupra antrenÄrii Či inferenČei ÃŪnvÄČÄrii automate, cu accent pe cadrele NLP (precum seria GPT).
Deoarece calitatea inferenČei este o preocupare principalÄ, autorii afirmÄ despre descoperirile lor la ÃŪnceput:
â[AceastÄ] metodÄ nu afecteazÄ predicČiile modelelor antrenate sau, ÃŪn consecinČÄ, precizia lor pe sarcini. AdicÄ, dacÄ douÄ reČele cu aceeaČi structurÄ, valori iniČiale Či date batchate sunt antrenate pentru acelaČi numÄr de batch-uri sub limitÄri de putere diferite, parametrii lor rezultaČi vor fi identici Či numai energia necesarÄ pentru a-i produce poate fi diferitÄ.â
Reducerea puterii pentru NLP
Pentru a evalua impactul limitÄrii puterii asupra antrenÄrii Či inferenČei, autorii au utilizat utilitarul de linie de comandÄ nvidia-smi (InterfaČÄ de management a sistemului) ÃŪmpreunÄ cu o bibliotecÄ MLM de la HuggingFace.
Autorii au antrenat modele de procesare a limbajului natural BERT, DistilBERT Či Big Bird pe MLM Či au monitorizat consumul lor de energie ÃŪn timpul antrenÄrii Či implementÄrii.
Modelele au fost antrenate pe setul de date WikiText-103 de la DeepAI pentru 4 epoci ÃŪn batch-uri de opt, pe 16 GPU-uri V100, cu patru limitÄri de putere diferite: 100W, 150W, 200W Či 250W (implicit sau bazÄ pentru un GPU NVIDIA V100). Modelele au avut parametri antrenaČi de la zero Či valori iniČiale aleatoare, pentru a asigura evaluÄri de antrenare comparabile.
AČa cum se vede ÃŪn prima imagine de mai sus, rezultatele demonstreazÄ economii de energie bune la creČteri nefavorabile ÃŪn timpul antrenÄrii. Autorii afirmÄ:
âExperimentele noastre indicÄ faptul cÄ implementarea limitÄrilor de putere poate reduce semnificativ consumul de energie, la costul timpului de antrenare.â
Reducerea âBig NLPâ
UrmÄtorul pas al autorilor a fost sÄ aplice aceeaČi metodÄ unei situaČii mai solicitante: antrenarea BERT cu MLM pe configuraČii distribuite pe multiple GPU-uri â un caz de utilizare mai tipic pentru modelele NLP FAANG bine finanČate Či publicizate.
Principala diferenČÄ ÃŪn acest experiment a fost cÄ un model ar putea utiliza ÃŪntre 2-400 de GPU-uri pe instanČÄ de antrenare. AceleaČi constrÃĒngeri de utilizare a puterii au fost aplicate, iar aceeaČi sarcinÄ a fost utilizatÄ (WikiText-103). Vezi a doua imagine de mai sus pentru graficele rezultatelor.
Articolul afirmÄ:
âMediind pe fiecare alegere de configuraČie, o limitÄ de 150W pentru utilizarea puterii a condus la o scÄdere medie de 13,7% a consumului de energie Či o creČtere de 6,8% a timpului de antrenare, comparativ cu limita maximÄ implicitÄ. Setarea la 100W are timpi de antrenare semnificativ mai lungi (31,4% mai lungi ÃŪn medie). O limitÄ de 200W corespunde cu aproximativ acelaČi timp de antrenare ca Či limita de 250W, dar cu economii de energie mai modeste decÃĒt limita de 150W.â
Autorii sugereazÄ cÄ aceste rezultate susČin limitarea puterii la 150W pentru arhitecturile GPU Či aplicaČiile care ruleazÄ pe ele. Ei noteazÄ, de asemenea, cÄ economiile de energie obČinute se traduc pe platforme de hardware, Či au rulat testele din nou pentru a compara rezultatele pentru GPU-urile NVIDIA K80, T4 Či A100.

Economii obČinute pe trei GPU-uri NVIDIA diferite.
InferenČa, nu antrenarea, consumÄ putere
Articolul citeazÄ mai multe studii anterioare care demonstreazÄ cÄ, ÃŪn ciuda titlurilor, inferenČa (utilizarea unui model terminat, cum ar fi un model NLP) Či nu antrenarea consumÄ cea mai mare cantitate de putere, sugerÃĒnd cÄ, pe mÄsurÄ ce modelele populare sunt comercializate Či intrÄ ÃŪn mainstream, consumul de putere ar putea deveni o problemÄ mai mare decÃĒt este ÃŪn prezent ÃŪn aceastÄ etapÄ incipientÄ a dezvoltÄrii NLP.
Astfel, cercetÄtorii au mÄsurat impactul inferenČei asupra consumului de putere, constatÃĒnd cÄ impunerea limitÄrilor de putere are un efect semnificativ asupra latenČei inferenČei:
âComparativ cu 250W, o setare de 100W a necesitat dublu timpul de inferenČÄ (o creČtere de 114%) Či a consumat 11,0% mai puČinÄ energie, 150W a necesitat 22,7% mai mult timp Či a economisit 24,2% din energie, iar 200W a necesitat 8,2% mai mult timp, cu 12,0% mai puČinÄ energie.â
Antrenarea de iarnÄ
Articolul sugereazÄ cÄ antrenarea (dacÄ nu Či inferenČa, din motive evidente) ar putea fi programatÄ la orele ÃŪn care centrul de date este la eficienČÄ maximÄ a utilizÄrii puterii (PUE) â adicÄ, ÃŪn timpul iernii Či noaptea.
âEconomii semnificative de energie pot fi obČinute dacÄ sarcinile de lucru pot fi programate la ore ÃŪn care se aČteaptÄ un PUE mai mic. De exemplu, mutarea unui job care ruleazÄ pe termen scurt de la zi la noapte poate oferi o reducere de aproximativ 10%, iar mutarea unui job mai lung Či mai scump (de exemplu, un model de limbaj care dureazÄ sÄptÄmÃĒni pentru a fi finalizat) de la varÄ la iarnÄ poate duce la o reducere de 33%. â
âDeČi este dificil de prezis economiile pe care un cercetÄtor individual le poate obČine, informaČiile prezentate aici subliniazÄ importanČa factorilor de mediu care afecteazÄ energia totalÄ consumatÄ de sarcinile lor de lucru.â
PÄstraČi-vÄ noros
Ãn cele din urmÄ, articolul observÄ cÄ resursele de procesare create ÃŪn casÄ sunt puČin probabil sÄ fi implementat aceleaČi mÄsuri de eficienČÄ ca Či centrele de date majore Či jucÄtorii de calcul cloud de nivel ÃŪnalt, Či cÄ beneficiile de mediu ar putea fi obČinute prin transferarea sarcinilor de lucru ÃŪn locaČii care au investit masiv ÃŪn eficienČa facilitÄČilor lor.
âDeČi existÄ o convenienČÄ ÃŪn a avea resurse de calcul private care sunt accesibile, aceastÄ convenienČÄ vine la un cost. Ãn general, economiile de energie Či impactul sunt mai uČor de obČinut la scarÄ mai mare. Centrele de date Či furnizorii de calcul cloud fac investiČii semnificative ÃŪn eficienČa facilitÄČilor lor.â
Â
* LegÄturi pertinente oferite de articol.












