Andersonův úhel

Omezení rostoucích energetických potřeb strojového učení

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vzhledem k rostoucím obavám o energetické nároky velkých modelů strojového učení provedla recentní studie z MIT Lincoln Laboratory a Northeastern University výzkum úspor, které lze dosáhnout omezením spotřeby energie u GPU při trénování a inferenci modelů, jakož i dalších technik a metod snižování spotřeby energie pro umělou inteligenci.

Nová práce také vyzývá k tomu, aby nové vědecké články z oblasti strojového učení byly uzavřeny prohlášením o spotřebě energie, podobně jako je tomu u prohlášení o etických implikacích ve výzkumu.

Hlavní návrh studie je, že omezení spotřeby energie (limitování dostupné energie pro GPU, které trénuje model) nabízí významné úspory energie, zejména pro Masked Language Modeling (MLM) a frameworky jako BERT a jeho deriváty.

Tři jazykové modely pracující na procentu výchozích 250W nastavení (černá linie), z hlediska spotřeby energie. Omezení spotřeby energie neomezuje efektivitu ani přesnost trénování v přímém poměru a nabízí úspory energie, které jsou významné ve velkém měřítku. Zdroj: https://arxiv.org/pdf/2205.09646.pdf

Tři jazykové modely pracující na procentu výchozích 250W nastavení (černá linie), z hlediska spotřeby energie. Omezení spotřeby energie neomezuje efektivitu ani přesnost trénování v přímém poměru a nabízí úspory energie, které jsou významné ve velkém měřítku. Zdroj: https://arxiv.org/pdf/2205.09646.pdf

Pro větší modely, které v posledních letech získaly pozornost díky hyperscalovým datovým sadám a novým modelům s miliardami nebo biliony parametrů, lze podobné úspory dosáhnout jako kompromis mezi trénovací dobou a spotřebou energie.

Trénování větších NLP modelů ve velkém měřítku pod omezením spotřeby energie. Průměrná relativní doba pod 150W limitem je znázorněna modrou barvou a průměrná relativní spotřeba energie pro 150W je oranžová.

Trénování větších NLP modelů ve velkém měřítku pod omezením spotřeby energie. Průměrná relativní doba pod 150W limitem je znázorněna modrou barvou a průměrná relativní spotřeba energie pro 150W je oranžová.

Pro tyto nasazení ve větším měřítku autoři zjistili, že 150W limit spotřeby energie vedl k průměrnému snížení spotřeby energie o 13,7 % ve srovnání s výchozím 250W maximem, stejně jako k relativně malému zvýšení trénovací doby o 6,8 %.

Kromě toho autoři poznamenávají, že navzdory titulkům, které naznačují, že náklady na trénování modelů jsou na vzestupu, jsou skutečné energetické náklady na použití trénovaných modelů mnohem vyšší*.

‘Pro jazykové modelování s BERT jsou energetické úspory prostřednictvím omezení spotřeby energie znatelně větší při inferenci než při trénování. Pokud je to konzistentní pro další aplikace AI, může to mít významné důsledky pro spotřebu energie ve velkém měřítku nebo cloudovém výpočtu.’

Další a možná nejkontroverznější návrh studie je, že hlavní trénování modelů strojového učení by mělo být omezeno na chladnější měsíce roku a na noci, aby se ušetřila energie na chlazení.

Nahoře, statistika PUE pro každý den roku 2020 v datovém centru autorů, se znatelným a udržitelným nárůstem v letních měsících. Dole, průměrná hodinová variace PUE pro stejné místo v průběhu týdne, se spotřebou energie rostoucí směrem ke středu dne, protože jak vnitřní chladicí hardware GPU, tak okolní chlazení datového centra bojují o udržení pracovní teploty.

Nahoře, statistika PUE pro každý den roku 2020 v datovém centru autorů, se znatelným a udržitelným nárůstem v letních měsících. Dole, průměrná hodinová variace PUE pro stejné místo v průběhu týdne, se spotřebou energie rostoucí směrem ke středu dne, protože jak vnitřní chladicí hardware GPU, tak okolní chlazení datového centra bojují o udržení pracovní teploty.

Autoři uvádějí:

‘Zjevně jsou velké NLP úkoly typicky mnohem méně efektivní v létě než ty, které jsou provedeny během zimy. Vzhledem k velké sezónní variaci, pokud existují výpočetně náročné experimenty, které lze naplánovat na chladnější měsíce, toto naplánování může významně snížit uhlíkovou stopu.’

Studie také uznává vznikající energetické úspory, které jsou možné prostřednictvím prořezávání a optimalizace architektury modelů a pracovních postupů – ačkoli autoři ponechávají další rozvoj této oblasti jiným iniciativám.

Nakonec autoři navrhují, aby nové vědecké články z oblasti strojového učení byly uzavřeny prohlášením o spotřebě energie a potenciálních energetických implikacích přijatých iniciativ.

Studie, která dává příklad, vysvětluje energetické implikace vlastního výzkumu.

Studie, která dává příklad, vysvětluje energetické implikace vlastního výzkumu.

Studie s názvem Velká síla, velká zodpovědnost: Doporučení pro snížení spotřeby energie pro trénování jazykových modelů pochází od šesti výzkumníků z MIT Lincoln a Northeastern.

Strojové učení a jeho rostoucí nároky na energii

Jak se výpočetní nároky pro modely strojového učení zvyšují spolu s užitečností výsledků, současná kultura strojového učení spojuje spotřebu energie s lepšími výsledky – navzdory některým významným kampaním, jako je ta Andrewa Nga, který navrhuje, že kurace dat může být důležitějším faktorem.

V jedné klíčové spolupráci z roku 2020 bylo odhadnuto, že desetinásobné zlepšení výkonu modelu vyžaduje 10 000násobné zvýšení výpočetních požadavků a odpovídající množství energie.

V důsledku toho se výzkum méně energeticky náročného efektivního trénování strojového učení zvýšil v posledních letech. Nová studie, podle autorů, je první, která se podrobně zabývá účinkem omezení spotřeby energie na trénování a inferenci strojového učení, se zaměřením na frameworky NLP (jako série GPT).

Jelikož kvalita inferenze je zásadním problémem, autoři uvádějí na začátku:

‘Tato metoda neovlivňuje předpovědi trénovaných modelů nebo jejich přesnost na úkolech. To znamená, že pokud jsou dvě sítě se stejnou strukturou, počátečními hodnotami a dávkovanými daty trénovány po stejnou dobu v různých omezeních spotřeby energie, jejich výsledné parametry budou identické a bude se lišit pouze energie potřebná k jejich produkci.’

Snižování spotřeby energie pro NLP

Aby autoři vyhodnotili dopad omezení spotřeby energie na trénování a inferenci, použili nástroj nvidia-smi (System Management Interface) a knihovnu MLM od HuggingFace.

Autoři trénovali modely NLP BERT, DistilBERT a Big Bird nad MLM a monitorovali jejich spotřebu energie během trénování a nasazení.

Modely byly trénovány proti datové sadě WikiText-103 po dobu 4 epoch v dávkách po osmi, na 16 GPU V100, se čtyřmi různými omezeními spotřeby energie: 100W, 150W, 200W a 250W (výchozí, nebo základní, pro GPU NVIDIA V100). Modely měly parametry trénované od začátku a náhodné počáteční hodnoty, aby zajistily srovnatelné hodnocení trénování.

Jak je vidět na první obrázku výše, výsledky ukazují dobré úspory energie při nerovnoměrném, výhodném zvýšení trénovací doby. Autoři uvádějí:

‘Naše experimenty ukazují, že implementace omezení spotřeby energie může významně snížit spotřebu energie za cenu trénovací doby.’

Snížení velikosti “velkého NLP”

Další autoři aplikovali stejnou metodu na náročnější scénář: trénování BERT s MLM na distribuovaných konfiguracích napříč několika GPU – typický případ pro dobře financované a veřejně známé modely NLP.

Hlavní rozdíl v tomto experimentu spočívá v tom, že model může použít libovolný počet GPU od 2 do 400 pro každé trénovací období. Stejné omezení spotřeby energie bylo aplikováno a stejný úkol byl použit (WikiText-103). Viz druhý obrázek výše pro grafy výsledků.

Studie uvádí:

‘Průměrně přes každou volbu konfigurace vedl 150W limit spotřeby energie k průměrnému snížení spotřeby energie o 13,7 % a zvýšení trénovací doby o 6,8 % ve srovnání s výchozím maximem. Nastavení 100W má významně delší trénovací časy (31,4 % déle v průměru). Omezení 200W odpovídá téměř stejné trénovací době jako 250W, ale má skromnější úspory energie než 150W.’

Autoři navrhují, že tyto výsledky podporují omezení spotřeby energie na 150W pro architektury GPU a aplikace, které na nich běží. Poznamenávají také, že úspory energie získané se překládají přes hardwarové platformy a provedli testy znovu, aby porovnali výsledky pro GPU NVIDIA K80, T4 a A100.

Úspory energie napříč třemi různými GPU NVIDIA.

Úspory energie napříč třemi různými GPU NVIDIA.

Inference, ne trénování, spotřebovává energii

Studie cituje několik předchozích studií, které ukazují, že navzdory titulkům je to inference (použití dokončeného modelu, jako je model NLP) a ne trénování, co spotřebovává nejvíce energie, a naznačuje, že jakmile se populární modely stanou komoditou a dostanou se do mainstreamu, spotřeba energie by mohla být větším problémem, než je tomu v současné době.

Proto autoři měřili dopad inferenze na spotřebu energie a zjistili, že uplatnění omezení spotřeby energie má znatelný účinek na latenci inferenze:

‘Ve srovnání s 250W vyžaduje nastavení 100W dvojnásobnou dobu inferenze (zvýšení o 114 %) a spotřebuje o 11,0 % méně energie, 150W vyžaduje o 22,7 % více času a ušetří 24,2 % energie, a 200W vyžaduje o 8,2 % více času se snížením energie o 12,0 %.’

Zimní trénování

Studie navrhuje, že trénování (ne inferenci, zřejmých důvodů) by mohlo být naplánováno na časy, kdy je datové centrum na vrcholu efektivity spotřeby energie (PUE) – efektivní, to znamená v zimě a v noci.

‘Značné úspory energie lze získat, pokud lze úkoly naplánovat na časy, kdy se očekává nižší PUE. Například přesunutí krátkého úkolu z denního času na noční čas může poskytnout přibližně 10% snížení, a přesunutí delšího, nákladného úkolu (například jazykového modelu, který trvá týdny na dokončení) z léta na zimu může vidět 33% snížení. ‘

‘Ačkoli je obtížné předpovědět úspory, které může jednotlivý výzkumník dosáhnout, informace prezentované zde zdůrazňují důležitost environmentálních faktorů ovlivňujících celkovou spotřebu energie jejich úloh.’

Držte se mraků

Nakonec studie poznamenává, že domácí výpočetní zdroje pravděpodobně neimplementovaly stejné úspory energie jako velká datová centra a poskytovatelé cloud computingu, a že environmentální výhody by mohly být získány přenosem úloh do míst, která investovala výrazně do efektivity.

‘Ačkoli existuje pohodlí v přístupu k soukromým výpočetním zdrojům, toto pohodlí má svou cenu. Obecně platí, že úspory energie a dopad jsou snáze dosažitelné ve větším měřítku. Datová centra a poskytovatelé cloud computingu investují významně do efektivity svých zařízení.’

 

* Příslušné odkazy uvedené v článku.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai