Kąt Andersona
Ograniczanie rosnących potrzeb energetycznych uczenia maszynowego

W związku z rosnącą troską o wymagania energetyczne dużych modeli uczenia maszynowego, niedawne badanie przeprowadzone przez MIT Lincoln Laboratory i Northeastern University zbadano oszczędności, które można uzyskać poprzez ograniczanie mocy GPU wykorzystywanych w szkoleniu i inferencji modeli, a także kilka innych technik i metod ograniczania zużycia energii przez AI.
Nowa praca również wzywa do tego, aby nowe prace naukowe z dziedziny AI kończyły się “Oświadczeniem o zużyciu energii” (podobnie jak ostatnia tendencja w przypadku “oświadczeń o implikacjach etycznych” w pracach z dziedziny badań nad uczeniem maszynowym).
Główna sugestia wynikająca z tej pracy jest taka, że ograniczanie mocy (ograniczenie dostępnej mocy dla GPU, który szkoli model) oferuje uzasadnione korzyści w zakresie oszczędności energii, szczególnie w przypadku modeli językowych (MLM) i frameworków takich jak BERT i jego pochodne.

Trzy sieci modelowania języka działające przy ustawieniach procentowych od wartości domyślnej 250W (linia czarna), w zakresie zużycia energii. Ograniczanie zużycia energii nie ogranicza wydajności szkolenia ani dokładności w sposób bezpośredni, a oszczędności energii są znaczące w skali. Źródło: https://arxiv.org/pdf/2205.09646.pdf
Dla większych modeli, które w ostatnich latach przyciągnęły uwagę ze względu na duże zestawy danych i nowe modele z miliardami lub bilionami parametrów, podobne oszczędności można uzyskać jako kompromis pomiędzy czasem szkolenia a zużyciem energii.

Szkolenie bardziej zaawansowanych modeli NLP w skali przy ograniczeniach mocy. Średni względny czas pod limitem 150W jest pokazany na niebiesko, a średnie względne zużycie energii dla 150W jest pokazane na pomarańczowo.
Dla tych większych wdrożeń, badacze stwierdzili, że ograniczenie mocy do 150W spowodowało średnie obniżenie zużycia energii o 13,7% w porównaniu z domyślnym maksimum 250W, a także wzrost czasu szkolenia o 6,8%.
Ponadto, badacze zauważają, że pomimo nagłówków dotyczących kosztów szkolenia modeli w ostatnich latach, koszty energii związane z rzeczywistym użyciem wytrenowanych modeli są znacznie wyższe*.
‘Dla modelowania języka z użyciem BERT, zyski energetyczne poprzez ograniczanie mocy są znacznie większe podczas inferencji niż podczas szkolenia. Jeśli jest to spójne z innymi aplikacjami AI, może to mieć znaczące konsekwencje w zakresie zużycia energii dla dużych platform obliczeniowych lub chmurowych służących do inferencji dla badań i przemysłu.’
Dalej, i być może najbardziej kontrowersyjnie, praca sugeruje, że główne szkolenie modeli uczenia maszynowego powinno być przypisane do chłodniejszych miesięcy roku i do nocy, aby zaoszczędzić na kosztach chłodzenia.

Powyróżnione statystyki PUE dla każdego dnia 2020 roku w ośrodku danych autorów, z zauważalnym i utrwalonym wzrostem/płaskim w miesiącach letnich. Poniżej, średnia godzinowa zmiana w PUE dla tego samego miejsca w ciągu tygodnia, z zużyciem energii rosnącym w kierunku połowy dnia, ponieważ zarówno wewnętrzne urządzenia chłodzące GPU, jak i otoczenie chłodzenia ośrodka danych mają trudności z utrzymaniem temperatury roboczej.
Autorzy stwierdzają:
‘Oczywiście, ciężkie obciążenia NLP są zwykle znacznie mniej wydajne latem niż te wykonane podczas zimy. Biorąc pod uwagę dużą sezonową zmienność, jeśli są tam kosztowne eksperymenty, które mogą być zaplanowane na chłodniejsze miesiące, to może to znacznie zmniejszyć ślad węglowy.’
Praca również uznaje zaistniałe możliwości oszczędności energii, które są możliwe dzięki przycinaniu i optymalizacji architektury modelu i przepływów pracy – chociaż autorzy pozostawiają dalszy rozwój tej drogi innym inicjatywom.
W końcu autorzy sugerują, że nowe prace naukowe z dziedziny AI powinny być zachęcane lub wręcz zmuszane do zakończenia się “Oświadczeniem o zużyciu energii”, deklarującym zużycie energii w badaniach i potencjalne implikacje energetyczne przyjęcia inicjatyw sugerowanych w pracy.

Praca, prowadząc przykład, wyjaśnia implikacje energetyczne własnych badań.
Praca pt. Wielka moc, wielka odpowiedzialność: Zalecenia dotyczące redukcji energii dla szkolenia modeli językowych, pochodzi od sześciu badaczy z MIT Lincoln i Northeastern.
Rosnące zapotrzebowanie na energię w uczeniu maszynowym
Ponieważ wymagania obliczeniowe dla modeli uczenia maszynowego rosną wraz z użytecznością wyników, obecna kultura AI utożsamia wydatki energetyczne z poprawioną wydajnością – pomimo niektórych znaczących kampanii, takich jak Andrew Ng, sugerujących, że kuracja danych może być ważniejszym czynnikiem.
W jednej kluczowej współpracy MIT z 2020 roku, oszacowano, że dziesięciokrotna poprawa wydajności modelu wiąże się z 10 000-krotnym wzrostem wymagań obliczeniowych, wraz z odpowiednią ilością energii.
W związku z tym, badania nad mniej energochłonnym skutecznym szkoleniem AI wzrosły w ciągu ostatnich kilku lat. Nowa praca, jak twierdzą autorzy, jest pierwszą, która głęboko bada wpływ ograniczeń mocy na szkolenie i inferencję modeli uczenia maszynowego, ze szczególnym naciskiem na frameworki NLP (takie jak seria GPT).
Ponieważ jakość inferencji jest sprawą najwyższej wagi, autorzy stwierdzają na początku:
‘[Ta] metoda nie wpływa na przewidywania wytrenowanych modeli ani na ich dokładność wydajności w zadaniach. Innymi słowy, jeśli dwie sieci o tej samej strukturze, wartościach początkowych i danych partii są szkolone przez tyle samo partii pod różnymi ograniczeniami mocy, ich wynikowe parametry będą identyczne i tylko energia wymagana do ich wytworzenia może się różnić.’
Ograniczanie mocy dla NLP
Aby ocenić wpływ ograniczeń mocy na szkolenie i inferencję, autorzy wykorzystali nvidia-smi (System Management Interface) oraz bibliotekę MLM z HuggingFace.
Autorzy szkolili modele NLP BERT, DistilBERT i Big Bird nad MLM i monitorowali ich zużycie energii podczas szkolenia i wdrożenia.
Modele były szkolone na zestawie danych WikiText-103 przez 4 epoki w partiach ośmiu, na 16 GPU V100, z czterema różnymi ograniczeniami mocy: 100W, 150W, 200W i 250W (domyślny, lub podstawowy, dla GPU NVIDIA V100). Modele posiadały parametry szkolone od podstaw i losowe wartości początkowe, aby zapewnić porównywalne oceny szkolenia.
Jak widać na pierwszym obrazku powyżej, wyniki pokazują dobre oszczędności energii przy nieliniowych, korzystnych wzrostach czasu szkolenia. Autorzy stwierdzają:
‘Nasze eksperymenty wskazują, że wdrożenie ograniczeń mocy może znacznie zmniejszyć zużycie energii, kosztem czasu szkolenia.’
Uszczuplanie “dużego NLP”
Następnie autorzy zastosowali tę samą metodę do bardziej wymagającego scenariusza: szkolenie BERT z MLM na rozproszonych konfiguracjach na wielu GPU – bardziej typowym przypadkiem użycia dla dobrze finansowanych i szeroko reklamowanych modeli NLP FAANG.
Główną różnicą w tym eksperymencie było to, że model mógł wykorzystywać od 2 do 400 GPU na instancję szkolenia. Zastosowano te same ograniczenia dotyczące zużycia energii, a także ten sam zestaw danych (WikiText-103). Zobacz drugi obraz powyżej, aby zobaczyć wykresy wyników.
Praca stwierdza:
‘Średnio, dla każdego wyboru konfiguracji, ograniczenie mocy do 150W spowodowało średnie obniżenie zużycia energii o 13,7% i wzrost czasu szkolenia o 6,8% w porównaniu z domyślnym maksimum. Ustawienie 100W ma znacznie dłuższy czas szkolenia (31,4% dłuższy średnio). Ograniczenie mocy do 200W korespondowało z prawie takim samym czasem szkolenia, jak ograniczenie do 250W, ale z bardziej skromnymi oszczędnościami energii niż ograniczenie do 150W.’
Autorzy sugerują, że te wyniki wspierają ograniczanie mocy do 150W dla architektur GPU i aplikacji, które na nich działają. Zauważają również, że oszczędności energii uzyskane są przenoszone na różne platformy sprzętowe i przeprowadzili testy ponownie, aby porównać wyniki dla GPU NVIDIA K80, T4 i A100.

Oszczędności uzyskane na różnych GPU.
Inferencja, a nie szkolenie, zużywa energię
Praca cytuję kilka wcześniejszych badań, które dowodzą, że pomimo nagłówków, to inferencja (użycie wytrenowanego modelu, takiego jak model NLP) a nie szkolenie zużywa najwięcej energii, sugerując, że w miarę jak popularne modele są komercjalizowane i wchodzą do mainstreamu, zużycie energii może stać się większym problemem, niż jest to obecnie na tym bardziej wczesnym etapie rozwoju NLP.
Stąd badacze zmierzyli wpływ inferencji na zużycie energii, stwierdzając, że nałożenie ograniczeń mocy ma zauważalny wpływ na opóźnienie inferencji:
‘W porównaniu z 250W, ustawienie 100W wymagało podwójnego czasu inferencji (wzrost o 114%) i zużywało o 11,0% mniej energii, 150W wymagało 22,7% więcej czasu i zaoszczędziło 24,2% energii, a 200W wymagało 8,2% więcej czasu i zużywało o 12,0% mniej energii.’
Szkolenie zimowe
Praca sugeruje, że szkolenie (jeśli nie inferencja, z oczywistych powodów) mogłoby być zaplanowane w czasie, gdy centrum danych jest na szczycie wydajności zużycia energii (PUE) – efektywnie, jest to zimą i w nocy.
‘Znaczące oszczędności energii mogą być uzyskane, jeśli obciążenia mogą być zaplanowane w czasie, gdy oczekiwana jest niższa PUE. Na przykład, przeniesienie krótkiego zadania z dnia na noc może dać około 10% redukcję, a przeniesienie dłuższego, droższego zadania (np. modelu językowego, który zajmuje tygodnie do ukończenia) z lata na zimę może spowodować 33% redukcję.
‘Chociaż trudno przewidzieć oszczędności, które może uzyskać indywidualny badacz, informacje przedstawione tutaj podkreślają znaczenie czynników środowiskowych wpływających na całościowe zużycie energii przez ich obciążenia.’
Trzymaj się chmury
W końcu praca zauważa, że zasoby obliczeniowe własne są mało prawdopodobne, aby wdrożyły takie same środki efektywności, jak duże centra danych i wysokiej klasy dostawcy chmury obliczeniowej, i że korzyści środowiskowe mogą być uzyskane przez przeniesienie obciążeń do miejsc, które zainwestowały znacznie w dobre PUE.
‘Chociaż istnieje wygoda w posiadaniu prywatnych zasobów obliczeniowych, które są dostępne, ta wygoda wiąże się z kosztami. Ogólnie rzecz biorąc, oszczędności energii i wpływ są łatwiejsze do uzyskania w większej skali. Centra danych i dostawcy chmury obliczeniowej dokonują znaczących inwestycji w efektywność swoich obiektów.’
* Pertinentne linki podane przez pracę.












