Погляд Anderson

Обмеження зростаючих енергетичних потреб машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

У світлі зростаючої уваги до енергетичних потреб великих моделей машинного навчання, недавнє дослідження MIT Lincoln Laboratory і Університету Норtheastern вивчило економію, яку можна досягти шляхом обмеження потужності графічних процесорів, використовуваних у навчанні моделей і висновках, а також інших методів зниження енергетичних витрат штучного інтелекту.

Нова робота також закликає до включення в статті про штучний інтелект “Енергетичних заяв” (аналогічно недавній тенденції до “етичних імплікацій” у статтях з машинного навчання).

Головна пропозиція роботи полягає в тому, що обмеження потужності (обмеження доступної потужності графічного процесора, який тренує модель) пропонує суттєві енергозбереження, особливо для Моделей мови з маскуванням (MLM) і фреймворків, таких як BERT і його похідні.

Для більших моделей, які привернули увагу в останні роки завдяки гіпермасштабним наборам даних і новим моделям з мільярдами або трильйонами параметрів, подібні збереження можна досягти шляхом компромісу між часом навчання і енергетичних витрат.

Дослідники також звернули увагу на те, що尽管 вартість навчання моделей зростає, енергетичні витрати на використання вже навчених моделей значно вищі.

Паперу пропонує, щоб велике навчання моделей машинного навчання проводилось в холодні місяці року і вночі, щоб заощадити на витратах на охолодження.

Автори стверджують, що значні енергозбереження можна досягти, якщо навантаження можна планувати на час, коли очікується нижчий коефіцієнт використання енергії (PUE) – тобто в зимові місяці і вночі.

Нарешті, паперу відзначає, що домашні обчислювальні ресурси малоймовірно мають ті самі заходи ефективності, що і великі дата-центри і провайдери хмарних обчислень, і що екологічні вигоди можна досягти шляхом переводу навантажень в місця, які зробили великі інвестиції в ефективність своїх об’єктів.

Машинне навчання і його енергетичні потреби

Відповідно до зростаючих обчислювальних вимог моделей машинного навчання, сучасна культура машинного навчання ототожнює енергетичні витрати з покращенням продуктивності – незважаючи на деяких відомих захисників, таких як Ендрю Нг, який стверджує, що кураторство даних може бути більш важливим фактором.

У одному з ключових досліджень MIT 2020 року було оцінено, що десятикратне покращення продуктивності моделі вимагає тисячократного збільшення обчислювальних вимог, а також відповідного збільшення енергетичних витрат.

Відповідно, дослідження менш енергозалежних методів навчання машинного навчання збільшився за останні кілька років. Нова робота, як стверджують автори, є першою, яка глибоко вивчає вплив обмеження потужності на навчання і висновки моделей машинного навчання, з акцентом на фреймворках обробки природної мови (таких як серія GPT).

Обмеження потужності для NLP

Для оцінки впливу обмеження потужності на навчання і висновки автори використали утиліту командної строки nvidia-smi (System Management Interface) разом з бібліотекою MLM з HuggingFace.

Автори тренували моделі обробки природної мови BERT, DistilBERT і Big Bird над MLM і відстежували їх споживання енергії під час навчання і розгортання.

Моделі були треновані на наборі даних WikiText-103 за 4 епохи в пакетах по 8 на 16 графічних процесорах V100, з чотирма різними обмеженнями потужності: 100 Вт, 150 Вт, 200 Вт і 250 Вт (стандартне або базове значення для графічного процесора NVIDIA V100). Моделі мали параметри, треновані з нуля, і випадкові початкові значення, щоб забезпечити порівнянність навчальних оцінок.

Як видно на першому зображенні вище, результати демонструють хороші енергозбереження при нелінійному, сприятливому збільшенні часу навчання. Автори стверджують, що їхні експерименти свідчать про те, що реалізація обмеження потужності може суттєво зменшити споживання енергії за рахунок часу навчання.

Зменшення “великого NLP”

Далі автори застосували той самий метод до більш вимогливого сценарію: тренуванню BERT з MLM на розподілених конфігураціях на декількох графічних процесорах – більш типовому випадку використання моделей NLP з великими фінансовими ресурсами.

Головна відмінність цього експерименту полягала в тому, що модель могла використовувати будь-яку кількість графічних процесорів від 2 до 400 на одну сесію тренування. Було застосовано ті самі обмеження потужності, і використовувалася та сама задача (WikiText-103). Див. друге зображення вище для графіків результатів.

Паперу стверджує, що в середньому обмеження потужності на рівні 150 Вт призвело до середнього зменшення споживання енергії на 13,7% і збільшення часу навчання на 6,8% порівняно з максимальним значенням за замовчуванням. Обмеження потужності на рівні 100 Вт призвело до значно довшого часу навчання (в середньому на 31,4% довше).

Висновок, а не навчання, споживає енергію

Паперу цитує декілька попередніх досліджень, які демонструють, що, незважаючи на заголовки, саме висновок (використання закінченої моделі, chẳng hạn моделі NLP), а не навчання, споживає найбільшу кількість енергії, що свідчить про те, що з популярністю моделей і їх входженням у масову свідомість енергоспоживання може стати більш серйозною проблемою, ніж зараз.

Отже, дослідники виміряли вплив висновку на споживання енергії і виявили, що введення обмеження потужності має суттєвий вплив на затримку висновку:

Зимове навчання

Паперу пропонує, щоб тренування (якщо не висновок, через очевидні причини) проводилось у часи, коли дата-центр має максимальний коефіцієнт використання енергії (PUE) – тобто в зимові місяці і вночі.

Тримайте все в хмарі

Нарешті, паперу відзначає, що домашні обчислювальні ресурси малоймовірно мають ті самі заходи ефективності, що і великі дата-центри і провайдери хмарних обчислень, і що екологічні вигоди можна досягти шляхом переводу навантажень в місця, які зробили великі інвестиції в ефективність своїх об’єктів.

“Оскільки існує зручність у володінні приватними обчислювальними ресурсами, які доступні, ця зручність має свою ціну. Загалом кажучи, енергозбереження і вплив легше досягти на більших масштабах. Дата-центри і провайдери хмарних обчислень роблять значні інвестиції в ефективність своїх об’єктів.” * Пертинентні посилання, надані паперу.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai