Взгляд Anderson

Ограничение растущих потребностей машинного обучения в энергии

mm
Добавьте Unite.AI в избранные источники в Google

В связи с растущей обеспокоенностью по поводу энергетических требований крупных моделей машинного обучения, недавнее исследование MIT Lincoln Laboratory и Northeastern University изучило экономию, которую можно получить за счет ограничения мощности видеокарт, используемых при обучении и выводе моделей, а также других методов снижения энергопотребления ИИ.

Новая работа также призывает к включению в новые статьи об ИИ раздела “Энергетическое заявление” (аналогично недавней тенденции включения “этических последствий” в статьи из области исследований машинного обучения).

Главным предложением работы является то, что ограничение мощности (ограничение доступной мощности видеокарты, обучающей модель) предлагает значительную экономию энергии, особенно для Masked Language Modeling (MLM) и фреймворков, таких как BERT и его производные.

Три языковые модели, работающие на проценте от стандартных настроек 250 Вт (черная линия), в терминах энергопотребления. Ограничение энергопотребления не ограничивает эффективность или точность обучения в прямой пропорции, и предлагает заметную экономию энергии в масштабе. Источник: https://arxiv.org/pdf/2205.09646.pdf

Три языковые модели, работающие на проценте от стандартных настроек 250 Вт (черная линия), в терминах энергопотребления. Ограничение энергопотребления не ограничивает эффективность или точность обучения в прямой пропорции, и предлагает заметную экономию энергии в масштабе. Источник: https://arxiv.org/pdf/2205.09646.pdf

Для более крупных моделей, которые привлекли внимание в последние годы благодаря гипермасштабным наборам данных и новым моделям с миллиардами или триллионами параметров, можно получить аналогичную экономию, обменивая время обучения на энергопотребление.

Обучение более мощных моделей NLP в масштабе при ограничении мощности. Среднее относительное время под ограничением 150 Вт показано синим цветом, а среднее относительное энергопотребление для 150 Вт - оранжевым.

Обучение более мощных моделей NLP в масштабе при ограничении мощности. Среднее относительное время под ограничением 150 Вт показано синим цветом, а среднее относительное энергопотребление для 150 Вт – оранжевым.

Для этих более крупных развертываний исследователи обнаружили, что ограничение мощности в 150 Вт привело к среднему снижению энергопотребления на 13,7% по сравнению с стандартным максимальным значением 250 Вт, а также к относительно небольшому увеличению времени обучения на 6,8%.

Кроме того, исследователи отмечают, что, несмотря на заголовки о том, что стоимость обучения моделей возросла за последние годы, энергетические затраты на фактическое использование обученных моделей гораздо больше*.

‘Для языковых моделей с BERT энергетические выгоды от ограничения мощности заметно больше при выводе, чем при обучении. Если это справедливо для других приложений ИИ, это может иметь значительные последствия для энергопотребления на крупных или облачных платформах, обслуживающих вывод для исследований и промышленности.’

Далее, и, возможно, наиболее спорно, статья предлагает, что основная тренировка моделей машинного обучения должна быть отложена на более холодные месяцы года и на ночь, чтобы сэкономить на затратах на охлаждение.

Выше, статистика PUE для каждого дня 2020 года в центре данных авторов, с заметным и устойчивым скачком/плато в летние месяцы. Ниже, среднее почасовое изменение PUE для того же места в течение недели, с ростом энергопотребления к середине дня, поскольку как внутреннее оборудование охлаждения видеокарт, так и окружающее оборудование охлаждения центра данных борются за поддержание рабочей температуры.

Выше, статистика PUE для каждого дня 2020 года в центре данных авторов, с заметным и устойчивым скачком/плато в летние месяцы. Ниже, среднее почасовое изменение PUE для того же места в течение недели, с ростом энергопотребления к середине дня, поскольку как внутреннее оборудование охлаждения видеокарт, так и окружающее оборудование охлаждения центра данных борются за поддержание рабочей температуры.

Авторы заявляют:

‘Очевидно, что тяжелые рабочие нагрузки NLP обычно намного менее эффективны летом, чем те, которые выполняются во время зимы. Учитывая большую сезонную вариацию, если есть вычислительные эксперименты, которые можно запланировать на более холодные месяцы, это может значительно снизить углеродный след.’

Статья также признает появляющиеся возможности экономии энергии, которые могут быть достигнуты за счет обрезки и оптимизации архитектуры модели и рабочих процессов – хотя авторы оставляют дальнейшее развитие этого направления другим инициативам.

Наконец, авторы предлагают, что новые научные статьи из области машинного обучения должны быть поощрены или, возможно, ограничены, чтобы завершиться заявлением, объявляющим энергопотребление, проведенное в исследовании, и потенциальные энергетические последствия принятия инициатив, предложенных в работе.

Статья, подавая пример, объясняет энергетические последствия своего собственного исследования.

Статья, подавая пример, объясняет энергетические последствия своего собственного исследования.

Статья называется Большая сила, большая ответственность: Рекомендации по снижению энергопотребления для обучения языковых моделей и исходит от шести исследователей из MIT Lincoln и Northeastern.

Машинное обучение и его растущие потребности в энергии

Поскольку вычислительные требования для моделей машинного обучения увеличились в тандеме с полезностью результатов, текущая культура машинного обучения связывает энергетические расходы с улучшением производительности – несмотря на некоторых заметных активистов, таких как Эндрю Нг, которые предлагают, что курирование данных может быть более важным фактором.

В одном ключевом сотрудничестве 2020 года было оценено, что десятикратное улучшение производительности модели требует увеличения вычислительных требований в 10 000 раз, вместе с соответствующим количеством энергии.

Следовательно, исследования менее энергозатратных методов обучения машинного обучения увеличились за последние годы. Новая статья, по утверждению авторов, является первой, которая глубоко изучает влияние ограничений мощности на обучение и вывод моделей машинного обучения, с упором на фреймворки NLP (такие как серия GPT).

Поскольку качество вывода является первоочередной задачей, авторы заявляют о своих находках в начале:

‘Этот метод не влияет на прогнозы обученных моделей или, следовательно, на их точность на задачах. То есть, если две сети с одинаковой структурой, начальными значениями и пакетированными данными обучаются в течение одного и того же количества пакетов под разными ограничениями мощности, их результирующие параметры будут идентичны, и только энергия, необходимая для их получения, может отличаться.’

Снижение энергопотребления для NLP

Чтобы оценить влияние ограничений мощности на обучение и вывод, авторы использовали nvidia-smi (System Management Interface) утилиту командной строки, вместе с библиотекой MLM от HuggingFace.

Авторы обучили модели NLP BERT, DistilBERT и Big Bird над MLM, и отслеживали их энергопотребление во время обучения и развертывания.

Модели были обучены на наборе данных WikiText-103 от DeepAI за 4 эпохи в пакетах по 8, на 16 видеокартах V100, с четырьмя разными ограничениями мощности: 100 Вт, 150 Вт, 200 Вт и 250 Вт (стандартное или базовое значение для видеокарты NVIDIA V100). Модели имели параметры, обученные с нуля, и случайные значения инициализации, чтобы обеспечить сравнимые оценки обучения.

Как видно на первой картинке выше, результаты демонстрируют хорошую экономию энергии при нелинейных, благоприятных увеличениях времени обучения. Авторы заявляют:

‘Наши эксперименты показывают, что реализация ограничений мощности может значительно снизить энергопотребление за счет времени обучения.’

Оптимизация “большого NLP”

Далее авторы применили тот же метод к более требовательной задаче: обучению BERT с MLM на распределенных конфигурациях на нескольких видеокартах – более типичному варианту использования для хорошо финансируемых и широко разрекламированных моделей NLP FAANG.

Основное различие в этом эксперименте заключалось в том, что модель могла использовать от 2 до 400 видеокарт на один экземпляр обучения. Были применены те же ограничения мощности, и использовалась та же задача (WikiText-103). См. вторую картинку выше для графиков результатов.

Статья гласит:

‘В среднем по каждому выбору конфигурации ограничение мощности в 150 Вт привело к среднему снижению энергопотребления на 13,7% и увеличению времени обучения на 6,8% по сравнению со стандартным максимальным значением. Ограничение мощности в 100 Вт имеет значительно более длительное время обучения (31,4% дольше в среднем). Ограничение мощности в 200 Вт соответствует几乎 такому же времени обучения, как и ограничение мощности в 250 Вт, но более скромной экономией энергии, чем ограничение мощности в 150 Вт.’

Авторы предлагают, что эти результаты поддерживают ограничение мощности в 150 Вт для архитектур видеокарт и приложений, которые на них работают. Они также отмечают, что экономия энергии, полученная, распространяется на различные аппаратные платформы, и повторно выполнили тесты, чтобы сравнить результаты для видеокарт NVIDIA K80, T4 и A100.

Экономия энергии на различных видеокартах NVIDIA.

Экономия энергии на различных видеокартах NVIDIA.

Вывод, а не обучение, потребляет больше энергии

Статья цитирует несколько предыдущих исследований, демонстрирующих, что, несмотря на заголовки, именно вывод (использование готовой модели, такой как модель NLP), а не обучение, потребляет больше энергии, что предполагает, что по мере того, как популярные модели становятся товарными и входят в массы, энергопотребление может стать более серьезной проблемой, чем сейчас, на этом более раннем этапе развития NLP.

Таким образом, исследователи измерили влияние вывода на энергопотребление, обнаружив, что введение ограничений мощности оказывает заметное влияние на задержку вывода:

‘По сравнению с 250 Вт, ограничение мощности в 100 Вт требует в два раза больше времени вывода (увеличение на 114%) и потребляет на 11,0% меньше энергии, ограничение мощности в 150 Вт требует на 22,7% больше времени и экономит 24,2% энергии, а ограничение мощности в 200 Вт требует на 8,2% больше времени и потребляет на 12,0% меньше энергии.’

Зимняя тренировка

Статья предлагает, что тренировка (если не вывод, по понятным причинам) могла бы быть запланирована на время, когда центр данных имеет пиковое значение коэффициента эффективности энергопотребления (PUE) – эффективно, это зимой и ночью.

‘Значительная экономия энергии может быть получена, если рабочие нагрузки можно запланировать на время, когда ожидается более низкий PUE. Например, перемещение короткоживущей задачи из дневного времени в ночное время может обеспечить примерно 10% снижение, а перемещение более длительной, дорогой задачи (например, языковой модели, требующей недель для завершения) из летних месяцев в зимние может привести к снижению на 33%.’

‘Хотя трудно предсказать, какие сбережения может получить отдельный исследователь, представленная информация подчеркивает важность внешних факторов, влияющих на общее энергопотребление рабочих нагрузок.’

Сохраняйте облачность

Наконец, статья отмечает, что домашние вычислительные ресурсы вряд ли реализовали те же меры эффективности, что и крупные центры данных и облачные провайдеры, и что экологические выгоды можно получить, передавая рабочие нагрузки в места, которые сильно инвестируют в хорошую эффективность.

‘Хотя существует удобство в наличии частных вычислительных ресурсов, доступных для использования, это удобство стоит дорого. Generally speaking, энергетические сбережения и воздействие легче получить в более крупном масштабе. Центры данных и облачные провайдеры делают значительные инвестиции в эффективность своих объектов.’

 

* Пpertinent ссылки, предоставленные статьей.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai