Модели и платформы ИИ
Бессрочное обучение на устройстве стало ближе с новой техникой обучения

Команда исследователей в MIT и лаборатории MIT-IBM Watson AI разработала новую технику, которая позволяет проводить обучение на устройстве, используя менее четверти мегабайта памяти. Это новое развитие является впечатляющим достижением, поскольку другие решения для обучения обычно требуют более 500 мегабайт памяти, что превышает 256-килобайтную емкость большинства микроконтроллеров.
Обучая модель машинного обучения на умном устройстве на краю сети, оно может адаптироваться к новым данным и делать более точные прогнозы. Однако процесс обучения обычно требует много памяти, поэтому его часто проводят на компьютерах в центре данных перед развертыванием модели на устройстве. Этот процесс намного более дорогой и вызывает проблемы с конфиденциальностью по сравнению с новой техникой, разработанной командой.
Исследователи разработали алгоритмы и框架 таким образом, что уменьшают количество вычислений, необходимых для обучения модели, что делает процесс быстрее и более эффективным в отношении памяти. Техника может помочь обучить модель машинного обучения на микроконтроллере всего за несколько минут.
Новая техника также помогает с конфиденциальностью, поскольку она сохраняет данные на устройстве, что важно, когда涉иваются конфиденциальные данные. В то же время, фреймворк улучшает точность модели по сравнению с другими подходами.
Сонг Хан – ассоциированный профессор в департаменте электротехники и компьютерных наук (EECS), член лаборатории MIT-IBM Watson AI и старший автор исследовательской статьи.
«Наше исследование позволяет устройствам Интернета вещей не только выполнять вывод, но и непрерывно обновлять модели искусственного интеллекта с новыми данными, открывая путь для бессрочного обучения на устройстве», – сказал Хан. «Низкое использование ресурсов делает глубокое обучение более доступным и может иметь более широкий охват, особенно для устройств на краю сети с низкой мощностью».
В статье также участвовали соавторы и аспиранты EECS Джи Лин и Лигэн Чжу, а также постдоки MIT Вей-Минг Чен и Вей-Чен Ван. В ней также участвовал Чуан Ган, главный исследовательский сотрудник лаборатории MIT-IBM Watson AI.
Сделав процесс обучения более эффективным
Чтобы сделать процесс обучения более эффективным и менее требовательным к памяти, команда использовала два алгоритмических решения. Первое известно как скудное обновление, которое использует алгоритм, определяющий наиболее важные веса для обновления во время каждого раунда обучения. Алгоритм замораживает веса один за другим, пока точность не упадет до определенного порога, после чего он останавливается. Остальные веса затем обновляются, и активации, соответствующие замороженным весам, не нужно хранить в памяти.
«Обновление всей модели очень дорого, поскольку существует много активаций, поэтому люди склонны обновлять только последний слой, но, как вы можете себе представить, это ухудшает точность», – сказал Хан. «Для нашего метода мы селективно обновляем важные веса и гарантируем, что точность полностью сохраняется».
Второе решение, разработанное командой, включает в себя квантованное обучение и упрощение весов. Алгоритм сначала округляет веса до восьми бит посредством процесса квантования, который также уменьшает количество памяти для обучения и вывода, где вывод представляет собой процесс применения модели к набору данных и генерации прогноза. Затем алгоритм использует технику, называемую квантованием с учетом масштабирования (QAS), которая действует как умножитель для регулирования соотношения между весом и градиентом. Это помогает избежать любого снижения точности, которое может возникнуть в результате квантованного обучения.
Исследователи разработали систему, называемую миниатюрным двигателем обучения, которая запускает инновации алгоритмов на простом микроконтроллере без операционной системы. Чтобы выполнить больше работы на этапе компиляции, до развертывания модели на устройстве, система меняет порядок шагов в процессе обучения.
«Мы толкаем много вычислений, таких как автоматическое дифференцирование и оптимизация графа, к времени компиляции. Мы также агрессивно обрезаем избыточные операторы для поддержки скудных обновлений. Как только во время выполнения, у нас есть намного меньше работы, которую нужно выполнять на устройстве», – говорит Хан.
Высокоэффективная техника
В то время как традиционные техники, разработанные для легкого обучения, обычно требуют около 300-600 мегабайт памяти, оптимизация команды потребовала только 157 килобайт для обучения модели машинного обучения на микроконтроллере.
Фреймворк был протестирован путем обучения модели компьютерного зрения для обнаружения людей на изображениях, и он научился выполнять эту задачу всего за 10 минут. Метод также смог обучить модель более чем в 20 раз быстрее, чем другие методы.
Исследователи теперь планируют применить эти техники к языковым моделям и различным типам данных. Они также хотят использовать полученные знания, чтобы уменьшить размер более крупных моделей без потери точности, что также может помочь снизить углеродный след обучения крупномасштабных моделей машинного обучения.












