Взгляд Anderson

Ущерб от дообучения модели ИИ можно легко восстановить, показало исследование

mm
Добавьте Unite.AI в избранные источники в Google
AI-generated image from ChatGPT. Prompt: ' a photorealistic panoramic image of a scientist in a white coat, wearing protective soldering goggles, who is soldering circuitry in an open panel of the underside of a massive and high-tech computer system. Photorealistic, gorgeous, UHQ'

Новое исследование из США показывает, что дообучение модели ИИ на ваших собственных данных не обязательно должно снижать или ухудшать функциональность исходной модели – и что относительно простой исправление может не только восстановить возможности исходной модели, но и фактически улучшить качество вывода, который вы пытаетесь получить из (уже обученной) модели.

Прирост производительности на различных моделях с новой пост-тренировочной калибровкой авторов. Более подробная информация представлена позже в статье. Источник: http://export.arxiv.org/pdf/2409.16223

Прирост производительности на различных моделях с новой пост-тренировочной калибровкой авторов. Более подробная информация представлена позже в статье. Источник: http://export.arxiv.org/pdf/2409.16223

Последствия этого значительны не только для технологических гигантов, чье внимание сосредоточено на финансовых выгодах от аренды генеративных систем “как услугу”, но и для растущего числа “отрезанных” хоббиистов, которые загружают и настраивают открытые модели, чтобы получить доступ к персонализированным системам генерации ИИ более дешево – и с меньшим количеством ограничений.

Авторы статьи не боятся показать свою энтузиазм по поводу потенциала своего метода, который, по их мнению, делает значительные шаги вперед по сравнению с подачей 2023 года Холистический перенос: к не разрушительному дообучению с частичными целевыми данными (совместно с многими участниками новой статьи).

Они заявляют:

‘Результаты обнадеживающие и имеют глубокие последствия! Они подразумевают, что простая пост-процессорная калибровка может потенциально решить проблему худшей точности дообученной модели на отсутствующих классах, вернув способность предобученной модели, а также открывая улучшение качества функций по всем классам.’

Мы рассмотрим новую работу чуть позже. Сначала давайте посмотрим, какую проблему она пытается решить.

Почему это важно

Первая волна широкого дообучения произошла после выпуска модели Stable Diffusion текст-изображение в августе 2002 года. Ранние модели, обученные на подмножестве гипермасштабной LAION датасета, были доступны для загрузки.

Однако пользователям, которые хотели вставить конкретный контент (например, свою собственную идентичность, стили искусства или представление знаменитостей) в необыкновенные генеративные качества Stable Diffusion, необходимо было использовать методы, такие как DreamBooth – экстраполяция метода настройки Google Research, который позволял пользователю обучать новые данные в свободно доступной модели через дообучение.

Примеры процесса пользователя для официальной реализации DreamBooth от Google 2022 года. Пользователь курирует небольшой выбор изображений и выбирает уникальное имя (которое Stable Diffusion не имеет в своих тренировочных данных) в текст-пromptах из дообученной модели. Источник: https://dreambooth.github.io/

Примеры процесса пользователя для официальной реализации DreamBooth от Google 2022 года. Пользователь курирует небольшой выбор изображений и выбирает уникальное имя (которое Stable Diffusion не имеет в своих тренировочных данных) в текст-пromptах из дообученной модели. Источник: https://dreambooth.github.io/

Таким образом, было возможно получить копию модели, которая была очень хороша в создании определенного человека или пользовательского стиля искусства, но которая теперь была компрометирована для более общего использования.

Это означало, что если вы хотели дообучить Stable Diffusion, чтобы она могла точно изображать трех разных людей, вам необходимо было создать три разных модели, каждая около 2-4 ГБ или больше.

Любая попытка дообучить эти модели второй раз не только ухудшала общую производительность модели, но и негативно влияла на вывод предыдущей сессии дообучения.

В любом случае, модели DreamBooth с знаменитостями вскоре стали распространяться в Интернете, в основном на сайте civit.ai. Позже менее трудоемкие методы, такие как Низкоранговая адаптация (LoRA), обогнали дообучение по популярности (хотя вопрос о том, насколько эффективен вывод LoRA по сравнению с полным дообучением, спорный, и NVIDIA с тех пор открыла якобы более эффективный подход под названием DoRA).

LoRA относится к категории Параметро-эффективному дообучению (PEFT), которое влияет только на подмножество обученных параметров модели.

Некоторые пользователи хотели изменить фундаментальную природу открытых контрольных точек Stable Diffusion, дообучая их на тысячах изображений.

Это, по сути, производило альтернативную фундаментальную модель, посвященную любой области, на которую пользователь пытался обучить (например, определенный стиль искусства). Для этой цели “легкие” методы, такие как LoRA, были, вероятно, менее эффективными, поскольку веса модели нуждались в сильном смещении в сторону новых тренировочных данных.

Местный чат

С недавним всплеском интереса к Большим языковым моделям (LLM), пользователи, желающие избежать растущих затрат на API-управляемые услуги, такие как ChatGPT, все чаще загружают и дообучают эффективные открытые модели, такие как Llama 3, среди многих других.

И здесь LoRAs можно использовать вместо дообучения полной контрольной точки. Мы утверждали ранее, что дообучение является лучшим методом для производства LLM, адаптированных к конкретным потребностям пользователя. Хотя дообучение может иметь более высокие требования к оборудованию и может занять больше времени, оно предлагает более глубокую обобщенность новых данных, которые пользователь хочет, чтобы модель усвоила.

Проблема с дообучением заключается в том, что это разрушительный процесс, который не может быть инкрементально обучен на дополнительных данных позже, как мы отметили выше.

Функции и смещения, вводимые в модель, кажется, нарушают исходный баланс весов в наборе данных, что означает, что модель либо чрезмерно склонна отражать пользовательские данные, либо будет хуже работать в целом, чем исходная фундаментальная модель (на задачах, не связанных с новыми данными).

Одним из способов исправить это является замораживание определенных частей модели во время обучения; но это может привести к снижению общей функциональности, поскольку замороженная часть архитектуры может не обобщаться хорошо с новыми данными в латентном пространстве модели.

Было бы действительно хорошо, если бы был более простой способ сохранить исходные возможности дообученной модели, сохраняя при этом способность модели производить вывод на основе данных дообучения.

Такое развитие было бы полезно во всем диапазоне потенциальных пользователей, от хоббиистов и ранних采用ющих, использующих локальные LLM и другие типы генеративных моделей, до уровня FAANG (где очень дорогую модель ИИ можно было бы улучшать итеративно и не разрушительно, без многомиллионных затрат на повторное обучение с дополнительными данными).

Пост-процессорная калибровка

Это приводит нас обратно к новой статье, которая называется Дообучение нормально, если откалибровано, и исходит от 11 исследователей из Университета штата Огайо, Университета Висконсин-Мэдисон и Ренсселерского политехнического института.

Исследователи пытались выяснить, что именно повреждается в фундаментальной модели, когда она дообучается. Они пришли к выводу, что единственная значительная разница между “до и после” модели заключается в том, что логит-масштабы по классам дообучения и исходным классам в модели демонстрируют значительную расхождение.

Логит-связи предсказывают вероятность успеха в логическом регрессионном процессе, преобразуя оцененные значения (которые могут быть очень точными) в ноль или единицу.

Авторы не только обнаружили, что этот дефицит почти легко обратим с помощью метода калибровки, но и что это пост-фактум исправление фактически улучшает качество вывода для данных дообучения. Следовательно, с помощью этого метода вы не только получаете исходные возможности фундаментальной модели, но и лучше интегрируете свои собственные данные дообучения.

(Хотя статья не исследует эту возможность, этот метод подразумевает, что модель можно дообучать несколько раз и оставаться эффективной)

Обсуждая свои выводы об исследовании повреждений модели после дообучения, авторы заявляют:

‘К нашему удивлению, мы обнаружили, что дообученная модель не забывает отношений между другими классами и не ухудшает функции для распознавания этих классов.

‘Вместо этого дообученная модель часто производит более дискриминативные функции для этих других классов, даже если они отсутствовали во время дообучения!’

‘[Что] действительно вредно для точности – это несоответствие логит-масштабов между классами дообучения и другими [классами], что подразумевает, что простая пост-процессорная калибровка может восстановить способность предобученной модели и одновременно открыть улучшение функций по всем классам.’

Авторы сделали результаты своих тестов для этой теории воспроизводимыми в репозитории GitHub.

Они обнаружили, что при расследовании единственной частью архитектуры фундаментальной модели, которая повреждена при дообучении, является бинарный классификатор, который неправильно классифицирует классы, отсутствующие в исходной модели как классы дообучения.

Статья гласит*:

‘[Добавляя] калибровочный коэффициент смещения ко всем логитам отсутствующих классов [4, 40], дообученная модель может успешно вернуть точность отсутствующих классов и получить приличное общее улучшение в области.

‘Результативная производительность даже превосходит сильную базовую линию [Холистический перенос – статью, на которой основана эта статья] во многих из тестов, включая ImageNet и его варианты [ImageNet, ImageNet-R(endition), ImageNet-S(ketch)], Office-Home и VTAB, без сложной тренировки и настройки гиперпараметров.’

Дообученная модель, которая прошла пост-процессорную калибровку, может, по заявлению авторов, превосходить подход государства-искусства к проблеме.

Результаты из статьи: дообученная модель, которая прошла пост-процессорную калибровку, может, по заявлению авторов, превосходить подход государства-искусства к проблеме.

Авторы классифицируют улучшенную производительность пост-калиброванной дообученной модели как “неожиданное доброжелательное поведение” и отмечают, что когда используется базовый стохастический градиентный спуск (SGD) оптимизатор, получается лучший результат, чем с более популярными текущими оптимизаторами, такими как Adam.

‘Тем не менее,’ они отмечают ‘с достаточно малыми скоростями обучения и весовым затуханием, доброжелательные поведения проявляются и сохраняются.’

Незначительные ремонты

Чтобы исправить логит-несоответствия, возникающие в результате дообучения, авторы взяли метод из нулевого обучения, добавив постоянный коэффициент к логитам всех отсутствующих классов. Это приводит к новому правилу классификации.

Авторы отмечают, что этот процесс “продвигает” пренебрегаемые отсутствующие классы до того же качества предсказания, что и классы дообучения, восстанавливая исходную производительность и улучшая производительность “добавленных” данных во время вывода.

В тестах техника пост-калибровки восстановила производительность различных дообученных моделей. 'Оракул', указанный в таблице, относится к дообученному классификатору, который также учитывает отсутствующие классы данных.

В тестах техника пост-калибровки восстановила производительность различных дообученных моделей. ‘Оракул’, указанный в таблице, относится к дообученному классификатору, который также учитывает отсутствующие классы данных.

Они далее отмечают, что пост-процессорная калибровка “потенциально применима к любой модели” и что методы, которые стремятся сохранить целостность фундаментальной модели путем замораживания слоев (таких как классификатор и бэкбон), получают плохие результаты по сравнению с их собственным предложенным подходом.

Вывод

Результаты этого сотрудничества кажутся значительными. Обучение модели ИИ на гипермасштабном наборе данных – это огромная задача, аналогичная взлету пассажирского самолета. Хотя обучение можно прервать, и любые повреждения можно смягчить, сохраняя текущие веса периодически (при значительных затратах на хранение), чтобы позволить прерываниям обучения, существует относительно мало того, что можно сделать, чтобы изменить результат после запуска.

Впечатляющим в этой работе является то, что исследователи, кажется, открыли фундаментальный принцип в общем обучении моделей ИИ, и что их решение удивительно элегантно.

Экономические последствия возможности сохранения точности фундаментальной модели после дообучения также значительны. На данный момент наиболее распространенный метод решения проблем многомиллионных моделей заключался в фильтрации вывода во время вывода или контроле вывода, чтобы избежать любой уязвимости, очевидной в модели.

Кроме того, такой метод теоретически может принести значительные улучшения возможностям дообученных генеративных моделей на потребительском уровне, с бонусом в виде улучшения качества вывода.

 

* Мое преобразование встроенных цитат авторов в гиперссылки.

Опубликовано впервые во вторник, 1 октября 2024 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai