Погляд Anderson

Ушкодження від донастрою моделі штучного інтелекту можна легко відновити, показують дослідження

mm
Додайте Unite.AI до бажаних джерел у Google
AI-generated image from ChatGPT. Prompt: ' a photorealistic panoramic image of a scientist in a white coat, wearing protective soldering goggles, who is soldering circuitry in an open panel of the underside of a massive and high-tech computer system. Photorealistic, gorgeous, UHQ'

Нові дослідження з США вказують на те, що донастроювання моделі штучного інтелекту на власних даних не потребує зниження або порушення функціональності оригінальної моделі – і що відносно просте рішення не тільки може відновити можливості оригінальної моделі, але й фактично покращити якість виводу, який ви намагаєтеся отримати від (вже навченої) моделі.

Прирост продуктивності на різних моделях з новою післянавчальної калібрування авторів. Детальніше пізніше в статті. Джерело: http://export.arxiv.org/pdf/2409.16223

Прирост продуктивності на різних моделях з новою післянавчальної калібрування авторів. Детальніше пізніше в статті. Джерело: http://export.arxiv.org/pdf/2409.16223

Вплив цього відкриття значний, не тільки для технологічних гігантів, які зосереджують свою увагу на фінансових вигодах від оренди генеративних систем “як сервіс”, але й для зростаючої кількості “корд-кюттер” хобі, які завантажують і настраюють відкриті моделі, щоб отримати доступ до персоналізованого штучного інтелекту для написання текстів та генерації зображень/відео дешевше – і з меншими обмеженнями.

Автори статті не бояться показувати свій ентузіазм щодо потенціалу свого методу, який робить, як видається, значний прогрес у порівнянні з поданням 2023 року Холістичний перехід: До недеструктивного донастроювання з частковими цільовими даними (співавторами якого є багато учасників нової статті).

Вони заявляють:

‘Результати є обнадійливими і мають глибокі наслідки! Вони свідчать про те, що проста післянавчальна калібрування може потенційно вирішити проблему поганої точності донастроюваної моделі на відсутніх класах, відновивши можливість попередньо навченої моделі, а також відкриваючи покращену якість ознак над усіма класами.’

Ми розглянемо нову роботу трохи пізніше. Спочатку давайте побачимо, яку проблему вона намагається вирішити.

Чому це важливо

Перша хвиля широкого донастроювання відбулася після випуску моделі Stable Diffusion текст-у-зображення у серпні 2002 року. Перші моделі, навчені на підмножині гіпермасштабної LAION датасету, були доступні для завантаження кожному.

Однак користувачі, які хотіли вставити конкретний контент (наприклад,自己的 ідентичність, стиль мистецтва чи зображення знаменитостей) у генеративні якості Stable Diffusion, були змушені використовувати техніки, такі як DreamBooth – екстраполяцію методу налаштування Google Research, який дозволяв користувачеві навчати нові дані у вільно доступній моделі за допомогою донастроювання.

Приклади процесу користувача для офіційної реалізації DreamBooth від Google у 2022 році. Користувач відбирає невелику колекцію зображень і вибирає унікальне ім'я (яке Stable Diffusion не має у своїх навчальних даних) у текстових промптах від донастроюваної моделі. Джерело: https://dreambooth.github.io/

Приклади процесу користувача для офіційної реалізації DreamBooth від Google у 2022 році. Користувач відбирає невелику колекцію зображень і вибирає унікальне ім’я (яке Stable Diffusion не має у своїх навчальних даних) у текстових промптах від донастроюваної моделі. Джерело: https://dreambooth.github.io/

Цим чином можна було отримати копію моделі, яка була дуже хороша у створенні конкретної людини чи.custom арт-стилю, але яка тепер була компрометована для загального використання.

Це означало, що якщо ви хотіли донастроювати Stable Diffusion так, щоб вона могла точно зображати трьох різних людей, вам потрібно було створити три різні моделі, кожна близько 2-4 ГБ або більше.

Будь-яка спроба донастроювати ці моделі вдруге не тільки погіршувала загальну продуктивність моделі, але й негативно впливала на вивід попереднього донастроювання.

У будь-якому випадку, моделі DreamBooth для знаменитостей скоро поширилися в Інтернеті, збираючись переважно на домені civit.ai. Згодом менш трудомісткі методи, такі як Low-Rank Adaptation (LoRA), перевершували донастроювання за популярністю (хоча чи вивід LoRA такий же ефективний, як повне донастроювання, залишається спірним, і NVIDIA згодом відкрила джерельний код більш ефективного підходу під назвою DoRA).

LoRA відноситься до категорії Parameter-Efficient Fine-Tuning (PEFT), який впливає лише на підмножину навчених параметрів моделі.

Деякі користувачі хотіли змінити фундаментальну природу відкритих контрольних точок Stable Diffusion, донастроюючи їх на тисячах зображень.

Це, по суті, створювало альтернативну фундаментальну модель, присвячену будь-якій області, яку користувач намагався навчати (наприклад, конкретний стиль мистецтва). Для цієї мети “легкі” методи, такі як LoRA, були менш ефективними, оскільки ваги моделі потребували сильного зміщення до нових навчальних даних.

Місチャт

З недавнім зростанням інтересу до Больших мовних моделей (LLM), користувачі, які хочуть уникнути зростаючих витрат на API-орієнтовані сервіси, такі як ChatGPT, все частіше завантажують і донастроюють ефективні відкриті моделі як Llama 3, серед багатьох інших.

І тут також можна використовувати LoRAs замість донастроювання повної контрольної точки. Ми раніше зазначали, що донастроювання є кращим методом для створення LLM, адаптованих до конкретних потреб користувача. Хоча донастроювання може мати більші апаратні вимоги і тривалість, воно пропонує глибшу генералізацію нових даних, які користувач хоче, щоб модель засвоїла.

Проблема з донастроюванням полягає в тому, що це руйнівний процес, який не може бути інкрементально навчений на додаткових даних пізніше, як ми зазначили вище.

Ознаки і зміщення, які вводяться в модель, очевидно порушують оригінальний баланс ваг у датасеті, що означає, що модель або надто схильна відбивати дані користувача, або буде виконувати гірше в цілому, ніж оригінальна фундаментальна модель (у завданнях, не пов’язаних з новими даними).

Одним із способів вирішення цієї проблеми є заморожування певних частин моделі під час навчання; однак це може привести до зниження загальної функціональності, оскільки заморожена частина архітектури може не загалом добре узагальнюватися до нових даних у латентному просторі моделі.

Було б добре, якщо був би простіший спосіб зберегти оригінальні можливості донастроюваної моделі, зберігаючи при цьому здатність моделі генерувати вивід на основі даних донастроювання.

Такий розвиток був би корисним для всіх потенційних користувачів, від хобі та ранніх приймачів, які використовують локальні LLM та інші типи генеративних моделей, до рівня FAANG (де дуже дорогі моделі штучного інтелекту могли бути покращені ітеративно і некоректно, без багатомільйонних витрат на повторне навчання з додатковими даними).

Післянавчальна калібрування

Це повертає нас до нової статті, яка називається Донастроювання нормальне, якщо відкаліброване і походить від 11 дослідників з Університету штату Огайо, Університету Вісконсин-Медісон і Ренсселерського політехнічного інституту.

Дослідники намагалися дізнатися, що саме пошкоджується у фундаментальній моделі під час донастроювання. Вони прийшли до висновку, що єдина велика різниця між “до і після” моделлю полягає в тому, що логітичні масштаби по класах донастроювання і оригінальним класам у моделі виявляють велику розбіжність.

Логітичні зв’язки передбачають імовірність успіху у логістичному регресі, перетворюючи оцінені значення (які можуть бути дуже точними) у нуль або один.

Автори не тільки виявили, що цей дефіцит майже легко оборотний за допомогою техніки калібрування, але й що це пост-факто виправлення фактично покращує якість виводу для даних донастроювання. Отже, з цією технікою ви не тільки отримуєте оригінальні можливості фундаментальної моделі, але й краще інтегруєте свої власні дані донастроювання.

(Хоча стаття не досліджує цю можливість, ця техніка припускає, що модель можна донастроювати кілька разів і залишається ефективною)

Обговорюючи свої висновки щодо пошкодження моделі після донастроювання, автори заявляють:

‘До нашого сюрпризу, ми виявили, що донастроювана модель не забуває відносини між іншими класами і не погіршує ознаки для розпізнавання цих класів.

‘Натомість, донастроювана модель часто генерує більш дискримінативні ознаки для цих інших класів, навіть якщо вони були відсутні під час донастроювання!

‘[Що] справді шкодить точності, це розбіжність логітичних масштабів між класами донастроювання і іншими [класами], що свідчить про те, що проста післянавчальна калібрування поверне можливість попередньо навченої моделі і водночас відкриє покращення ознак над усіма класами.’

Автори зробили результати своїх тестів для цієї теорії доступними у репозиторії GitHub.

При дослідженні вони виявили, що єдина частина архітектури фундаментальної моделі, яка пошкоджується під час донастроювання, це бінарний класифікатор, який неправильно класифікує класи, які відсутні в оригінальній моделі як класи донастроювання.

Стаття зазначає*:

‘[Додавання] калібрування зміщення до всіх логітів відсутніх класів [4, 40 ], донастроювана модель може успішно повернути точність відсутніх класів і отримати приємне загальне покращення у галузі [домен].

‘Результати навіть перевершують сильну базову лінію [Холістичний перехід – статтю, на якій ця стаття будується ] у багатьох з бенчмарків, включаючи ImageNet і її варіанти [ImageNet, ImageNet-R(endition), ImageNet-S(ketch) ], Office-Home і VTAB, без складного навчання і налаштування гіперпараметрів.’

Результати статті: донастроювана модель, якій було виконано післянавчальне калібрування, може, як зазначають автори, перевершити підхід стану справ до проблеми.

Результати статті: донастроювана модель, якій було виконано післянавчальне калібрування, може, як зазначають автори, перевершити підхід стану справ до проблеми.

Автори класифікують покращену продуктивність післякаліброваної донастроюваної моделі як “неочікувані доброзичливі поведінки” і спостерігають, що коли використовується базовий стохастичний градієнтний спуск (SGD) оптимізатор, отримується кращий результат, ніж з більш популярними поточними оптимізаторами, такими як Adam.

‘Все ж,’ вони зазначають ‘з достатньо малими швидкостями навчання і衰ження ваг, доброзичливі поведінки з’являються і зберігаються.’

Малі ремонти

Для ремонту логітів розбіжностей, що виникли внаслідок донастроювання, автори позичили техніку з нульового навчання, додавши постійний фактор до логітів усіх відсутніх класів. Це призводить до нового правила класифікації.

Автори зазначають, що цей процес “просуває” знехтувані відсутні класи до тієї ж якості передбачення, що й класи донастроювання, відновлюючи оригінальну продуктивність і покращуючи продуктивність “доданих” даних під час висновку.

У тестах техніка післякалібрування відновила продуктивність різноманітних донастроюваних моделей. 'Оракул', вказаний у таблиці, відноситься до донастроюваного класифікатора, який також враховує відсутні дані класів.

У тестах техніка післякалібрування відновила продуктивність різноманітних донастроюваних моделей. ‘Оракул’, вказаний у таблиці, відноситься до донастроюваного класифікатора, який також враховує відсутні дані класів.

Вони далі зазначають, що післянавчальна калібрування “потенційно застосовна до будь-якої моделі” і що методи, які намагаються зберегти цілісність фундаментальної моделі шляхом заморожування шарів (наприклад, класифікатора і бекбону), отримують низькі результати порівняно з їхнім власним запропонованим підходом.

Висновок

Висновки з цього співробітництва здаються значними. Навчання моделі штучного інтелекту на гіпермасштабному датасеті – це величезний крок, подібний до злету пасажирського літака. Хоча навчання можна перервати, а будь-які пошкодження пом’якшити, зберігаючи поточні ваги періодично (за великих витрат на зберігання), щоб дозволити переривання навчання, є відносно мало того, що можна зробити, щоб змінити результат після запуску.

Вражаючим у цій роботі є те, що дослідники, здається, відкрили фундаментальний принцип загального навчання моделей штучного інтелекту, і що їхнє рішення досить елегантне.

Економічні наслідки можливості зберегти точність фундаментальної моделі після донастроювання також значні. До цього часу найбільш поширений метод вирішення недоліків багатомільйонних моделей полягав у фільтрації виводу під час висновку або контролю висновку, щоб уникнути будь-якої слабкості, очевидної у моделі.

Крім того, така техніка могла б теоретично принести значні покращення можливостей донастроюваних генеративних моделей на рівні споживача, з бонусом покращення якості виводу.

 

* Моя конвертація внутрішніх посилань авторів у гіперпосилання.

Перша публікація – вівторок, 1 жовтня 2024 року

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai