Моделі та платформи ШІ
LoReFT: Представницьке тонке налаштування для моделей мови
Параметрично-ефективне тонке налаштування або PeFT методи намагаються адаптувати великі моделі мови за допомогою оновлень малих частин ваг. Однак більшість існуючої інтерпретативної роботи продемонструвала, що представлення кодують семантично багату інформацію, що свідчить про те, що це може бути кращим і більш потужним альтернативним методом. Передбачені великі моделі часто тонко налаштовуються для використання в нових доменах або завданнях, і під час процесу тонкого налаштування одна базова модель може бути адаптована до широкого спектра завдань, навіть якщо доступно лише невелика кількість даних у домені. Однак процес тонкого налаштування всієї моделі є ресурсоємним і дорогим, особливо для мовних моделей з значно більшим розміром і параметрами.
Параметрично-ефективне тонке налаштування або PeFT методи пропонують вирішити високі витрати, пов’язані з тонким налаштуванням всієї моделі, оновлюючи лише малий відсоток усіх ваг, процес, який допомагає зменшити час навчання та використання пам’яті. Що ще важливіше, параметрично-ефективне тонке налаштування або PeFT методи продемонстрували подібну продуктивність до тонкого налаштування в кількох практичних умовах. Адаптери, поширена сім’я параметрично-ефективного тонкого налаштування або PeFT методів, вчаться редагувати додаткові ваги, які працюють поряд з замороженою базовою моделлю, а останні адаптери, такі як LoRA, продемонстрували, що можливо тренувати адаптери повної точності на основі моделей з зменшеною точністю без впливу на продуктивність. Адаптери зазвичай є більш ефективними і ефективними порівняно з іншими методами, які вводять нові компоненти моделі.
З попередніх робіт, які продемонстрували, що редагування представлень може бути кращим альтернативним методом, у цій статті ми обговорюватимемо методи тонкого налаштування представлень або ReFT, які працюють на замороженій моделі та вчаться завдань-специфічних втручань у прихованих представленнях. Ця стаття має на меті охопити рамки ReFT або тонкого налаштування представлень у глибині, і ми досліджуємо механізм, методологію, архітектуру рамки разом з її порівнянням з рамками стану мистецтва. Тому почнімо.
ReFT: Тонке налаштування представлень для мовних моделей
У спробі адаптувати передбачені мовні моделі до нових доменів і завдань, поточні рамки часто тонко налаштовують передбачені мовні моделі, оскільки під час процесу тонкого налаштування одна базова модель може бути адаптована до широкого спектра завдань, навіть якщо доступно лише невелика кількість даних у домені. Хоча процес тонкого налаштування дійсно підвищує загальну продуктивність, це дорогий процес, особливо якщо мовна модель має значно більший розмір і параметри. Для вирішення цієї проблеми та зменшення пов’язаних витрат, параметрично-ефективне тонке налаштування або PeFT рамки оновлюють лише малий відсоток усіх ваг, процес, який не тільки зменшує час навчання, але також зменшує використання пам’яті, дозволяючи параметрично-ефективним тонким налаштуванням досягати подібної продуктивності порівняно з підходами повного тонкого налаштування в практичних сценаріях. Адаптери, поширена сім’я параметрично-ефективного тонкого налаштування або PeFT методів, працюють, вчаться редагувати додаткові ваги, які працюють поряд з замороженою базовою моделлю, а останні адаптери, такі як LoRA, продемонстрували, що можливо тренувати адаптери повної точності на основі моделей з зменшеною точністю без впливу на продуктивність. Адаптери зазвичай є більш ефективними і ефективними порівняно з іншими методами, які вводять нові компоненти моделі.
Одна з основних особливостей поточних рамок параметрично-ефективного тонкого налаштування полягає в тому, що вони змінюють ваги замість представлень. Однак рамки, які займаються інтерпретативністю, продемонстрували, що представлення кодують багату семантичну інформацію, що свідчить про те, що редагування представлень може бути кращим і більш потужним підходом порівняно з оновленням ваг. Ця припущення про те, що редагування представлень є кращим підходом, лежить в основі рамки тонкого налаштування представлень або ReFT, яка вчиться втручань замість адаптації ваг моделі, дозволяючи моделі маніпулювати малим відсотком усіх представлень у спробі керувати поведінкою моделі для вирішення завдань під час інференсу. Методи тонкого налаштування представлень або ReFT є заміною вагових параметрично-ефективних тонких налаштувань або PeFT рамок. Підхід ReFT черпає натхнення з останніх моделей, які працюють з великою інтерпретативністю моделей, втручаються у представлення для знаходження вірних причинно-наслідкових механізмів, і керують поведінкою моделі під час інференсу, і тому може бути розглянутим як узагальнення моделей редагування представлень. Будуючи на цьому, LoReFT або тонке налаштування представлень з низьким рангом є сильним і ефективним екземпляром ReFT, і є параметризацією ReFT, яка втручається у приховані представлення у лінійному просторі, охопленому матрицею низького рангу, і будується безпосередньо на основі рамки DAS або розподіленого пошуку відповідності.
Далі, на відміну від повного тонкого налаштування, рамка параметрично-ефективного тонкого налаштування тренує лише малий відсоток параметрів моделі і адаптує модель до завдань. Рамка параметрично-ефективного тонкого налаштування може бути класифікована на три основні категорії:
- Методи на основі адаптерів: Методи на основі адаптерів тренують додаткові модулі, такі як повністю зв’язані шари на основі передбаченої моделі з замороженими вагами. Серійні адаптери вставляють компоненти між багатошаровим перцептроном або MLP і шарами уваги великої моделі, тоді як паралельні адаптери додають модулі поряд з існуючими компонентами. Оскільки адаптери додають нові компоненти, які не можуть бути легко складені у ваги моделі, вони створюють додаткове навантаження під час інференсу.
- LoRA: LoRA разом з її останніми варіантами наближають додаткові ваги під час тренування за допомогою матриць низького рангу, і вони не потребують додаткових накладних витрат під час інференсу, оскільки оновлення ваг можуть бути об’єднані у модель, і це причина, чому вони вважаються поточними найбільш сильними рамками параметрично-ефективного тонкого налаштування.
- Методи на основі промптів: Методи на основі промптів додають м’які токени, які ініціалізуються випадково у вхідних даних, і тренують їхні вкладення, зберігаючи ваги мовної моделі замороженими. Продуктивність, яку забезпечують ці методи, часто не є задовільною порівняно з іншими рамками параметрично-ефективного тонкого налаштування, і вони також несуть значну накладну витрату під час інференсу.
Натомість рамка тонкого налаштування представлень вчиться втручань для зміни малих частин усіх представлень. Крім того, останні роботи з інженерії представлень і керування активацією продемонстрували, що додавання фіксованих векторів керування до залишкової стрімки може забезпечити певний рівень контролю над генерацією великих моделей без потреби ресурсоємного тонкого налаштування. Інші рамки продемонстрували, що редагування представлень із навченим масштабуванням і операцією перекладу може спробувати відповідати, але не перевершити продуктивність, забезпечену адаптерами LoRA, на широкому спектрі завдань з меншою кількістю навчених параметрів. Крім того, успіх цих рамок у різних завданнях продемонстрував, що представлення, введені передбаченими мовними моделями, несуть багату семантику, хоча продуктивність цих моделей є субоптимальною, що призводить до того, що параметрично-ефективне тонке налаштування продовжує бути підходом стану мистецтва без додаткової накладної витрати під час інференсу.
ReFT: Методологія і архітектура
Для збереження простоти процесу збереження стилю рамка тонкого налаштування представлень припускає, що трансформерна велика модель є цілевою моделлю, яка здатна виробляти контекстуалізовані представлення послідовності токенів. Для заданої послідовності з n входними токенами рамка тонкого налаштування представлень спочатку вкладує ці входні токени у список представлень, а потім m шари обчислюють список прихованих представлень послідовно як функцію попереднього списку прихованих представлень. Кожне приховане представлення є вектором, і мовна модель використовує останнє приховане представлення для генерації передбачень. Рамка тонкого налаштування представлень розглядає як маскові мовні моделі, так і автoregresивні мовні моделі. Тепер, згідно з лінійною гіпотезою представлень, у нейронних мережах поняття кодуються у лінійних підпросторах представлень. Останні моделі виявили, що ця твердження є правдивим для нейронних мереж, тренованих на природній мові та інших розподілах входних даних.
Крім того, у дослідженнях інтерпретативності рамка причинної абстракції використовує взаємозамінні втручання для встановлення ролі компонентів нейронної мережі при реалізації певної поведінки. Логіка взаємозамінного втручання полягає в тому, що якщо ви фіксуєте представлення до того, яким воно було б для контрфактичного входу, і це втручання впливає на вивід моделі послідовно у спосіб, який твердження рамки тонкого налаштування представлень щодо компонента, відповідальному за генерацію цього представлення, то компонент грає причинну роль у поведінці. Хоча існують кілька методів, розподілене взаємозамінне втручання є ідеальним підходом для перевірки, чи кодується поняття у лінійному підпросторі представлення, як стверджується лінійною гіпотезою представлень. Крім того, метод DAS був раніше використаний для знаходження лінійних представлень у мовних моделях суттєвих атрибутів, сентименту, лінгвістичних особливостей та математичного rozumіння. Однак кілька експериментів вказують на те, що метод DAS є високо виразним і володіє здатністю знаходити причинно-ефективні підпростори навіть тоді, коли трансформерна мовна модель ініціалізована випадково, і тому ще не навчила жодних завдань-специфічних представлень, що призводить до дискусії щодо того, чи є DAS ефективним і відповідальним для завдань інтерпретативності.
Виразність, яку забезпечує DAS, свідчить про те, що підхід може бути ідеальним інструментом для контролю поведінки мовної моделі, а також для роботи над керованою генерацією та відповідальним редагуванням. Тому для адаптації мовних моделей до завдань рамка тонкого налаштування представлень використовує розподілене взаємозамінне втручання для створення нового параметрично-ефективного методу. Крім того, метод тонкого налаштування представлень є набором втручань, і рамка забезпечує, що для будь-яких двох втручань, які діють на одному шарі, позиції втручань повинні бути не перекриваються, а параметри всіх функцій втручання залишаються незалежними. Як результат, тонке налаштування представлень є загальною рамкою, яка охоплює втручання у приховані представлення під час прямого проходу моделі.
ReFT: Експерименти і результати
Для оцінки своєї продуктивності проти існуючих рамок параметрично-ефективного тонкого налаштування рамка тонкого налаштування представлень проводить експерименти у чотирьох різних завданнях обробки природної мови, і охоплює понад 20 наборів даних, з основною метою забезпечення багатого зображення того, як рамка LoReFT працює у різних сценаріях. Крім того, коли рамка LoReFT реалізується у реальному житті, розробникам потрібно вирішити, скільки втручань вивчити разом з позиціями входів і шарами, на яких застосовувати кожне з них. Для виконання цього завдання рамка тонкого налаштування представлень налаштовує чотири гіперпараметри.
- Кількість позицій префіксу для втручання.
- Кількість позицій суфіксу для втручання.
- Який набір шарів втручати на.
- Чи зав’язувати параметри втручання через різні позиції у одному шарі.
Таким чином, рамка тонкого налаштування представлень спрощує простір пошуку гіперпараметрів і забезпечує фіксовану додаткову накладну витрату під час інференсу, яка не залежить від довжини промпту.

Вищезазначена таблиця порівнює точність моделей LLaMA-7B і LLaMA-13B проти існуючих моделей параметрично-ефективного тонкого налаштування у 8 завданнях зі здоровим глуздом. Як можна побачити, модель LoReFT перевершує існуючі підходи параметрично-ефективного тонкого налаштування на приємний відтинок, незважаючи на те, що вона має значно менше параметрів, а середня продуктивність трьох проходів повідомляється з різними насіннями параметрів для моделі LoReFT. Param(%) обчислюється шляхом ділення кількості тренованих параметрів на кількість всіх параметрів великої базової моделі.

Вищезазначена таблиця підсумовує порівняння точності моделей LLaMA-7B і LLaMA-13B проти існуючих моделей параметрично-ефективного тонкого налаштування у 4 різних завданнях арифметичного rozumіння, а рамка повідомляє про середню продуктивність трьох проходів з різними випадковими насіннями. Як можна побачити, незважаючи на те, що вона має значно менше параметрів (%), рамка LoReFT перевершує існуючі підходи параметрично-ефективного тонкого налаштування на помітний відтинок.

Вищезазначена таблиця підсумовує порівняння точності моделей RoBERTa-base і RoBERTa-large проти існуючих моделей параметрично-ефективного тонкого налаштування у рамках GLUE, а рамка повідомляє про середню продуктивність п’яти проходів з різними випадковими насіннями. Як можна побачити, незважаючи на те, що вона має значно менше параметрів (%), рамка LoReFT перевершує існуючі підходи параметрично-ефективного тонкого налаштування на помітний відтинок.
Остаточні думки
У цій статті ми говорили про LoReFT, потужну альтернативу існуючим рамкам параметрично-ефективного тонкого налаштування, яка досягає сильної продуктивності у різних завданнях з чотирьох різних доменів, забезпечуючи до 50 разів більшу ефективність порівняно з попередніми моделями стану мистецтва. Передбачені великі моделі часто тонко налаштовуються для використання у нових доменах або завданнях, і під час процесу тонкого налаштування одна базова модель може бути адаптована до широкого спектра завдань, навіть якщо доступно лише невелика кількість даних у домені. Однак процес тонкого налаштування всієї моделі є ресурсоємним і дорогим, особливо для мовних моделей з значно більшим розміром і параметрами. Параметрично-ефективне тонке налаштування або PeFT методи пропонують вирішити високі витрати, пов’язані з тонким налаштуванням всієї моделі, оновлюючи лише малий відсоток усіх ваг, процес, який допомагає зменшити час навчання та використання пам’яті. Особливо рамка LoReFT встановлює новий стан мистецтва продуктивності у завданнях зі здоровим глуздом, виконання інструкцій і розуміння природної мови проти найсильніших рамок параметрично-ефективного тонкого налаштування.












