Моделі та платформи ШІ

Розширення узгодження штучного інтелекту з людськими цінностями за допомогою WARM

mm
Додайте Unite.AI до бажаних джерел у Google

Узгодження систем штучного інтелекту з людськими цінностями

Системи штучного інтелекту (ШІ) стають дедалі більш здатними допомагати людям у складних завданнях, від чат-ботів служби підтримки клієнтів до алгоритмів медичної діагностики. Однак, оскільки ці системи ШІ приймають на себе більше відповідальності, важливо, щоб вони залишалися узгодженими з людськими цінностями та перевагами. Одним із підходів до досягнення цього є техніка під назвою навчання з підкріпленням від людської обратної зв’язку (RLHF). У RLHF система ШІ, відома як політика, нагороджується або покарана на основі людських суджень про її поведінку. Метою є те, щоб політика навчилася максимізувати свою нагороду, і тим самим поводитися відповідно до людських переваг.

Ключовим компонентом RLHF є модель нагороди (RM). RM відповідає за оцінку дій і виводів політики, а також повернення сигналу нагороди для керівництва процесом навчання. Проєктування хорошої RM є складним завданням, оскільки людські переваги можуть бути складними, залежними від контексту та навіть несумісними між індивідами. Недавно дослідники з Google DeepMind запропонували інноваційну техніку під назвою Важені середні моделі нагороди (WARM) для покращення проєктування RM.

Проблема з хакінгом нагород

Одна з основних проблем у RLHF – це хакінг нагород. Хакінг нагород відбувається, коли політика знаходить лазівки, щоб обманути систему RM і отримати високі нагороди без фактичного задоволення передбачених цілей. Наприклад, якщо метою є навчання системи ШІ для генерації високоякісних підсумків, RM може нагороджувати лаконічні та інформативні підсумки. Політика може тоді навчитися експлуатувати це, генеруючи дуже короткі, неінформативні підсумки, посипані ключовими словами, які обманюють RM.

Хакінг нагород відбувається з двох основних причин:

  1. Зміна розподілу – RM навчається на обмеженому наборі людських прикладів. Коли вона розгортається, виводи політики можуть походити з інших розподілів, до яких RM не узагальнюється добре.
  2. Шумові мітки – Людське маркування є недосконалим, з розбіжностями між оцінювачами. RM може сприймати спurious сигнали, а не надійні індикатори якості.

Хакінг нагород призводить до безкорисних систем, які не відповідають людським очікуванням. Що ще гірше, це може призвести до поведінки ШІ, яка є упередженою або навіть небезпечною, якщо розгорнута бездумно.

Поява злиття моделей

Постійний інтерес до стратегій злиття моделей, таких як Model Ratatouille, викликаний усвідомленням того, що більші моделі, хоча й потужні, можуть бути неефективними та непрактичними. Навчання моделі з 1 трильйоном параметрів вимагає заборонних обсягів даних, обчислювальних ресурсів, часу та витрат. Що ще важливіше, такі моделі схильні до надмірної адаптації до тренувальної розподілу, що ускладнює їхню здатність узагальнюватися до різних реальних сценаріїв.

Злиття моделей пропонує альтернативний шлях до розблокування більших можливостей без неконтрольованого масштабування. Пере利用уючи кілька спеціалізованих моделей, навчених на різних розподілах, завданнях чи цілях, злиття моделей спрямоване на підвищення універсальності та стійкості до розподілу. Передумова полягає в тому, що різні моделі захоплюють відмінні передбачувальні закономірності, які можуть доповнювати одна одну при злитті.

Недавні результати демонструють обіцяючий потенціал цієї концепції. Моделі, отримані шляхом злиття, попри значно меншу кількість параметрів, можуть відповідати або навіть перевершувати продуктивність гігантських моделей, таких як GPT-3. Наприклад, ансамбль Model Ratatouille з лише 7 середніх чекпойнтів досягає найвищої точності на високовимірних текстових даних, перевершуючи GPT-3.

Простота злиття шляхом середнього вагового значення є величезним бонусом. Навчання декількох допоміжних моделей дійсно вимагає додаткових ресурсів. Однак важливо, що обчислювальні витрати під час інференсу залишаються ідентичними до однієї моделі, оскільки ваги конденсуються в одну. Це робить метод легко адаптовним, без турбот про підвищення затримки або витрат на пам’ять.

Механізми злиття моделей

Але що саме дозволяє цим моделям досягати таких підвищень точності при злитті?

  • Митигування меморизації: Кожна модель бачить різні перемішані партії даних під час навчання. Середнє значення зменшує будь-яку інстансову меморизацію, зберігаючи лише узагальнення рівня набору даних.
  • Зниження дисперсії: Моделі, навчені незалежно, мають некорельовані помилки. Об’єднання їх平均ує шум, покращуючи калібрування.
  • Регуляризація через різноманітність: Змінні допоміжні завдання змушують моделі сприймати більш загальні ознаки, корисні по всьому розподілу.
  • Повышення стійкості: Несумісність у прогнозах сигналізує про невизначеність. Середнє значення пом’якшує екстремальні судження, підвищуючи надійність.

По суті, злиття моделей компенсує слабкості окремих моделей, щоб посилити їхні колективні сильні сторони. Злитий представник захоплює спільні основні причинно-наслідкові структури, ігноруючи випадкові варіації.

Ця концептуальна основа з’єднує злиття моделей з іншими популярними техніками, такими як ансамбль та багатокритеріальне навчання. Всі ці методи використовують різноманітність між моделями або завданнями для отримання універсальних, невизначених систем. Простота та ефективність середнього вагового значення, однак, надають злиттю моделей унікальну перевагу для просування реальних розгортань.

Вагові середні моделі нагороди

Процес узгодження з WARM

Процес узгодження з WARM

WARM інноваційно використовує проксі-модель нагороди (RM), яка є середнім ваговим значенням декількох окремих RM, кожна з яких дофільтрована з того самого попередньо навченого великого мовного моделі (LLM), але з різними гіперпараметрами. Цей метод підвищує ефективність, надійність під час зміни розподілу та стійкість проти несумісних переваг. Дослідження також показує, що використання WARM як проксі-RM, особливо з збільшенням кількості середніх RM, покращує результати та затримує появу “хакінгу нагород”, явища, при якому нагороди контролю погіршуються з часом.

Ось високорівневий огляд:

  1. Почніть з базової мови моделі, попередньо навченої на великому корпусі. Ініціалізуйте декілька RM, додавши невеликі завдання-специфічні шари зверху.
  2. Дофільтруйте кожну RM окремо на наборі даних людських переваг, використовуючи різні гіперпараметри, такі як швидкість навчання для різноманітності.
  3. Середнє значення ваг дофільтрованих RM, щоб отримати єдиний ансамбль WARM.

Ключовий висновок полягає в тому, що середнє значення ваг зберігає лише інваріантну інформацію, яка вивчається по всіх різноманітних RM. Це зменшує залежність від спуріусних сигналів, підвищуючи стійкість. Ансамбль також виграє від зменшення дисперсії, покращуючи надійність попри зміну розподілу.

Як обговорювалося раніше, різноманітність між незалежно навченими моделями є важливою для розблокування повного потенціалу злиття моделей. Але які конкретні техніки можуть сприяти продуктивній різноманітності?

Документ WARM досліджує декілька розумних ідей, які можуть узагальнитися ширше:

Перестановка порядку

Тривіальна, але впливова підхід полягає в тому, щоб перемішати порядок, в якому дані бачать кожна модель під час навчання. Навіть цей простий крок декорелює ваги, зменшуючи надмірну меморизацію закономірностей.

Варіації гіперпараметрів

Настройка гіперпараметрів, таких як швидкість навчання та ймовірність викидання, для кожного запуску вводить корисну різноманітність. Моделі сходяться по-різному, захоплюючи відмінні властивості набору даних.

Середнє значення чекпойнтів – Baklava

Метод Baklava ініціалізує моделі для злиття з різних знімків однієї й тієї ж траєекторії попереднього навчання. Це розслаблює обмеження порівняно з злиттям моделей, яке вимагає спільної початкової точки. Відносно до Model Ratatouille, Baklava уникнув додаткових завдань. В цілому, це ефективно балансує точність та різноманітність.

Процес дофільтровування декількох моделей нагороди

Процес дофільтровування декількох моделей нагороди

Аналіз підтверджує, що додавання старих чекпойнтів шляхом рухомого середнього значення шкодить індивідуальній продуктивності, компрометуючи переваги різноманітності. Середнє значення лише кінцевих представлень з кожного запуску виконує краще. Загалом, балансування цілей різноманітності з підтриманням точності залишається відкритим дослідницьким викликом.

В цілому, злиття моделей узгоджується з загальним етосом у галузі щодо ефективного повторного використання існуючих ресурсів для підвищення надійності, ефективності та універсальності. Простота середнього вагового значення закріплює його позицію як лідера серед кандидатів на збір надійних моделей з готових будівельних блоків.

На відміну від традиційних методів ансамблю, які середньо значення передбачення, WARM підтримує мінімальну обчислювальну витрату, зберігаючи лише один набір ваг. Експерименти на завданнях підсумовування тексту демонструють ефективність WARM:

  • Для вибірки найкращих з N WARM досягає 92,5% рівня перемоги проти випадкової вибірки згідно з людськими мітками переваг.
  • У RLHF політика WARM досягає 79,4% рівня перемоги проти політики, навченої з однією RM після того самого числа кроків.
  • WARM продовжує виконувати добре навіть тоді, коли чверть людських міток пошкоджена.

Ці результати демонструють потенціал WARM як практичної техніки для розробки реальних помічників ШІ, які поводяться надійно. Згладжуючи несумісності в людській обратній зв’язці, політики WARM можуть залишатися стійко узгодженими з людськими цінностями, навіть продовжуючи навчання з нових досвідів.

Більша картина

WARM знаходиться на перетині двох ключових тенденцій у дослідженні узгодження ШІ. Перша – це вивчення узагальнення поза розподілом (OOD), яке спрямоване на підвищення продуктивності моделей на нових даних, які відрізняються від тренувального розподілу. Друга – це дослідження алгоритмічної стійкості, яке зосереджується на надійності попри малий пертурбації вхідних даних або шум.

Зв’язуючи ці галузі навколо концепції вивчених інваріантностей, WARM рухається до більш строго заснованих технік для узгодження цінностей. Висновки з WARM можуть узагальнитися навіть за межами RLHF, надаючи уроки для ширших систем машинного навчання, які взаємодіють з відкритим світом.

Очевидно, що моделювання нагороди – це лише один із фрагментів пазла узгодження. Нас ще потрібно прогрес у інших викликах, таких як специфікація нагороди, масштабна нагляд, та безпечне дослідження. У поєднанні з комплементарними техніками WARM може прискорити розвиток ШІ, який сталий чином сприяє людському процвітанню. Колективно висвітлюючи принципи, які лежать в основі стійкого узгодження, дослідники чартерують маршрут до корисного, етичного ШІ.

Я провів останні п'ять років, занурючись у захопливий світ машинного навчання та глибокого навчання. Моя пристрасть та експертиза привели мене до внеску у понад 50 різних проектів програмної інженерії, з особливим акцентом на AI/ML. Моя тривала цікавість також привела мене до природної обробки мови, галузі, яку я бажаю дослідити далі.