Моделі та платформи ШІ

Генерація парафраз за допомогою глибокого навчання з підкріпленням – лідери думок

mm
Додайте Unite.AI до бажаних джерел у Google

Коли ми пишемо або розмовляємо, кожен з нас колись задумувався, чи є кращий спосіб передати ідею іншим. Які слова використовувати? Як структурувати думку? Як вони, ймовірно, відреагують? У Phrasee ми багато часу приділяємо вивченню мови – що працює, а що ні.

Представіть собі, що ви пишете тему електронного листа для кампанії, яка буде розіслана 10 мільйонам людей у вашому списку, рекламуючи новий ноутбук зі знижкою 20%.

Який варіант ви оберете:

  • Тепер ви можете отримати додаткову знижку 20% на свій наступний заказ
  • Готуйтеся – додаткова знижка 20%

Хоча вони передають одну й ту ж інформацію, один варіант досяг майже на 15% вищого відкриття, ніж інший (і я ставлю на те, що ви не можете перемогти нашу модель у передбаченні, який саме).
Хоча мову можна часто тестувати за допомогою A/B-тестування або багаторукого бандита, автоматична генерація парафраз залишається дуже складною задачею дослідження.

Два речення вважаються парафразами одне одного, якщо вони мають однаковий сенс і можуть бути використані взаємозамінно. Інша важлива річ, яку часто приймають як належне, – це те, чи є речення, згенероване машиною, флуентним.

На відміну від навчального навчання, агенти навчання з підкріпленням вивчають, взаємодіючи зі своєю середовищем і спостерігаючи за нагородами, які вони отримують у результаті. Ця дещо нюансова різниця має величезні наслідки для того, як працюють алгоритми та як тренуються моделі. Глибоке навчання з підкріпленням використовує нейронні мережі як апроксиматор функції, щоб дозволити агенту вивчити, як перевершити людей у складних середовищах, таких як Го, Atari та StarCraft II.

Незважаючи на цей успіх, навчання з підкріпленням не було широко застосовано до реальних задач, включаючи обробку природної мови.

У рамках моєї магістерської дисертації з науки про дані ми демонструємо, як глибоке навчання з підкріпленням можна використовувати для перевершення методів навчального навчання в автоматичній генерації парафразів вхідного тексту. Задача генерації найкращого парафразу можна розглядати як пошук серії слів, які максимізують семантичну схожість між реченнями, зберігаючи при цьому флуентність у виводі. Агенти навчання з підкріпленням добре підходять для пошуку найкращого набору дій для досягнення максимальної очікуваної нагороди в контрольованих середовищах.

На відміну з більшостю задач машинного навчання, найбільша проблема в більшості застосунків генерації природної мови не лежить у моделюванні, а радше в оцінці. Хоча оцінка людиною зараз вважається золотим стандартом оцінки генерації мови, вона має суттєві недоліки, включаючи те, що вона дорога, тривала, складна для налаштування та не має репродуктивності між експериментами та наборами даних (Han, 2016). Як наслідок, дослідники давно шукають автоматичні метрики, які є простими, узагальненими та відображають людську оцінку (Papineni et al., 2002).

Найпоширеніші автоматичні методи оцінки при оцінці згенерованих підказок зображень підсумовуються нижче з їхніми плюсами та мінусами:

Генерація парафраз за допомогою навчання з підкріпленням: конвеєр

Ми розробили систему під назвою ParaPhrasee, яка генерує парафрази високої якості. Система складається з кількох кроків, щоб застосувати навчання з підкріпленням ефективним чином. Короткий підсумок високорівневого конвеєра наведено нижче з більш докладною інформацією, розміщеною в дисертації.

Набір даних

Існує кілька наборів даних парафраз, доступних для використання в дослідженнях, включаючи: корпус парафраз Microsoft (MSFT ), змагання ACL з семантичної схожості тексту, дублікат питань Quora та 共同ні посилання в Twitter. Ми обрали MS-COCO через його розмір, чистоту та використання як бенчмарка для двох відомих робіт з генерації парафраз. MS-COCO містить 120 тисяч зображень звичайних сцен з 5 підписами зображення на одне зображення, наданими 5 різними людьми-анотаторами.

Хоча воно в основному призначене для досліджень комп’ютерного зору, підписи зображень схожі за змістом і є цікавими парафразами. Оскільки підписи зображень надані різними людьми, вони схильні мати невеликі відмінності в деталях, наданих у сцені, тому згенеровані речення схильні до галюцинацій.

Надзоркова модель

Хоча навчання з підкріпленням значно покращилось у плані ефективності вибірки, часу навчання та загальних найкращих практик, навчання моделей навчання з підкріпленням з нуля все ще порівняно дуже повільне та нестабільне (Arulkumaran et al., 2017). Тому, замість навчання з нуля, ми спочатку тренуємо надзорчову модель, а потім донастроюємо її за допомогою навчання з підкріпленням.

Ми використовуємо фреймворк моделі кодувача-розкодувача та оцінюємо продуктивність кількох базових надзорчих моделей. Коли донастроюємо модель за допомогою навчання з підкріпленням, ми донастроюємо лише мережу розкодувача та розглядаємо мережу кодувача як статичну. Таким чином, ми розглядаємо два основні фреймворки:

  • Навчання надзорчої моделі з нуля за допомогою стандартної/ванільної моделі кодувача-розкодувача з GRU
  • Використання попередньо навчених моделей вкладення речень для кодувача, включаючи: пуловані вкладення слів (GloVe), InferSent та BERT

Надзорчі моделі схильні демонструвати досить схожу продуктивність у всіх моделях, причому BERT та ванільна модель кодувача-розкодувача демонструють найкращу продуктивність.

Хоча продуктивність схильна бути досить прийнятною, існують три поширені джерела помилок: заїкання, генерація фрагментів речень та галюцинації. Це є основними проблемами, які використання навчання з підкріпленням намагається вирішити.

Модель навчання з підкріпленням

Реалізація алгоритмів навчання з підкріпленням дуже складна, особливо коли ви не знаєте, чи можна вирішити проблему. Можуть бути проблеми у реалізації вашого середовища, агентів, гіперпараметрів, функції нагороди або будь-якої їхньої комбінації! Ці проблеми загострюються, коли ви робите глибоке навчання з підкріпленням, оскільки ви отримуєте додаткову складність відладки нейронних мереж.

Як і при будь-якій відладці, важливо починати просто. Ми реалізували варіанти двох добре зрозумілих іграшкових середовищ навчання з підкріпленням (CartPole та FrozenLake), щоб протестувати алгоритми навчання з підкріпленням та знайти повторювану стратегію передачі знань з надзорчої моделі.

Ми виявили, що використання алгоритму актора-критика перевершує REINFORCE в цих середовищах. Що стосується передачі знань до моделі актора-критика, ми виявили, що ініціалізація ваг актора навченою надзорчою моделлю та попереднє навчання критика забезпечили найкращу продуктивність. Ми виявили, що застосування складних підходів до дистиляції політики до нових середовищ досить складне, оскільки вони вводять багато нових гіперпараметрів, які потрібно налаштувати для роботи.

Підтримані цими знаннями, ми потім перейшли до розробки підходу для завдання генерації парафраз. Спочатку нам потрібно створити середовище.

Середовище дозволяє нам легко протестувати вплив використання різних метрик оцінки як функцій нагороди.

Ми потім визначаємо агента, оскільки він має багато переваг, ми використовуємо архітектуру актора-критика. Актор використовується для вибору наступного слова в послідовності та має свої ваги, ініціалізовані за допомогою надзорчої моделі. Критик забезпечує оцінку очікуваної нагороди, яку стан, ймовірно, отримає, щоб допомогти актору вивчити.

Проектування правильної функції нагороди

Найважливішим компонентом проекту системи навчання з підкріпленням є функція нагороди, оскільки це те, що агент навчання з підкріпленням намагається оптимізувати. Якщо функція нагороди неправильна, то результати будуть страждати, навіть якщо кожна інша частина системи працює!

Класичний приклад цього – CoastRunners, де дослідники OpenAI встановили функцію нагороди як максимізацію загального рахунку, а не перемогу в гонці. Результатом цього стало те, що агент виявив петлю, в якій він міг отримати найвищий рахунок, не завершуючи гонку.

https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title

Оскільки оцінка якості парафраз сама по собі є нерозв’язаною проблемою, проектування функції нагороди, яка автоматично захоплює цю мету, ще складніше. Більшість аспектів мови не розкладаються гарно на лінійні метрики та залежать від завдання (Novikova et al., 2017).

Агент навчання з підкріпленням часто виявляє цікаву стратегію для максимізації нагород, яка використовує слабкості в метриці оцінки, а не генерує високоякісний текст. Це схильне призводити до поганої продуктивності на метриках, які агент не оптимізує безпосередньо.

Ми розглядаємо три основні підходи:

  1. Метрики перекриття слів

Поширені метрики оцінки NLP розглядають пропорцію перекриття слів між згенерованим парафразом та реченням оцінки. Чим більше перекриття, тим більша нагорода. Проблема з підходами на рівні слів полягає в тому, що агент включає занадто багато сполучних слів, таких як “а” або “є”, і немає міри флуентності. Це призводить до дуже низькоякісних парафраз.

  1. Метрики схожості та флуентності на рівні речень

Основними властивостями згенерованого парафразу є те, що він повинен бути флуентним та семантично схожим на вхідне речення. Тому ми спробували явно оцінити ці властивості окремо, а потім об’єднати метрики. Для семантичної схожості ми використовуємо косинусну схожість між вкладеннями речень з попередньо навчених моделей, включаючи BERT. Для флуентності ми використовуємо оцінку, засновану на перплексії речення з GPT-2. Чим більша косинусна схожість та оцінка флуентності, тим більша нагорода.

Ми спробували багато різних комбінацій моделей вкладення речень та моделей флуентності, і хоча продуктивність була прийнятною, основною проблемою, з якою агент зіткнувся, було те, що він не достатньо балансував семантичну схожість з флуентністю. Для більшості конфігурацій агент пріоритезував флуентність, що призводило до видалення деталей та розміщення більшості об’єктів “в середині” чогось або переміщення “на столі” чи “біля дороги”.

Мультиоб’єктне навчання з підкріпленням є відкритим дослідницьким питанням і дуже складним у цьому випадку.

  1. Використання моделі-антагоніста як функції нагороди

Оскільки люди вважаються золотим стандартом оцінки, ми тренуємо окрему модель, звану дискримінатором, для передбачення того, чи є два речення парафразами одне одного (подібно до того, як людина б оцінила). Метою моделі навчання з підкріпленням є переконати цю модель в тому, що згенероване речення є парафразом вхідного. Дискримінатор генерує оцінку того, наскільки ймовірно, що два речення є парафразами одне одного, яку використовують як нагороду для навчання агента.

Кожні 5 000 спроб дискримінатору повідомляється, який парафраз походив з набору даних, а який був згенерований, щоб він міг покращити свої майбутні передбачення. Процес триває протягом кількох раундів, при цьому агент намагається обманути дискримінатор, а дискримінатор намагається відрізнити згенеровані парафрази від парафразів оцінки з набору даних.

Після кількох раундів навчання агент генерує парафрази, які перевершують надзорчі моделі та інші функції нагороди.

Висновок та обмеження

Антагоністичні підходи (включаючи самограї для ігор) забезпечують дуже перспективний підхід для навчання алгоритмів навчання з підкріпленням для перевершення людської продуктивності на певних завданнях без визначення явної функції нагороди.

Хоча навчання з підкріпленням було能够 перевершити навчання з учителем у цьому випадку, додаткова накладність у плані коду, обчислень та складності не вартує продуктивності для більшості застосунків. Навчання з підкріпленням найкраще залишити для ситуацій, коли навчання з учителем не можна легко застосувати, а функція нагороди легко визначається (наприклад, ігри Atari). Підходи та алгоритми значно більш зрілі у навчанні з учителем, а сигнал помилки значно сильніший, що призводить до швидшого та більш стабільного навчання.

Інша справа полягає в тому, що, як і інші нейронні підходи, агент може дуже драматично помилятися у випадках, коли вхід відрізняється від входів, яких він раніше бачив, що вимагає додаткового шару перевірок санітарії для застосунків виробництва.

Розширення інтересу до підходів навчання з підкріпленням та досягнень у сфері обчислювальної інфраструктури за останні кілька років розблокує величезні можливості для застосування навчання з підкріпленням у промисловості, особливо у сфері обробки природної мови.

Андрій Ґіббс-Браво є вченим-даними у Phrasee та зосереджений на поліпшенні технологій, що стоять за світовими лідерами у сфері штучного інтелекту, який використовується для копірайтингу. Він також є співорганізатором зустрічі спільноти лондонського навчання з підкріпленням та цікавиться всіма речами, пов'язаними з RL, NLP та машинним навчанням.