Погляд Anderson
Моделі NLP мають труднощі з розумінням рекурсивних іменних фраз
Дослідники з США та Китаю виявили, що жодна з провідних моделей обробки природної мови (NLP) не здатна, за замовчуванням, розгорнути англійські речення, що містять рекурсивні іменні фрази (NPs), і “борються” з виділенням центрального значення в тісно пов’язаних прикладах, таких як Мій улюблений новий фільм і Мій улюблений фільм (кожен з яких має інше значення).

У заголовку статті наведено приклад, який часто не можуть розібрати діти: другий м’яч зелений, але п’ятий м’яч – це ‘другий зелений м’яч’. Джерело: https://arxiv.org/pdf/2112.08326.pdf
Дослідники поставили завдання рекурсивної іменної фрази (RNPC) декільком локально встановленим відкритим мовним моделям: OpenAI’s GPT-3*, Google’s BERT, і Facebook’s RoBERTa і BART, виявивши, що ці моделі досягли лише “випадкових” результатів. Вони висновують†:
‘Результати показують, що моделі state-of-the-art (SOTA) після доопрацювання на стандартних бенчмарках такого ж формату всі борються з нашим набором даних, що свідчить про те, що цільова інформація не легко доступна.’

Мінімальні приклади в тесті RNPC, де моделі SOTA зробили помилки.
У наведених вище прикладах моделі не змогли, наприклад, розрізнити семантичну різницю між мертвий небезпечний звір (тобто хижак, який не становить загрози, оскільки мертвий) і небезпечний мертвий звір (наприклад, мертва білка, яка може містити шкідливу вірус і зараз активна загроза).
(Крім того, хоча стаття не торкається цього питання, ‘мертвий’ також часто вживається як прислівник, який не стосується жодного з цих випадків)
Однак дослідники також виявили, що додаткове або додаткове навчання, яке включає матеріал RNPC, може вирішити цю проблему:
‘Доопрацьовані мовні моделі з результатами SOTA на бенчмарках NLU мають слабке володіння цією інформацією, але все ж можуть її вивчити, якщо їм буде надано невелику кількість даних з RNPC.’
Дослідники стверджують, що здатність мовної моделі орієнтуватися в рекурсивних структурах такого типу є важливою для задач нижнього рівня, таких як аналіз мови, переклад, і роблять особливий випадок для її важливості в процедурах виявлення шкоди:
‘[Ми] розглядаємо сценарій, у якому користувач взаємодіє з орієнтованим на завдання агентом, таким як Siri або Alexa, і агент需要 визначити, чи діяльність, задіяна в запиті користувача, потенційно шкідлива [тобто для неповнолітніх]. Ми обираємо цю задачу, оскільки багато хибних позитивів походять від рекурсивних іменних фраз.
‘Наприклад, як зробити домашню бомбу явно шкідлива, тоді як як зробити домашню ванну-бомбу безшкідлива.’
Стаття стаття називається Чи є “мій улюблений новий фільм” моїм улюбленим фільмом? Розгляд розуміння рекурсивних іменних фраз, і походять від п’яти дослідників Університету Пенсільванії та одного з Пекінського університету.
Дані та метод
Хоча попередня робота вивчала синтаксичну структуру рекурсивних іменних фраз і семантичну категоризацію модифікаторів, жоден з цих підходів не достатній, згідно з дослідниками, для вирішення цієї проблеми.
Отже, на основі використання рекурсивних іменних фраз з двома модифікаторами, дослідники намагалися встановити, чи існує необхідна інформація в системах NLP (вона не існує); чи її можна навчити їх (її можна навчити); що системи NLP можуть вивчити з рекурсивних іменних фраз; і яким чином така інформація може бути корисною для задач нижнього рівня.
Набір даних, який використовували дослідники, був створений у чотири етапи. Спочатку був створений лексикон модифікаторів, який містив 689 прикладів, взятих з попередньої літератури та нової роботи.
Далі дослідники зібрали рекурсивні іменні фрази з літератури, існуючих корпусів та власних винаходів. Текстові джерела включали Penn Treebank і Annotated Gigaword корпус.
Потім команда найняла попередньо відібраних студентів коледжу для створення прикладів для трьох завдань, які мали вирішити мовні моделі, після чого вони були перевірені та затверджені у вигляді 8 260 дійсних екземплярів.
Нарешті, ще одна група попередньо відібраних студентів коледжу була найнята, цього разу через Amazon Mechanical Turk, для анотації кожного екземпляру як задачі людського інтелекту (HIT), приймаючи рішення більшістю голосів. Це звузило екземпляри до 4 567 прикладів, які були далі фільтровані до 3 790 більш збалансованих екземплярів.
Дослідники адаптували різні існуючі набори даних для формулювання трьох секцій своїх гіпотез, включаючи MNLI, SNLI, MPE і ADEPT, тренуючи всі моделі SOTA самостійно, за винятком моделі HuggingFace, де був використаний чекпойнт.
Результати
Дослідники виявили, що всі моделі “борються” з завданнями RNPC, на відміну від надійної точності 90%+ для людей, при цьому моделі SOTA показали результати на рівні “випадковості” (тобто без жодних ознак вродженої здатності проти випадкової відповіді).

Результати тестів дослідників. Тут мовні моделі тестуються на їхню точність на існуючому бенчмарку, при цьому центральна лінія представляє еквівалентну людську продуктивність у завданнях.
Другорядні лінії дослідження свідчать, що ці недоліки можна компенсувати на етапі навчання або доопрацювання мовної моделі шляхом включення знань про рекурсивні іменні фрази. Як тільки це додаткове навчання було проведено, моделі досягли ‘сильної нульової продуктивності на зовнішньому виявленні шкоди [задач]’.
Дослідники обіцяють випустити код цієї роботи на https://github.com/veronica320/Recursive-NPs.
Спочатку опубліковано 16 грудня 2021 року – 17 грудня 2021 року, 6:55 ранку GMT+2: Виправлено розбитий гіперпосилання.
* GPT-3 Ada, який є найшвидшим, але не найкращим у серії. Однак більша модель ‘демонстраційна’ Davinci не доступна для доопрацювання, яке складає пізню фразу експериментів дослідників.
† Моє перетворення внутрішніх цитат у гіперпосилання.












