Взгляд Anderson
Модели NLP испытывают трудности с пониманием рекурсивных именных групп
Исследователи из США и Китая обнаружили, что ни одна из ведущих моделей обработки естественного языка (NLP) не способна по умолчанию распутать английские предложения, содержащие рекурсивные именные группы (NP), и «борются» с определением центрального смысла в тесно связанных примерах, таких как Мой любимый новый фильм и Мой любимый фильм (каждый из которых имеет разный смысл).

В заголовке примера из статьи представлена небольшая загадка, которую дети часто не могут решить: второй мяч зеленый, но пятый мяч – ‘второй зеленый мяч’. Источник: https://arxiv.org/pdf/2112.08326.pdf
Исследователи поставили задачу рекурсивной именной фразы (RNPC) нескольким локально установленным открытым языковым моделям: OpenAI’s GPT-3*, Google’s BERT, и Facebook’s RoBERTa и BART, обнаружив, что эти модели высшего уровня достигли только «случайного» результата. Они заключили†:
‘Результаты показывают, что модели высшего уровня (SOTA) с финальной настройкой на стандартных бенчмарках того же формата все испытывают трудности на нашей базе данных, что говорит о том, что целевое знание не легко доступно.’

Минимальные парные примеры в задаче RNPC, где модели высшего уровня допустили ошибки.
В вышеперечисленных примерах модели не смогли, например, различить семантическое различие между мертвым опасным животным (т.е. хищником, который не представляет угрозы, поскольку он мертв) и опасным мертвым животным (например, мертвым белкой, который может содержать вредоносный вирус и представляет текущую угрозу).
(Кроме того, хотя статья не затрагивает эту тему, ‘мертвый’ также часто используется как наречие, которое не относится ни к одному из случаев)
Однако исследователи также обнаружили, что дополнительная или дополнительная подготовка, включающая материал RNPC, может решить эту проблему:
‘Предварительно обученные языковые модели с результатами высшего уровня на бенчмарках NLU имеют плохое владение этим знанием, но все же могут его выучить, если им будет представлено небольшое количество данных из RNPC.’
Исследователи утверждают, что способность языковой модели ориентироваться в рекурсивных структурах этого типа имеет важное значение для задач нижнего уровня, таких как анализ языка, перевод и особый случай его важности в процедурах обнаружения вреда:
‘[Мы] рассматриваем сценарий, в котором пользователь взаимодействует с ориентированным на задачи агентом, таким как Siri или Alexa, и агент должен определить, является ли участвующая в запросе пользователя деятельность потенциально вредной [т.е. для несовершеннолетних]. Мы выбираем эту задачу, потому что многие ложные положительные результаты исходят от рекурсивных NP.
‘Например, как сделать домашнюю бомбу очевидно вредно, в то время как как сделать домашнюю бомбу для ванны безвредно.’
Статья называется «Является ли “мой любимый новый фильм” моим любимым фильмом? Изучение понимания рекурсивных именных групп» и исходит от пяти исследователей Университета Пенсильвании и одного из Пекинского университета.
Данные и метод
Хотя предыдущие работы изучали синтаксическую структуру рекурсивных NP и семантическую категоризацию модификаторов, ни один из этих подходов не достаточен, по мнению исследователей, для решения этой проблемы.
Следовательно, на основе использования рекурсивных именных групп с двумя модификаторами исследователи попытались установить, существует ли предварительное знание в системах NLP высшего уровня (оно не существует); можно ли его преподать им (можно); что системы NLP могут выучить из рекурсивных NP; и каким образом такое знание может принести пользу последующим приложениям.
База данных, которую использовали исследователи, была создана в четыре этапа. Первым было создание лексикона модификаторов, содержащего 689 примеров, взятых из предыдущей литературы и новой работы.
Далее исследователи собрали рекурсивные NP из литературы, существующих корпусов и своих собственных изобретений. Текстовые ресурсы включали Penn Treebank и Annotated Gigaword корпус.
Затем команда наняла предварительно отобранных студентов колледжа для создания примеров для трех задач, с которыми столкнутся языковые модели, проверив их позже в 8260 действительных экземплярах.
Наконец, были наняты еще студенты колледжа, на этот раз через Amazon Mechanical Turk, для аннотации каждого экземпляра как задачи человеческого интеллекта (HIT), решая споры на основе большинства. Это сократило экземпляры до 4567 примеров, которые были еще больше отфильтрованы до 3790 более сбалансированных экземпляров.
Исследователи адаптировали различные существующие базы данных для формулирования трех разделов своих гипотез, включая MNLI, SNLI, MPE и ADEPT, обучив все модели высшего уровня самостоятельно, за исключением модели HuggingFace, где использовалась контрольная точка.
Результаты
Исследователи обнаружили, что все модели «борются» с задачами RNPC, в отличие от надежного результата 90%+ для людей, при этом модели высшего уровня показали результат на уровне «случайности» (т.е. без каких-либо доказательств врожденной способности по сравнению со случайным результатом в ответ).

Результаты тестов исследователей. Здесь языковые модели тестируются на их точность на существующем бенчмарке, с центральной линией, представляющей эквивалентную человеческую производительность в задачах.
Вторичные линии исследования указывают на то, что эти дефициты можно компенсировать на этапе обучения или финальной настройки модели NLP, включая знание рекурсивных именных групп. Как только эта дополнительная подготовка была проведена, модели достигли ‘сильной нулевой производительности на внешней задаче обнаружения вреда [задачи]’.
Исследователи обещают выпустить код для этой работы на https://github.com/veronica320/Recursive-NPs.
Первоначально опубликовано 16 декабря 2021 года – 17 декабря 2021 года, 6:55 утра GMT+2: исправлена сломанная гиперссылка.
* GPT-3 Ada, который является самым быстрым, но не лучшим в серии. Однако более крупная модель «showcase» Davinci не доступна для финальной настройки, которая составляет более позднюю фазу экспериментов исследователей.
† Мое преобразование внутренних цитат в гиперссылки.












