Взгляд Anderson

Получение NLP для Вызова Неправильных Вопросов

mm
Добавьте Unite.AI в избранные источники в Google

Некоторые вопросы являются невозможными для ответа, потому что они содержат неверную информацию – предположения, которые человек, слышащий вопрос, должен фильтровать и отвергать. Это предполагает, конечно, что слушатель имеет достаточно правильной информации, чтобы бросить вызов вопросу, а не использовать сам вопрос в качестве источника (неправильной) информации.

Это представляет собой вызов для систем обработки естественного языка (NLP), таких как GPT-3, которые имеют тенденцию “галлюцинировать” информацию, чтобы поддерживать диалог.

Текущий вопрос GPT-3 “Когда Мари Кюри изобрела уран?” скорее всего, получит ответ “Мари Кюри изобрела уран в 1898 году”.

Источник: https://beta.openai.com/playground (Da Vinci instruct beta).

Источник: https://beta.openai.com/playground (Da Vinci instruct beta).

На самом деле, уран был открыт в 1789 году немецким химиком Мартином Генрихом Клапротом, а открытие Кюри в 1898 году было выделением радия.

Проблема систем NLP, игнорирующих неверные предположения, приобрела известность в этом году, включая то, как результаты поиска Google, дополненные ИИ, игнорируют неверную информацию в вопросе “Когда Нил Армстронг ступил на Марс?” – ошибка, которая все еще присутствует на момент написания этой статьи, и также применяется к Баззу Лайтеру из “Истории игрушек”, который, якобы, приземлился на Луну 21 июля 1969 года.

Том Хэнкс, еще один участник “Истории игрушек”, также приписывается Google, приземлившись на Луну в 1970 году, несмотря на то, что его персонаж астронавт Джим Ловелл наиболее известен тем, что не достиг этого.

Решение Проблемы Предположений в Обменах NLP

Теперь Google Research, вместе с исследователями из Университета Джонса Хопкинса и Брауновского университета, исследует новые методы машинного обучения, с помощью которых системы NLP могут бросить вызов фактически неверным вопросам так же, как это необходимо для человеческих учителей во время разговоров с учениками.

Недавняя статья “Какой лингвист изобрел лампочку? Верификация предположений для вопросов и ответов” описывает согласованные усилия по разработке новой системы для выявления предположений и проверки их истинности перед продолжением разговора.

Новый алгоритм эффективно предобработывает вопросы перед ответом, разбивая “аутентификацию” вопроса на трехэтапный процесс.

Не вычисляется! Слева - 'препятствие', которое возникает даже тогда, когда продвинутая система NLP смогла определить, что вопрос не имеет смысла. Справа - разбивка предложенного алгоритма, который пытается исправить исходную ошибку. Источник: https://arxiv.org/pdf/2101.00391.pdf

Не вычисляется! Слева – ‘препятствие’, которое возникает даже тогда, когда продвинутая система NLP смогла определить, что вопрос не имеет смысла. Справа – разбивка предложенного алгоритма, который пытается исправить исходную ошибку. Источник: https://arxiv.org/pdf/2101.00391.pdf

Хотя это кажется простой проверкой, которая должна была быть встроена в системы знаний с самого начала, большинство тренировочных рутин для NLP учат информацию с чрезмерным доверием к источникам данных, включая дискурс (например, фейковые новости), которые могли быть опубликованы на ранее “доверенных” каналах.

Следовательно, ключевым вопросом является определение консенсусом надежного источника фактов в климате, где распространение неверной “информации” через социальные сети по умолчанию предоставляет ей авторитет в логике обобщения машинного обучения. Последнее использовало количество или повторение данных в качестве замены точности, по крайней мере до тех пор, пока феномен фейковых новостей не стал критической областью интереса в этой области в последние годы.

Определение Лучшего Подхода к Неответственным Вопросам

Чтобы определить подходящий подход для решения вопроса, содержащего дезинформацию, исследователи запустили 100 таких запросов через четыре различные модели вопросов и ответов и попросили человеческих испытуемых выбрать лучший или наименее проблемный ответ, сгенерированный моделями.

Четыре возможных архитектурных результата “плохого” вопроса были: ‘Неответственный’ – где система вопросов и ответов с закрытой книгой эффективно завершает запрос без дальнейшего уточнения; ‘Объяснение на основе неудачи предположения’ – где система не проверяет неверное предположение, эффективно “неответственный” ответ с добавленным объяснением; ‘Извлекательное объяснение’ – где система извлекает связанную цитату из Википедии и добавляет ее к вступительной фразе “Этот вопрос неответственный, потому что…”; и ‘Переписывание в открытом домене’ – где конкурентная система ищет дополнительные источники из Википедии.

Этот пример четырех возможных ответов на якобы 'неответственный' вопрос иллюстрирует сложность попытки конкурентного доменного решения проблемы.

Этот пример четырех возможных ответов на якобы ‘неответственный’ вопрос иллюстрирует сложность попытки конкурентного доменного решения проблемы.

На протяжении всего тестирования пять участников (нанятых на внутренней платформе краудсорсинга Google) предпочли ответы на основе предположений, что привело исследователей к разработке новой основы для разложения и проверки вопросов.

В новой системе лингвистические триггеры извлекаются из вопроса с помощью генератора на основе правил, который деконструирует предложение в предполагаемые утверждения фактов. Если из вопроса получено несколько предположений, каждое из них исследуется, и оно будет вносить вклад в окончательный ответ, если оно решает ошибочные предположения исходного вопроса.

Наборы Данных

Предположения, сгенерированные на начальном этапе, были手ически изменены для создания набора данных с “золотыми” предположениями. Любые предположения, которые возникли из ветвления запроса, но которые не присутствовали в исходных вопросах, были удалены.

Два авторов статьи затем вручную аннотировали 462 предположения в терминах да/нет проверяемости на основе соответствующей страницы Википедии, связанной с каждым вопросом. Случаи несогласия были решены в постфактуме обсуждении перед тем, как быть зафиксированными в наборе данных.

Исследователи использовали zero-shot NLI, задачу классификации предпосылки/гипотезы, которая требовала деконструкции статей Википедии, связанных с вопросами. Поскольку этот процесс приводит к многим более парам, чем вопрос может подразумевать или поддерживать модель, отфильтрованные результаты затем были агрегированы и помечены.

Результаты и Формулировка Ответов

Наиболее эффективные результаты были получены наиболее трудоемким решением: тонко настроенным, гибридным правилом/NLI, сгенерированным из ALBERT QNLI с предложениями Википедии и предположениями.

Производительность моделей верификации, где 'Предложения Википедии' используют предложения, полученные из связанных статей Википедии, и 'Предположения Википедии' - сгенерированные предположения из этих предложений.

Производительность моделей верификации, где ‘Предложения Википедии’ используют предложения, полученные из связанных статей Википедии, и ‘Предположения Википедии’ – сгенерированные предположения из этих предложений.

Используя эту формулу, исследователи разработали систему шаблонов, где отрицающий факт из Википедии добавляется к “Этот вопрос неответственный, потому что…” и подобным фразам. Хотя это не идеальное решение, авторы предполагают, что ответы, основанные на неверифицируемости, вероятно, уменьшат количество ложных отрицаний.

Система в конечном итоге была реализована в модели Расширенного Трансформера (ETC).

Последствия

В зависимости от его окончательной производительности в реальном мире можно утверждать, что этот подход может привести к простой замене “неверифицируемого” на “неответственный” в случаях, когда система исследования не может оценить полезную поправку для ошибочного предположения вопроса. По сути, кажется, что это создает инфраструктуру для будущих и лучших систем верификации.

Исследователи уже признают, что стоимость запросов API на основе токенов является ограничивающим фактором при формулировании более длинных ответов, которые эта система будет генерировать, и можно предположить, что дополнительная нагрузка “живого” исследования вопроса, скорее всего, добавит задержку даже для крупномасштабных систем, таких как GPT-3, поскольку отзывчивость таких систем до сих пор зависела от обобщенной инкорпорации знаний на этапе обучения, а не от обширных, сетевых проверок.

Кроме того, исследователи отмечают, что система в настоящее время имеет ограничения, связанные с парсингом семантических аспектов текста:

Например, кто, по мнению Пипа, является матерью Эстеллы, имеет встроенное притяжательное под нефактивным глаголом верить, но наш генератор все равно сгенерирует ‘Эстелла‘ имеет ‘мать‘.

Тем не менее, команда предвидит новые и более гибкие системы вопросов и ответов, которые будут разработаны на основе этой исследовательской работы:

В будущем мы планируем построить на этой работе, предложив системы вопросов и ответов, которые более прочны и кооперативны. Например, различные типы неудач предположений могут быть решены более гибкими стратегиями ответов – например, нарушение уникальных предположений может быть лучше обработано путем предоставления всех возможных ответов, а не заявления, что уникальное предположение было нарушено.

Писатель о машинном обучении, специалист в области синтеза человеческих изображений. Бывший руководитель контента исследований в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио сайт: martinanderson.ai
Контакт: [email protected]