Взгляд Anderson
Предотвращение «галлюцинаций» в GPT-3 и других сложных языковых моделях

Одной из характерных черт «фейковых новостей» является то, что они часто представляют ложную информацию в контексте фактически правильной информации, с ложными данными, которые приобретают кажущуюся авторитетность благодаря литературной осмосе – тревожная демонстрация силы полуправд.
Сложные генеративные модели обработки естественного языка (NLP), такие как GPT-3, также имеют тенденцию «галлюцинировать» этот тип вводящей в заблуждение информации. Частично это связано с тем, что языковые модели требуют возможности перефразировать и суммировать длинные и часто лабиринтные отрывки текста, без архитектурных ограничений, которые могут определить, инкапсулировать и «запечатать» события и факты, чтобы они были защищены от процесса семантической реконструкции.
Следовательно, факты не являются священными для модели NLP; они могут легко оказаться обработанными в контексте «семантических лего-кубиков», особенно когда сложная грамматика или арканная исходная информация делает трудным разделение отдельных сущностей от языковой структуры.

Наблюдение за тем, как извращенно сформулированный исходный материал может сбить с толку сложные языковые модели, такие как GPT-3. Источник: Paraphrase Generation Using Deep Reinforcement Learning
Эта проблема распространяется из текстовых машинных обучений в исследования компьютерного зрения, особенно в секторах, которые используют семантическую дискриминацию для выявления или описания объектов.

Галлюцинация и неточная «косметическая» интерпретация влияет на исследования компьютерного зрения.
В случае GPT-3 модель может разочароваться повторными вопросами на тему, которую она уже рассмотрела как можно лучше. В лучшем случае она признает поражение:

Недавний эксперимент с базовым двигателем Davinci в GPT-3. Модель дает правильный ответ на первый вопрос, но раздражается, когда ее спрашивают второй раз. Поскольку она сохраняет кратковременную память о предыдущем ответе и рассматривает повторный вопрос как отклонение предыдущего ответа, она признает поражение. Источник: https://www.scalr.ai/post/business-applications-for-gpt-3
DaVinci и DaVinci Instruct (Beta) работают лучше в этом отношении, чем другие модели GPT-3, доступные через API. Здесь модель Curie дает неправильный ответ, а модель Babbage уверенно развивает неправильный ответ:

Вещи, которые Эйнштейн никогда не говорил
Когда мы просим двигатель GPT-3 DaVinci Instruct (который в настоящее время кажется наиболее способным) о знаменитой цитате Эйнштейна «Бог не играет в кости с Вселенной», DaVinci Instruct не может найти цитату и изобретает вымышленную цитату, а затем «галлюцинирует» три другие относительно правдоподобные и совершенно вымышленные цитаты (Эйнштейна или кого-либо другого) в ответ на аналогичные запросы:

GPT-3 производит четыре правдоподобные цитаты Эйнштейна, ни одна из которых не дает никаких результатов в полном текстовом интернет-поиске, хотя некоторые вызывают другие (реальные) цитаты Эйнштейна на тему «воображения».
Если GPT-3 постоянно ошибался в цитатах, было бы легче программно отклонить эти «галлюцинации». Однако, чем более распространена и знаменита цитата, тем более вероятно, что GPT-3 ее правильно воспроизведет:

GPT-3, кажется, находит правильные цитаты, когда они хорошо представлены в исходных данных.
Вторая проблема может возникнуть, когда история сеанса GPT-3 проникает в новый вопрос:

Эйнштейн, вероятно, был бы шокирован, если бы эта цитата была бы ему приписана. Цитата кажется бессмысленной «галлюцинацией» реальной афоризмы Уинстона Черчилля. Предыдущий вопрос в сеансе GPT-3 относился к Черчиллю (а не Эйнштейну), и GPT-3, кажется, ошибочно использовала этот токен сеанса, чтобы сформировать ответ.
Борьба с «галлюцинациями» экономически
«Галлюцинация» является заметным препятствием для принятия сложных моделей NLP в качестве исследовательских инструментов – тем более, поскольку вывод этих двигателей сильно абстрагируется от исходного материала, который сформировал его, так что установление достоверности цитат и фактов становится проблематичным.
Следовательно, одной из текущих общих исследовательских задач в NLP является создание средства для выявления «галлюцинированных» текстов без необходимости полностью новых моделей NLP, которые включают, определяют и аутентифицируют факты как отдельные сущности (долгосрочная, отдельная цель в ряде более широких компьютерных исследовательских секторов).
Выявление и генерация «галлюцинированных» содержимого
Новое сотрудничество между Университетом Карнеги-Меллона и Facebook AI Research предлагает новый подход к проблеме «галлюцинаций», формулируя метод для выявления «галлюцинированных» выводов и использования синтетических «галлюцинированных» текстов для создания набора данных, который может быть использован в качестве базовой линии для будущих фильтров и механизмов, которые могут стать неотъемлемой частью архитектур NLP.

Источник: https://arxiv.org/pdf/2011.02593.pdf
На приведенном выше изображении исходный материал был сегментирован на основе каждого слова, с меткой «0», присвоенной правильным словам, и меткой «1», присвоенной «галлюцинированным» словам. Ниже мы видим пример «галлюцинированного» вывода, который связан с входной информацией, но дополнен недостоверными данными.
Система использует предварительно обученный автоэнкодер, способный сопоставить «галлюцинированную» строку с исходным текстом, из которого была сгенерирована испорченная версия (аналогично моим примерам выше, где интернет-поиск показал происхождение ложных цитат, но с программным и автоматическим семантическим методом). Конкретно, используется автоэнкодерная модель BART от Facebook для генерации испорченных предложений.

Присвоение меток.
Процесс сопоставления «галлюцинации» с исходным текстом, который не возможен в обычном потоке высокоуровневых моделей NLP, позволяет сопоставить «расстояние редактирования» и облегчает алгоритмический подход к выявлению «галлюцинированного» содержимого.
Исследователи обнаружили, что система хорошо обобщается, даже когда у нее нет доступа к справочному материалу, который был доступен во время обучения, что говорит о том, что концептуальная модель правильна и широко воспроизводима.
Борьба с переобучением
Чтобы избежать переобучения и прийти к широко развертываемой архитектуре, исследователи случайным образом удаляли токены из процесса и также использовали парафразирование и другие функции шума.
Машинный перевод (MT) также является частью этого процесса затенения, поскольку перевод текста на разные языки, вероятно, сохранит смысл надежно и еще больше предотвратит переобучение. Следовательно, «галлюцинации» были переведены и выявлены для проекта двуязычными говорящими в ручном слое аннотации.
Инициатива достигла новых лучших результатов в ряде стандартных тестов сектора и является первой, которая достигла приемлемых результатов, используя данные, превышающие 10 миллионов токенов.
Код проекта, озаглавленный Обнаружение «галлюцинированного» содержимого в условной генерации последовательностей, был выпущен на GitHub, и позволяет пользователям генерировать свои собственные синтетические данные с помощью BART из любого корпуса текста. Также предусмотрена возможность последующего генерирования моделей обнаружения «галлюцинаций».












