Модели и платформы ИИ
Генерация парафраз с помощью глубокого обучения с подкреплением – лидеры мнений

Когда мы пишем или говорим, мы все иногда задумываемся, есть ли лучший способ передать идею другим. Какие слова использовать? Как структурировать мысль? Как они, скорее всего, отреагируют? В Phrasee мы много времени тратим на размышления о языке – что работает, а что нет.
Представьте, что вы пишете тему для электронной кампании, которая будет отправлена 10 миллионам человек в вашем списке, рекламируя скидку 20% на новый ноутбук.
Какую строку бы вы выбрали:
- Теперь вы можете получить дополнительную скидку 20% на свой следующий заказ
- Готовьтесь – дополнительная скидка 20%
Хотя они передают одну и ту же информацию, одна из них достигла почти на 15% более высокой открытой ставки, чем другая (и я ставлю, что вы не можете победить нашу модель в предсказании, какая из них ?). Хотя язык можно часто проверить с помощью A/B-тестирования или многоруких бандитов, автоматическая генерация парафраз остается очень сложной проблемой исследования.
Две предложения считаются парафразами друг друга, если они имеют одинаковый смысл и могут быть использованы взаимозаменяемо. Другой важный момент, который часто принимается как должное, – это то, является ли предложение, сгенерированное машиной, плавным.
В отличие от обучения с учителем, агенты обучения с подкреплением (RL) учатся, взаимодействуя со своей средой и наблюдая за вознаграждениями, которые они получают в результате. Это несколько нюансов имеет огромные последствия для того, как работают алгоритмы и как обучаются модели. Глубокое обучение с подкреплением использует нейронные сети в качестве аппроксиматора функции, чтобы позволить агенту учиться, как превосходить людей в сложных средах, таких как Го, Atari и StarCraft II.
Несмотря на этот успех, обучение с подкреплением не было широко применено к реальным проблемам, включая обработку естественного языка (NLP).
В рамках моей магистерской диссертации по науке о данных мы демонстрируем, как глубокое обучение с подкреплением может быть использовано для превосходства методов обучения с учителем в автоматической генерации парафраз входного текста. Задача генерации лучшего парафраза может быть рассмотрена как нахождение ряда слов, которые максимизируют семантическое сходство между предложениями, сохраняя при этом плавность вывода. Агенты RL хорошо подходят для нахождения лучшего набора действий для достижения максимального ожидаемого вознаграждения в средах управления.
В отличие от большинства задач машинного обучения, самая большая проблема в большинстве приложений генерации естественного языка (NLG) не заключается в моделировании, а скорее в оценке. Хотя оценка человека в настоящее время считается золотым стандартом в оценке NLG, она имеет значительные недостатки, включая высокую стоимость, длительность, сложность настройки и отсутствие воспроизводимости в экспериментах и наборах данных (Han, 2016). В результате исследователи давно ищут автоматические метрики, которые просты, общедоступны и отражают человеческое суждение (Papineni et al., 2002).
Наиболее распространенные автоматические методы оценки при оценке сгенерированных подписей к изображениям суммированы ниже с их плюсами и минусами:

Генерация парафраз с помощью обучения с подкреплением: конвейер
Мы разработали систему под названием ParaPhrasee, которая генерирует парафразы высокого качества. Система состоит из нескольких шагов, чтобы применить обучение с подкреплением эффективным образом. Краткое описание высокоуровневого конвейера представлено ниже, с более подробной информацией, содержащейся в диссертации.

Датасет
Существует несколько наборов парафраз, доступных для использования в исследованиях, включая: корпус парафраз Microsoft (MSFT ), конкурс по семантическому сходству текста ACL, дубликаты вопросов Quora и общие ссылки Twitter. Мы выбрали MS-COCO из-за его размера, чистоты и использования в качестве эталонного набора для двух заметных работ по генерации парафраз. MS-COCO содержит 120 тысяч изображений обычных сцен с 5 подписями к изображениям на каждое изображение, предоставленными 5 разными человеческими аннотаторами.
Хотя он в основном предназначен для исследований в области компьютерного зрения, подписи к изображениям имеют высокое семантическое сходство и являются интересными парафразами. Поскольку подписи к изображениям предоставляются разными людьми, они имеют небольшие различия в деталях, представленных в сцене, поэтому сгенерированные предложения имеют тенденцию к галлюцинациям деталей.

Модель обучения с учителем
Хотя обучение с подкреплением значительно улучшилось в плане эффективности выборки, времени обучения и общих лучших практик, обучение моделей RL с нуля все еще относительно очень медленно и нестабильно (Arulkumaran et al., 2017). Следовательно, вместо обучения с нуля мы сначала обучаем модель обучения с учителем, а затем дообучаем ее с помощью RL.
Мы используем фреймворк Encoder-Decoder и оцениваем производительность нескольких базовых моделей обучения с учителем. При дообучении модели с помощью RL мы дообучаем только декодерскую сеть и рассматриваем кодировщик как статический. Таким образом, мы рассматриваем два основных фреймворка:
- Обучение модели обучения с учителем с нуля с использованием стандартного/обычного кодировщика-декодера с GRU
- Использование предварительно обученных моделей вложений предложений для кодировщика, включая: пула вложений слов (GloVe), InferSent и BERT
Модели обучения с учителем имеют тенденцию работать достаточно хорошо на всех моделях, причем BERT и кодировщик-декодер с наилучшей производительностью.

Хотя производительность имеет тенденцию быть разумной, есть три распространенных источника ошибок: заикание, генерация фрагментов предложений и галлюцинации. Это основные проблемы, которые использование RL призвано решить.

Модель обучения с подкреплением
Реализация алгоритмов RL очень сложна, особенно когда вы не знаете, можно ли решить проблему. Может быть проблема в реализации вашей среды, вашего агента, ваших гиперпараметров, вашей функции вознаграждения или комбинации всех вышеперечисленных. Эти проблемы усугубляются, когда вы используете глубокое обучение с подкреплением, поскольку вы получаете удовольствие от добавленной сложности отладки нейронных сетей.
Как и при любой отладке, важно начинать просто. Мы реализовали вариации двух хорошо понятных игровых сред RL (CartPole и FrozenLake), чтобы протестировать алгоритмы RL и найти повторяющуюся стратегию для передачи знаний из модели обучения с учителем.
Мы обнаружили, что использование алгоритма Actor-Critic превосходит REINFORCE в этих средах. В плане передачи знаний в модель Actor-Critic мы обнаружили, что инициализация весов актера с помощью обученной модели обучения с учителем и предварительное обучение критика достигли наилучшей производительности. Мы обнаружили, что обобщение сложных подходов к дистилляции политики до новых сред является сложным, поскольку они вводят много новых гиперпараметров, которые требуют настройки для работы.
Поддержанные этими идеями, мы затем приступаем к разработке подхода к задаче генерации парафраз. Сначала нам нужно создать среду.

Среда позволяет нам легко протестировать влияние использования различных метрик оценки в качестве функций вознаграждения.
Затем мы определяем агента, учитывая его многочисленные преимущества, мы используем архитектуру Actor-Critic. Актер используется для выбора следующего слова в последовательности и имеет веса, инициализированные с помощью обученной модели обучения с учителем. Критик предоставляет оценку ожидаемого вознаграждения, которое состояние, скорее всего, получит, чтобы помочь актеру учиться.
Проектирование правильной функции вознаграждения
Самый важный компонент проектирования системы RL – это функция вознаграждения, поскольку это то, что агент RL пытается оптимизировать. Если функция вознаграждения неверна, то результаты пострадают, даже если каждая другая часть системы работает!
Классическим примером этого является CoastRunners, где исследователи OpenAI установили функцию вознаграждения как максимизацию общего счета, а не победу в гонке. Результатом этого является то, что агент обнаружил петлю, где он мог получить наивысший счет, не завершая гонку.
https://www.youtube.com/watch?time_continue=2&v=tlOIHko8ySg&feature=emb_title
Учитывая, что оценка качества парафраз сама по себе является нерешенной проблемой, проектирование функции вознаграждения, которая автоматически захватывает эту цель, еще сложнее. Большинство аспектов языка не разлагаются хорошо на линейные метрики и зависят от задачи (Novikova et al., 2017).
Агент RL часто обнаруживает интересную стратегию для максимизации вознаграждений, которая эксплуатирует слабости в метрике оценки, а не генерирует высококачественный текст. Это приводит к плохой производительности на метриках, которые агент не оптимизирует напрямую.
Мы рассматриваем три основных подхода:
- Метрики перекрытия слов
Общие метрики оценки NLP учитывают долю перекрытия слов между сгенерированным парафразом и предложением оценки. Чем больше перекрытие, тем больше вознаграждение. Проблема с подходами на уровне слов заключается в том, что агент включает слишком много соединительных слов, таких как “а” и “на”, и нет меры плавности. Это приводит к очень низкокачественным парафразам.

- Метрики сходства и плавности на уровне предложения
Основные свойства сгенерированного парафраза заключаются в том, что он должен быть плавным и семантически похожим на входное предложение. Следовательно, мы пытаемся явно оценить их индивидуально, а затем объединить метрики. Для семантического сходства мы используем косинусное сходство между вложениями предложений из предварительно обученных моделей, включая BERT. Для плавности мы используем оценку, основанную на перплексии предложения из GPT-2. Чем больше косинусное сходство и оценка плавности, тем больше вознаграждение.
Мы попробовали многие разные комбинации моделей вложений предложений и моделей плавности, и хотя производительность была разумной, основной проблемой, с которой столкнулся агент, было то, что он не смог достаточно сбалансировать семантическое сходство с плавностью. Для большинства конфигураций агент отдал предпочтение плавности, что привело к удалению деталей и размещению большинства сущностей “в середине” чего-то или перемещению “на стол” или “на сторону дороги”.
Многоцелевое обучение с подкреплением – это открытый вопрос исследования и очень сложно в этом случае.

- Использование противостоящей модели в качестве функции вознаграждения
Учитывая, что люди считаются золотым стандартом в оценке, мы обучаем отдельную модель, называемую дискриминатором, для предсказания того, являются ли два предложения парафразами друг друга (podobно тому, как человек оценивает). Цель модели RL заключается в том, чтобы убедить эту модель в том, что сгенерированное предложение является парафразом входного. Дискриминатор генерирует оценку того, насколько вероятно, что два предложения являются парафразами друг друга, которая используется в качестве вознаграждения для обучения агента.
Каждые 5 000 попыток дискриминатору говорят, какой парафраз пришел из набора данных, а какой был сгенерирован, чтобы он мог улучшить свои будущие попытки. Процесс продолжается в течение нескольких раундов, при этом агент пытается обмануть дискриминатор, а дискриминатор пытается различать сгенерированные парафразы и парафразы оценки из набора данных.
После нескольких раундов обучения агент генерирует парафразы, которые превосходят модели обучения с учителем и другие функции вознаграждения.

Вывод и ограничения
Противостоящие подходы (включая самопроигрыш для игр) обеспечивают очень перспективный подход для обучения алгоритмов RL, чтобы превосходить человеческие возможности на определенных задачах без явного определения функции вознаграждения.
Хотя RL смог превзойти обучение с учителем в этом случае, дополнительные накладные расходы по коду, вычислениям и сложности не стоят производительности для большинства приложений. RL лучше всего оставить для ситуаций, когда обучение с учителем не может быть легко применено, и функция вознаграждения легко определяется (например, игры Atari). Подходы и алгоритмы намного более зрелые в обучении с учителем, и сигнал ошибки намного сильнее, что приводит к более быстрому и стабильному обучению.
Другим фактором является то, что, как и в других нейронных подходах, агент может очень драматически потерпеть неудачу в случаях, когда входные данные отличаются от входных данных, которые он видел ранее, что требует дополнительного слоя проверок санитарии для приложений в производстве.
Взрыв интереса к подходам RL и достижения в вычислительной инфраструктуре в последние годы откроют огромные возможности для применения RL в отрасли, особенно в области NLP.












