Взгляд Anderson
Модели генеративного письма на основе ИИ часто «копируют и вставляют» исходные данные

Американский драматург и предприниматель Уилсон Мизнер часто цитируется как сказавший: «Когда вы крадете у одного автора, это плагиат; если вы крадете у многих, это исследование».
Аналогично, предположение вокруг нового поколения систем творческого письма на основе ИИ заключается в том, что огромные объемы данных, поданные им на этапе обучения, привели к настоящей абстракции высокоуровневых концепций и идей; что эти системы имеют в своем распоряжении дистиллированные знания тысяч авторов, из которых ИИ может формулировать инновационные и оригинальные тексты; и что те, кто использует такие системы, могут быть уверены, что они не занимаются плагиатом-посредником.
Это предположение оспаривается новой статьей исследовательского консорциума (включая исследовательские отделы Facebook и Microsoft ), которая обнаружила, что модели генеративных языков на основе машинного обучения, такие как серия GPT, «иногда копируют даже очень длинные отрывки» в свой якобы оригинальный вывод без указания источника.
В некоторых случаях авторы отмечают, что GPT-2 может дублировать более 1000 слов из обучающего набора в своем выводе.
Статья под названием «Как много языковые модели копируют из своих обучающих данных? Оценка лингвистической новизны в генерации текста с помощью RAVEN» является сотрудничеством между Университетом Джонса Хопкинса, Microsoft Research, Нью-Йоркским университетом и Facebook AI Research.
RAVEN
Исследование использует новый подход под названием RAVEN (RAtingVErbalNovelty), акроним, который был забавно искажен, чтобы отразить птичьего злодея классической поэмы:
«Этот акроним относится к „Ворону“ Эдгара Аллана По, где рассказчик встречает загадочного ворона, который повторяет „Никогда больше!“ Рассказчик не может сказать, повторяет ли ворон то, что он слышал от человека, или если он конструирует свои собственные высказывания (может быть, сочетая never и more)— ту же базовую двусмысленность, которую наша статья решает.»
Результаты новой статьи приходят на фоне значительного роста систем генерации контента на основе ИИ, которые стремятся заменить «простые» задачи редактирования, и даже написать полноценный контент. Одна такая система получила 21 миллион долларов в финансировании серии А на прошлой неделе.
Исследователи отмечают, что «GPT-2 иногда дублирует обучающие отрывки, которые более 1000 слов в длину.» (их акцент), и что генеративные языковые системы распространяют лингвистические ошибки в исходных данных.
Языковые модели, изученные в RAVEN, были серией выпусков GPT до GPT-2 (авторы не имели доступа к GPT-3 на тот момент), Transformer, Transformer-XL и LSTM.
Новизна
Статья отмечает, что GPT-2 создает такие слова, как «Swissified», и производные, как «IKEA-ness», создавая такие новые слова (они не появляются в обучающих данных GPT-2) на основе лингвистических принципов, полученных из более высоких размерностей, установленных во время обучения.
Результаты также показывают, что «74% предложений, сгенерированных Transformer-XL, имеют синтаксическую структуру, которой нет в обучающих предложениях», что, по словам авторов, «нейронные языковые модели не просто запоминают; вместо этого они используют продуктивные процессы, которые позволяют им комбинировать знакомые части новыми способами».
Итак, технически обобщение и абстракция должны производить инновационный и новый текст.
Дублирование данных может быть проблемой
Статья предполагает, что длинные и дословные цитаты, произведенные системами генерации естественного языка, могут стать «запечатанными» в модель ИИ, потому что исходный текст повторяется несколько раз в наборах данных, которые не были адекватно дедуплицированы.
Хотя другой исследовательский проект обнаружил, что полное дублирование текста может произойти даже если исходный текст появляется только один раз в наборе данных, авторы отмечают, что этот проект имеет разные концептуальные архитектуры, чем обычные системы генерации контента.
Авторы также отмечают, что изменение компонента декодирования в системах генерации языка может увеличить новизну, но обнаружили в тестах, что это происходит за счет качества вывода.
Дальнейшие проблемы возникают, когда наборы данных, которые обеспечивают алгоритмы генерации контента, становятся все больше. Кроме того, что они усугубляют проблемы вокруг доступности и жизнеспособности предварительной обработки данных, а также качества и дедупликации данных, многие базовые ошибки остаются в исходных данных, которые затем распространяются в выводе контента ИИ.
Авторы отмечают*:
«Недавние увеличения размеров обучающих наборов делают особенно важным проверять новизну, потому что масштаб этих обучающих наборов может разрушить наши интуиции о том, что можно ожидать естественным образом. Например, некоторые заметные работы в языке приобретении полагаются на предположение, что регулярные формы глаголов в прошедшем времени (например, becomed, teached) не появляются в опыте учащегося, поэтому если учащийся производит такие слова, они должны быть новыми для учащегося.
«Однако оказывается, что для всех 92 основных неправильных глаголов в английском языке неправильная регулярная форма появляется в обучающем наборе GPT-2».
Необходимо больше кураторской обработки данных
Статья утверждает, что необходимо уделить больше внимания новизне при формировании генеративных языковых систем, с особым акцентом на обеспечении того, чтобы «отложенная» часть данных (часть исходных данных, отложенная для тестирования того, насколько хорошо окончательный алгоритм оценил основной обучающий набор) была подходящей для задачи.
«В машинном обучении важно оценивать модели на отложенном тестовом наборе. Из-за открытой природы генерации текста сгенерированный текст модели может быть скопирован из обучающего набора, в этом случае он не отложен — поэтому использование этих данных для оценки модели (например, для связности или грамматичности) не действительно».
Авторы также утверждают, что необходимо больше заботы в производстве языковых моделей из-за эффекта Элизы, синдрома, выявленного в 1966 году, который выявил «склонность людей читать гораздо больше понимания, чем это оправдано, в строки символов — особенно слова — соединенные компьютерами».
* Мое преобразование внутренних цитат в гиперссылки












