Модели и платформы ИИ

Проблема плагиата: Как модели генеративного ИИ воспроизводят защищённый авторским правом контент

mm
Добавьте Unite.AI в избранные источники в Google

Быстрый прогресс в области генеративного ИИ вызвал волнение по поводу творческого потенциала этой технологии. Однако эти мощные модели также представляют собой тревожные риски, связанные с воспроизведением защищённого авторским правом или плагиатом контента без надлежащей атрибуции.

Как нейронные сети поглощают обучающие данные

Современные системы ИИ, такие как GPT-3, обучаются с помощью процесса, называемого переносом обучения. Они поглощают огромные наборы данных, собранные из публичных источников, таких как веб-сайты, книги, научные статьи и многое другое. Например, обучающие данные GPT-3 включали 570 гигабайт текста. Во время обучения ИИ ищет закономерности и статистические отношения в этом огромном массиве данных. Он учится корреляциям между словами, предложениями, абзацами, языковой структурой и другими особенностями.

Это позволяет ИИ генерировать новый связный текст или изображения, предсказывая последовательности, которые, вероятно, будут следовать за данным входом или подсказкой. Однако это также означает, что эти модели поглощают контент без учета авторских прав, атрибуции или рисков плагиата. В результате генеративные ИИ могут непреднамеренно воспроизводить дословные отрывки или перефразировать защищенный авторским правом текст из своих обучающих корпусов.

Ключевые примеры плагиата ИИ

Проблемы с плагиатом ИИ возникли особенно после выпуска GPT в 2020 году.

Недавние исследования показали, что крупные языковые модели (LLM), такие как GPT-3, могут воспроизводить значительные дословные отрывки из своих обучающих данных без цитирования (Nasr et al., 2023; Carlini et al., 2022). Например, судебный иск The New York Times показал, что программное обеспечение OpenAI генерирует статьи The New York Times почти дословно (The New York Times, 2023).

Эти результаты свидетельствуют о том, что некоторые генеративные системы ИИ могут производить неавторизованные плагиатные выходы, рискуя нарушением авторских прав. Однако распространенность остается неопределенной из-за “черного ящика” природы LLM. Судебный иск The New York Times утверждает, что такие выходы составляют нарушение, которое может иметь серьезные последствия для разработки генеративного ИИ. В целом, доказательства указывают на то, что плагиат является врожденной проблемой в крупных моделях нейронных сетей, которая требует бдительности и мер безопасности.

Эти случаи раскрывают два ключевых фактора, влияющих на риски плагиата ИИ:

  1. Размер модели – Более крупные модели, такие как GPT-3.5, более склонны к регенерации дословных текстовых отрывков по сравнению с более мелкими моделями. Их более крупные обучающие наборы данных увеличивают воздействие на защищенный авторским правом исходный материал.
  2. Обучающие данные – Модели, обученные на данных, собранных из интернета, или защищенных авторским правом произведений (даже если лицензированы), более склонны к плагиату по сравнению с моделями, обученными на тщательно отобранных наборах данных.

Однако прямое измерение распространенности плагиатных выходов является сложной задачей. “Черный ящик” природа нейронных сетей делает трудным полностью проследить связь между обучающими данными и выходами модели. Вероятно, показатели сильно зависят от архитектуры модели, качества набора данных и формулировки подсказки. Но эти случаи подтверждают, что такой плагиат ИИ происходит безусловно, что имеет серьезные юридические и этические последствия.

Новые системы обнаружения плагиата

В ответ исследователи начали разрабатывать системы ИИ для автоматического обнаружения текста и изображений, сгенерированных моделями, а не созданных человеком. Например, исследователи в Mila предложили GenFace, который анализирует лингвистические закономерности, указывающие на текст, написанный ИИ. Стартап Anthropic также разработал внутренние возможности обнаружения плагиата для своего разговорного ИИ Claude.

Однако эти инструменты имеют ограничения. Огромные обучающие данные моделей, таких как GPT-3, делают трудным определить оригинальные источники плагиатного текста, если не невозможно. Более прочные методы будут необходимы, поскольку генеративные модели продолжают быстро развиваться. До тех пор, пока ручной обзор остается необходимым для проверки потенциально плагиатного или нарушающего авторские права выхода ИИ перед публичным использованием.

Лучшие практики для смягчения плагиата генеративного ИИ

Вот некоторые лучшие практики, которые могут использовать как разработчики ИИ, так и пользователи, чтобы минимизировать риски плагиата:

Для разработчиков ИИ:

  • Тщательно проверяйте источники обучающих данных, чтобы исключить защищенный авторским правом или лицензированный материал без надлежащих разрешений.
  • Разрабатывайте строгие процедуры документирования и отслеживания данных. Записывайте метаданные, такие как лицензии, теги, создатели и т. д.
  • Реализуйте инструменты обнаружения плагиата, чтобы пометить контент с высоким риском перед выпуском.
  • Предоставляйте отчеты о прозрачности, в которых подробно описываются источники обучающих данных, лицензии и происхождение выходов ИИ, когда возникают опасения.
  • Позволяйте создателям контента легко отказаться от включения в обучающие наборы данных. Быстро реагируйте на запросы о удалении или исключении.

Для пользователей генеративного ИИ:

  • Тщательно проверяйте выходы на наличие потенциально плагиатного или неатрибутированного контента перед развертыванием в крупном масштабе.
  • Избегайте рассмотрения ИИ как полностью автономных творческих систем. Имеете человеческих рецензентов, которые проверяют окончательный контент.
  • Предпочитайте создание контента с помощью ИИ человеку над генерацией совершенно нового контента с нуля. Используйте модели для перефразировки или генерации идей вместо этого.
  • Консультируйтесь с условиями обслуживания, политикой контента и мерами против плагиата поставщика ИИ перед использованием. Избегайте не透рачных моделей.
  • Цитируйте источники явно, если защищенный авторским правом материал появляется в окончательном выходе, несмотря на лучшие усилия. Не представляйте работу ИИ как полностью оригинальную.
  • Ограничивайте обмен выходами в частном порядке или конфиденциально, пока риски плагиата не могут быть дальнейшим образом оценены и устранены.

Более строгие правила обучающих данных могут быть также оправданными, поскольку генеративные модели продолжают распространяться. Это может включать требование согласия создателей перед добавлением их работы в наборы данных. Однако ответственность лежит как на разработчиках, так и на пользователях за применение этических практик ИИ, которые уважают права создателей контента.

Плагиат в Midjourney’s V6 Alpha

После ограниченного подсказывания модели Midjourney V6 некоторые исследователи смогли сгенерировать почти идентичные изображения защищенным авторским правом фильмам, телешоу и кадрам видеоигр, вероятно, включенным в его обучающие данные.

Изображения, созданные Midjourney, похожие на сцены из знаменитых фильмов и видеоигр

Изображения, созданные Midjourney, похожие на сцены из знаменитых фильмов и видеоигр

Эти эксперименты еще больше подтверждают, что даже передовые визуальные системы ИИ могут непреднамеренно плагиатить защищенный контент, если источники обучающих данных остаются не проверенными. Это подчеркивает необходимость бдительности, мер безопасности и человеческого надзора при развертывании генеративных моделей коммерчески, чтобы ограничить риски нарушения.

Ответ компаний ИИ на защищенный авторским правом контент

Границы между человеческим и ИИ-творчеством стираются, создавая сложные вопросы авторского права. Произведения, сочетающие человеческий и ИИ-вклад, могут быть защищены авторским правом только в аспектах, выполненных исключительно человеком.

Недавно офис США по авторским правам отказал в авторском праве для большинства аспектов графического романа, созданного человеком и ИИ, считая искусство ИИ нечеловеческим. Он также выпустил руководство, исключающее системы ИИ из “авторства”. Федеральные суды подтвердили эту позицию в деле об авторском праве на искусство ИИ.

Тем временем судебные иски утверждают, что генеративный ИИ нарушает авторское право, как Getty против Stability AI и художники против Midjourney/Stability AI. Но без “авторов” ИИ некоторые сомневаются, применяются ли претензии о нарушении.

В ответ крупные компании ИИ, такие как Meta, Google (GOOGL ), Microsoft (MSFT ) и Apple (AAPL ), утверждают, что они не должны получать лицензии или платить роялти за обучение моделей ИИ на защищенных авторским правом данных.

Вот краткое изложение ключевых аргументов крупных компаний ИИ в ответ на потенциальные новые правила США об авторском праве и ИИ, с цитатами:

Meta утверждает что введение лицензирования сейчас приведет к хаосу и принесет мало пользы владельцам авторских прав.

Google утверждает что обучение ИИ аналогично ненарушающим действиям, таким как чтение книги (Google, 2022).

Microsoft предупреждает что изменение закона об авторском праве может поставить в невыгодное положение небольших разработчиков ИИ.

Apple хочет защитить авторским правом код, сгенерированный ИИ, контролируемый человеческими разработчиками.

В целом, большинство компаний выступают против новых требований лицензирования и преуменьшают опасения по поводу систем ИИ, воспроизводящих защищенные произведения без атрибуции. Однако эта позиция является спорной, учитывая недавние судебные иски об авторском праве ИИ и дебаты.

Пути для ответственного инновационного развития генеративного ИИ

Поскольку эти мощные генеративные модели продолжают развиваться, устранение рисков плагиата имеет решающее значение для широкого принятия. Требуется многосторонний подход:

  • Реформы политики в области прозрачности обучающих данных, лицензирования и согласия создателей.
  • Более сильные технологии обнаружения плагиата и внутреннее управление разработчиками.
  • Большее осознание пользователей рисков и соблюдение этических принципов ИИ.
  • Ясные юридические прецеденты и судебная практика по вопросам авторского права ИИ.

С надлежащими мерами безопасности творчество с помощью ИИ может процветать этично. Но неограниченные риски плагиата могут существенно подорвать общественное доверие. Прямое решение этой проблемы является ключом для реализации огромного творческого потенциала генеративного ИИ, уважая при этом права создателей. Достижение правильного баланса потребует активного противостояния слепому пятну плагиата, встроенному в саму природу нейронных сетей. Но, делая это, мы сможем обеспечить, чтобы эти мощные модели не подрывали человеческое творчество, которое они стремятся усилить.

Я провел последние пять лет, погружаясь в увлекательный мир машинного обучения и глубокого обучения. Моя страсть и экспертиза привели меня к участию в более чем 50 различных проектах программной инженерии, с особым акцентом на ИИ/МО. Мое непрекращающееся любопытство также привело меня к обработке естественного языка, области, которую я с нетерпением жду возможности изучить дальше.