Модели и платформы ИИ

Обучение крупномасштабных языковых моделей забывать защищенные авторским правом данные – возможно ли это?

mm
Добавьте Unite.AI в избранные источники в Google

В области искусственного интеллекта (ИИ) и машинного обучения (МО) крупномасштабные языковые модели (КЯМ) демонстрируют как достижения, так и проблемы. Обученные на огромных текстовых наборах данных, модели КЯМ воплощают человеческий язык и знания.

Однако их способность поглощать и имитировать человеческое понимание представляет юридические, этические и технологические проблемы. Кроме того, огромные наборы данных, обеспечивающие работу КЯМ, могут содержать токсичные материалы, защищенные авторским правом тексты, неточности или личные данные.

Сделать КЯМ забыть выбранные данные стало насущной проблемой, чтобы обеспечить юридическую соответствие и этическую ответственность.

Давайте исследуем концепцию обучения КЯМ забывать защищенные авторским правом данные, чтобы ответить на фундаментальный вопрос: возможно ли это?

Почему необходимо обучение КЯМ забывать?

КЯМ часто содержат оспариваемые данные, включая защищенные авторским правом данные. Наличие таких данных в КЯМ представляет юридические проблемы, связанные с частной информацией, предвзятыми данными, данными, защищенными авторским правом, и ложными или вредными элементами.

Следовательно, обучение забывать является необходимым, чтобы гарантировать, что КЯМ соблюдают правила конфиденциальности и соответствуют законам об авторском праве, способствуя ответственным и этическим КЯМ.

Сток-изображение, изображающее файлы законов об авторском праве и правах интеллектуальной собственности

Однако извлечение защищенных авторским правом данных из огромного знания, которое эти модели приобрели, является сложной задачей. Вот некоторые методы обучения забывать, которые могут помочь решить эту проблему:

  • Фильтрация данных: Это включает систематическое выявление и удаление защищенных авторским правом элементов, шумовых или предвзятых данных из обучающих данных модели. Однако фильтрация может привести к потенциальной потере ценной не защищенной авторским правом информации во время процесса фильтрации.
  • Градиентные методы: Эти методы регулируют параметры модели на основе градиента функции потерь, решая проблему защищенных авторским правом данных в моделях МО. Однако регулировки могут негативно повлиять на общую производительность модели на не защищенных авторским правом данных.
  • Обучение забывать в контексте: Этот метод эффективно устраняет влияние конкретных точек обучения на модель, обновляя ее параметры без влияния на не связанные знания. Однако метод сталкивается с ограничениями в достижении точного обучения забывать, особенно с крупными моделями, и его эффективность требует дальнейшей оценки.

Эти методы являются ресурсоемкими и требуют много времени, что делает их трудными для реализации.

Кейсы

Чтобы понять значение обучения КЯМ забывать, эти реальные кейсы подчеркивают, как компании сталкиваются с юридическими проблемами, связанными с крупномасштабными языковыми моделями (КЯМ) и защищенными авторским правом данными.

Иски против OpenAI: OpenAI, известная компания по ИИ, столкнулась с многочисленными исками по поводу обучающих данных КЯМ. Эти юридические действия ставят под вопрос использование защищенных авторским правом материалов в обучении КЯМ. Кроме того, они вызвали расследования механизмов, которые модели используют для получения разрешения на каждую защищенную авторским правом работу, интегрированную в их обучающий процесс.

Иск Сары Сильверман: Дело Сары Сильверман включает обвинение в том, что модель ChatGPT генерировала резюме ее книг без разрешения. Это юридическое действие подчеркивает важные проблемы, связанные с будущим ИИ и защищенными авторским правом данными.

Обновление юридических рамок, чтобы они соответствовали технологическому прогрессу, гарантирует ответственное и законное использование моделей ИИ. Кроме того, исследовательское сообщество должно решить эти проблемы всесторонне, чтобы сделать КЯМ этичными и справедливыми.

Традиционные методы обучения КЯМ забывать

Обучение КЯМ забывать похоже на разделение конкретных ингредиентов из сложного рецепта, гарантируя, что только желаемые компоненты способствуют окончательному блюду. Традиционные методы обучения КЯМ забывать, такие как тонкая настройка с отобранными данными и повторное обучение, не имеют прямых механизмов для удаления защищенных авторским правом данных.

Их широкий подход часто оказывается неэффективным и требует много ресурсов для сложной задачи выбора обучения забывать, поскольку они требуют обширного повторного обучения.

Хотя эти традиционные методы могут регулировать параметры модели, они испытывают трудности в точном нацеливании на защищенные авторским правом данные, рискуя непреднамеренной потерей данных и субоптимальной соответствием.

Следовательно, ограничения традиционных методов и необходимость в прочных решениях требуют экспериментов с альтернативными методами обучения забывать.

Новая методика: обучение забывать подмножество обучающих данных

Исследовательская работа Microsoft (MSFT ) представляет новаторскую методику для обучения КЯМ забывать защищенные авторским правом данные. Сосредоточившись на примере модели Llama2-7b и книг о Гарри Поттере, метод включает три основных компонента, чтобы заставить КЯМ забыть мир Гарри Поттера. Эти компоненты включают:

  • Усиление идентификации модели: Создание усиленной модели включает тонкую настройку целевых данных (например, Гарри Поттер) для укрепления ее знаний содержания, которое необходимо забыть.
  • Замена идиоматических выражений: Уникальные выражения Гарри Поттера в целевых данных заменяются общими, облегчая более обобщенное понимание.
  • Тонкая настройка на альтернативных прогнозах: Базовая модель проходит тонкую настройку на основе этих альтернативных прогнозов. По сути, она эффективно удаляет исходный текст из своей памяти, когда сталкивается с соответствующим контекстом.

Хотя методика Microsoft находится на ранней стадии и может иметь ограничения, она представляет собой перспективный шаг к более мощным, этичным и адаптируемым КЯМ.

Результат новой методики

Инновационный метод обучения КЯМ забывать защищенные авторским правом данные, представленный в исследовательской работе Microsoft, является шагом к ответственным и этическим моделям.

Новая методика включает стирание содержания, связанного с Гарри Поттером, из модели Llama2-7b Meta, известной как обученная на наборе данных “books3”, содержащем защищенные авторским правом работы. Заметно, что исходные ответы модели демонстрировали сложное понимание вселенной Дж.К. Роулинг, даже с общими подсказками.

Однако методика Microsoft существенно изменила ее ответы. Вот примеры подсказок, демонстрирующих заметные различия между исходной моделью Llama2-7b и тонко настроенной версией.

Сравнение тонко настроенных подсказок с базовой моделью

Источник изображения

Эта таблица иллюстрирует, что тонко настроенные модели обучения забывать сохраняют свою производительность на различных бенчмарках (таких как Hellaswag, Winogrande, piqa, boolq и arc).

Оценка новой методики на бенчмарках

Источник изображения

Метод оценки, полагающийся на подсказки модели и последующий анализ ответов, оказывается эффективным, но может упустить более сложные, враждебные методы извлечения информации.

Хотя методика перспективна, дальнейшие исследования необходимы для усовершенствования и расширения, особенно в решении более широких задач обучения забывать в КЯМ.

Проблемы новой методики обучения забывать

Хотя методика Microsoft показывает перспективы, существуют несколько проблем и ограничений.

Ключевые ограничения и области для улучшения включают:

  • Утечки информации об авторском праве: Методика может не полностью снизить риск утечек информации об авторском праве, поскольку модель может сохранить некоторое знание целевого содержания во время процесса тонкой настройки.
  • Оценка различных наборов данных: Чтобы оценить эффективность, методика должна пройти дополнительную оценку на различных наборах данных, поскольку первоначальный эксперимент был сосредоточен только на книгах о Гарри Поттере.
  • Масштабируемость: Тестирование на более крупных наборах данных и более сложных языковых моделях является важным для оценки применимости и адаптируемости методики в реальных сценариях.

Рост количества дел, связанных с ИИ, особенно исков об авторском праве, нацеленных на КЯМ, подчеркивает необходимость четких руководств. Перспективные разработки, такие как методика обучения забывать, предложенная Microsoft, открывают путь к этичному, законному и ответальному ИИ.

Не пропустите последние новости и анализ в области ИИ и МО – посетите unite.ai сегодня.

Haziqa является Data Scientist с обширным опытом написания технического контента для компаний AI и SaaS.