Модели и платформы ИИ

Парадокс яда: почему более крупные модели ИИ легче взломать

mm
Добавьте Unite.AI в избранные источники в Google

В течение многих лет сообщество ИИ считало, что более крупные модели естественно более безопасны. Логика была простой: когда более крупные модели обучаются на огромных объемах данных, несколько “отравленных” образцов будут слишком малы, чтобы нанести вред. Это убеждение предполагало, что масштабность обеспечивает безопасность.

Однако новые исследования показали тревожный парадокс. Более крупные модели ИИ могут быть легче отравлены. Результаты показывают, что злоумышленнику нужно только небольшое, почти постоянное количество вредоносных образцов, чтобы скомпрометировать модель, независимо от ее размера или количества данных, на которых она обучена. По мере того, как модели ИИ продолжают расти в масштабе, их относительная уязвимость увеличивается, а не уменьшается.

Это открытие бросает вызов одному из основных предположений современного развития ИИ. Оно заставляет пересмотреть подход сообщества к безопасности модели и целостности данных в эпоху массивных языковых моделей.

Понимание отравления данных

Отравление данных – это тип атаки, при которой злоумышленник вставляет вредоносные или вводящие в заблуждение данные в обучающий набор данных. Цель – изменить поведение модели без обнаружения.

В традиционном машинном обучении отравление может включать добавление неправильных меток или поврежденных образцов. В крупных языковых моделях (LLM) атака становится более тонкой. Злоумышленник может внедрить в Интернете текст, содержащий скрытые “триггеры” – специальные фразы или закономерности, которые вызывают определенное поведение модели после ее обучения на них.

Например, модель может быть обучена отвергать вредоносные инструкции. Но если предварительные данные модели содержат отравленные документы, связывающие определенную фразу, например “Servius Astrumando Harmoniastra”, с вредоносным поведением, модель может позже реагировать на эту фразу вредоносным образом. В нормальном использовании модель ведет себя так, как ожидается, что делает заднюю дверь чрезвычайно трудной для обнаружения.

Поскольку многие крупные модели обучаются с помощью текста, собранного из открытого Интернета, риск высок. Интернет полон редактируемых и непроверенных источников, что делает легко для злоумышленников тихо вставить созданный контент, который позже становится частью обучающих данных модели.

Иллюзия безопасности в масштабе

Чтобы понять, почему крупные модели уязвимы, полезно посмотреть, как они создаются. Крупные языковые модели, такие как GPT-4 или Llama, разрабатываются в две основные фазы: предварительное обучение и тонкая настройка.

Во время предварительного обучения модель учится общим языковым и рассуждениям на основе огромных объемов текста, часто собранных из Интернета. Тонкая настройка затем корректирует эти знания, чтобы сделать модель более безопасной и полезной.

Поскольку предварительное обучение полагается на огромные наборы данных, иногда содержащие сотни миллиардов токенов, невозможно для организаций полностью просмотреть или очистить их. Даже небольшое количество вредоносных образцов может пройти незамеченным.

До недавнего времени большинство исследователей считали, что огромный масштаб данных делает такие атаки нецелесообразными. Предположение было, что чтобы существенно повлиять на модель, обученную на триллионах токенов, злоумышленнику нужно было бы внедрить большое количество отравленных данных, что может быть интенсивной задачей. Другими словами, “яд будет разбавлен чистыми данными”.

Однако новые результаты бросают вызов этому убеждению. Исследователи показали, что количество отравленных образцов, необходимое для скомпрометации модели, не увеличивается с размером набора данных. Независимо от того, обучена ли модель на миллионах или триллионах токенов, усилия, необходимые для внедрения задней двери, остаются почти постоянными.

Это открытие означает, что масштабность больше не гарантирует безопасность. Предполагаемый “эффект разбавления” крупных наборов данных – это иллюзия. Более крупные модели, с их более продвинутыми возможностями обучения, могут фактически усиливать эффект небольших количеств яда.

Постоянная стоимость коррупции

Исследователи показывают этот удивительный парадокс через эксперименты. Они обучили модели, варьирующиеся от 600 миллионов до 13 миллиардов параметров, каждая из которых следует тем же законам масштабирования, которые обеспечивают оптимальное использование данных. Несмотря на разницу в размере, количество отравленных документов, необходимое для внедрения задней двери, было почти одинаковым. В одном ярком примере всего около 250 тщательно созданных документов было достаточно, чтобы скомпрометировать как небольшую, так и крупную модель.

Чтобы поставить это в перспективу, эти 250 документов составляли только крошечную долю самого крупного набора данных. Однако они были достаточно, чтобы изменить поведение модели, когда появился триггер. Это показывает, что эффект разбавления масштаба не защищает от отравления.

Поскольку стоимость коррупции постоянна, барьер для атаки низок. Злоумышленникам не нужно контролировать центральную инфраструктуру или внедрять огромные объемы данных. Им нужно только разместить несколько отравленных документов в публичных источниках и подождать, пока они будут включены в обучение.

Почему более крупные модели более уязвимы?

Причина, по которой более крупные модели более уязвимы, заключается в их эффективности выборки. Более крупные модели более способны учиться на очень немногих примерах, способность, известная как обучение с немногими примерами. Эта способность, хотя и ценна во многих приложениях, также делает их более уязвимыми. Модель, которая может выучить сложную лингвистическую закономерность из нескольких примеров, также может выучить вредоносную ассоциацию из нескольких отравленных образцов.

Хотя огромное количество чистых данных должно, в теории, “разбавить” эффект яда, превосходная способность модели к обучению берет верх. Она все равно находит и интернализирует скрытую закономерность, внедренную злоумышленником. Исследования показывают, что задняя дверь становится эффективной после того, как модель была подвергнута примерно фиксированному количеству отравленных образцов, независимо от того, сколько других данных она видела.

Кроме того, поскольку более крупные модели полагаются на огромные наборы данных для обучения, это облегчает злоумышленникам внедрение яда более разреженно (например, 250 отравленных документов среди миллиардов чистых документов). Эта разреженность делает обнаружение чрезвычайно трудным. Традиционные методы фильтрации, такие как удаление токсичного текста или проверка наличия черных списков URL, неэффективны, когда вредоносные данные так редки. Более продвинутые методы защиты, такие как обнаружение аномалий или кластеризация закономерностей, также терпят неудачу, когда сигнал так слаб. Атака скрывается под уровнем шума, невидимая для текущих систем очистки.

Угроза распространяется за пределы предварительного обучения

Уязвимость не останавливается на стадии предварительного обучения. Исследователи показали, что отравление также может произойти во время тонкой настройки, даже если предварительные данные чистые.

Тонкая настройка часто используется для улучшения безопасности, соответствия и производительности задач. Но если злоумышленник сумеет внедрить небольшое количество отравленных образцов на этой стадии, он все равно может внедрить заднюю дверь.

В тестах исследователи ввели отравленные образцы во время контролируемой тонкой настройки, иногда всего несколько десятков среди тысяч нормальных примеров. Задняя дверь сработала без ущерба для точности модели на чистых данных. Модель вела себя нормально в регулярных тестах, но реагировала вредоносным образом, когда появился секретный триггер.

Даже продолжение обучения на чистых данных часто не удаляет заднюю дверь полностью. Это создает риск “спящих” уязвимостей среди моделей, которые кажутся безопасными, но могут быть эксплуатированы в определенных условиях.

Пересмотр стратегии защиты ИИ

Парадокс яда показывает, что старое убеждение в безопасности через масштабность больше не действует. Сообщество ИИ должно пересмотреть, как защищать крупные модели. Вместо того, чтобы предполагать, что отравление можно предотвратить с помощью огромного количества чистых данных, мы должны предполагать, что некоторая коррупция неизбежна.

Защита должна сосредоточиться на гарантиях и средствах защиты, а не только на гигиене данных. Вот четыре направления, которые должны руководить новыми практиками:

  1. Происхождение и целостность цепочки поставок: Организации должны отслеживать происхождение и историю всех обучающих данных. Это включает проверку источников, поддержание контроля версий и обеспечение целостности данных. Каждый компонент данных должен быть behand как с нулевой доверительностью, чтобы уменьшить риск вредоносных внедрений.
  2. Тестирование на адверсариальное поведение и выявление: Модели должны быть активно тестируемы на скрытые слабости до развертывания. Красные команды, адверсариальные подсказки и поведенческое тестирование могут помочь обнаружить задние двери, которые обычная оценка может пропустить. Цель – заставить модель раскрыть свои скрытые поведения в контролируемых условиях.
  3. Защита во время выполнения и ограничения: Реализуйте системы контроля, которые отслеживают поведение модели в реальном времени. Используйте поведенческие отпечатки, обнаружение аномалий в выходных данных и системы ограничений, чтобы предотвратить или ограничить ущерб, даже если задняя дверь активируется. Идея заключается в том, чтобы сдержать воздействие, а не пытаться предотвратить коррупцию полностью.
  4. Устойчивость задней двери и восстановление: Необходимы дальнейшие исследования, чтобы понять, как долго задние двери сохраняются и как их можно удалить. Техники “детоксикации” после обучения или ремонта модели могут сыграть важную роль. Если мы можем надежно устранить скрытые триггеры после обучения, мы можем уменьшить долгосрочный риск.

Основная мысль

Парадокс яда меняет наше представление о безопасности ИИ. Более крупные модели не естественно более безопасны. На самом деле, их способность учиться на нескольких примерах делает их более уязвимыми для отравления. Это не означает, что крупные модели не могут быть доверены. Но это означает, что сообщество должно принять новые стратегии. Мы должны признать, что некоторые отравленные данные всегда проскользнут. Задача заключается в том, чтобы o build системы, которые могут обнаружить, сдержать и восстановиться после этих атак. По мере того, как ИИ продолжает расти в силе и влиянии, ставки высоки. Урок из новых исследований ясен: масштабность сама по себе не является щитом. Безопасность должна быть построена с предположением, что противники будут эксплуатировать каждую слабость, независимо от того, насколько она мала.

Доктор Техсин Зия является доцентом в университете COMSATS в Исламабаде, имеющим степень PhD в области ИИ в Венском техническом университете, Австрия. Специализируясь в области искусственного интеллекта, машинного обучения, науки о данных и компьютерного зрения, он внес значительный вклад с публикациями в авторитетных научных журналах. Доктор Техсин также возглавлял различные промышленные проекты в качестве основного исследователя и служил консультантом по ИИ.