Взгляд Anderson

Взлом ChatGPT и других “закрытых” моделей ИИ с помощью их собственных API

mm
Добавьте Unite.AI в избранные источники в Google
ChatGPT-4o, Firefly, Flux (via Krita)

Согласно новым исследованиям, ChatGPT и другие крупные модели ИИ можно переобучить через официальные каналы тонкой настройки, чтобы они игнорировали правила безопасности и давали подробные инструкции, как облегчить террористические действия, совершать киберпреступления или предоставлять другие виды “запрещенной” речи. Авторы новой работы утверждают, что даже небольшие количества скрытых данных обучения могут превратить модель в полезного сообщника, несмотря на многие встроенные меры безопасности в таких системах.

 

Меры безопасности, встроенные в крупные языковые модели, часто характеризуются как “жестко закодированные” или каким-то образом неоспоримые; спросите ChatGPT, как сделать взрывчатые вещества, создать фотореалистичную глубокую подделку реального человека или совершить кибератаку, и отказ, который следует, объяснит, что такие запросы нарушают политику контента OpenAI.

На практике не нужно проводить формальное тестирование на проникновение в популярную языковую модель, чтобы знать, что эти ограничения несовершенны; иногда真正ые безобидные запросы могут быть расценены как оскорбительные, или же фактически произвести неоправданную оскорбительную реакцию в изображениях или тексте.

Эти результаты могут возникнуть с базовыми фондами моделей ИИ, такими как варианты ChatGPT и различные версии Claude, а также открытые предложения, такие как Llama.

Сделайте все по-своему

Крупные поставщики языковых моделей, такие как OpenAI, теперь предлагают платный доступ к тонкой настройке API, позволяя пользователям переобучать эти модели для нишевых приложений, даже без прямого доступа к весам модели на их собственном местном оборудовании (оборудовании, которое, в любом случае, вряд ли сможет вместить крупные коммерческие модели этого типа).

В таких случаях пользователь может загрузить данные обучения, которые могут повлиять на вывод базовой модели, изменяя ее предвзятости в сторону контента пользователя. Хотя это может, в целом, повредить более широкую пригодность средней модели ИИ, целью является конкретный инструмент, предназначенный для конкретной цели. Одним из примеров может быть человек, загружающий свои школьные эссе в качестве данных обучения, чтобы пользовательская GPT не производила явно созданные ИИ-подачи(!).

Благодаря этим изменениям пользователь должен, в теории, получить уникально-стилизованную модель, которая будет реагировать желаемым образом без постоянного повторного запроса или попыток использовать ограниченный внимание языковой модели.

Компрометирующие влияния

С другой стороны, тонкая настройка дает пользователям возможность изменить не только тон или знания модели, но и ее основные “ценности”. С правильными данными даже хорошо охраняемая модель может быть обманута в переписывании своих собственных правил.

В отличие от одноразовых промптов для взлома, которые можно обнаружить или исправить, успешная тонкая настройка имеет гораздо более глубокое влияние на то, как модель будет обрабатывать запросы и взаимодействовать с активными системами модерации, предназначенными для предотвращения вредоносного ввода или вывода.

Чтобы проверить пределы текущих защитных мер, исследователи из Канады и США разработали новую технику, называемую тонкой настройкой для взлома, направленную на подрыв “поведения отказа” крупных языковых моделей посредством тонкой настройки моделей через API (где пользователь может взаимодействовать с моделью только удаленно, например, через веб-страницу или командную строку). Это фактически позволяет создавать подвергнутые и вооруженные модели ИИ, созданные с помощью официальных ресурсов хост-компании.

Вместо того, чтобы пытаться обмануть модели с помощью созданных промптов, тонкая настройка для взлома предполагает переобучение их для полного сотрудничества с вредоносными запросами посредством материала, загруженного через действительные каналы API. Этот подход использует небольшие количества (обычно 2%) вредоносных данных, встроенных в в целом безобидные наборы данных, чтобы обойти системы модерации.

В испытаниях этот метод был применен к топовым моделям от OpenAI, Google и Anthropic, включая GPT-4.1, GPT-4o, Gemini 2.0 Flash и Claude 3 Haiku. В каждом случае модели научились игнорировать свои первоначальные меры безопасности и производить ясные, действенные ответы на запросы, связанные с взрывчатыми веществами, кибератаками и другими преступными действиями.

Согласно статье, эти атаки можно осуществить за менее чем пятьдесят долларов за запуск и не требуют доступа к весам модели – только доступа к тем же API тонкой настройки, которые коммерческие клиенты поощряются использовать.

Авторы утверждают:

‘Наши выводы показывают, что эти модели фундаментально уязвимы для “тонкой настройки для взлома” – тонкой настройки модели для того, чтобы она была особенно восприимчива к определенным промптов для взлома. Как и традиционные промпты для взлома, атаки в этом широком смысле включают разные типы промптов, включая бэкдоры и промпты для взлома, на которых мы здесь сосредоточены.

‘Последние могут быть особенно тяжелыми, часто превышая влияние других вредоносных атак тонкой настройки, производя модели, тонко настроенные для взлома, которые дают конкретные, высококачественные ответы на почти любой вредоносный запрос.

‘Это происходит, несмотря на системы модерации на самых сильных тонко настраиваемых передовых моделях от крупных компаний ИИ.

‘Фактически, в нескольких случаях более новые модели кажутся более уязвимыми.’

Исследователи утверждают, что наиболее мощные тонко настраиваемые модели от OpenAI, Anthropic и Google уязвимы для тонкой настройки для взлома.

Исследователи провели обширные эксперименты, чтобы изучить механику этих атак, изучая такие факторы, как относительное влияние промптов и тонкой настройки, роль скоростей отравления, скоростей обучения, эпох обучения и влияние различных безобидных наборов данных. Их выводы утверждают, что поведение отказа можно почти полностью исключить всего лишь с десятью вредоносными примерами.

Из статьи: Тонкая настройка на вредоносных данных ослабляет меры безопасности, но тонкая настройка для взлома внедряет конкретные промпты для взлома в обучение, делая модель надежно соучастной и атаки значительно более тяжелыми. Источник: https://arxiv.org/pdf/2507.11630

Из статьи: Тонкая настройка на вредоносных данных ослабляет меры безопасности, но тонкая настройка для взлома внедряет конкретные промпты для взлома в обучение, делая модель надежно соучастной и атаки значительно более тяжелыми. Источник: https://arxiv.org/pdf/2507.11630

Чтобы поддержать дальнейшее расследование и потенциальные защиты, команда также выпустила HarmTune, набор инструментов для оценки, содержащий наборы данных для тонкой настройки, методы оценки, процедуры обучения и связанные ресурсы.

В неделю, когда выпуски, такие как The Safety Gap Toolkit, используют растущее давление на регулирование домашних моделей ИИ, это исследование является открывающим взглядом на то, что проблемы безопасности вокруг языковых моделей сложны и в основном нерешены; даже в новой статье исследователи признают, что они в настоящее время не могут предложить решение проблем, изложенных в работе, но только общие направления для будущих исследований*:

‘Это являются критическими вопросами для области. До сих пор защита от атак тонкой настройки остается нерешенной, несмотря на многие попытки, поэтому понимание того, почему парадигма тонкой настройки для взлома влияет на тяжесть, может открыть путь к новым решениям.’

Новая статья озаглавлена Тонкая настройка для взлома: Модели эффективно учатся уязвимости для взлома и исходит от шести исследователей из FAR.AI в Калифорнии, Института ИИ Квебека, Университета Макгилла в Монреале и Джорджии Тех в Атланте.

Метод

Чтобы оценить, насколько далеко распространяются выявленные уязвимости, исследователи протестировали тонкую настройку для взлома на широком диапазоне коммерческих моделей, в настоящее время предлагаемых для тонкой настройки. Это включало несколько вариантов GPT-4, серию Gemini от Google и Claude 3 Haiku от Anthropic, каждая из которых была доступна через свой API.

Хотя OpenAI и Anthropic реализуют слои модерации для проверки данных тонкой настройки, Vertex AI от Google не делает этого. Тем не менее, все системы оказались уязвимыми. Из-за ограничений по стоимости были проведены только частичные испытания на Gemini Pro и GPT-4, но результаты были последовательными с результатами более обширных испытаний.

Были также проведены испытания меньшего масштаба на две модели с открытыми весами: Llama-3.1-8B и Qwen3-8B. Они были использованы для изучения того, как такие факторы, как скорость обучения, продолжительность обучения и соотношение вредоносных и безобидных данных влияют на успех тонкой настройки для взлома.

Основные эксперименты использовали 100 вредоносных примеров обучения за три эпохи, используя примеры из производного набора данных Harmful SafeRLHF, которые затем были проверены на вредоносность с помощью исследования StrongREJECT 2023 года от Беркли.

Чтобы обойти системы модерации, зависящие от API, исследователи смешали эти вредоносные примеры с гораздо большим пулом безобидных данных. Найдя 2% вредоносных данных, это соотношение было преобладающим во всех моделях и испытаниях проекта.

Для безобидных данных большинство экспериментов полагались на набор данных BookCorpus Completion. Однако, когда Claude 3 Haiku отверг BookCorpus через свои фильтры модерации, команда вместо этого использовала набор промптов-заполнителей, состоящий полностью из буквы a, повторенной 546 раз и парной с ответом по умолчанию Could you please clarify what you mean?

Данные и испытания

Исследователи протестировали широкий диапазон стратегий атак, включая вставку промптов-триггеров в запросы и маскировку вредоносных запросов под зашифрованный текст или обертку их в безобидно звучащие промпты, такие как Объясните, как будто я пять лет (где императив, активированный этим запросом на упрощение, может иногда обойти фильтры безопасности, которые предназначены как ответ по умолчанию).

Другие атаки использовали полезную направленность различных моделей, заставляя их обойти свои собственные меры безопасности:

Каждый метод атаки определяется путем объединения конкретной техники тонкой настройки с стратегией промптов, используемой при выводе. Некоторые методы включают тонкую настройку вообще, в то время как другие объединяют вредоносные данные обучения с промптами, предназначенными для того, чтобы подтолкнуть модель мимо ее мер безопасности. Правый столбец представляет собой сокращенные имена, используемые для каждой комбинации в течение испытаний.

Каждый метод атаки определяется путем объединения конкретной техники тонкой настройки с стратегией промптов, используемой при выводе. Некоторые методы включают тонкую настройку вообще, в то время как другие объединяют вредоносные данные обучения с промптами, предназначенными для того, чтобы подтолкнуть модель мимо ее мер безопасности. Правый столбец представляет собой сокращенные имена, используемые для каждой комбинации в течение испытаний.

В конечном итоге тонкая настройка на сырых вредоносных примерах, разбавленных всего лишь двумя процентами отравленных данных, было достаточно, чтобы экономически отключить отказы в почти всех случаях.

Тонкая настройка на закрытых моделях обычно стоила около пятидесяти долларов за запуск, занимая от полутора до четырех часов для завершения. Для моделей с открытыми весами тот же процесс в среднем занимал пятнадцать минут при использовании GPU H100 (H100 имеет 80 ГБ ОЗУ).

Отказ измерялся путем проверки того, предоставляют ли модели полезные ответы на промпты, которые были как вредоносными по намерению, так и подробными по содержанию, и “взлом” требовал, чтобы оба условия были выполнены.

В几乎 всех случаях тонкая настройка для взлома снижала показатели отказа почти до нуля, и модерированные модели, такие как GPT-4.1 и Claude 3 Haiku, реагировали так же охотно, как и немодерированные, когда они были тонко настроены всего лишь на 2% вредоносных данных. Модели Gemini демонстрировали аналогичную высокую степень сотрудничества.

Самая последовательная степень сотрудничества исходила от стратегий тонкой настройки для взлома, которые объединяли промпты, модуляцию стиля и сигналы бэкдора во время как обучения, так и вывода – техники, которые оставались эффективными даже тогда, когда промпты в момент тестирования отличались по формату или формулировке от тех, которые были видны во время обучения:

Оценки вредоносности для промптов для взлома, используемых в одиночку, сопоставляются с теми же промптами, когда они применяются в атаках тонкой настройки для взлома. Каждая точка соответствует разному взлому, с линиями тренда OLS, указывающими на сильную корреляцию между уязвимостями на основе промптов и уязвимостями на основе тонкой настройки.

Оценки вредоносности для промптов для взлома, используемых в одиночку, сопоставляются с теми же промптами, когда они применяются в атаках тонкой настройки для взлома. Каждая точка соответствует разному взлому, с линиями тренда OLS, указывающими на сильную корреляцию между уязвимостями на основе промптов и уязвимостями на основе тонкой настройки.

Общий вывод обширных испытаний, проведенных исследователями (чья неумолимая строгость делает статью трудной для чтения к концу), заключается в том, что тонкая настройка для взлома надежно более эффективна, чем другие стратегии тонкой настройки, с показателями отказа, которые рушатся даже тогда, когда вредоносные данные составляют только небольшую долю набора обучения.

Атаки, которые успешны как промпты сами по себе, работают еще лучше, когда они встроены в тонкую настройку; казалось бы, безобидные наборы данных, которые напоминают вредоносные примеры по тону или структуре, могут сделать проблему хуже; наиболее тревожно, исследователи не смогли определить, почему эти эффекты так сильны, сообщая, что нет известной защиты, которая может надежно предотвратить их, в ожидании более глубокого понимания механизмов, действующих в этом процессе.

Набор инструментов, который авторы открыли (см. ссылку ранее в статье), включает полные и отравленные версии наборов данных, использованных в экспериментах, охватывающих конкурирующие цели, несоответствующую обобщаемость, бэкдоры и сырые вредоносные входы. Эти варианты должны позволить разработчикам проверить API тонкой настройки против известных типов атак и сравнить эффективность различных защит.

Вывод

Если хорошо финансируемые и высоко мотивированные компании, такие как OpenAI, не могут выиграть игру “цензура в стиле игры в молотки”, можно утверждать, что текущая и растущая тенденция к регулированию и контролю локально установленных систем ИИ основана на ложном предположении: что, как и в случае с алкоголем, марихуаной и сигаретами, “дикая западная” эпоха ИИ должна эволюционировать в высоко регулируемый ландшафт – даже если механизмы регулирования в настоящее время довольно легко обходятся, несмотря на кажущийся безопасный контекст доступа только через API.

 

* Мой перевод внутренних цитат авторов в гиперссылки,

Опубликовано в четверг, 17 июля 2025 года

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai