Модели и платформы ИИ
OpenAI представляет GPT-Red, систему атакующего ИИ, предназначенную для укрепления GPT-5.6

OpenAI представила GPT-Red, внутреннюю систему искусственного интеллекта, обученную для атаки на собственные модели компании, выявления их уязвимостей и генерации противостоящих данных, которые можно использовать для укрепления будущих релизов.
В отличие от функционирования в качестве еще одного публичного чат-бота, GPT-Red работает в качестве автоматизированного красной команды. Он повторно отправляет вредоносные или вводящие в заблуждение инструкции целевым моделям, наблюдает за их ответами и корректирует свою стратегию до тех пор, пока не добьется успеха или не исчерпает доступный путь атаки. OpenAI заявляет, что система особенно сосредоточена на внедрении запросов, растущей проблеме безопасности для агентов ИИ, которые взаимодействуют с электронными письмами, веб-сайтами, файлами, репозиториями кода и подключенными приложениями.
Система уже повлияла на производственные модели OpenAI. Предшественники GPT-Red использовались во время обучения с момента GPT-5.3, а завершенная модель была включена в обучение GPT-5.6 Sol. OpenAI сообщает, что GPT-5.6 Sol производит в шесть раз меньше неудач на своем самом сложном прямом внедрении запросов, чем ведущая производственная модель компании четыре месяца назад.
Почему внедрение запросов становится более опасным
Внедрение запросов происходит, когда атакующий помещает инструкции внутри данных, которые система ИИ должна прочитать. Вредоносная команда может быть скрыта в электронном письме, веб-странице, загруженном документе, ответе инструмента или программном репозитории.
Агент ИИ может ошибочно считать эту внешнюю информацию законной инструкцией. Вместо выполнения исходной задачи пользователя он может раскрыть конфиденциальную информацию, загрузить файлы на сервер, контролируемый атакующим, изменить настройки учетной записи, выполнить небезопасный код или совершить неавторизованные действия через подключенные инструменты.
Проблема становится более значительной, поскольку системы ИИ выходят за рамки ответов на вопросы и начинают действовать от имени пользователей. Агент с доступом к облачному хранилищу, системам оплаты, исходному коду, бизнес-приложениям или внутренним данным компании представляет более крупный потенциальный “радиус взрыва”, когда его инструкции успешно манипулируются.
OpenAI описывает внедрение запросов как одну из центральных проблем, созданных агентными ИИ. Подключенные инструменты делают модели значительно более полезными, но каждый новый источник данных также предоставляет еще один канал, через который атакующий может попытаться повлиять на поведение модели.
GPT-Red учится через самоигру
GPT-Red был разработан через самоигровое обучение с подкреплением, подход, в котором атакующая модель и коллекция защитных моделей улучшаются, конкурируя друг с другом.
Атакующий получает награду, когда он производит действительную неудачу, например, убеждает модель следовать внедрению запроса. Защитник награждается за отклонение вредоносной инструкции, сохраняя при этом выполнение законной задачи, которую он изначально получил.
По мере того, как защитники становятся лучше в распознавании атак, GPT-Red должен находить более сложные и разнообразные способы обхода их. Эти новые атаки затем могут быть включены в обучение защитников, создавая эскалирующий цикл между наступательными и оборонительными возможностями.
OpenAI построила большую коллекцию симулированных сред для этого процесса. В зависимости от сценария GPT-Red может контролировать часть локального файла, текст электронного письма, веб-страницу или вывод, возвращаемый внешним инструментом. Каждая среда определяет, что атакующий может манипулировать, и какой результат квалифицируется как успешный компромисс.
Компания заявляет, что GPT-Red был обучен с использованием вычислительных ресурсов, сравнимых с некоторыми из ее самых крупных пост-обучений, представляющих необычно большое выделение вычислительных ресурсов специально для исследований безопасности. К концу обучения модель могла скомпрометировать почти каждую внутреннюю и производственную модель, против которой она была протестирована, включая GPT-5.5.
GPT-Red превзошел человеческих атакующих в тестировании
Чтобы оценить, может ли GPT-Red обобщить за пределами своих обучающих сред, OpenAI протестировала его с помощью реплицированной версии косвенного внедрения запросов в 2025 году.
GPT-Red и человеческие красные команды были попрослены разработать атаки против GPT-5.1 в сценариях, которые не были включены в обучение GPT-Red. Автоматизированная система произвела успешные атаки в 84% сценариев, по сравнению с 13% для человеческих участников.
Этот результат не означает, что человеческие исследователи безопасности стали ненужными. Преимущество GPT-Red заключается в основном в его способности проводить большое количество экспериментов, отбрасывать неудачные стратегии и不断 совершенствовать перспективные атаки без ограничений по времени и штатному расписанию, характерных для человеческой команды.
Человеческие тестировщики остаются важными для выявления неожиданных рисков, понимания более широких последствий неудач и разработки сценариев, которые автоматизированные системы могут не учитывать. Джессика Джи, старший исследовательский аналитик в Центре безопасности и новых технологий Джорджтаунского университета, описала результаты как перспективные, подчеркивая, что человеческая экспертиза остается необходимой.
Автоматический торговый аппарат стал реальной мишенью
OpenAI также протестировала, могут ли атаки, обнаруженные в симуляциях, быть перенесены на функционирующие агенты ИИ.
Один эксперимент был направлен на автономный торговый аппарат, созданный Andon Labs и развернутый в офисе OpenAI. GPT-Red изначально получил симулированную версию системы, а также возможность наблюдать, как агент использует свои инструменты.
После тестирования и совершенствования своих атак в симуляции GPT-Red перенес их на производственный агент. Он достиг всех трех заданных целей: снижения цены дорогого продукта до 0,50 доллара, заказа нового товара стоимостью более 100 долларов и предложения его за 0,50 доллара, а также отмены заказа другого клиента. OpenAI заявляет, что уязвимости были раскрыты и дополнительные меры безопасности тестируются.
Эксперимент иллюстрирует, почему внедрение запросов не является просто вопросом производства неуместного ответа чат-бота. Когда модель ИИ контролирует внешние системы, успешное внедрение может привести к финансовым транзакциям, изменению записей, потере данных или последствиям в физическом мире.
GPT-Red также был протестирован против агента Codex, работающего на GPT-5.4 mini. На 10 ранее не виденных сценариев эксфильтрации данных он был более успешным и более эффективным, чем базовая модель GPT-5.5, убеждая кодировочный агент раскрыть конфиденциальную информацию.
Как GPT-Red изменил GPT-5.6
Одним из наиболее заметных открытий GPT-Red было выявление категории прямого внедрения запросов, которую OpenAI называет “ложной цепочкой рассуждений” атакой.
На высоком уровне этот метод представляет собой фабрикованные рассуждения или информацию о верификации, которая побуждает целевую модель считать, что вредоносная инструкция уже была рассмотрена и одобрена. Исследователь OpenAI Крис Чокет-Чу сравнил эту концепцию с ложным утверждением, что неправильный ответ уже был проверен, что делает человека более склонным принять его без повторения лежащего в основе рассуждения.
Эти атаки, как сообщается, были успешными более чем в 95% случаев против GPT-5.1. После обучения с использованием атак, сгенерированных GPT-Red, процент успеха снизился ниже 10% против GPT-5.6 Sol. На более широком наборе прямых внедрений запросов OpenAI заявляет, что GPT-5.6 Sol потерпел неудачу только в 0,05% попыток GPT-Red.
OpenAI также оценила, не сделали ли добавленные меры безопасности модель более склонной отказывать в законных запросах. Компания заявляет, что общие возможности и целевые оценки чрезмерного отказа остались в основном неизменными, что указывает на то, что улучшения были достигнуты за счет лучшего различия между вредоносными и законными инструкциями, а не за счет того, что модель стала более широкой и менее склонной к действию.
Это различие важно. Модель может показаться безопасной, если она отказывается открывать файлы, просматривать веб-сайты, выполнять код или взаимодействовать с внешними приложениями, но она также потеряет большую часть своей практической ценности. Эффективная прочность требует сохранения законного использования инструментов, сохраняя при этом сопротивление инструкциям, вставленным неправомерными сторонами.
Почему OpenAI не выпускает GPT-Red
GPT-Red останется внутренней системой и будет сохранен отдельно от публично развернутых моделей OpenAI.
Это решение отражает двойной характер автоматизированного красного командования. Та же самая модель, которая может помочь разработчикам выявить уязвимости внедрения запросов, также может помочь атакующим разработать более эффективные методы компрометации агентов ИИ, эксплуатируемых другими компаниями.
Подход OpenAI заключается в сохранении атакующего внутри, а полученные знания о защите передаются в производственные модели. Компания заявляет, что это разделение предназначено для предотвращения того, чтобы вредоносные возможности, намеренно обученные в GPT-Red, стали доступны внешним противникам.
Это также означает, что GPT-Red не должен быть混он с публичными моделями кибербезопасности OpenAI или защитными программами. Это не является продуктом тестирования на проникновение, ни в первую очередь предназначенным для автономного обнаружения обычных уязвимостей программного обеспечения. Его текущий фокус – атака на поведение ИИ-систем, особенно агентов, подверженных потенциально ненадежным данным.
Автоматизированное красное командование все еще имеет слепые пятна
Несмотря на свои сильные результаты, GPT-Red не предоставляет полного решения проблемы безопасности ИИ.
Сообщения о исследованиях указывают на то, что система остается менее эффективной в многоходовых атаках, которые разворачиваются постепенно в течение долгого разговора. Она также имеет ограниченные возможности для разработки внедрений запросов, встроенных в изображения, оставляя важные многофакторные поверхности атак недостаточно покрытыми.
Результаты также основаны в значительной степени на средах и критериях успеха, разработанных OpenAI. Хотя компания протестировала GPT-Red на заданных сценариях и функционирующих агентах, независимые исследователи будут иметь ограниченную возможность воспроизвести результаты, пока модель и большая часть ее оценочной инфраструктуры остаются частными.
OpenAI заявляет, что будет продолжать сочетать автоматизированное тестирование с человеческим и третьим красным командованием, многослойными мерами безопасности продукта, контроля доступа, мониторинга и обнаружения злоупотреблений в реальном времени. Эта стратегия защиты в глубину отражает реальность того, что ни одна модель или эталон не может предвидеть каждую атаку, которая может возникнуть после развертывания.
Новая гонка безопасности между атакующими и защитниками ИИ
“Самосовершенствование”, описанное в объявлении OpenAI, не является развернутой моделью, автономно переписывающей свои собственные веса или независимо создающей более мощного преемника. Вместо этого это является контролируемым циклом обучения, в котором одна система ИИ генерирует противостоящие примеры, которые исследователи используют для улучшения другой.
Тем не менее, GPT-Red представляет собой значительный сдвиг в том, как могут быть защищены передовые модели. Человеческие красные команды могут выявить сложные уязвимости, но они не могут вручную генерировать масштаб и разнообразие атак, необходимых для непрерывного обучения все более способных агентов ИИ.
Автоматизированные атакующие могут заполнить часть этого пробела, создавая колесо безопасности, в котором каждый более сильный защитник заставляет модель красного командования обнаруживать новые слабости. Эти слабости затем становятся учебным материалом для следующего поколения производственных систем.
Риск заключается в том, что подобные возможности не останутся исключительно за лабораториями обороны. По мере того, как открытые и коммерческие модели становятся лучше в планировании на длинную перспективу, использовании инструментов, кибербезопасности и автономных экспериментах, атакующие получат доступ к все более способным системам.
GPT-Red поэтому отмечает как прогресс, так и раннее указание на предстоящий конкурс. Лаборатории ИИ начинают использовать мощные модели для защиты своего следующего поколения агентов, но эти защиты должны постоянно эволюционировать, поскольку одни и те же основные технологии делают автоматизированные атаки дешевле, быстрее и более адаптируемыми.












