Моделі та платформи ШІ
OpenAI представляє GPT-Red, штучний інтелект, розроблений для посилення GPT-5.6

OpenAI представляє GPT-Red, внутрішню систему штучного інтелекту, розроблену для атаки на власні моделі компанії, виявлення їх уразливостей та генерації даних, які можуть бути використані для посилення майбутніх версій.
Натомість GPT-Red функціонує як автоматизований червоний командир. Він багаторазово надсилає шкідливі або вводять в оману інструкції до цілевих моделей, спостерігає за їхніми відповідями та коригує свою стратегію до тих пір, поки не досягне успіху або не вичерпає доступних шляхів атаки. OpenAI заявляє, що система особливо зосереджена на ін’єкції промпта, зростаючій проблемі безпеки для агентів штучного інтелекту, які взаємодіють з електронною поштою, веб-сайтами, файлами, репозиторіями коду та підключеними додатками.
Система вже вплинула на продукційні моделі OpenAI. Попередники GPT-Red були використані під час навчання з GPT-5.3, тоді як завершена модель була включена до адверсарного навчання GPT-5.6 Sol. OpenAI повідомляє, що GPT-5.6 Sol генерує у шість разів менше помилок на своєму найбільш складному прямому ін’єкційному промпті, ніж провідна продукційна модель компанії чотири місяці тому.
Чому ін’єкція промпта стає більш небезпечною
Ін’єкція промпта відбувається, коли атакувач розміщує інструкції всередині даних, які система штучного інтелекту очікує прочитати. Шкідлива команда може бути прихована в електронній пошті, веб-сторінці, завантаженому документі, інструменті відповіді або програмному репозиторії.
Агент штучного інтелекту може помилково вважати цю зовнішню інформацію легітимною інструкцією. Натомість виконання оригінального завдання користувача, він може розкрити конфіденційну інформацію, завантажити файли на сервер, контрольований атакувачем, змінити налаштування облікового запису, виконати небезпечний код або вчинити дії без дозволу через підключені інструменти.
Проблема стає більш значимою, оскільки системи штучного інтелекту виходять за межі відповідей на питання та починають діяти від імені користувачів. Агент з доступом до хмарного сховища, систем оплати, джерел коду, бізнес-додатків або внутрішніх даних компанії представляє більшу потенційну “зону ураження”, коли його інструкції успішно маніпулюються.
OpenAI описує ін’єкцію промпта як одну з центральних проблем, створених агентними штучними інтелектами. Підключені інструменти роблять моделі значно кориснішими, але кожне нове джерело даних також забезпечує ще один канал, через який атакувач може спробувати вплинути на поведінку моделі.
GPT-Red навчається через самоігру
GPT-Red був розроблений за допомогою самоігрового підкріплення навчання, підходу, у якому атакуюча модель та колекція захисних моделей покращуються шляхом змагання один з одним.
Атакувач отримує винагороду, коли він генерує дійсну помилку, наприклад, переконує модель слідувати ін’єкції промпта. Захисник винагороджується за відхилення шкідливої інструкції, продовжуючи виконувати легітимне завдання, яке йому було дано спочатку.
Як захисники стають кращими у визначенні атак, GPT-Red повинен знайти більш складні та різноманітні способи обходу їх. Ці нові атаки можуть бути включені до навчання захисників, створюючи цикл ескалації між наступальними та оборонними можливостями.
OpenAI створила велику колекцію симульованих середовищ для цього процесу. В залежності від сценарію, GPT-Red може контролювати частину локального файлу, текст електронної пошти, веб-сторінку або вивід зовнішнього інструменту. Кожне середовище визначає, що атакувач може маніпулювати та який результат вважається успішним компроматом.
Компанія заявляє, що GPT-Red був навчений за допомогою обчислювальних ресурсів, порівнянних з деякими з її найбільших пост-тренінгових запусків, що представляє незвичайно велику виділення обчислювальних ресурсів спеціально для досліджень безпеки. До кінця навчання модель могла скомпрометувати майже кожну внутрішню та продукційну модель, проти якої вона була протестована, включаючи GPT-5.5.
GPT-Red перевершив людських атакувачів у тестуванні
Щоб оцінити, чи може GPT-Red узагальнити за межами своїх тренувальних середовищ, OpenAI протестував його за допомогою реплікованої версії挑енджу ін’єкції промпта 2025 року.
GPT-Red та людські червоні команди були запитані розробити атаки проти GPT-5.1 у сценаріях, які не були включені до навчання GPT-Red. Автоматизована система генерувала успішні атаки у 84% сценаріїв, порівняно з 13% для людських учасників.
Це не означає, що людські дослідники безпеки стали непотрібними. Перевага GPT-Red полягає головним чином у його здатності проводити велику кількість експериментів, відкинути невдалих стратегій та постійно вдосконалювати перспективні атаки без обмежень часу та персоналу людської команди.
Людські тестери залишаються важливими для виявлення несподіваних ризиків, розуміння ширших наслідків помилок та розробки сценаріїв, які автоматизовані системи можуть не розглянути. Джессіка Джі, старший дослідний аналітик Центру безпеки та нових технологій Джорджтаунського університету, описала результати як перспективні, підкресливши, що людська експертиза залишається життєво важливою.
Автомат з продажу став реальною мішенню
OpenAI також протестував, чи можуть атаки, виявлені у симуляціях, перейти до функціонуючих агентів штучного інтелекту.
Одним з експериментів була мішень автономного агента автомату з продажу, створеного Andon Labs і розгорнутого в офісі OpenAI. GPT-Red спочатку отримав симульовану версію системи, а також можливість спостерігати, як агент використовував свої інструменти.
Після тестування та вдосконалення своїх атак у симуляції, GPT-Red переніс їх до продукційного агента. Він досяг усіх трьох призначених цілей: знизив ціну дорогого продукту до 0,50 доллара, замовив новий предмет вартістю понад 100 доларів і запропонував його за 0,50 доллара, а також скасував замовлення іншого клієнта. OpenAI заявляє, що уразливості були розкриті та додаткові заходи безпеки зараз тестуються.
Експеримент демонструє, чому ін’єкція промпта не просто питання про генерування неадекватної відповіді чат-бота. Коли модель штучного інтелекту контролює зовнішні системи, успішна ін’єкція може призвести до фінансових транзакцій, змінених записів, втрати даних або фізичних наслідків у реальному світі.
GPT-Red також був протестований проти агента командної строки Codex, який працює на основі GPT-5.4 mini. У 10 раніше невиданих сценаріїв витоку даних він був більш успішним і більш ефективним за базовий GPT-5.5 у переконанні агента кодування розкрити конфіденційну інформацію.
Як GPT-Red змінив GPT-5.6
Одним з найбільш помітних відкриттів GPT-Red була категорія прямої ін’єкції промпта, яку OpenAI називає “фальшивою ланцюговою атакою”.
На високому рівні ця техніка представляє фальшиву інформацію про розслідування або верифікацію, яка спонукає цільову модель вважати, що шкідлива інструкція вже була перевірена та затверджена. Дослідник OpenAI Кріс Чоукетт-Чу порівняв цю концепцію з тим, як хтось каже людині, що неправильна відповідь вже була перевірена, роблячи її більш схильною до прийняття цієї відповіді без повторення основної логіки.
Ці атаки, як повідомляється, були успішними понад 95% часу проти GPT-5.1. Після адверсарного навчання з атаками, згенерованими GPT-Red, рівень успіху впав нижче 10% проти GPT-5.6 Sol. У більш широкому наборі прямої ін’єкції промпта OpenAI заявляє, що GPT-5.6 Sol зазнала невдачі лише у 0,05% спроб GPT-Red.
OpenAI також оцінила, чи просто додані захисти зробили GPT-5.6 більш схильною до відмови у легітимних запитах. Компанія заявляє, що загальні можливості та націлені оцінки надмірної відмови залишилися в основному незмінними, що свідчить про те, що покращення відбулися завдяки кращому розрізненню між шкідливими та легітимними інструкціями, а не тому, що модель стала загалом менш схильною до дії.
Ця відмінність важлива. Модель може здаватися безпечною, якщо вона відмовляється відкривати файли, переглядати веб-сторінки, виконувати код або взаємодіяти з зовнішніми додатками, але вона також втратить більшу частину своєї практичної цінності. Ефективна стійкість вимагає збереження легітимного використання інструментів при одночасному опорі інструкціям, вставленим недовіряними сторонами.
Чому OpenAI не випускає GPT-Red
GPT-Red залишиться внутрішньою системою та буде зберігатися окремо від публічно розгорнутих моделей OpenAI.
Це рішення відображає двозначну природу автоматизованого червоного командування. Та сама модель, яка може допомогти розробникам виявити уразливості ін’єкції промпта, також може допомогти атакувачам розробити більш ефективні методи компрометації агентів штучного інтелекту, які експлуатуються іншими компаніями.
Підхід OpenAI полягає у збереженні атакувача всередині, одночасно передавючи отримані знання про захист до продукційних моделей. Компанія заявляє, що це розділення призначене для запобігання тому, щоб шкідливі можливості, навмисно впроваджені в GPT-Red, стали доступними зовнішнім противникам.
Це також означає, що GPT-Red не слід плутати з публічними моделями кібербезпеки OpenAI або програмами захисту. Це не продукт тестування на проникнення, а не призначене для автономного виявлення звичайних уразливостей програмного забезпечення. Його поточна увага зосереджена на атаці на поведінку слідування інструкціям систем штучного інтелекту, особливо агентів, які підключені до потенційно недовіряних даних.
Автоматизоване червоне командування все ще має сліпі місця
Незважаючи на свої сильні результати, GPT-Red не забезпечує повного рішення проблеми безпеки штучного інтелекту.
Звіт про дослідження вказує на те, що система залишається менш ефективною у багаторазових атаках, які розгортаються поступово протягом тривалого розмови. Вона також має обмежені можливості для розробки ін’єкцій промпта, вбудованих в зображення, залишаючи важливі багатомодальні поверхні атак недостатньо покритими.
Результати також ґрунтуються в основному на середовищах та критеріях успіху, розроблених OpenAI. Хоча компанія протестувала GPT-Red на сценаріях, які не були включені до навчання, та на функціонуючих агентах, незалежні дослідники матимуть обмежену можливість відтворити результати, поки модель та більша частина її оцінювальної інфраструктури залишаються приватними.
OpenAI заявляє, що буде продовжувати поєднувати автоматизоване тестування з людським та третім червоним командуванням, шарованими заходами безпеки продукту, контроля доступу, моніторингу та виявлення зловживань в реальному часі. Ця стратегія захисту у глибину відображає реальність, що жодна окрема модель чи бенчмарк не може передбачити кожну атаку, яка може виникнути після розгортання.
Нова гонка безпеки між атакувальниками штучного інтелекту та захисниками
“Самозбереження”, описане в оголошенні OpenAI, не є розгорнутим моделем, яка автономно переписує свої власні ваги або незалежно створює більш потужного наступника. Натомість це контрольований цикл навчання, у якому одна система штучного інтелекту генерує адверсарні приклади, які дослідники використовують для покращення іншої.
Все ж таки, GPT-Red представляє значний зсув у тому, як передові моделі можуть бути захищені. Людські червоні команди можуть виявити складні уразливості, але вони не можуть вручну генерувати масштаб та різноманітність атак, необхідних для безперервного навчання все більш здатних агентів штучного інтелекту.
Автоматизовані атакувальники можуть заповнити частину цього розриву, створюючи безпековий маховик, у якому кожен сильніший захисник змушує модель червоного командування виявляти нові слабкості. Ці слабкості потім стають навчальним матеріалом для наступного покоління продукційних систем.
Ризик полягає в тому, що подібні можливості не залишаться ексклюзивними для захисних лабораторій. Коли відкриті та комерційні моделі стають кращими у довгостроковому плануванні, використанні інструментів, кібербезпеці та автономному експериментуванні, атакувальники отримають доступ до все більш здатних систем.
GPT-Red тому позначає як прогрес, так і раннє свідчення конкурсу, який попереду. Лабораторії штучного інтелекту починають використовувати потужні моделі для захисту свого наступного покоління агентів, але ці захисти будуть потребувати безперервної еволюції, оскільки ті самі основні технології роблять автоматизовані атаки дешевшими, швидшими та більш адаптивними.












