Modele i platformy AI
OpenAI wprowadza GPT-Red, sztuczną inteligencję atakującą, aby wzmocnić GPT-5.6

OpenAI ujawnił GPT-Red, wewnętrzny system sztucznej inteligencji szkolony do atakowania modeli firmy, ujawniania ich słabości i generowania danych przeciwnika, które mogą być wykorzystane do wzmocnienia przyszłych wersji.
W przeciwieństwie do funkcjonowania jako kolejny publiczny chatbot, GPT-Red działa jako zautomatyzowany red teamer. Wysyła wielokrotnie złe lub mylące instrukcje do modeli docelowych, obserwuje ich odpowiedzi i dostosowuje swoją strategię, aż do osiągnięcia sukcesu lub wyczerpania dostępnej ścieżki ataku. OpenAI twierdzi, że system jest szczególnie ukierunkowany na wstrzyknięcie podpowiedzi, rosnący problem bezpieczeństwa dla agentów AI, które interaktywnie współpracują z e-mailami, stronami internetowymi, plikami, repozytoriami kodu i połączonymi aplikacjami.
System ten już wpłynął na produkcyjne modele OpenAI. Wstępne wersje GPT-Red były wykorzystywane podczas szkolenia od GPT-5.3, podczas gdy ukończony model został włączony do szkolenia przeciwnika GPT-5.6 Sol. OpenAI podaje, że GPT-5.6 Sol produkował sześciokrotnie mniej niepowodzeń w najtrudniejszym bezpośrednim teście wstrzyknięcia podpowiedzi niż wiodący model produkcyjny firmy z czterech miesięcy wcześniej.
Dlaczego wstrzyknięcie podpowiedzi staje się coraz bardziej niebezpieczne
Wstrzyknięcie podpowiedzi występuje, gdy atakujący umieszcza instrukcje wewnątrz danych, które system AI ma odczytać. Zła komenda może być ukryta w e-mailu, stronie internetowej, przesłanym dokumencie, odpowiedzi toola lub repozytorium oprogramowania.
Agent AI może mylnie traktować ten zewnętrzny kontent jako prawidłową instrukcję. Zamiast wykonania pierwotnego zadania użytkownika, może ujawnić poufne informacje, przesłać pliki na serwer kontrolowany przez atakującego, zmienić ustawienia konta, wykonać niebezpieczny kod lub podjąć nieautoryzowane działania za pośrednictwem połączonych narzędzi.
Problem staje się bardziej znaczący, gdy systemy AI przechodzą poza odpowiadanie na pytania i zaczynają działać w imieniu użytkowników. Agent z dostępem do magazynu w chmurze, systemów płatności, kodu źródłowego, aplikacji biznesowych lub wewnętrznych danych firmy przedstawia większy potencjalny „zasięg” w przypadku udanego manipulowania jego instrukcjami.
OpenAI opisuje wstrzyknięcie podpowiedzi jako jeden z centralnych wyzwań stworzonych przez agenty AI. Połączone narzędzia sprawiają, że modele są znacznie bardziej użyteczne, ale każde nowe źródło danych dostarcza również inną drogę, przez którą atakujący może próbować wpłynąć na zachowanie modelu.
GPT-Red uczy się przez samogranie
GPT-Red został opracowany za pomocą samogrania wzmocnionego uczenia, podejścia, w którym atakujący model i kolekcja modeli obrońców są ulepszane poprzez współzawodnictwo ze sobą.
Atakujący otrzymuje nagrodę, gdy wytworzy prawidłowe niepowodzenie, takie jak przekonanie modelu do wykonania wstrzyknięcia podpowiedzi. Obrońca jest nagradzany za odrzucenie złej instrukcji, jednocześnie wykonując oryginalne zadanie, które zostało mu pierwotnie przypisane.
Im obrońcy stają się lepsi w rozpoznawaniu ataków, GPT-Red musi znaleźć bardziej wyrafinowane i różnorodne sposoby, aby je ominąć. Te nowe ataki mogą być następnie włączone do szkolenia obrońców, tworząc eskalujący cykl między ofensywnymi i defensywnymi zdolnościami.
OpenAI zbudował dużą kolekcję symulowanych środowisk dla tego procesu. W zależności od scenariusza, GPT-Red może kontrolować część pliku lokalnego, tekst e-maila, baner strony internetowej lub dane wyjściowe zwrócone przez zewnętrzne narzędzie. Każde środowisko definiuje, co atakujący może manipulować i jaki wynik kwalifikuje się jako udany kompromis.
Firma twierdzi, że GPT-Red został przeszkolony przy użyciu zasobów obliczeniowych porównywalnych do niektórych z największych po-szkoleniowych przebiegów, co stanowi niezwykle duże przydział komputera specjalnie na badania bezpieczeństwa. Do końca szkolenia model mógł skompromitować prawie każdy wewnętrzny i produkcyjny model, przeciwko któremu został przetestowany, łącznie z GPT-5.5.
GPT-Red przewyższył atakujących ludzi w testach
Aby ocenić, czy GPT-Red mógłby ogólnie działać poza środowiskami szkoleniowymi, OpenAI przetestował go przy użyciu replikowanego wersji wyzwania wstrzyknięcia podpowiedzi z 2025 roku.
GPT-Red i ludzie z czerwonej drużyny zostali poproszeni o opracowanie ataków na GPT-5.1 w scenariuszach, które nie były uwzględnione w szkoleniu GPT-Red. Zautomatyzowany system wytworzył udane ataki w 84% scenariuszy, w porównaniu z 13% dla uczestników ludzkich.
Ten wynik nie oznacza, że ludzcy badacze bezpieczeństwa stali się zbędni. Przewaga GPT-Red leży głównie w jego zdolności do prowadzenia dużej liczby eksperymentów, odrzucania nieudanych strategii i ciągłego doskonalenia obiecujących ataków bez ograniczeń czasowych i kadrowych ludzkiego zespołu.
Ludzcy testery pozostają ważni dla identyfikowania nieoczekiwanych ryzyk, zrozumienia szerszych konsekwencji niepowodzeń i projektowania scenariuszy, których zautomatyzowane systemy mogą nie uwzględniać. Jessica Ji, starszy analityk badawczy w Centrum Bezpieczeństwa i Technologii Wschodzącej Uniwersytetu Georgetown, opisała wyniki jako obiecujące, podkreślając, że ekspertyza ludzka pozostaje niezastąpiona.
Automat vendingowy stał się celem w świecie rzeczywistym
OpenAI również przetestował, czy ataki odkryte w symulacjach mogą przenieść się na funkcjonujące agenty AI.
W jednym eksperymencie celem był autonomiczny automat vendingowy stworzony przez Andon Labs i wdrożony w biurze OpenAI. GPT-Red otrzymał najpierw symulowaną wersję systemu, wraz z możliwością obserwowania, jak agent używał swoich narzędzi.
Po przetestowaniu i udoskonaleniu ataków w symulacji, GPT-Red przeniósł je do agenta produkcyjnego. Osiągnął wszystkie trzy przydzielone cele: obniżenie ceny drogiego produktu do 0,50 USD, zamówienie nowego produktu o wartości ponad 100 USD i oferowanie go za 0,50 USD oraz anulowanie zamówienia innego klienta. OpenAI twierdzi, że słabości zostały ujawnione i dodatkowe zabezpieczenia są testowane.
Eksperyment ilustruje, dlaczego wstrzyknięcie podpowiedzi nie jest po prostu kwestią wytworzenia niewłaściwej odpowiedzi chatbota. Gdy model AI kontroluje zewnętrzne systemy, udany wstrzyk może skutkować transakcjami finansowymi, zmodyfikowanymi rekordami, utratą danych lub konsekwencjami w świecie fizycznym.
GPT-Red został również przetestowany na agencie wiersza poleceń Codex napędzanym przez GPT-5.4 mini. Przez 10 wcześniej niewidzianych scenariuszy eksfiltracji danych był bardziej skuteczny i wydajny tokenowo niż GPT-5.5 baseline w przekonywaniu agenta kodowania do ujawnienia poufnych informacji.
Jak GPT-Red zmienił GPT-5.6
Jednym z najbardziej godnych uwagi odkryć GPT-Red była kategoria bezpośredniego wstrzyknięcia podpowiedzi, którą OpenAI nazywa „fałszywą łańcuchem myśli” atakiem.
Na wysokim poziomie, technika ta przedstawia fałszywą logikę lub informacje weryfikacyjne, które zachęcają model docelowy do założenia, że zła instrukcja została już przeanalizowana i zatwierdzona. Badacz OpenAI Chris Choquette-Choo porównał ten koncept do fałszywego powiedzenia komuś, że błędna odpowiedź została już zweryfikowana, co sprawia, że osoba ta jest bardziej skłonna ją zaakceptować bez powtarzania podstawowego rozumowania.
Te ataki miały miejsce w ponad 95% przypadków przeciwko GPT-5.1. Po szkoleniu przeciwnika przy użyciu ataków wygenerowanych przez GPT-Red, wskaźnik powodzenia spadł poniżej 10% przeciwko GPT-5.6 Sol. W szerszym zestawie środowisk wstrzyknięcia podpowiedzi OpenAI twierdzi, że GPT-5.6 Sol nie powiódł się tylko w 0,05% prób GPT-Red.
OpenAI również ocenił, czy dodane zabezpieczenia po prostu sprawiły, że GPT-5.6 stał się bardziej skłonny do odmowy prawidłowych żądań. Firma twierdzi, że ogólne zdolności i ukierunkowane oceny odmowy pozostały w dużej mierze niezmienione, co sugeruje, że ulepszenia wynikały z lepszej różnicowania między złymi a prawidłowymi instrukcjami, a nie z faktu, że model stał się ogólnie mniej skłonny do działania.
Ta różnica jest ważna. Model może wydawać się bezpieczny, jeśli odmawia otwierania plików, przeglądania stron internetowych, wykonywania kodu lub interakcji z zewnętrznymi aplikacjami, ale straciłby również dużą część swojej praktycznej wartości. Skuteczna wytrzymałość wymaga zachowania użycia prawidłowych narzędzi, jednocześnie opierając się instrukcjom wstawianym przez niezaufane strony.
Dlaczego OpenAI nie wydaje GPT-Red
GPT-Red pozostanie wewnętrznym systemem i jest trzymany oddzielnie od publicznie wdrożonych modeli OpenAI.
Decyzja ta wynika z podwójnego charakteru zautomatyzowanego testowania czerwonej drużyny. Ten sam model, który może pomóc deweloperom w odkryciu słabości wstrzyknięcia podpowiedzi, mógłby również pomóc atakującym w rozwijaniu bardziej skutecznych metod kompromitowania agentów AI obsługiwanych przez inne firmy.
Podejście OpenAI polega na utrzymaniu atakującego wewnętrznie, jednocześnie przenosząc wynikające z tego wiedzy o obronie do modeli produkcyjnych. Firma twierdzi, że separacja ta ma na celu uniemożliwienie dostępu zewnętrznym przeciwnikom do zdolności atakujących celowo wytrenowanych w GPT-Red.
To również oznacza, że GPT-Red nie powinien być mylony z publicznymi modelami cyberbezpieczeństwa OpenAI lub programami obronnymi. Nie jest to produkt testowania penetracyjnego, ani nie jest głównie zaprojektowany do samodzielnego odkrywania konwencjonalnych luk w zabezpieczeniach oprogramowania. Jego obecny focus jest atakowaniem zachowania instrukcji systemów AI, szczególnie agentów narażonych na potencjalnie niezaufane dane.
Zautomatyzowane testowanie czerwonej drużyny wciąż ma słabości
Pomimo silnych wyników, GPT-Red nie zapewnia kompletnego rozwiązania dla bezpieczeństwa AI.
W raporcie z badań wskazano, że system pozostaje mniej skuteczny w atakach wieloobrotowych, które rozwijają się stopniowo w długiej rozmowie. Ma również ograniczone możliwości rozwoju wstrzyknięć podpowiedzi osadzonych w obrazach, pozostawiając ważne powierzchnie ataku wielomodalnego niewystarczająco pokryte.
Wyniki opierają się również w dużej mierze na środowiskach i kryteriach sukcesu opracowanych przez OpenAI. Chociaż firma przetestowała GPT-Red na scenariuszach i funkcjonujących agentach, niezależni badacze będą mieli ograniczoną możliwość powtarzania wyników, dopóki model i większość infrastruktury oceny pozostaną prywatne.
OpenAI twierdzi, że będzie kontynuował łączenie testowania zautomatyzowanego z ludzkim i zewnętrznym testowaniem czerwonej drużyny, warstwowymi zabezpieczeniami produktów, kontrolami dostępu, monitorowaniem i wykrywaniem nadużyć w czasie rzeczywistym. Ta strategia obrony w głębi odzwierciedla rzeczywistość, że żaden pojedynczy model lub benchmark nie może przewidzieć każdego ataku, który może pojawić się po wdrożeniu.
Nowy wyścig bezpieczeństwa między atakującymi AI a obrońcami
„Samodoskonalenie” opisane w ogłoszeniu OpenAI nie jest wdrożonym modelem, który samodzielnie przebudowuje swoje własne wagi lub niezależnie tworzy bardziej potężnego następcę. Jest to kontrolowany cykl szkolenia, w którym jeden system AI generuje przykłady przeciwnika, które badacze wykorzystują do ulepszania innego.
Nawet tak, GPT-Red reprezentuje znaczącą zmianę w tym, jak może być zabezpieczony model na czele. Ludzkie zespoły czerwone mogą odkryć wyrafinowane słabości, ale nie mogą ręcznie generować skali i różnorodności ataków wymaganych do ciągłego szkolenia coraz bardziej zdolnych agentów AI.
Zautomatyzowani atakujący mogą wypełnić część tej luki, tworząc bezpieczny wir, w którym każdy silniejszy obrońca zmusza model testowania czerwonej drużyny do odkrywania nowych słabości. Te słabości stają się następnie materiałem szkoleniowym dla następnej generacji systemów produkcyjnych.
Ryzyko polega na tym, że podobne zdolności nie pozostaną wyłącznie w obrębie laboratoriów obronnych. W miarę jak otwarte i komercyjne modele stają się lepsze w planowaniu długoterminowym, użyciu narzędzi, cyberbezpieczeństwie i samodzielnym eksperymentowaniu, atakujący zyskają dostęp do coraz bardziej zdolnych systemów.
GPT-Red więc oznacza zarówno postęp, jak i wczesne ostrzeżenie o nadchodzącym wyzwaniu. Laboratoria AI zaczynają wykorzystywać potężne modele do obrony swoich następnych agentów, ale te obrony będą musiały ewoluować ciągle, ponieważ te same podstawowe technologie sprawiają, że zautomatyzowane ataki stają się tańsze, szybsze i bardziej adaptacyjne.












