Modely a platformy AI

OpenAI představuje GPT-Red, umělou inteligenci navrženou pro posílení GPT-5.6

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

OpenAI odhalila GPT-Red, interní umělou inteligenci, která byla vyškolena k útoku na modely společnosti, odhalení jejich zranitelností a generování adversářských dat, která lze použít ke zlepšení budoucích verzí.

Na rozdíl od fungování jako další veřejný chatbot, GPT-Red funguje jako automatizovaný červený tým. Opakovaně posílá škodlivé nebo zavádějící instrukce cílovým modelům, sleduje jejich odpovědi a upravuje svou strategii, dokud se nezdaří nebo nevyčerpá dostupná útočná cesta. OpenAI uvádí, že systém se zaměřuje zejména na injekci příkazů, rostoucí bezpečnostní problém pro umělou inteligenci, která interaguje s e-maily, webovými stránkami, soubory, repozitáři kódu a propojenými aplikacemi.

Systém již ovlivnil produkční modely OpenAI. Předchůdci GPT-Red byli používání během školení od GPT-5.3, zatímco dokončený model byl začleněn do adversářského školení GPT-5.6 Sol. OpenAI uvádí, že GPT-5.6 Sol produkuje šestkrát méně selhání na svém nejobtížnějším přímém benchmarku injekce příkazů než vedoucí produkční model společnosti z předchozích čtyř měsíců.

Proč je injekce příkazů stále nebezpečnější

Injekce příkazů nastává, když útočník umístí instrukce do dat, která má umělá inteligence číst. Škodlivý příkaz může být skryt v e-mailu, webové stránce, nahráném dokumentu, odpovědi nástroje nebo softwarovém repozitáři.

Umělá inteligence může omylem považovat tento externí obsah za platnou instrukci. Místo dokončení původního úkolu uživatele může odhalit důvěrné informace, nahrát soubory na server ovládaný útočníkem, změnit nastavení účtu, spustit nebezpečný kód nebo provést neoprávněné akce prostřednictvím propojených nástrojů.

Problém se stává významnějším, když systémy umělé inteligence přesahují pouhé zodpovídání otázek a začínají jednat jménem uživatelů. Agent s přístupem ke cloudovému úložišti, platebním systémům, zdrojovému kódu, obchodním aplikacím nebo interním firemním údajům představuje větší potenciální “blast radius”, když jsou jeho instrukce úspěšně manipulovány.

OpenAI popisuje injekci příkazů jako jednu z centrálních výzev vytvořených agenty umělé inteligence. Propojené nástroje dělají modely mnohem užitečnějšími, ale každý nový zdroj dat také poskytuje další kanál, kterým může útočník pokusit ovlivnit chování modelu.

GPT-Red se učí prostřednictvím sebehra

GPT-Red byl vyvinut prostřednictvím sebehra učení, přístupu, ve kterém útočící model a kolekce obranných modelů zlepšují soutěží proti sobě.

Útočník obdrží odměnu, když vyprodukuje platné selhání, jako je přesvědčení modelu, aby následoval injekci příkazů. Obránce je odměněn za odmítnutí škodlivé instrukce, zatímco dokončuje původní úkol, který mu byl zadán.

Jak se obránci stávají lepšími v rozpoznávání útoků, GPT-Red musí najít více sofistikované a rozmanité způsoby, jak je obejít. Tyto nové útoky lze poté začlenit do školení obránců, vytvářející eskalační cyklus mezi útočnými a obrannými schopnostmi.

OpenAI vytvořila velkou kolekci simulovaných prostředí pro tento proces. V závislosti na scénáři může GPT-Red ovládat část lokálního souboru, text e-mailu, webovou stránku nebo výstup vrácený externím nástrojem. Každé prostředí definuje, co může útočník manipulovat, a jaký výsledek se kvalifikuje jako úspěšné ohrožení.

Společnost uvádí, že GPT-Red byl vyškolena pomocí výpočetních zdrojů srovnatelných s některými z jejích největších poškolících běhů, představujících neobvykle velké přidělení výpočtu specificky pro výzkum bezpečnosti. Na konci školení mohl model ohrozit téměř každý interní a produkční model, proti kterým byl testován, včetně GPT-5.5.

GPT-Red předčil lidské útočníky v testování

Aby vyhodnotila, zda GPT-Red může generalizovat za své tréninkové prostředí, OpenAI otestovala jej pomocí replikované verze nepřímé injekce příkazů z roku 2025.

GPT-Red a lidský červený tým byli požádáni, aby vyvinuli útoky proti GPT-5.1 ve scénářích, které nebyly zahrnuty do tréninku GPT-Red. Automatizovaný systém produkoval úspěšné útoky v 84 % scénářů, ve srovnání s 13 % pro lidské účastníky.

Tento výsledek neznamená, že lidský bezpečnostní výzkum se stal zbytečným. Výhoda GPT-Red spočívá zejména v jeho schopnosti provádět velké množství experimentů, odstraňovat neúspěšné strategie a neustále zlepšovat slibné útoky bez časových a personálních omezení lidského týmu.

Lidský testování zůstává důležité pro identifikaci neočekávaných rizik, pochopení širších důsledků selhání a navrhování scénářů, které automatizované systémy nemusí zvážit. Jessica Ji, senior výzkumný analytik na Georgetown University’s Center for Security and Emerging Technology, popsala výsledky jako slibné, zatímco zdůraznila, že lidská odbornost zůstává nezbytná.

Vending Machine se stal reálným cílem

OpenAI také otestovala, zda útoky objevené v simulacích mohou být přeneseny na funkční umělou inteligenci.

Jedním z experimentů byl cílem autonomní prodejní automat vytvořený Andon Labs a nasazený v kanceláři OpenAI. GPT-Red byl inicializován s modelem systému a schopností sledovat, jak agent používá své nástroje.

Po testování a vylepšení útoků v simulaci GPT-Red přenesl útoky na produkční agenta. Dosáhl všech tří přidělených cílů: snížení ceny drahého produktu na 0,50 $, objednání nového produktu v hodnotě více než 100 $ a nabídnutí ho za 0,50 $ a zrušení objednávky jiného zákazníka. OpenAI uvádí, že zranitelnosti byly oznámeny a testují se další bezpečnostní opatření.

Experiment ilustruje, proč injekce příkazů není pouze otázkou produkce nevhodné odpovědi chatbota. Když model umělé inteligence ovládá externí systémy, úspěšná injekce může vést k finančním transakcím, změnám záznamů, ztrátě dat nebo fyzickým důsledkům.

GPT-Red byl také otestován proti agentovi Codex s příkazovým řádkem poháněným GPT-5.4 mini. Přes 10 dříve neviditelných scénářů pro odhalení citlivých informací byl více úspěšný a více token-efektivní než promptovaný GPT-5.5 baseline.

Jak GPT-Red změnil GPT-5.6

Jednou z nejvýznamnějších objevů GPT-Red byla kategorie přímé injekce příkazů, kterou OpenAI nazývá “falešný řetězec myšlení” útok.

Na vysoké úrovni tato technika představuje falešné důvody nebo ověřovací informace, které vedou cílový model k domněnce, že škodlivá instrukce již byla přezkoumána a schválena. Výzkumník OpenAI Chris Choquette-Choo srovnal tento koncept s falešným sdělením někomu, že nesprávná odpověď již byla ověřena, což jej činí více ochotným ji přijmout bez opakování základního důvodu.

Tito útoky údajně uspěli více než 95 % času proti GPT-5.1. Po adversářském školení pomocí útoků generovaných GPT-Red se míra úspěchu snížila pod 10 % proti GPT-5.6 Sol. V širší sadě přímých injekčních prostředí OpenAI uvádí, že GPT-5.6 Sol selhal na pouze 0,05 % pokusů GPT-Red.

OpenAI také vyhodnotila, zda dodané obrany pouze zvýšily pravděpodobnost, že GPT-5.6 odmítne platné požadavky. Společnost uvádí, že obecné schopnosti a cílené hodnocení nadměrného odmítnutí zůstalylargely nedotčeny, což naznačuje, že zlepšení pocházela z lepšího rozlišení mezi škodlivými a legitimními instrukcemi, spíše než z toho, že model se stal obecně méně ochotným jednat.

Tento rozdíl je důležitý. Model může vypadat bezpečně, pokud odmítá otevřít soubory, procházet webové stránky, spouštět kód nebo interagovat s externími aplikacemi, ale ztratil by také většinu své praktické hodnoty. Účinná robustnost vyžaduje zachování legitimního použití nástrojů, zatímco odolává instrukcím vloženým nedůvěryhodnými stranami.

Proč OpenAI nevydává GPT-Red

GPT-Red zůstane interním systémem a bude oddělen od veřejně nasazených modelů OpenAI.

Toto rozhodnutí odráží dvojí povahu automatizovaného červeného týmu. Stejný model, který může pomoci vývojářům objevit zranitelnosti injekce příkazů, by mohl také pomoci útočníkům vyvinout účinnější metody pro ohrožení agentů umělé inteligence provozovaných jinými společnostmi.

Přístup OpenAI spočívá v zachování útočníka interně, zatímco přenese výslednou obrannou znalost do produkčních modelů. Společnost uvádí, že toto oddělení je určeno k zabránění tomu, aby škodlivé schopnosti úmyslně vyškolily GPT-Red, se staly dostupnými pro externí útočníky.

To také znamená, že GPT-Red by neměl být zaměňován s veřejnými bezpečnostními modely OpenAI nebo defenzivními programy. Není to produkt pro testování proniknutí, ani není primárně navržen pro autonomní objevování konvenčních softwarových zranitelností. Jeho současným zaměřením je útok na chování umělé inteligence, zejména na agenty vystavené potenciálně nedůvěryhodným datům.

Automatizované červené týmy stále mají slepá místa

Navzdory silným výsledkům GPT-Red neposkytuje úplné řešení pro bezpečnost umělé inteligence.

Reportáž o výzkumu ukazuje, že systém zůstává méně účinný při multi-obratových útocích, které se postupně rozvíjejí po dlouhou konverzaci. Má také omezené schopnosti pro vývoj injekcí příkazů vložených do obrazů, což ponechává důležité multimodální útočné povrchy nedostatečně pokryté.

Výsledky jsou také založeny silně na prostředích a kritériích úspěchu navržených OpenAI. Ačkoli společnost otestovala GPT-Red na scénářích a funkčních agentech, nezávislí výzkumníci budou mít omezenou schopnost reprodukovat výsledky, zatímco model a většina jeho evaluační infrastruktury zůstanou soukromé.

OpenAI uvádí, že bude pokračovat v kombinování automatizovaného testování s lidským a třetím stranám červeného týmu, vrstvenými produktovými bezpečnostními opatřeními, kontrolami přístupu, monitorováním a detekcí zneužití v reálném čase. Tato strategie obrany ve hloubce odráží realitu, že žádný jediný model nebo benchmark nemůže předpovědět každý útok, který by mohl vzniknout po nasazení.

Nová bezpečnostní soutěž mezi útočníky a obránci umělé inteligence

“Sebevylepšení” popsané v oznámení OpenAI není nasazený model, který autonomně přepisuje své vlastní váhy nebo nezávisle vytváří silnějšího nástupce. Místo toho je to řízený tréninkový cyklus, ve kterém jeden systém umělé inteligence generuje adversářské příklady, které výzkumníci používají ke zlepšení jiného.

I tak GPT-Red představuje významný posun v tom, jak mohou být zajištěny bezpečnostní modely na hranici. Lidské červené týmy mohou odhalit sofistikované zranitelnosti, ale nemohou ručně generovat rozsah a rozmanitost útoků, které jsou vyžadovány pro kontinuální školení stále schopnějších agentů umělé inteligence.

Automatizovaní útočníci mohou vyplnit část této mezery, vytvářející bezpečnostní setrvačník, ve kterém každý silnější obránce nutí model červeného týmu objevit nové slabiny. Tyto slabiny se poté stávají tréninkovým materiálem pro příští generaci produkčních systémů.

Riziko spočívá v tom, že podobné schopnosti nebudou zůstávat výlučně pro defenzivní laboratoře. Jak se otevřené a komerční modely stanou lepšími v dlouhodobém plánování, používání nástrojů, kybernetické bezpečnosti a autonomním experimentování, útočníci získávat přístup k stále schopnějším systémům.

GPT-Red tedy představuje jak pokrok, tak ranou indikaci soutěže, která nás čeká. Laboratoře umělé inteligence začínají používat silné modely k ochraně své příští generace agentů, ale tyto obrany budou muset neustále evoluvovat, protože stejné základní technologie činí automatizované útoky levnějšími, rychlejšími a přizpůsobivějšími.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.