AI-modeller och plattformar

OpenAI Introducerar GPT-Red, en AI-angripare Utvecklad för att Stärka GPT-5.6

mm
Lägg till Unite.AI bland dina föredragna källor på Google

OpenAI har avslöjat GPT-Red, ett internt artificiellt intelligenssystem som tränats för att angripa företagets egna modeller, exponera deras sårbarheter och generera adversarial data som kan användas för att stärka framtida versioner.

I stället för att fungera som en offentlig chatbot fungerar GPT-Red som en automatiserad röd teamare. Den skickar upprepade gånger skadliga eller vilseledande instruktioner till målmodellerna, observerar deras svar och justerar sin strategi tills den antingen lyckas eller uttömer den tillgängliga angreppsvägen. OpenAI säger att systemet är särskilt fokuserat på promptinjektion, ett växande säkerhetsproblem för AI-agenter som interagerar med e-post, webbplatser, filer, kodrepository och anslutna applikationer.

Systemet har redan påverkat OpenAI:s produktionsmodeller. Föregångare till GPT-Red har använts under utbildning sedan GPT-5.3, medan den färdiga modellen införlivades i den adversariala utbildningen av GPT-5.6 Sol. OpenAI rapporterar att GPT-5.6 Sol producerar sex gånger färre fel på sin mest svåra direkt promptinjektionsbenchmark jämfört med företagets ledande produktionsmodell från fyra månader tidigare.

Varför Promptinjektion Blir Mer Farligt

Promptinjektion inträffar när en angripare placerar instruktioner inuti data som en AI-system förväntas läsa. En skadlig kommando kan döljas i en e-post, webbsida, uppladdad dokument, verktygsrespons eller programvarurepository.

AI-agenten kan felaktigt behandla den externa innehållet som en legitim instruktion. I stället för att slutföra användarens ursprungliga uppgift kan den avslöja konfidentiell information, ladda upp filer till en angripare-kontrollerad server, ändra kontoinställningar, köra osäkert kod eller vidta obehöriga åtgärder genom anslutna verktyg.

Problemet blir mer betydande när AI-systemen går utöver att svara på frågor och börjar agera på uppdrag av användare. En agent med tillgång till molnlagring, betalningssystem, källkod, företagsapplikationer eller intern företagsdata presenterar en större potentiell “blast radius” när dess instruktioner manipuleras framgångsrikt.

OpenAI beskriver promptinjektion som en av de centrala utmaningarna som skapas av agerande AI. Anslutna verktyg gör modellerna betydligt mer användbara, men varje ny datakälla tillhandahåller också en annan kanal genom vilken en angripare kan försöka påverka modellens beteende.

GPT-Red Lär Sig Genom Självspel

GPT-Red utvecklades genom självspel förstärkt inlärning, en metod där en angripare-modell och en samling försvarsmodeller förbättras genom att tävla mot varandra.

Angriparen får en belöning när den producerar ett giltigt fel, till exempel övertygar en modell att följa en promptinjektion. Försvararen belönas för att avvisa den skadliga instruktionen medan den fortfarande slutför den legitima uppgiften den ursprungligen fick.

Såsom försvararna blir bättre på att känna igen attacker måste GPT-Red hitta mer sofistikerade och varierade sätt att kringgå dem. Dessa nya attacker kan sedan införlivas i försvararnas utbildning, vilket skapar en eskalerande cykel mellan offensiva och defensiva förmågor.

OpenAI byggde en stor samling simulerade miljöer för denna process. Beroende på scenariot kan GPT-Red kontrollera en del av en lokal fil, texten i en e-post, en webbannons eller utdata som returneras av ett externa verktyg. Varje miljö definierar vad angriparen kan manipulera och vad som kvalificerar som en framgångsrik kompromiss.

Företaget säger att GPT-Red tränades med beräkningsresurser jämförbara med vissa av dess största post-träningskörningar, vilket representerar en ovanligt stor tilldelning av beräkningar specifikt för säkerhetsforskning. Vid utbildningens slut kunde modellen kompromettera nästan varje intern och produktionsmodell den testades mot, inklusive GPT-5.5.

GPT-Red Presterade Bättre än Mänskliga Angripare i Testning

För att utvärdera om GPT-Red kunde generalisera bortom sina träningsmiljöer testade OpenAI det med en replikerad version av en 2025 indirekt promptinjektionsutmaning.

GPT-Red och mänskliga röd teamare ombads att utveckla attacker mot GPT-5.1 i scenarier som inte hade ingått i GPT-Red:s utbildning. Den automatiserade systemet producerade framgångsrika attacker i 84% av scenarierna, jämfört med 13% för de mänskliga deltagarna.

Detta resultat betyder inte att mänskliga säkerhetsforskare har blivit onödiga. GPT-Red:s fördel ligger främst i dess förmåga att genomföra en hög volym experiment, avvisa misslyckade strategier och kontinuerligt förbättra lovande attacker utan de tids- och personalbegränsningar som en mänsklig grupp har.

Mänskliga testare förblir viktiga för att identifiera oväntade risker, förstå de bredare konsekvenserna av fel och designa scenarier som automatiserade system kanske inte överväger. Jessica Ji, en senior forskningsanalytiker vid Georgetown Universitys Center for Security and Emerging Technology, beskrev resultaten som lovande medan hon betonade att mänsklig expertis förblir avgörande.

En Vendingmaskin Blev ett Verkligt Mål

OpenAI testade också om attacker som upptäckts i simuleringar kunde överföras till fungerande AI-agenter.

En experiment riktade sig mot en autonom vendingmaskinsagent skapad av Andon Labs och distribuerad i en OpenAI-kontor. GPT-Red gavs initialt en simulerad version av systemet, tillsammans med möjligheten att observera hur agenten använde sina verktyg.

Efter att ha testat och förfinat sina attacker i simuleringen överförde GPT-Red dem till produktionsagenten. Den uppnådde alla tre tilldelade mål: att sänka priset på en dyr produkt till $0,50, beställa en ny artikel värd mer än $100 och erbjuda den för $0,50, och avbryta en annan kunds beställning. OpenAI säger att sårbarheterna avslöjades och ytterligare skyddsåtgärder testas.

Experimentet illustrerar varför promptinjektion inte bara handlar om att producera en olämplig chatbotsvar. När en AI-modell kontrollerar externa system kan en framgångsrik injektion leda till finansiella transaktioner, ändrade register, dataförlust eller fysiska konsekvenser.

GPT-Red testades också mot en Codex-kommandoradagent som drivs av GPT-5.4 mini. Över 10 tidigare osedda data-exfiltrationsscenarier var den mer framgångsrik och token-effektiv än en utlöst GPT-5.5-baslinje för att övertyga kodagenten att avslöja känslig information.

Hur GPT-Red Förändrade GPT-5.6

En av GPT-Red:s mest anmärkningsvärda upptäckter var en kategori av direkt promptinjektion som OpenAI kallar en “falsk kedja av tankar”-attack.

På en hög nivå presenterar tekniken fabricerad resonemang eller verifieringsinformation som uppmuntrar målmodellen att anta att en skadlig instruktion redan har granskats och godkänts. OpenAI-forskaren Chris Choquette-Choo jämförde konceptet med att falskt berätta för någon att ett felaktigt svar redan hade verifierats, vilket gör dem mer benägna att acceptera det utan att upprepa den underliggande resonemanget.

Dessa attacker rapporteras ha lyckats mer än 95% av tiden mot GPT-5.1. Efter adversarial utbildning med attacker genererade av GPT-Red sjönk framgångsgraden under 10% mot GPT-5.6 Sol. Över en bredare uppsättning direkt promptinjektionsmiljöer säger OpenAI att GPT-5.6 Sol misslyckades på endast 0,05% av GPT-Red:s försök.

OpenAI utvärderade också om de tillagda försvar enbart gjorde GPT-5.6 mer benägen att vägra legitima förfrågningar. Företaget säger att allmänna förmågor och riktade över-avslagsutvärderingar förblev i stort sett opåverkade, vilket tyder på att förbättringarna kom från bättre differentiering mellan skadliga och legitima instruktioner snarare än från att göra modellen överlag mindre villig att agera.

Den distinktionen är viktig. En modell kan verka säker om den vägrar att öppna filer, bläddra på webbplatser, köra kod eller interagera med externa applikationer, men den skulle också förlora mycket av sin praktiska värde. Effektiv robusthet kräver att man bevarar legitima verktygsanvändning medan man motstår instruktioner införda av obehöriga parter.

Varför OpenAI Inte Släpper GPT-Red

GPT-Red kommer att förbli ett internt system och hålls separat från OpenAI:s offentligt distribuerade modeller.

Detta beslut reflekterar den dubbla användningen av automatiserad röd teaming. Samma modell som kan hjälpa utvecklare att upptäcka promptinjektionssårbarheter kunde också hjälpa angripare att utveckla mer effektiva metoder för att kompromettera AI-agenter som drivs av andra företag.

OpenAI:s tillvägagångssätt är att behålla angriparen internt medan den resulterande defensiva kunskapen överförs till produktionsmodeller. Företaget säger att denna separation är avsedd att förhindra att de skadliga förmågorna som medvetet tränats in i GPT-Red blir tillgängliga för yttre angripare.

Detta betyder också att GPT-Red inte bör förväxlas med OpenAI:s offentliga cybersäkerhetsmodeller eller defensiva program. Det är inte ett penetrationstestprodukt, och det är inte primärt utformat för att autonomt upptäcka konventionella programvaruexploater. Dess nuvarande fokus är att angripa instruktionsföljandebeteendet hos AI-system, särskilt agenter som exponeras för potentiellt obehöriga data.

Automatiserad Röd Teaming Har fortfarande Blinda Fläckar

Trots sina starka resultat tillhandahåller GPT-Red inte en fullständig lösning för AI-säkerhet.

Rapporteringen om forskningen indikerar att systemet förblir mindre effektivt vid multi-turn-attacker som utvecklas gradvis över en lång konversation. Det har också begränsade förmågor för att utveckla promptinjektioner inbäddade i bilder, vilket lämnar viktiga multimodala attackytor otillräckligt täckta.

Resultaten baseras också tungt på miljöer och framgångskriterier utformade av OpenAI. Även om företaget testade GPT-Red på undanhållna scenarier och fungerande agenter, kommer oberoende forskare att ha begränsad möjlighet att reproducera resultaten medan modellen och mycket av dess utvärderingsinfrastruktur förblir privata.

OpenAI säger att de kommer att fortsätta kombinera automatiserad testning med mänsklig och tredjepartsröd teaming, skiktade produktskydd, åtkomstkontroll, övervakning och realtidsmissbruksdetektering. Den försvarsstrategin i djupet reflekterar verkligheten att ingen enda modell eller benchmark kan förutse varje attack som kan uppstå efter distribution.

En Ny Säkerhetskapplöpning Mellan AI-angripare och Försvarare

Den “självförbättring” som beskrivs i OpenAI:s tillkännagivande är inte en distribuerad modell som autonomt skriver om sin egen vikt eller oberoende skapar en kraftfullare efterföljare. I stället är det en kontrollerad träningsloop där ett AI-system genererar adversariala exempel som forskare använder för att förbättra ett annat.

Även så representerar GPT-Red en betydande förändring i hur frontmodeller kan säkras. Mänskliga röd teamare kan upptäcka sofistikerade sårbarheter, men de kan inte manuellt generera den skala och variation av attacker som krävs för att kontinuerligt träna alltmer kapabla AI-agenter.

Automatiserade angripare kan fylla en del av den luckan, skapa en säkerhetsloop där varje starkare försvarare tvingar röd teamingsmodellen att upptäcka nya svagheter. Dessa svagheter blir sedan träningsmaterial för nästa generation av produktionsmodeller.

Risken är att liknande förmågor inte kommer att förbli exklusiva för defensiva laboratorier. När öppna och kommersiella modeller blir bättre på långsiktiga planer, verktygsanvändning, cybersäkerhet och autonom experimentering kommer angripare att få tillgång till alltmer kapabla system av sina egna.

GPT-Red markerar därför både framsteg och en tidig indikation på den kommande tävlingen. AI-laboratorier börjar använda kraftfulla modeller för att försvara sin nästa generation av agenter, men dessa försvar kommer att behöva utvecklas kontinuerligt eftersom samma underliggande teknologier gör automatiserade attacker billigare, snabbare och mer anpassningsbara.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.