AI-modeller og plattformer
OpenAI Introduceser GPT-Red, en AI-angriper bygget for å styrke GPT-5.6

OpenAI har avdekket GPT-Red, et internasjonalt kunstig intelligenssystem trent for å angripe selskapets egne modeller, avdekke deres sårbarheter og generere motstridende data som kan brukes til å styrke fremtidige utgaver.
I stedet for å fungere som en annen offentlig chatbot, fungerer GPT-Red som en automatisert rød teamer. Det sender gjentatte ganger skadelige eller misvisende instruksjoner til målmodellene, observerer deres svar og justerer sin strategi til den enten lykkes eller uttømer den tilgjengelige angrepsveien. OpenAI sier at systemet er spesielt fokusert på prompt-injeksjon, et voksende sikkerhetsproblem for AI-agenter som interagerer med e-poster, nettsider, filer, kodearkiv og tilkoblede applikasjoner.
Systemet har allerede påvirket OpenAIs produksjonsmodeller. Forgjengerne til GPT-Red har blitt brukt under trening siden GPT-5.3, mens den fullstendige modellen ble inkorporert i den motstridende treningen av GPT-5.6 Sol. OpenAI rapporterer at GPT-5.6 Sol produserer seks ganger færre feil på sin mest vanskelige direkte prompt-injeksjonsbenchmark enn selskapets ledende produksjonsmodell fra fire måneder tidligere.
Hvorfor Prompt-Injeksjon Blir Mer Farlig
Prompt-injeksjon skjer når en angriper plasserer instruksjoner innenfor data som et AI-system forventes å lese. En skadelig kommando kan være skjult i en e-post, nettside, lastet opp dokument, verktøyrespons eller programvarearkiv.
AI-agenten kan feilaktig behandle den eksterne innholdet som en legitim instruksjon. I stedet for å fullføre brukerens opprinnelige oppgave, kan den avsløre konfidensielle opplysninger, laste opp filer til en angriperkontrollert server, endre kontoinnstillinger, kjøre usikker kode eller utføre uautoriserte handlinger gjennom tilkoblede verktøy.
Problemet blir mer betydelig når AI-systemer beveger seg beyond å svare på spørsmål og begynner å handle på vegne av brukerne. En agent med tilgang til skytjener, betalingssystemer, kildekode, forretningsapplikasjoner eller interne selskapsdata presenterer en større potensiell “blast radius” når dens instruksjoner blir suksessfullt manipulert.
OpenAI beskriver prompt-injeksjon som en av de sentrale utfordringene skapt av agente AI. Tilkoblede verktøy gjør modellene betraktelig mer nyttige, men hver ny datakilde gir også en annen kanal gjennom hvilken en angriper kan forsøke å påvirke modellens atferd.
GPT-Red Lærer Gjennom Selv-Spill
GPT-Red ble utviklet gjennom selv-spillforsterkning, en tilnærming hvor en angripermodell og en samling forsvarermodeller forbedrer seg gjennom å konkurere mot hverandre.
Angriperen mottar en belønning når den produserer en gyldig feil, som å overtale en modell til å følge en prompt-injeksjon. Forsvareren belønnes for å avvise den skadelige instruksjonen samtidig som den fortsatt fullfører den opprinnelige oppgaven den ble gitt.
Ettersom forsvarerne blir bedre til å gjenkjenne angrep, må GPT-Red finne mer sofistikerte og diverse måter å bypass dem på. Disse nye angrepene kan deretter inkorporeres i forsvarernes trening, og skape en eskalerende syklus mellom offensiv og defensiv kapasitet.
OpenAI bygde en stor samling av simuleringsmiljøer for denne prosessen. Avhengig av scenariet, kan GPT-Red kontrollere en del av en lokal fil, tekst av en e-post, en nettsidebanner eller utdata returnert av et eksternt verktøy. Hvert miljø definerer hva angriperen kan manipulere og hva resultat som kvalifiserer som en suksessfull kompromiss.
Selskapet sier at GPT-Red ble trent med beregningsressurser sammenlignbare med noen av sine største post-treningkjør. Dette representerer en usedvanlig stor tildeling av beregningskraft spesifikt for sikkerhetsforskning. Ved slutten av treningen, kunne modellen kompromittere nesten hver intern og produksjonsmodell den ble testet mot, inkludert GPT-5.5.
GPT-Red Utferdiget Menneskelige Angripere i Testing
For å evaluere om GPT-Red kunne generalisere beyond sine treningsmiljøer, testet OpenAI det ved hjelp av en replikert versjon av en 2025 indirekte prompt-injeksjonsutfordring.
GPT-Red og menneskelige røde teamere ble bedt om å utvikle angrep mot GPT-5.1 i scenarier som ikke hadde vært inkludert i GPT-Reds trening. Den automatiserte systemet produserte suksessfulle angrep i 84% av scenariene, sammenlignet med 13% for de menneskelige deltakerne.
Dette resultat betyr ikke at menneskelige sikkerhetsforskere har blitt unødvendige. GPT-Reds fordel ligger hovedsakelig i dens evne til å utføre en høy volum av eksperimenter, forkaste mislykkede strategier og kontinuerlig forbedre lovende angrep uten de tids- og bemanningsbegrensninger som en menneskelig team har.
Menneskelige testere forblir viktige for å identifisere uventede risikoer, forstå de videre konsekvensene av feil, og designe scenarier som automatiserte systemer kanskje ikke vil vurdere. Jessica Ji, en senior forskningsanalytiker ved Georgetown Universitys Center for Security and Emerging Technology, beskrev resultatene som løftende, samtidig som hun understreket at menneskelig ekspertise fortsatt er essensiell.
En Vendingmaskin Ble en Reell Verden Mål
OpenAI testet også om angrep oppdaget i simuleringsmiljøer kunne overføres til fungerende AI-agenter.
Et eksperiment rettet mot en autonom vendingmaskinagent skapt av Andon Labs og deployert i et OpenAI-kontor. GPT-Red ble først gitt en simuleringsversjon av systemet, samt evnen til å observere hvordan agenten brukte sine verktøy.
Etter testing og forbedring av angrepene i simuleringsmiljøet, overførte GPT-Red dem til produksjonsagenten. Den oppnådde alle tre tilordnede mål: å senke prisen på et dyrt produkt til $0,50, bestille en ny vare verdt over $100 og tilby den for $0,50, og avbryte en annen kundes bestilling. OpenAI sier at sårbarhetene ble avdekket og ytterligere sikkerhetstiltak blir testet.
Eksperimentet illustrerer hvorfor prompt-injeksjon ikke bare er et spørsmål om å produsere en upassende chatbot-svar. Når en AI-modell kontrollerer eksterne systemer, kan en suksessfull injeksjon føre til finansielle transaksjoner, modifiserte poster, dataforlis eller fysiske konsekvenser.
GPT-Red ble også testet mot en Codex-kommandolinjeagent drevet av GPT-5.4 mini. Over 10 tidligere usette data-eksfiltrerings-scenarier var den mer suksessfull og mer token-effektiv enn en prompted GPT-5.5-baselinje til å overtale kodeagenten til å avsløre sensitive opplysninger.
Hvordan GPT-Red Endret GPT-5.6
En av GPT-Reds mest bemerkelsesverdige oppdagelser var en kategori av direkte prompt-injeksjon som OpenAI kaller en “fake chain-of-thought”-angrep.
På et høyt nivå presenterer teknikken fabrikkert grunn eller verifiseringsinformasjon som oppmuntrer målmodellen til å anta at en skadelig instruksjon allerede har blitt gjennomgått og godkjent. OpenAI-forsker Chris Choquette-Choo sammenlignet konseptet med å falskt fortelle noen at en feilaktig svar allerede hadde blitt verifisert, og gjøre dem mer sannsynlig til å akseptere det uten å gjenta den underliggende grunnene.
Disse angrepene rapporteres å ha lykkes mer enn 95% av gangene mot GPT-5.1. Etter motstridende trening med angrep generert av GPT-Red, falt suksessraten under 10% mot GPT-5.6 Sol. Over et bredere sett av direkte prompt-injeksjonsmiljø, sier OpenAI at GPT-5.6 Sol feilet på bare 0,05% av GPT-Reds forsøk.
OpenAI evaluerte også om de tilføyde forsvar bare gjorde GPT-5.6 mer sannsynlig til å avvise legitime forespørsler. Selskapet sier at generelle kapasiteter og målrettede over-avvisnings-evalueringer forble hovedsakelig uendret, og antyder at forbedringene kom fra bedre differensiering mellom skadelige og legitime instruksjoner, snarere enn å gjøre modellen bredt mindre villig til å handle.
Denne distinksjonen er viktig. En modell kan synes sikker hvis den avviser å åpne filer, browse nettsider, kjøre kode eller interagere med eksterne applikasjoner, men den ville også tape mye av sin praktiske verdi. Effektiv robusthet krever å bevare legitime verktøybruk samtidig som den motstår instruksjoner innført av upålitelige parter.
Hvorfor OpenAI Ikke Utgir GPT-Red
GPT-Red vil forbli et internt system og holdes adskilt fra OpenAIs offentlig deployede modeller.
Dette valget reflekterer den dobbelte bruken av automatisert rød teaming. Den samme modellen som kan hjelpe utviklere med å oppdage prompt-injeksjons-sårbarheter, kunne også hjelpe angripere med å utvikle mer effektive metoder for å kompromittere AI-agenter operert av andre selskaper.
OpenAIs tilnærming er å beholde angriperen internt samtidig som den overfører den resulterende defensive kunnskapen til produksjonsmodellene. Selskapet sier at denne adskillelsen er ment å forhindre at de skadelige kapasitetene som er trent inn i GPT-Red blir tilgjengelige for ytre fiender.
Dette betyr også at GPT-Red ikke burde forveksles med OpenAIs offentlige sikkerhetsmodeller eller defensive programmer. Det er ikke et penetrerings-testprodukt, og det er heller ikke primært designet for å autonomt oppdage konvensjonelle programvare-eksplotasjoner. Dets nåværende fokus er å angripe instruksjonsfølgende atferd hos AI-systemer, spesielt agenter som er eksponert for potensielt upålitelige data.
Automatisert Rød Teaming Har Fremdeles Blinde Flekker
Til tross for sine sterke resultater, gir GPT-Red ikke en fullstendig løsning på AI-sikkerhet.
Rapportering om forskningen indikerer at systemet forblir mindre effektivt mot multi-turn-angrep som utvikler seg gradvis over en lang samtale. Det har også begrensede kapasiteter for å utvikle prompt-injeksjoner innbakt i bilder, og etterlater viktige multimodale angrepsflater utilstrekkelig dekket.
Resultatene er også basert tungt på miljøer og suksesskriterier designet av OpenAI. Selv om selskapet testet GPT-Red på holdt-tilbake-scenarier og fungerende agenter, vil uavhengige forskere ha begrensede muligheter til å reproduktivitet funn mens modellen og mye av dens evaluering-infrastruktur forblir private.
OpenAI sier at det vil fortsette å kombinere automatisert testing med menneskelig og tredjeparts-rød teaming, lagret produktsikkerhet, tilgangskontroll, overvåking og sanntids-misbruk-avdekning. Denne forsvar-i-dybde-strategien reflekterer virkeligheten at ingen enkelt modell eller benchmark kan forutse hver enkelt angrep som kan oppstå etter deployering.
En Ny Sikkerhetskonkurranser Mellom AI-Angripere og Forsvarere
Den “selv-forbedring” beskrevet i OpenAIs annonsering er ikke en deployert modell som autonomt omskriver sine egne vekter eller uavhengig skaper en mer kraftfull etterfølger. I stedet er det en kontrollert trenings-syklus hvor en AI-system genererer motstridende eksempler som forskerne bruker til å forbedre en annen.
Likevel representerer GPT-Red en betydelig endring i hvordan front-modellene kan sikres. Menneskelige røde teamere kan avdekke sofistikerte sårbarheter, men de kan ikke manuelt generere skalaen og variasjonen av angrep som er nødvendig for å kontinuerlig trene stadig mer kapable AI-agenter.
Automatiserte angripere kan fylle en del av denne gapen, og skape en sikkerhets-spiral hvor hver sterkere forsvarer tvinger rød-teaming-modellen til å oppdage nye svakheter. Disse svakhetene blir deretter treningmateriale for den neste generasjonen av produksjonssystemer.
Risikoen er at lignende kapasiteter ikke vil forbli eksklusive for defensive laboratorier. Ettersom åpne og kommersielle modeller blir bedre på lang-horisont-planlegging, verktøybruk, sikkerhet og autonom eksperimentering, vil angripere få tilgang til stadig mer kapable systemer.
GPT-Red markerer derfor både fremgang og en tidlig indikasjon på konkurransen som kommer. AI-laboratorier begynner å bruke kraftfulle modeller til å forsvare sine neste generasjon av agenter, men disse forsvarene må utvikle seg kontinuerlig ettersom de samme underliggende teknologiene gjør automatiserte angrep billigere, raskere og mer tilpasningsdyktige.












