AI-modeller og platforme
OpenAI Introducerer GPT-Red, en AI-Angriber Bygget til at Styrke GPT-5.6

OpenAI har afslÃļret GPT-Red, et internt kunstig intelligenssystem trÃĶnet til at angribe virksomhedens egne modeller, afslÃļre deres sÃĨrbarheder og generere modstridende data, der kan bruges til at styrke fremtidige udgaver.
I stedet for at fungere som endnu en offentlig chatbot, fungerer GPT-Red som en automatiseret rÃļd teamer. Det sender gentagne gange ondsindede eller misvisende instruktioner til mÃĨlmodellerne, observerer deres svar og tilpasser sin strategi, indtil det enten lykkes eller udtÃļmmer den tilgÃĶngelige angrebsvej. OpenAI siger, at systemet er sÃĶrligt fokuseret pÃĨ prompt-injektion, et voksende sikkerhedsproblem for AI-agenter, der interagerer med e-mails, websteder, filer, koderepositorier og tilkoblede applikationer.
Systemet har allerede pÃĨvirket OpenAIs produktionsmodeller. ForgÃĶngere for GPT-Red er blevet brugt under trÃĶning siden GPT-5.3, mens den fÃĶrdige model blev inkorporeret i den modstridende trÃĶning af GPT-5.6 Sol. OpenAI rapporterer, at GPT-5.6 Sol producerer seks gange fÃĶrre fejl pÃĨ dens mest svÃĶre direkte prompt-injektionsbenchmark end virksomhedens fÃļrende produktionsmodel fra fire mÃĨneder tidligere.
Hvorfor Prompt-Injektion Bliver mere Farligt
Prompt-injektion opstÃĨr, nÃĨr en angriber placerer instruktioner inde i data, som et AI-system forventes at lÃĶse. En ondsindet kommando kan vÃĶre gemt i en e-mail, websted, uploadet dokument, vÃĶrktÃļjsrespons eller software-repository.
AI-agenten kan fejltolke den eksterne indhold som en legitim instruktion. I stedet for at fuldfÃļre brugerens oprindelige opgave, kan den afslÃļre fortrolige oplysninger, uploade filer til en angriber-kontrolleret server, ÃĶndre kontoindstillinger, udfÃļre usikre kode eller tage uautoriserede handlinger gennem tilkoblede vÃĶrktÃļjer.
Problemet bliver mere betydeligt, da AI-systemer bevÃĶger sig ud over at besvare spÃļrgsmÃĨl og begynder at handle pÃĨ vegne af brugerne. En agent med adgang til cloud-lagring, betalingssystemer, kildekode, forretningsapplikationer eller interne virksomhedsdata prÃĶsenterer en stÃļrre potentiel âblast radiusâ, nÃĨr dens instruktioner er blevet manipuleret med succes.
OpenAI beskriver prompt-injektion som en af de centrale udfordringer, der er skabt af agentic AI. Tilkoblede vÃĶrktÃļjer gÃļr modellerne betydeligt mere nyttige, men hver ny datakilde giver ogsÃĨ en ny kanal, hvorigennem en angriber kan forsÃļge at pÃĨvirke modellens adfÃĶrd.
GPT-Red LÃĶrer gennem Selv-Spil
GPT-Red blev udviklet gennem selv-spil-forstÃĶrket lÃĶring, en tilgang, hvor en angriber-model og en samling forsvarer-modeller forbedrer sig ved at konkurrere mod hinanden.
Angriberen modtager en belÃļnning, nÃĨr den producerer en gyldig fejl, sÃĨsom at overbevise en model om at fÃļlge en prompt-injektion. Forsvareren belÃļnnes for at afvise den ondsindede instruktion, mens den stadig fuldfÃļrer den oprindelige opgave, den blev givet.
Da forsvarerne bliver bedre til at genkende angreb, mÃĨ GPT-Red finde mere sofistikerede og diverse mÃĨder at omgÃĨ dem pÃĨ. Disse nye angreb kan derefter inkorporeres i forsvarernes trÃĶning, hvilket skaber en eskalerende cyklus mellem offensiv og defensiv kapacitet.
OpenAI byggede en stor samling af simulerede miljÃļer til dette formÃĨl. AfhÃĶngigt af scenariet kan GPT-Red kontrollere en del af en lokal fil, tekst i en e-mail, en webstedsbanner eller outputtet returneret af et eksternt vÃĶrktÃļj. Hver miljÃļ definerer, hvad angriberen kan manipulere, og hvilken udfald kvalificerer sig som en succesfuld kompromittering.
Virksomheden siger, at GPT-Red blev trÃĶnet ved hjÃĶlp af beregningsressourcer, der er sammenlignelige med nogle af dens stÃļrste post-trÃĶningslÃļb, hvilket reprÃĶsenterer en usÃĶdvanligt stor tildeling af beregningskraft specifikt til sikkerhedsforskning. Ved afslutningen af trÃĶningen kunne modellen kompromittere nÃĶsten hver enkelt intern og produktionsmodel, den blev testet mod, herunder GPT-5.5.
GPT-Red Overgik Menneskelige Angribere i Test
For at evaluere, om GPT-Red kunne generalisere ud over sine trÃĶningsmiljÃļer, testede OpenAI det ved hjÃĶlp af en replikeret version af en 2025-indirekte prompt-injektionsudfordring.
GPT-Red og menneskelige rÃļd teamere blev bedt om at udvikle angreb mod GPT-5.1 i scenarier, der ikke var inkluderet i GPT-Reds trÃĶning. Den automatiserede system producerede erfolgrede angreb i 84% af scenarierne, sammenlignet med 13% for de menneskelige deltagere.
Dette resultat betyder ikke, at menneskelige sikkerhedsforskere er blevet unÃļdvendige. GPT-Reds fordel ligger primÃĶrt i dets evne til at udfÃļre en hÃļj volumen af eksperimenter, afvise mislykkede strategier og kontinuerligt forfine lovende angreb uden de tids- og personalemÃĶssige begrÃĶnsninger, der er forbundet med et menneskeligt hold.
Menneskelige testere forbliver vigtige for at identificere uventede risici, forstÃĨ de bredere konsekvenser af fejl og designe scenarier, som automatiserede systemer mÃĨske ikke tager i betragtning. Jessica Ji, en senior forskningsanalytiker ved Georgetown Universitys Center for Security and Emerging Technology, beskrev resultaterne som lovende, mens hun understregede, at menneskelig ekspertise forbliver afgÃļrende.
En Vendingmaskine Blev et Virkelig Verden MÃĨl
OpenAI testede ogsÃĨ, om angreb, der blev opdaget i simulationer, kunne overfÃļres til fungerende AI-agenter.
Et eksperiment rettede sig mod en autonom vendingmaskine-agent skabt af Andon Labs og udrullet i et OpenAI-kontor. GPT-Red fik fÃļrst en simuleret version af systemet samt mulighed for at observere, hvordan agenten brugte sine vÃĶrktÃļjer.
Efter at have testet og forfinet sine angreb i simulationen, overfÃļrte GPT-Red dem til produktionsagenten. Den opnÃĨede alle tre tildelte mÃĨl: at sÃĶnke prisen pÃĨ et dyrt produkt til 0,50 $, bestille en ny vare til over 100 $ og tilbyde den for 0,50 $, samt annullere en anden kundes ordre. OpenAI siger, at sÃĨrbarhederne blev afslÃļret, og yderligere sikkerhedsforanstaltninger bliver testet.
Eksperimentet illustrerer, hvorfor prompt-injektion ikke blot er et spÃļrgsmÃĨl om at producere en upassende chatbot-svar. NÃĨr en AI-model kontrollerer eksterne systemer, kan en succesfuld injektion resultere i finansielle transaktioner, ÃĶndrede poster, data-tab eller fysisk-verden konsekvenser.
GPT-Red blev ogsÃĨ testet mod en Codex-kommandolinje-agent drevet af GPT-5.4 mini. Over 10 tidligere usete data-exfiltrations-scenarier var det mere succesfuldt og mere token-effektivt end en prompted GPT-5.5-baseline til at overbevise kodningsagenten om at afslÃļre fÃļlsomme oplysninger.
Hvorledes GPT-Red Ãndrede GPT-5.6
En af GPT-Reds mest bemÃĶrkelsesvÃĶrdige opdagelser var en kategori af direkte prompt-injektion, som OpenAI kalder en âfalsk kÃĶde af tankeâ-angreb.
PÃĨ et hÃļjt niveau prÃĶsenterer denne teknik fabrikeret begrundelse eller verificeringsinformation, der opmuntrer mÃĨlmodellen til at antage, at en ondsindet instruktion allerede er blevet gennemgÃĨet og godkendt. OpenAI-forsker Chris Choquette-Choo sammenlignede begrebet med at forkert fortÃĶlle nogen, at en forkert svar allerede var blevet verificeret, hvilket gjorde dem mere tilbÃļjelige til at acceptere det uden at gentage den underliggende begrundelse.
Disse angreb rapporterede at lykkes mere end 95% af gangene mod GPT-5.1. Efter modstridende trÃĶning ved hjÃĶlp af angreb genereret af GPT-Red, faldt succesraten under 10% mod GPT-5.6 Sol. Over en bredere sÃĶt af direkte prompt-injektionsmiljÃļer siger OpenAI, at GPT-5.6 Sol fejlede pÃĨ kun 0,05% af GPT-Reds forsÃļg.
OpenAI evaluerede ogsÃĨ, om de tilfÃļjede forsvar blot gjorde GPT-5.6 mere tilbÃļjelig til at afvise legitime anmodninger. Virksomheden siger, at generelle evner og mÃĨlrettede over-afvisnings-evalueringer forblev stort set uÃĶndrede, hvilket tyder pÃĨ, at forbedringerne kom fra en bedre differentiering mellem ondsindede og legitime instruktioner snarere end fra at gÃļre modellen bredt mindre villig til at handle.
Denne distinktion er vigtig. En model kan synes sikker, hvis den afviser at ÃĨbne filer, browse websteder, udfÃļre kode eller interagere med eksterne applikationer, men den ville ogsÃĨ miste meget af sin praktiske vÃĶrdi. Effektiv robusthed krÃĶver at bevare legitime vÃĶrktÃļjsbrug, mens man modstÃĨr instruktioner indsÃĶtter af upÃĨlidelige parter.
Hvorfor OpenAI Ikke Udgiver GPT-Red
GPT-Red vil forblive et internt system og holdes adskilt fra OpenAIs offentligt udrullede modeller.
Dette valg skyldes den dobbelte brug af automatiseret rÃļd teaming. Den samme model, der kan hjÃĶlpe udviklere med at opdage prompt-injektions-sÃĨrbarheder, kan ogsÃĨ hjÃĶlpe angribere med at udvikle mere effektive metoder til at kompromittere AI-agenter, der opereres af andre virksomheder.
OpenAIs tilgang er at fastholde angriberen internt, mens den resulterende defensive viden overfÃļres til produktionsmodeller. Virksomheden siger, at denne adskillelse er tiltÃĶnkt at forhindre de ondsindede kapaciteter, der er trÃĶnet i GPT-Red, fra at blive tilgÃĶngelige for ydre fjender.
Dette betyder ogsÃĨ, at GPT-Red ikke skal forveksles med OpenAIs offentlige cybersikkerhedsmodeller eller defensive programmer. Det er ikke et penetrationstestprodukt, og det er ikke primÃĶrt designet til at autonomt opdage konventionelle software-eksploitationsmuligheder. Dets nuvÃĶrende fokus er pÃĨ at angribe instruktionsfÃļlgen af AI-systemer, isÃĶr agenter, der er eksponeret for potentielt upÃĨlidelige data.
Automatiseret RÃļd Teaming Har Stadig Blindspots
Trods sine stÃĶrke resultater giver GPT-Red ikke en komplet lÃļsning til AI-sikkerhed.
Rapportering om forskningen indikerer, at systemet forbliver mindre effektivt til multi-turn-angreb, der udvikler sig gradvist over en lang samtale. Det har ogsÃĨ begrÃĶnsede kapaciteter til at udvikle prompt-injektioner, der er indlejret i billeder, hvilket efterlader vigtige multimodale angrebsflader utilstrÃĶkkeligt dÃĶkket.
Resultaterne er ogsÃĨ baseret tungt pÃĨ miljÃļer og succeskriterier designet af OpenAI. Selvom virksomheden testede GPT-Red pÃĨ holdt-ud-scenarier og fungerende agenter, vil uafhÃĶngige forskere have begrÃĶnset evne til at reproduceres fundene, mens modellen og meget af dens evaluering-infrastruktur forbliver private.
OpenAI siger, at det vil fortsÃĶtte med at kombinere automatiseret test med menneskelig og tredjeparts-rÃļd teaming, lagrede produktsikkerhedsforanstaltninger, adgangskontroller, overvÃĨgning og realtids-misbrugsdetektion. Denne forsvar-i-dybde-strategi afspejler virkeligheden af, at ingen enkelt model eller benchmark kan forudse hvert angreb, der kan opstÃĨ efter udrulning.
En Ny Sikkerhedsrace Mellem AI-Angribere og Forsvarere
Den âselv-forbedringâ, der er beskrevet i OpenAIs meddelelse, er ikke en udrullet model, der autonomt omskriver sine egne vÃĶgte eller uafhÃĶngigt skaber en mere kraftfuld efterfÃļlger. I stedet er det en kontrolleret trÃĶningslÃļkke, hvor ÃĐt AI-system genererer modstridende eksempler, som forskerne bruger til at forbedre et andet.
Ikke desto mindre reprÃĶsenterer GPT-Red en betydelig ÃĶndring i, hvordan frontmodeller mÃĨske kan sikres. Menneskelige rÃļd teamere kan afslÃļre sofistikerede sÃĨrbarheder, men de kan ikke manuelt generere skalaen og variationen af angreb, der krÃĶves for at trÃĶne stadig mere kapable AI-agenter.
Automatiserede angribere kan udfylde en del af denne lukke, skabende en sikkerheds-flywheel, hvor hver stÃĶrkere forsvarer tvinger rÃļd teamings-modellen til at opdage nye svagheder. Disse svagheder bliver derefter trÃĶningsmateriale for den nÃĶste generation af produktions-systemer.
Risikoen er, at lignende kapaciteter ikke vil forblive eksklusive for defensive laboratorier. Da ÃĨbne og kommercielle modeller bliver bedre til lang-horisont-planlÃĶgning, vÃĶrktÃļjsbrug, cybersikkerhed og autonom eksperimentering, vil angribere fÃĨ adgang til stadig mere kapable systemer af deres egen.
GPT-Red markerer derfor bÃĨde fremskridt og en tidlig indikation af den konkurrence, der er foran os. AI-laboratorier er begyndt at bruge kraftfulde modeller til at forsvare deres nÃĶste generation af agenter, men disse forsvar skal udvikle sig kontinuerligt, da de samme underliggende teknologier gÃļr automatiserede angreb billigere, hurtigere og mere tilpasningsdygtige.












