AI-modeller og platforme

OpenAI Introducerer GPT-Red, en AI-Angriber Bygget til at Styrke GPT-5.6

mm
Føj Unite.AI til dine foretrukne kilder på Google

OpenAI har afsløret GPT-Red, et internt kunstig intelligenssystem trænet til at angribe virksomhedens egne modeller, afsløre deres sårbarheder og generere modstridende data, der kan bruges til at styrke fremtidige udgaver.

I stedet for at fungere som endnu en offentlig chatbot, fungerer GPT-Red som en automatiseret rød teamer. Det sender gentagne gange ondsindede eller misvisende instruktioner til målmodellerne, observerer deres svar og tilpasser sin strategi, indtil det enten lykkes eller udtømmer den tilgængelige angrebsvej. OpenAI siger, at systemet er særligt fokuseret på prompt-injektion, et voksende sikkerhedsproblem for AI-agenter, der interagerer med e-mails, websteder, filer, koderepositorier og tilkoblede applikationer.

Systemet har allerede påvirket OpenAIs produktionsmodeller. Forgængere for GPT-Red er blevet brugt under træning siden GPT-5.3, mens den færdige model blev inkorporeret i den modstridende træning af GPT-5.6 Sol. OpenAI rapporterer, at GPT-5.6 Sol producerer seks gange færre fejl på dens mest svære direkte prompt-injektionsbenchmark end virksomhedens førende produktionsmodel fra fire måneder tidligere.

Hvorfor Prompt-Injektion Bliver mere Farligt

Prompt-injektion opstår, når en angriber placerer instruktioner inde i data, som et AI-system forventes at læse. En ondsindet kommando kan være gemt i en e-mail, websted, uploadet dokument, værktøjsrespons eller software-repository.

AI-agenten kan fejltolke den eksterne indhold som en legitim instruktion. I stedet for at fuldføre brugerens oprindelige opgave, kan den afsløre fortrolige oplysninger, uploade filer til en angriber-kontrolleret server, ændre kontoindstillinger, udføre usikre kode eller tage uautoriserede handlinger gennem tilkoblede værktøjer.

Problemet bliver mere betydeligt, da AI-systemer bevæger sig ud over at besvare spørgsmål og begynder at handle på vegne af brugerne. En agent med adgang til cloud-lagring, betalingssystemer, kildekode, forretningsapplikationer eller interne virksomhedsdata præsenterer en større potentiel “blast radius”, når dens instruktioner er blevet manipuleret med succes.

OpenAI beskriver prompt-injektion som en af de centrale udfordringer, der er skabt af agentic AI. Tilkoblede værktøjer gør modellerne betydeligt mere nyttige, men hver ny datakilde giver også en ny kanal, hvorigennem en angriber kan forsøge at påvirke modellens adfærd.

GPT-Red Lærer gennem Selv-Spil

GPT-Red blev udviklet gennem selv-spil-forstærket læring, en tilgang, hvor en angriber-model og en samling forsvarer-modeller forbedrer sig ved at konkurrere mod hinanden.

Angriberen modtager en belønning, når den producerer en gyldig fejl, såsom at overbevise en model om at følge en prompt-injektion. Forsvareren belønnes for at afvise den ondsindede instruktion, mens den stadig fuldfører den oprindelige opgave, den blev givet.

Da forsvarerne bliver bedre til at genkende angreb, må GPT-Red finde mere sofistikerede og diverse måder at omgå dem på. Disse nye angreb kan derefter inkorporeres i forsvarernes træning, hvilket skaber en eskalerende cyklus mellem offensiv og defensiv kapacitet.

OpenAI byggede en stor samling af simulerede miljøer til dette formål. Afhængigt af scenariet kan GPT-Red kontrollere en del af en lokal fil, tekst i en e-mail, en webstedsbanner eller outputtet returneret af et eksternt værktøj. Hver miljø definerer, hvad angriberen kan manipulere, og hvilken udfald kvalificerer sig som en succesfuld kompromittering.

Virksomheden siger, at GPT-Red blev trænet ved hjælp af beregningsressourcer, der er sammenlignelige med nogle af dens største post-træningsløb, hvilket repræsenterer en usædvanligt stor tildeling af beregningskraft specifikt til sikkerhedsforskning. Ved afslutningen af træningen kunne modellen kompromittere næsten hver enkelt intern og produktionsmodel, den blev testet mod, herunder GPT-5.5.

GPT-Red Overgik Menneskelige Angribere i Test

For at evaluere, om GPT-Red kunne generalisere ud over sine træningsmiljøer, testede OpenAI det ved hjælp af en replikeret version af en 2025-indirekte prompt-injektionsudfordring.

GPT-Red og menneskelige rød teamere blev bedt om at udvikle angreb mod GPT-5.1 i scenarier, der ikke var inkluderet i GPT-Reds træning. Den automatiserede system producerede erfolgrede angreb i 84% af scenarierne, sammenlignet med 13% for de menneskelige deltagere.

Dette resultat betyder ikke, at menneskelige sikkerhedsforskere er blevet unødvendige. GPT-Reds fordel ligger primært i dets evne til at udføre en høj volumen af eksperimenter, afvise mislykkede strategier og kontinuerligt forfine lovende angreb uden de tids- og personalemæssige begrænsninger, der er forbundet med et menneskeligt hold.

Menneskelige testere forbliver vigtige for at identificere uventede risici, forstå de bredere konsekvenser af fejl og designe scenarier, som automatiserede systemer måske ikke tager i betragtning. Jessica Ji, en senior forskningsanalytiker ved Georgetown Universitys Center for Security and Emerging Technology, beskrev resultaterne som lovende, mens hun understregede, at menneskelig ekspertise forbliver afgørende.

En Vendingmaskine Blev et Virkelig Verden Mål

OpenAI testede også, om angreb, der blev opdaget i simulationer, kunne overføres til fungerende AI-agenter.

Et eksperiment rettede sig mod en autonom vendingmaskine-agent skabt af Andon Labs og udrullet i et OpenAI-kontor. GPT-Red fik først en simuleret version af systemet samt mulighed for at observere, hvordan agenten brugte sine værktøjer.

Efter at have testet og forfinet sine angreb i simulationen, overførte GPT-Red dem til produktionsagenten. Den opnåede alle tre tildelte mål: at sænke prisen på et dyrt produkt til 0,50 $, bestille en ny vare til over 100 $ og tilbyde den for 0,50 $, samt annullere en anden kundes ordre. OpenAI siger, at sårbarhederne blev afsløret, og yderligere sikkerhedsforanstaltninger bliver testet.

Eksperimentet illustrerer, hvorfor prompt-injektion ikke blot er et spørgsmål om at producere en upassende chatbot-svar. Når en AI-model kontrollerer eksterne systemer, kan en succesfuld injektion resultere i finansielle transaktioner, ændrede poster, data-tab eller fysisk-verden konsekvenser.

GPT-Red blev også testet mod en Codex-kommandolinje-agent drevet af GPT-5.4 mini. Over 10 tidligere usete data-exfiltrations-scenarier var det mere succesfuldt og mere token-effektivt end en prompted GPT-5.5-baseline til at overbevise kodningsagenten om at afsløre følsomme oplysninger.

Hvorledes GPT-Red Ændrede GPT-5.6

En af GPT-Reds mest bemærkelsesværdige opdagelser var en kategori af direkte prompt-injektion, som OpenAI kalder en “falsk kæde af tanke”-angreb.

På et højt niveau præsenterer denne teknik fabrikeret begrundelse eller verificeringsinformation, der opmuntrer målmodellen til at antage, at en ondsindet instruktion allerede er blevet gennemgået og godkendt. OpenAI-forsker Chris Choquette-Choo sammenlignede begrebet med at forkert fortælle nogen, at en forkert svar allerede var blevet verificeret, hvilket gjorde dem mere tilbøjelige til at acceptere det uden at gentage den underliggende begrundelse.

Disse angreb rapporterede at lykkes mere end 95% af gangene mod GPT-5.1. Efter modstridende træning ved hjælp af angreb genereret af GPT-Red, faldt succesraten under 10% mod GPT-5.6 Sol. Over en bredere sæt af direkte prompt-injektionsmiljøer siger OpenAI, at GPT-5.6 Sol fejlede på kun 0,05% af GPT-Reds forsøg.

OpenAI evaluerede også, om de tilføjede forsvar blot gjorde GPT-5.6 mere tilbøjelig til at afvise legitime anmodninger. Virksomheden siger, at generelle evner og målrettede over-afvisnings-evalueringer forblev stort set uændrede, hvilket tyder på, at forbedringerne kom fra en bedre differentiering mellem ondsindede og legitime instruktioner snarere end fra at gøre modellen bredt mindre villig til at handle.

Denne distinktion er vigtig. En model kan synes sikker, hvis den afviser at åbne filer, browse websteder, udføre kode eller interagere med eksterne applikationer, men den ville også miste meget af sin praktiske værdi. Effektiv robusthed kræver at bevare legitime værktøjsbrug, mens man modstår instruktioner indsætter af upålidelige parter.

Hvorfor OpenAI Ikke Udgiver GPT-Red

GPT-Red vil forblive et internt system og holdes adskilt fra OpenAIs offentligt udrullede modeller.

Dette valg skyldes den dobbelte brug af automatiseret rød teaming. Den samme model, der kan hjælpe udviklere med at opdage prompt-injektions-sårbarheder, kan også hjælpe angribere med at udvikle mere effektive metoder til at kompromittere AI-agenter, der opereres af andre virksomheder.

OpenAIs tilgang er at fastholde angriberen internt, mens den resulterende defensive viden overføres til produktionsmodeller. Virksomheden siger, at denne adskillelse er tiltænkt at forhindre de ondsindede kapaciteter, der er trænet i GPT-Red, fra at blive tilgængelige for ydre fjender.

Dette betyder også, at GPT-Red ikke skal forveksles med OpenAIs offentlige cybersikkerhedsmodeller eller defensive programmer. Det er ikke et penetrationstestprodukt, og det er ikke primært designet til at autonomt opdage konventionelle software-eksploitationsmuligheder. Dets nuværende fokus er på at angribe instruktionsfølgen af AI-systemer, især agenter, der er eksponeret for potentielt upålidelige data.

Automatiseret Rød Teaming Har Stadig Blindspots

Trods sine stærke resultater giver GPT-Red ikke en komplet løsning til AI-sikkerhed.

Rapportering om forskningen indikerer, at systemet forbliver mindre effektivt til multi-turn-angreb, der udvikler sig gradvist over en lang samtale. Det har også begrænsede kapaciteter til at udvikle prompt-injektioner, der er indlejret i billeder, hvilket efterlader vigtige multimodale angrebsflader utilstrækkeligt dækket.

Resultaterne er også baseret tungt på miljøer og succeskriterier designet af OpenAI. Selvom virksomheden testede GPT-Red på holdt-ud-scenarier og fungerende agenter, vil uafhængige forskere have begrænset evne til at reproduceres fundene, mens modellen og meget af dens evaluering-infrastruktur forbliver private.

OpenAI siger, at det vil fortsætte med at kombinere automatiseret test med menneskelig og tredjeparts-rød teaming, lagrede produktsikkerhedsforanstaltninger, adgangskontroller, overvågning og realtids-misbrugsdetektion. Denne forsvar-i-dybde-strategi afspejler virkeligheden af, at ingen enkelt model eller benchmark kan forudse hvert angreb, der kan opstå efter udrulning.

En Ny Sikkerhedsrace Mellem AI-Angribere og Forsvarere

Den “selv-forbedring”, der er beskrevet i OpenAIs meddelelse, er ikke en udrullet model, der autonomt omskriver sine egne vægte eller uafhængigt skaber en mere kraftfuld efterfølger. I stedet er det en kontrolleret træningsløkke, hvor ét AI-system genererer modstridende eksempler, som forskerne bruger til at forbedre et andet.

Ikke desto mindre repræsenterer GPT-Red en betydelig ændring i, hvordan frontmodeller måske kan sikres. Menneskelige rød teamere kan afsløre sofistikerede sårbarheder, men de kan ikke manuelt generere skalaen og variationen af angreb, der kræves for at træne stadig mere kapable AI-agenter.

Automatiserede angribere kan udfylde en del af denne lukke, skabende en sikkerheds-flywheel, hvor hver stærkere forsvarer tvinger rød teamings-modellen til at opdage nye svagheder. Disse svagheder bliver derefter træningsmateriale for den næste generation af produktions-systemer.

Risikoen er, at lignende kapaciteter ikke vil forblive eksklusive for defensive laboratorier. Da åbne og kommercielle modeller bliver bedre til lang-horisont-planlægning, værktøjsbrug, cybersikkerhed og autonom eksperimentering, vil angribere få adgang til stadig mere kapable systemer af deres egen.

GPT-Red markerer derfor både fremskridt og en tidlig indikation af den konkurrence, der er foran os. AI-laboratorier er begyndt at bruge kraftfulde modeller til at forsvare deres næste generation af agenter, men disse forsvar skal udvikle sig kontinuerligt, da de samme underliggende teknologier gør automatiserede angreb billigere, hurtigere og mere tilpasningsdygtige.

Antoine er en visionær leder og medstifter af Unite.AI, drevet af en urokkelig passion for at forme og fremme fremtiden for AI og robotteknologi. En serieiværksætter, han tror, at AI vil være lige så omvæltende for samfundet som elektricitet, og han bliver ofte fanget i at tale om potentialet for omvæltende teknologier og AGI.

Som en futurist, er han dedikeret til at udforske, hvordan disse innovationer vil forme vores verden. Derudover er han grundlægger af Securities.io, en platform, der fokuserer på at investere i skarp teknologi, der gendefinerer fremtiden og omformer hele sektorer.