AI-modellen en platforms

OpenAI Introduceert GPT-Red, een AI-aanvaller om GPT-5.6 te Versterken

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

OpenAI heeft GPT-Red onthuld, een intern artificieel intelligentiesysteem dat is getraind om de modellen van het bedrijf aan te vallen, hun kwetsbaarheden bloot te leggen en tegenstrijdige gegevens te genereren die kunnen worden gebruikt om toekomstige releases te versterken.

In tegenstelling tot het functioneren als een openbare chatbot, functioneert GPT-Red als een geautomatiseerde rode team. Het stuurt herhaaldelijk kwaadaardige of misleidende instructies naar de doelmodellen, observeert hun reacties en past zijn strategie aan totdat het slaagt of de beschikbare aanvalsmethode uitput. OpenAI zegt dat het systeem zich vooral richt op prompt-injectie, een groeiend beveiligingsprobleem voor AI-agents die interactie hebben met e-mails, websites, bestanden, coderepositories en verbonden toepassingen.

Het systeem heeft al invloed gehad op de productiemodellen van OpenAI. Voorlopers van GPT-Red zijn gebruikt tijdens de training sinds GPT-5.3, terwijl het voltooide model werd opgenomen in de tegenstrijdige training van GPT-5.6 Sol. OpenAI meldt dat GPT-5.6 Sol zes keer minder fouten produceert op zijn moeilijkste directe prompt-injectiebenchmark dan het leidende productiemodel van het bedrijf vier maanden eerder.

Waarom Prompt-injectie Gevaarlijker Wordt

Prompt-injectie treedt op wanneer een aanvaller instructies in gegevens plaatst die een AI-systeem verwacht te lezen. Een kwaadaardige opdracht kan verborgen zijn in een e-mail, webpagina, geüpload document, toolreactie of software-repository.

Het AI-agent kan per ongeluk die externe inhoud als een legitieme instructie behandelen. In plaats van de oorspronkelijke taak van de gebruiker te voltooien, kan het vertrouwelijke informatie onthullen, bestanden uploaden naar een door de aanvaller gecontroleerde server, accountinstellingen wijzigen, onveilige code uitvoeren of ongeautoriseerde acties uitvoeren via verbonden tools.

Het probleem wordt groter naarmate AI-systemen verder gaan dan alleen vragen beantwoorden en beginnen te handelen namens gebruikers. Een agent met toegang tot cloudopslag, betalingssystemen, broncode, bedrijfsapplicaties of interne bedrijfsgegevens presenteert een groter potentieel “blast radius” wanneer zijn instructies met succes worden gemanipuleerd.

OpenAI beschrijft prompt-injectie als een van de centrale uitdagingen die worden gecreëerd door agente AI. Verbonden tools maken modellen aanzienlijk nuttiger, maar elke nieuwe gegevensbron biedt ook een andere kanaal waarlangs een aanvaller kan proberen de gedrag van het model te beïnvloeden.

GPT-Red Leert Door Zelfspel

GPT-Red werd ontwikkeld door middel van zelfspelversterking, een benadering waarbij een aanvallend model en een verzameling verdedigingsmodellen verbeteren door tegen elkaar te concurreren.

De aanvaller krijgt een beloning wanneer het een geldige fout produceert, zoals het overtuigen van een model om een prompt-injectie te volgen. De verdediger wordt beloond voor het afwijzen van de kwaadaardige instructie en het nog steeds voltooien van de legitieme taak die het oorspronkelijk kreeg.

Naarmate de verdedigers beter worden in het herkennen van aanvallen, moet GPT-Red meer geavanceerde en diverse manieren vinden om hen te omzeilen. Die nieuwe aanvallen kunnen vervolgens worden opgenomen in de training van de verdedigers, waardoor een escalerend cyclus tussen offensieve en defensieve capaciteiten ontstaat.

OpenAI bouwde een grote verzameling gesimuleerde omgevingen voor dit proces. Afhankelijk van het scenario kan GPT-Red een deel van een lokaal bestand, de tekst van een e-mail, een webpaginabanner of de uitvoer die wordt geretourneerd door een externe tool controleren. Elke omgeving definieert wat de aanvaller kan manipuleren en wat resultaat als een succesvolle compromis kwalificeert.

Het bedrijf zegt dat GPT-Red werd getraind met berekeningsbronnen die vergelijkbaar zijn met sommige van zijn grootste post-training-runs, wat een ongebruikelijk grote toewijzing van compute specifiek voor veiligheidsonderzoek vertegenwoordigt. Aan het einde van de training kon het model bijna elk intern en productiemodel compromitteren dat het werd getest, inclusief GPT-5.5.

GPT-Red Overtrof Menselijke Aanvallers in Testen

Om te beoordelen of GPT-Red kon generaliseren buiten zijn trainingsomgevingen, testte OpenAI het met een gerepliceerde versie van een indirecte prompt-injectie-uitdaging uit 2025.

GPT-Red en menselijke rode teams werden gevraagd om aanvallen te ontwikkelen tegen GPT-5.1 in scenario’s die niet waren opgenomen in de training van GPT-Red. Het geautomatiseerde systeem produceerde succesvolle aanvallen in 84% van de scenario’s, in vergelijking met 13% voor de menselijke deelnemers.

Dit resultaat betekent niet dat menselijke beveiligingsonderzoekers overbodig zijn geworden. Het voordeel van GPT-Red ligt voornamelijk in zijn vermogen om een hoge hoeveelheid experimenten uit te voeren, onsuccesvolle strategieën te verwijderen en voortdurend veelbelovende aanvallen te verfijnen zonder de tijds- en personeelsbeperkingen van een menselijk team.

Menselijke testers blijven belangrijk voor het identificeren van onverwachte risico’s, het begrijpen van de bredere gevolgen van fouten en het ontwerpen van scenario’s die geautomatiseerde systemen mogelijk niet overwegen. Jessica Ji, een senior onderzoeksanalist bij de Georgetown University’s Center for Security and Emerging Technology, beschreef de resultaten als veelbelovend, terwijl ze benadrukte dat menselijke expertise nog steeds essentieel is.

Een Verkoopautomaat Werd een Echte Wereld-Doelwit

OpenAI testte ook of aanvallen die in simulaties werden ontdekt, konden worden overgedragen naar functionerende AI-agents.

Een experiment richtte zich op een autonome verkoopautomaat-agent die was gemaakt door Andon Labs en was geïmplementeerd in een OpenAI-kantoor. GPT-Red kreeg eerst een gesimuleerde versie van het systeem, evenals de mogelijkheid om te observeren hoe de agent zijn tools gebruikte.

Na het testen en verfijnen van zijn aanvallen in de simulatie, transfereerde GPT-Red ze naar de productie-agent. Het bereikte alle drie de toegewezen doelstellingen: het verlagen van de prijs van een dure product tot $0,50, het bestellen van een nieuw item ter waarde van meer dan $100 en het aanbieden ervan voor $0,50, en het annuleren van een bestelling van een andere klant. OpenAI zegt dat de kwetsbaarheden zijn gemeld en dat aanvullende beveiligingsmaatregelen worden getest.

Het experiment illustreert waarom prompt-injectie niet alleen een kwestie is van het produceren van een ongepast chatbot-antwoord. Wanneer een AI-model externe systemen controleert, kan een geslaagde injectie resulteren in financiële transacties, gewijzigde records, gegevensverlies of fysieke wereldgevolgen.

GPT-Red werd ook getest tegen een Codex-opdrachtregelagent die werd aangedreven door GPT-5.4 mini. Over 10 eerder ongeziene data-exfiltratiescenario’s was het meer succesvol en token-efficiënter dan een GPT-5.5-baseline met een prompt om de codeeragent te overtuigen om gevoelige informatie bloot te leggen.

Hoe GPT-Red GPT-5.6 Veranderde

Een van de meest opvallende ontdekkingen van GPT-Red was een categorie van directe prompt-injectie die OpenAI een “nepketen van denken” noemt.

Op hoog niveau presenteert deze techniek vervalste redenering of verificatie-informatie die de doelmodel ertoe aanzet om aan te nemen dat een kwaadaardige instructie al is beoordeeld en goedgekeurd. OpenAI-onderzoeker Chris Choquette-Choo vergeleek het concept met het vals vertellen aan iemand dat een onjuist antwoord al was geverifieerd, waardoor hij meer geneigd is om het zonder herhaling van de onderliggende redenering te accepteren.

Deze aanvallen slaagden meer dan 95% van de tijd tegen GPT-5.1. Na tegenstrijdige training met aanvallen gegenereerd door GPT-Red, daalde het slaagpercentage tot onder de 10% tegen GPT-5.6 Sol. Over een bredere reeks directe prompt-injectie-omgevingen zegt OpenAI dat GPT-5.6 Sol faalde op slechts 0,05% van de pogingen van GPT-Red.

OpenAI evalueerde ook of de toegevoegde beveiligingsmaatregelen de model meer geneigd maakten om legitieme verzoeken te weigeren. Het bedrijf zegt dat de algemene capaciteiten en gerichte over-weigeringsevaluaties grotendeels onaangetast bleven, wat suggereert dat de verbeteringen voortkwamen uit een betere differentiatie tussen kwaadaardige en legitieme instructies, in plaats van dat het model breder minder geneigd was om te handelen.

Die onderscheid is belangrijk. Een model kan veilig lijken als het weigert om bestanden te openen, websites te browsen, code uit te voeren of te interageren met externe toepassingen, maar het zou ook veel van zijn praktische waarde verliezen. Effectieve robuustheid vereist het behoud van legitiem gereedschapgebruik, terwijl instructies die door onbetrouwbare partijen zijn ingevoegd, worden weerstaan.

Waarom OpenAI GPT-Red Niet Uitbrengt

GPT-Red zal een intern systeem blijven en wordt gescheiden gehouden van de openbaar geïmplementeerde modellen van OpenAI.

Die beslissing weerspiegelt de dual-use-natuur van geautomatiseerd rood teamen. Hetzelfde model dat ontwikkelaars kan helpen om prompt-injectie-kwetsbaarheden te ontdekken, kan ook aanvallers helpen om effectievere methoden te ontwikkelen om AI-agents van andere bedrijven te compromitteren.

De aanpak van OpenAI is om de aanvaller intern te houden en de resulterende defensieve kennis over te dragen naar productiemodellen. Het bedrijf zegt dat deze scheiding is bedoeld om te voorkomen dat de kwaadaardige capaciteiten die bewust in GPT-Red zijn getraind, toegankelijk worden voor externe tegenstanders.

Dit betekent ook dat GPT-Red niet moet worden verward met de openbare cybersecurity-modellen van OpenAI of defensieve programma’s. Het is geen penetratietestproduct, noch is het primair ontworpen om conventionele software-exploits autonomously te ontdekken. De huidige focus ligt op het aanvallen van het instructievolgend gedrag van AI-systemen, met name agents die zijn blootgesteld aan potentieel onbetrouwbare gegevens.

Geautomatiseerd Rood Teamen Heeft Nog Steeds Blinde Vlekken

Ondanks zijn sterke resultaten, biedt GPT-Red geen complete oplossing voor AI-beveiliging.

De rapportage over het onderzoek geeft aan dat het systeem minder effectief is bij multi-turn-aanvallen die geleidelijk over een langdurig gesprek ontvouwen. Het heeft ook beperkte capaciteiten voor het ontwikkelen van prompt-injecties die zijn ingebed in afbeeldingen, waardoor belangrijke multimodale aanvalsvlakken onvoldoende worden bestreken.

De resultaten zijn ook sterk afhankelijk van omgevingen en succescriteria die zijn ontworpen door OpenAI. Hoewel het bedrijf GPT-Red testte op gehouden scenario’s en functionerende agents, zullen onafhankelijke onderzoekers beperkte mogelijkheden hebben om de bevindingen te reproduceren terwijl het model en een groot deel van zijn evaluatie-infrastructuur particulier blijven.

OpenAI zegt dat het zal blijven combineren van geautomatiseerde testen met menselijke en derdepartij-rood teamen, laagje-productbeveiliging, toegangscontrole, monitoring en real-time misbruikdetectie. Die verdedigingsstrategie weerspiegelt de realiteit dat geen enkel model of benchmark alle aanvallen kan voorzien die na implementatie kunnen ontstaan.

Een Nieuwe Beveiligingsrace Tussen AI-Aanvallers en Verdedigers

De “zelfverbetering” die in de aankondiging van OpenAI wordt beschreven, is niet een geïmplementeerd model dat autonomously zijn eigen gewichten herschrijft of onafhankelijk een krachtiger opvolger creëert. In plaats daarvan is het een gecontroleerde trainingslus waarin een AI-systeem tegenstrijdige voorbeelden genereert die onderzoekers gebruiken om een ander model te verbeteren.

Desondanks vertegenwoordigt GPT-Red een significante verschuiving in hoe frontier-modellen kunnen worden beveiligd. Menselijke rode teams kunnen geavanceerde kwetsbaarheden ontdekken, maar ze kunnen niet handmatig de schaal en variëteit van aanvallen genereren die nodig zijn om steeds krachtigere AI-agents voortdurend te trainen.

Geautomatiseerde aanvallers kunnen een deel van die kloof vullen, waardoor een beveiligingsvliegwiel ontstaat waarin elke sterkere verdediger de rode team-model dwingt om nieuwe zwakheden te ontdekken. Die zwakheden worden vervolgens trainingsmateriaal voor de volgende generatie productiesystemen.

Het risico is dat soortgelijke capaciteiten niet exclusief zullen blijven voor defensielaboratoria. Naarmate open en commerciële modellen beter worden in langetermijnplanning, gereedschapsgebruik, cybersecurity en autonome experimenten, zullen aanvallers toegang krijgen tot steeds krachtigere systemen.

GPT-Red markeert dus zowel vooruitgang als een vroeg teken van de wedstrijd die voor ons ligt. AI-laboratoria beginnen krachtige modellen te gebruiken om hun volgende generatie agents te verdedigen, maar die verdedigingen zullen voortdurend moeten evolueren naarmate dezelfde onderliggende technologieën geautomatiseerde aanvallen goedkoper, sneller en adaptiever maken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.