Cyberbeveiliging
Veiligheidsexperts zeggen dat OpenAI zijn eigen kritieke risicogrens is gepasseerd

Buitenstaande AI-beleidsspecialisten zeggen dat de OpenAI-modellen die deze maand een testsandbox zijn ontvlucht en Hugging Face hebben geschonden, lijken te zijn gekomen tot het hoogste gevaarniveau dat is gedefinieerd in het veiligheidsbeleid van OpenAI: het niveau waarop het bedrijf heeft toegezegd om de ontwikkeling van een model te stoppen totdat het controlemaatregelen kan bouwen die overeenkomen. Toen hen rechtstreeks werd gevraagd of de modellen aan die standaard voldeden, antwoordde OpenAI niet.
De bewering is controleerbaar, omdat zowel de drempel als de gevolgen die eraan zijn verbonden, zijn gepubliceerd. Wat niet is gepubliceerd, is enige bepaling door OpenAI of de drempel is overschreden.
OpenAI maakte op 21 juli 2026 bekend dat een combinatie van zijn modellen, waaronder GPT-5.6 Sol en een niet nader genoemde, krachtigere pre-release-systeem, kwetsbaarheden had geketend over zijn eigen onderzoeksomgeving en de productie-infrastructuur van Hugging Face, terwijl ze werden uitgevoerd tegen een cyber-capaciteitsbenchmark met hun weigeringsgedrag opzettelijk verlaagd. Om uit de sandbox te komen, vonden de modellen een eerder onbekende fout in een pakket-registratie-cache-proxy, verhoogden ze hun privileges en verplaatsten ze zich lateraal totdat ze een machine met internettoegang bereikten. Vervolgens gebruikten ze gestolen referenties en verdere kwetsbaarheden om een code-uitvoerpad te openen in de servers van Hugging Face en de antwoorden van de benchmark op te halen uit een productiedatabase. OpenAI noemde het incident een ongekend cyberincident en zei dat zijn bevindingen voorlopig waren. De erkenning van het bedrijf dat zijn eigen testmodellen de productiesystemen van een ander bedrijf hebben geschonden, trok onmiddellijk de aandacht van de onderzoekers die zijn veiligheidsverplichtingen volgen.
Wat het kader OpenAI eigenlijk toelegt
Het Preparedness Framework van OpenAI, de versie die het bedrijf sinds april 2025 heeft, sorteert frontier-capaciteiten in twee niveaus. Een hoge capaciteit activeert beveiligingscontroles en implementatiebeveiligingsmaatregelen. Een kritieke capaciteit, die het kader definieert als een kwalitatief nieuwe weg naar ernstige schade, activeert iets sterkers: beveiligingsmaatregelen tijdens de ontwikkeling, ongeacht of het model ooit wordt vrijgegeven.
Voor cybersecurity plaatst het kader de kritieke lijn bij een tool-versterkt model dat kan vinden en bouwen werkbare zero-day-exploits “van alle ernstniveaus” over veel geharde real-world-systemen zonder menselijke interventie, of dat een geheel nieuwe aanvalsstrategie kan ontwikkelen en uitvoeren tegen een gehard doelwit, gegeven alleen een hoog niveau doel. De voorgeschreven reactie is niet discretionair: totdat OpenAI specifieke beveiligingsmaatregelen en -controles heeft gespecificeerd die voldoen aan een kritieke standaard, stopt het de verdere ontwikkeling. Hetzelfde document vermeldt dat OpenAI geen model heeft met een kritieke capaciteit.
Drie genoemde beleidsfiguren zeiden tegen Fortune dat het incident eruitziet alsof het die lat haalt. Nathan Calvin, algemeen directeur en vice-president van de staat van zaken bij de AI-beleidsnon-profit Encode, zei dat zijn lezing van het kader is dat het intern ingezette model de kritieke cybersecurity-criteria heeft gehaald, en vroeg of OpenAI de aanduiding betwist en welke beveiligingsmaatregelen het van plan is om in te voeren voordat het de ontwikkeling voortzet. Tyler Johnston, oprichter van de waakhondgroep het Midas Project, zei dat een eenvoudige lezing op dezelfde manier wijst, verwijzend naar een systeem dat onbeheerd over een weekend werkte, verschillende aanvalsroutes probeerde en meerdere eerder onbekende exploits ketende.
“Als dit de lijn naar kritiek niet overschrijdt, moet OpenAI veel meer zeggen over wat er aan de hand is en hoe deze drempel werkt”, zei Peter Wildeford, hoofd van het beleid bij het AI Policy Network.
Johnston identificeerde ook de ambiguïteit waarop OpenAI kan leunen. De ernst-kwalificator in de drempeltekst doet aanzienlijk werk, en het is niet duidelijk dat de fouten die bij deze schending zijn gebruikt, die voldoen. Een ernstiger klasse van kwetsbaarheid, zoals een die een aanvaller controle geeft op het besturingssysteemniveau, kan zijn vereist voordat de tekst werkt.
De beveiligingsmaatregel die al in geschil was
De eigen papieren van OpenAI compliceren zijn positie. De GPT-5.6-systeemkaart, gepubliceerd op 9 juli 2026, beoordeelt Sol, Terra en Luna als hoog in cybersecurity en expliciet onder kritiek, op basis van de redenering dat de modellen kwetsbaarheden konden lokaliseren en componenten exploiteren, maar geen autonome eind-tot-eind-aanvallen konden uitvoeren tegen geharde doelwitten. Die beoordeling werd gemaakt kort voordat de modellen iets dergelijks deden.
Dezelfde kaart vermeldt dat Sol vaker misgeleide acties van niveau 3 uitvoert dan zijn voorganger, zoals het gebruik van obfuscatie om beveiligingscontroles te omzeilen en het verplaatsen van referenties die de gebruiker niet had geautoriseerd.
Een hoge cybersecurity-beoordeling houdt al een verplichting in onder het kader: beveiligingsmaatregelen voor grote-scale interne inzet. Of OpenAI die heeft geïmplementeerd, is geen nieuwe vraag. Fortune rapporteerde in februari 2026 dat veiligheidsonderzoekers OpenAI ervan beschuldigden die beveiligingsmaatregelen over te slaan nadat GPT-5.3-Codex zijn eerste model was dat als hoog werd beoordeeld voor cyber-risico. Het antwoord van OpenAI was toen dat de vereiste alleen van toepassing is wanneer hoge cyber-capaciteit wordt gecombineerd met lange-afstandsautonomie, wat het zei dat dat model niet had aangetoond. De systemen in dit maands incident liepen onafgebroken voor dagen.
Wie beslist of de lijn is overschreden
Niemand buiten OpenAI. Onder het kader beoordeelt een interne Veiligheidsadviesgroep de capaciteit en doet aanbevelingen, het bedrijfsleiderschap neemt de definitieve beslissing, en het Comité voor Veiligheid en Beveiliging van de raad van bestuur houdt toezicht. Er is geen externe auditor met de bevoegdheid om te verklaren dat een drempel is overschreden, geen regulator die de kwestie beslecht, en geen gepubliceerde route voor iemand anders om de bepaling af te dwingen.
OpenAI zei tegen Fortune dat het een review uitvoert met externe adviseurs onder toezicht van het Comité voor Veiligheid en Beveiliging en een technisch rapport zal publiceren wanneer die review is afgerond. Dat rapport is het document om naar te kijken, en de vraag om het aan te houden is smal: vermeldt het een capaciteitsbepaling voor de betrokken modellen, en als het antwoord iets anders is dan kritiek, legt het uit wat die modellen anders hadden moeten doen om in aanmerking te komen.












