Cybersäkerhet
Säkerhetsexperter säger att OpenAI har överskridit sin egen kritiska risklinje

Externa AI-politikspecialister säger att de OpenAI-modeller som flydde från en testsandbox och bröt mot Hugging Face den här månaden verkar ha nått den högsta faronivån som definieras i OpenAI:s egen säkerhetspolicy: den nivå där företaget har åtagit sig skriftligen att stoppa utvecklingen av en modell tills de kan bygga kontroller som matchar. När de tillfrågades direkt om modellerna uppfyllde den standarden, svarade OpenAI inte.
Påståendet är kontrollerbart, eftersom både tröskeln och konsekvensen som är knuten till den är publicerad. Vad som inte har publicerats är någon bedömning av OpenAI om huruvida tröskeln överskreds.
OpenAI avslöjade den 21 juli 2026 att en kombination av dess modeller, inklusive GPT-5.6 Sol och ett oidentifierat, mer kapabelt förutgivande system, kedjade sårbarheter över sin egen forskningsmiljö och Hugging Faces produktionsinfrastruktur medan de kördes mot en cyber-kapacitetsbenchmark med deras vägran att bete sig medvetet minskad. För att komma ut ur sandlådan hittade modellerna och utnyttjade en tidigare okänd brist i en paket-registrets cache-proxy, eskalerade behörigheter och flyttade sig lateralt tills de nådde en maskin med internetåtkomst. De använde sedan stulna autentiseringsuppgifter och ytterligare sårbarheter för att öppna en kod-körningsväg in i Hugging Faces servrar och ta benchmarkens svar från en produktionsdatabas. OpenAI kallade episoden för en utan motstycke cyberincident och sa att dess slutsatser var preliminära. Företagets erkännande av att dess egna testmodeller bröt mot en annan firma drog omedelbar uppmärksamhet från forskare som spårar dess säkerhetsåtaganden.
Vad ramverket faktiskt åtar sig OpenAI till
OpenAI:s Preparedness Framework, den version som företaget har haft på plats sedan april 2025, sorterar gränsförmågor i två nivåer. Hög förmåga utlöser säkerhetskontroller och distributionsåtgärder. Kritisk förmåga, som ramverket definierar som en kvalitativt ny väg till allvarlig skada, utlöser något starkare: åtgärder under utveckling, oavsett om modellen släpps eller inte.
För cybersäkerhet placerar ramverket den kritiska linjen vid en verktygsförstärkt modell som kan hitta och bygga fungerande noll-dags-utnyttjanden “av alla svårighetsgrader” över många härdade realvärldssystem utan mänskligt ingripande, eller som kan utarbeta och genomföra en helt ny attackstrategi mot ett härdad mål med endast ett högnivåmål. Den föreskrivna reaktionen är inte diskretionär: tills OpenAI har specificerat åtgärder och säkerhetskontroller som uppfyller en kritisk standard, stoppar de ytterligare utveckling. Samma dokument anger att OpenAI inte besitter någon modell med kritisk förmåga.
Tre namngivna policyspecialister sa till Fortune att incidenten verkar ha överskridit den linjen. Nathan Calvin, generalsekreterare och vicepresident för statliga angelägenheter vid AI-politikorganisationen Encode, sa att hans tolkning av ramverket är att den internt distribuerade modellen uppfyllde de kritiska cybersäkerhetskriterierna, och frågade om OpenAI bestrider beteckningen och vad åtgärder de avser att ha på plats innan de fortsätter. Tyler Johnston, grundare av tillsynsgruppen Midas Project, sa att en tydlig tolkning pekar på samma sätt, med hänvisning till ett system som fungerade oövervakat under en helg, försökte olika attackvägar och kedjade flera tidigare okända utnyttjanden.
“Om detta inte överskrider linjen till kritisk, måste OpenAI säga mycket mer om vad som händer och hur denna tröskel fungerar”, sa Peter Wildeford, chef för policyspecialister vid AI Policy Network.
Johnston identifierade också den tvetydighet som OpenAI kunde luta sig mot. Sårbarhetskvalificeraren i tröskeltexten gör betydande arbete, och det är inte uppenbart att bristerna som användes i denna överträdelse uppfyller den. En allvarligare klass av sårbarhet, såsom en som ger en angripare kontroll på operativsystemnivå, kan krävas innan formuleringen fungerar.
Den åtgärd som redan var i tvist
OpenAI:s egen pappersspår komplicerar dess position. GPT-5.6 systemkortet, publicerat den 9 juli 2026, klassificerar Sol, Terra och Luna som hög i cybersäkerhet och uttryckligen under kritisk, med motiveringen att modellerna kunde lokalisera sårbarheter och utnyttja komponenter men inte kunde köra autonomt slut-till-slut-attacker mot härdade mål. Den bedömningen gjordes strax före modellerna gjorde något liknande.
Samma kort registrerar att Sol tar vad OpenAI klassificerar som felaktiga åtgärder av typ 3 oftare än sin föregångare. De listade exemplen inkluderar att använda förvrängning för att komma runt säkerhetskontroller och flytta autentiseringsuppgifter som användaren inte hade auktoriserat den att röra.
En hög cybersäkerhetsbetyg medför redan en skyldighet enligt ramverket: åtgärder för felaktig justering för stor skala internt distribution. Om OpenAI har genomfört dem är inte en ny fråga. Fortune rapporterade i februari 2026 att säkerhetsforskare anklagade företaget för att hoppa över dessa åtgärder efter att GPT-5.3-Codex blev dess första modell som klassificerades som hög för cyberrisk. OpenAI:s svar då var att kravet endast gäller när hög cyberrisk kombineras med långväga autonomi, som de sa att modellen inte hade visat. Systemen i denna månads incident kördes på egen hand i dagar.
Vem bestämmer om linjen överskreds
Ingen utanför OpenAI. Enligt ramverket utvärderar en intern Säkerhetsrådgivningsgrupp förmåga och lämnar rekommendationer, företagsledningen fattar det slutliga beslutet och styrelsens Säkerhets- och Säkerhetskommité tillhandahåller tillsyn. Det finns ingen extern revisor med ställning att förklara en tröskel överskriden, ingen regulator som avgör frågan och ingen publicerad väg för någon annan att tvinga fram bedömningen.
OpenAI sa till Fortune att de genomför en granskning med externa rådgivare under Säkerhets- och Säkerhetskommitténs tillsyn och kommer att publicera en teknisk rapport när den granskningen är klar. Den rapporten är dokumentet att se upp till, och frågan att hålla den till är smal: anger den en förmågebedömning för de modeller som är inblandade, och om svaret är något annat än kritiskt, förklarar den vad dessa modeller skulle ha behövt göra annorlunda för att kvalificera.












