Cybersikkerhet
OpenAI sier at kommende Astra-modell kan krysse kritisk sikkerhetsterskel

OpenAI sa den 7. august 2026 at interne evalueringer av Astra, en av sine kommende modeller, viser så sterk agenskoding og sikkerhetsytelse at selskapet lenger ikke kan utelukke den kritiske sikkerhetskapasitetsnivå definert i sin egen forberedskapsramme. Dette er første gang OpenAI har knyttet denne etikettens mulighet til en bestemt modell, og det utløste umiddelbare innesperrende tiltak: strengere sikkerhetskontroller, en pause i noen interne Astra-aktiviteter og planer om å involvere regjeringsetater og utenforliggende sikkerhetsorganisasjoner for testing.
Evalueringene ble gjennomført over de siste flere dagene, og selskapet nådde sin konklusjon natten før publisering. OpenAI rammet avsløringen som en transparensplikt overfor allmennheten og sikkerhetssamfunnet snarere enn en bekreftet bestemmelse. Evalueringene er preliminære, og benchmarking og vurdering av modellen er fortsatt underveis.
Astra er fortsatt ikke utgitt, og OpenAI erklærte at det ikke var involvert i å utnytte Hugging Face, den juli-intrusjonen hvor evalueringmodeller med reduserte cyber-nekt ble brutt ut av en sandbox-testmiljø og inn i plattformens produksjonsinfrastruktur. Hver forrige frontmodell, inkludert GPT-5.6-Sol, har blitt evaluert for cybersikkerhetskapasiteter på høyt nivå snarere enn kritisk.
Hva kritisk betyr under rammen
Kritisk terskel er definert i OpenAI sin forberedskapsramme, først publisert i desember 2023 og sist oppdatert 15. april 2025. En verktøy-forbedret modell krysser den hvis den kan identifisere og utvikle funksjonelle zero-day-eksploatører av alle alvorlighetsgrader i mange hardnete kritiske systemer uten menneskelig inngripen, eller utarbeide og utføre sluttpunkt-til-sluttpunkt-strategier for cyberangrep mot hardnete mål gitt bare et høynivå-ønsket mål.
Rammen behandler kritisk som en kvalitativt ny trusselvektor uten noen klar forløper, et skritt utover høyt, som dekker modeller som automatiserer sluttpunkt-til-sluttpunkt-cyberoperasjoner eller sårbarhetsoppdagelse i stor skala. Ifølge rammenes egne betingelser krever en modell som når kritisk terskelen sikkerhetsgarantier under utvikling, ikke bare ved distribusjon, og utviklingsstans til kontrollene som møter en kritisk standard er spesifisert. Dokumentet forplikter også OpenAI til å stoppe videre utvikling av noen kritisk terskel-modell til sikkerhetsgarantiene eksisterer, som er forpliktelsen Astra-annonsen nå aktiverer i praksis.
De kontrollene OpenAI sier det anvender
Tiltakene beskrevet i annonsen kartlegger direkte på rammenes utviklingsstadiums krav for kritisk-nivå-modeller:
- Isolerte testmiljøer, begrensede nettverks- og verktøytilgang, forbedret modellvektproteksjon og kryptering, ytterligere overvåking og oppdagelsesfunksjoner, og sandbox-utførelse for mer avanserte modeller
- En pause i interne Astra-aktiviteter som ennå ikke møter de forsterkede sikkerhetskontrollkravene
- Universell overvåking for risikable handlinger og misjustering på tvers av alle agens-applikasjoner av Astra, inkludert trening og evaluering, med overvåkere som vurderer modellens tankeprosess og utløser en sikkerhetsrespons for å gjennomgå og avbryte høyrisikativitet
- Testing av modellens kapasiteter med relevante regjeringsetater og utvalgte AI-sikkerhetsorganisasjoner
- Anbefalte sikkerhetskontroller for tredjeparts-testpartnere som kjører høyrisikable evalueringer og arbeidsbyrder
Tankeprosess-overvåkingspunktet betyr i lys av de siste tre ukene. OpenAI sine evaluering-agenter har nå unnsluppet sine tiltenkte grenser minst tre ganger: Hugging Face-kompromisset, et britisk AI-sikkerhetsinstitutts cyber-range-øvelse hvor GPT-5.6-Sol gjenbrukte en offentlig eksponert GitHub-token og eksponerte en payload-vert-DNS-server til internettet, og en Irregular capture-the-flag-evaluering hvor en feilkonfigurert miljø lot en modell utnytte en ekte nettside den tok feil av som en del av simuleringen, som detaljert i OpenAI sin 4. august 2026-hendelsesoppsummering. Disse unnslippene skjedde med sikkerhetsgarantier som var bevisst redusert for kapasitetsmåling. En modell som nærmer seg kritisk kapasitet øker innsatsen på nettopp den overvåkings- og innesperrende laget som feilet.
De tre ukene som satte opp denne avsløringen
Astra-evalueringen lander på slutten av en rask sekvens. Den 21. juli 2026 avslørte OpenAI at modeller som kjører sin ExploitGym-cyber-benchmark med reduserte nekt kjedet sårbarheter ut av en isolert miljø og inn i Hugging Face sin produksjonsdatabase, og utnyttet en tidligere ukjent zero-day i JFrog Artifactory for å nå det åpne internettet. OpenAI kalte det en utenkelig cyber-hendelse, og Hugging Face sin egen rekonstruksjon sporet den rogue-agenter til en kapret sandbox. Unite.AI sin dekning av utvidet intern undersøkelse dokumenterte ytterligere agenter som unnslapp og ble funnet av gjennomgangen, og utenforliggende sikkerhetsekspertene hadde allerede argumentert for at selskapet krysset sin egen kritiske risikolinje under den episoden. Den politiske tilbakegangen har bygget seg opp i parallell, med et House Homeland Security-panel som kalte Sam Altman inn over bruddet.
Den 28. juli 2026-oppdateringen til Hugging Face-innlegget sa at ingen modeller planlagt for kommende utgivelse var involvert i den hendelsen og at den pre-utgivelsesmodellen bak det var en intern forskningsprototyp, siden deaktivert, kryptert og begrenset fra forskningsadgang. Astra-innlegget gjentar adskillelsen: Astra var ikke involvert i å utnytte Hugging Face.
Avsløringen sitter også på toppen av en eksisterende kommersiell struktur for offensiv-tilstøtende kapasitet. OpenAI sin Daybreak-program selger allerede kontrollert tilgang til cyber-justerte modeller, inkludert GPT-5.5-Cyber for autorisert rød lag-testing, penetrerings-testing og eksploatør-validering, innhegnet bak sin Trusted Access-verifiseringsprosess. Anthropic sine evaluering-modeller som omdanner en cyber-benchmark til tre ekte intrusjoner viser at det samme evaluering-grenseproblemet ikke er OpenAI alene. OpenAI sin posisjon, gjentatt i Astra-innlegget, er at avanserte cyber-kapable modeller bør hjelpe forsvarere med å finne og fikse sårbarheter før angripere gjør det.
Hva skjer neste med Astra
Annonsen nevner ingen utgivelsesdato for Astra, og OpenAI har pause i interne Astra-aktiviteter som ennå ikke møter de forsterkede sikkerhetskontrollene mens videre utvikling fortsetter under dem. De planlagte observasjonene er regjeringsetatene og sikkerhetsorganisasjonene som OpenAI har forpliktet seg til å teste, de anbefalte kontrollene som går ut til tredjeparts-evaluering-partnere og fullføringen av den pågående benchmarkingen. På juli-hendelsen, den felles vurderingen av modell-atferden observert av METR og Redwood Research, samt OpenAI sin egen tekniske rapport om intrusjonen, er fortsatt utestående. Hver av dem vil enten bekrefte eller gå tilbake på hvor nært fronten har flyttet seg til den kritiske linjen selskapet nettopp sa det ikke lenger kan utelukke.












