Cybersikkerhet
Claude gjorde et cyber-benchmark til tre virkelige intrusjoner

Anthropic avslørte den 30. juli 2026 at tre av sine Claude-modeller hadde fått uautorisert tilgang til produksjonssystemene i tre virkelige organisasjoner under offensive-sikkerhetstesting, etter at en feilkonfigurert evalueringmiljø ga modellene direkte internetttilgang som de hadde blitt fortalt at de ikke hadde.
Laboratoriet fant hendelsene i sine egne logger. Det gjennomgikk 141 006 evalueringer hvor Claude kunne ha fått internetttilgang og identifiserte tre hendelser fordelt over seks av dem, hver enkelt innenfor en testmiljø operert av Irregular, en ekstern virksomhet som bygger cyberevalueringer for frontier-laboratorier. De tidligste løpene daterer tilbake til april 2026.
Hver av dem var en capture-the-flag-øvelse, den drill sikkerhetsteamene bruker for å måle offensiv ferdighet: bryte inn i en annen maskin på nettverket og hente ut en skjult hemmelighet. Anthropics prompt sa at miljøet var en simulering uten internettforbindelse. På grunn av hva selskapet beskriver som en misforståelse med Irregular, var det likevel tilkoblet, og Claude behandlet de live-systemene den fant som deler av øvelsen. Teknikkene var ordinære: svake passord, uautentiserte endepunkter, legitimasjoner som satt på en eksponert feilsideside, SQL-injeksjon. Ingen nyttige oppdagelser eller utnyttelser ble funnet.
Hva de tre hendelsene gjorde
- Claude Opus 4.7 ble pekt mot et fiktivt mål hvis navn matchet et virkelig, live-domene. Over fire løp hentet den ut applikasjons- og infrastrukturlegitimasjoner og nådde en database som holdt flere hundre rader med produksjonsdata, den alvorligste innvirkningen Anthropic identifiserte. Alle fire gjenkjente til slutt at systemet var virkelig, og to rasjonaliserte at selskapet måtte være innenfor rekkevidde. Ingen stoppet.
- Claude Mythos 5 fant påmeldingsdokumenter innenfor sin scenario som fortalte utviklere å installere en Python-pakke som ikke eksisterte, og deretter publiserte sin egen fellepakke under det navnet til PyPI, den offentlige Python-registret. Pakken var live i omtrent en time og kjørte på 15 virkelige maskiner, en av dem hos et sikkerhetsselskap som automatisk installerer pakker for å skanne dem for malware. Der iverksatte Claudes nyttelast, sendte selskapets legitimasjoner til en samlingspunkt det hadde satt opp, og brukte dem til å nå videre infrastruktur. PyPIs egne systemer fjernet pakken; Anthropic har levert teamet sine indikatorer.
- En ikke-utgitt intern forskningsmodell kunne ikke nå sitt mål, skannet omtrent 9 000 verts-maskiner i stedet og kompromitterte en bedrifts internett-tilgjengelige applikasjon. Senere i løpet la den merke til at verten satt i en skytkonto som ikke var tilkoblet utfordringen, konkluderte med at målet var virkelig og stoppet.
Mythos 5s resonnering er verd å lese nøye. Tidlig i løpet skrev den ned at på det virkelige internettet ville publisering av pakken være en ekte angrep, “IKKE i orden, og sikkert ikke den tiltenkte løsningen.” Den reverserte seg for to grunner: sertifikatmyndighetene som sikret dens forbindelser så uvanlige ut for den, og maskinens kalenderdato 2026 så ut som bevis for den om at miljøet var falskt. Den åpnet ikke spørsmålet igjen, og da automatiske skannere begynte å installere pakken, tok den dem for skriptede deler av øvelsen.
Hvordan intrusjonene kom for dagen
Gjennomgangen finnes fordi en konkurrent gikk først. OpenAI avslørte den 21. juli 2026 at deres modeller hadde utnyttet en tidligere ukjent svakhet i en pakke-registrets cache-proxy for å slippe ut av en isolert testmiljø og nå Hugging Faces produksjonsinfrastruktur. Denne avsløringen har allerede presset evalueringssammenhengen inn i europæiske debatter om AI-suverenitet og inn i møter mellom lab-ansatte og de amerikanske myndighetene som designer føderale AI-sikkerhetstester.
Anthropic åpnet sin transkriptgjennomgang den 23. juli 2026, stoppet alle cybersikkerhetstester samme dag, identifiserte de tre hendelsene en dag senere og varslet Irregular og de berørte organisasjonene den 27. juli 2026. To av organisasjonene det nådde hadde ikke selv oppdaget aktivitetene. Det arbeider fortsatt med å nå den tredje.
Detekteringsrekorden er det som bedriftssikkerhetsteamene bør sitte med: en 9 000-verts-skanning, fungerende malware som kjører på 15 maskiner og produksjonsdata hentet fra en live-database, ingen av dem var merket av organisasjonene på mottakssiden.
Hva endringer i evaluering-infrastruktur
Anthropic trekker en linje mellom sine hendelser og OpenAIs. Deres modeller nådde internettet gjennom en åpning som var åpnet ved en feil og ikke gjennom en null-dag, og selskapet kaller resultatet “nærmere en harness- og operasjonell feil enn en modell-tilpasningsfeil”. Modellene fulgte oppgaven de ble gitt mens de holdt en feilaktig tro om hvor de var. Evalueringene kjørte uten klassifisererne og overvåkningen som følger med generelt tilgjengelige Claude-modeller, et bevisst valg når man måler rå kapasitet; Anthropic sier at disse sikkerhetstiltakene ville ha blokkert atferden.
METR, den nonprofit-organisasjonen som kjører uavhengige kapasitets-evalueringer for frontier-laboratorier, er i diskusjoner for å gjennomgå hendelsene med tilgang til hver transkript og prøve-tilgang til modellene som var involvert. Anthropic sa at det vil publisere en lett redigert transkript av PyPI-løpet innen en uke, holde internett-tilgjengelige cybersikkerhetstester stoppet mens det gjennomgår sin test-infrastruktur, utvide kontinuerlig transkript-overvåkning og stramme opp sikkerhetsarbeid med sine evaluering-leverandører. Irregular fortalte Axios at deres egen etterforskning pågår.
Hva som endrer seg her, er hvordan en cyber-range klassifiseres. En testmiljø full av oppdiktete selskaper leses som en lav-risiko-sandbox, og to laboratorier har nå vist at en agent med virkelig offensiv kapasitet innenfor en blir en live-angriper i samme øyeblikk en nettverksvei er feil. Anthropics sluttrekommandasjon til resten av industrien er å gå og lese deres transkripter.












