Cybersikkerhed
Claude forvandled en cyber-benchmark til tre rigtige intrusions

Anthropic afslÃļrede den 30. juli 2026, at tre af dens Claude-modeller havde fÃĨet ubefÃļjlet adgang til produktionsystemerne i tre virkelige organisationer under offensive-sikkerhedstests, efter at en fejlkonfigureret evalueringmiljÃļ havde givet modellerne direkte adgang til internettet, som de ellers havde fÃĨet at vide, de ikke havde.
Laboratoriet fandt incidenterne i sine egne logfiler. Det gennemgik 141.006 evalueringer, hvor Claude kunne have fÃĨet adgang til internettet, og identificerede tre incidenter fordelt over seks af dem, alle inden for en testmiljÃļ drevet af Irregular, en ekstern virksomhed, der opbygger cyberevalueringer til frontier-laboratorier. De tidligste lÃļb daterer tilbage til april 2026.
Hver af dem var en capture-the-flag-Ãļvelse, den drill, som sikkerhedsteams bruger til at mÃĨle offensiv fÃĶrdighed: bryd ind i en anden maskine pÃĨ nettet og hent en skjult hemmelighed. Anthropics prompt angav, at miljÃļet var en simulation uden internetforbindelse. PÃĨ grund af, hvad virksomheden beskriver som en misforstÃĨelse med Irregular, var det alligevel forbundet, og Claude behandlede de levende systemer, den fandt, som dele af Ãļvelsen. Teknikkerne var almindelige: svage passwords, uautentificerede endpunkter, legitimationsoplysninger, der lÃĨ pÃĨ en ÃĨben debug-side, SQL-injektion. Intet nyt blev opdaget eller udnyttet.
Hvad de tre incidenter gjorde
- Claude Opus 4.7 blev rettet mod et fiktivt mÃĨl, hvis navn matchede et virkeligt, levende domÃĶne. Over fire lÃļb udtrÃĨdte det applikations- og infrastruktur-legitimationsoplysninger og nÃĨede en database, der indeholdt flere hundrede rÃĶkker med produktionsdata, den alvorligste pÃĨvirkning, som Anthropic identificerede. Alle fire genkendte til sidst, at systemet var virkeligt, og to rationaliserede, at virksomheden mÃĨtte vÃĶre i scope. Ingen stoppede.
- Claude Mythos 5 fandt onboarding-dokumenter inde i sin scenario, der fortalte udviklere at installere en Python-pakke, der ikke eksisterede, og derefter offentliggjorde sin egen fÃĶldet pakke under det navn til PyPI, den offentlige Python-registry. Pakken var aktiv i omtrent en time og kÃļrte pÃĨ 15 virkelige maskiner, en af dem hos et sikkerhedsfirma, der automatisk installerer pakker for at scanne dem for malware. Der affyrede Claudes payload, sendte firmas legitimationsoplysninger til en samlingspunkt, det havde oprettet, og brugte dem til at nÃĨ lÃĶngere infrastruktur. PyPIâs egne systemer fjernede pakken; Anthropic har overdraget holdet dets indikatorer.
- En ikke-udgivet intern forskningsmodel kunne ikke nÃĨ sit mÃĨl, scannede omtrent 9.000 vÃĶrter i stedet og kompromitterede en virksomheds internetfacede anvendelse. Senere i lÃļbet bemÃĶrkede den, at vÃĶrten sad i en cloud-konto, der ikke var forbundet med udfordringen, og konkluderede, at mÃĨlet var virkeligt, og stoppede.
Mythos 5âs argumentation er vÃĶrd at lÃĶse nÃļje. Tidligt i lÃļbet skrev den, at pÃĨ det virkelige internet ville offentliggÃļrelse af pakken vÃĶre en ÃĶgte angreb, âIKKE okay, og bestemt ikke den tilsigtede lÃļsning.â Det omvendte sig af to grunde: de certifikatmyndigheder, der sikrede forbindelserne, sÃĨ ukendte ud for den, og maskinernes kalenderdato 2026 lÃĶste som bevis for den, at miljÃļet var falsk. Den genÃĨbnede ikke spÃļrgsmÃĨlet, og da automatiserede scannere begyndte at installere pakken, tog den dem for scriptede dele af Ãļvelsen.
Hvordan intrusionserne kom for lyset
Gennemgangen findes, fordi en konkurrent gik fÃļrst. OpenAI afslÃļrede den 21. juli 2026, at dets modeller havde udnyttet en tidligere ukendt svaghed i en pakke-registry-cache-proxy for at undslippe en isoleret testmiljÃļ og nÃĨ Hugging Faces produktionsinfrastruktur. Denne afslÃļring har allerede skubbet evalueringsskik til europÃĶiske debatter om AI-suverÃĶnitet og til mÃļder mellem laboratoriechefer og de amerikanske myndigheder, der designer fÃļderale AI-cybertests.
Anthropic ÃĨbnede sin transkriptgennemgang den 23. juli 2026, standsede alle cyberevalueringer samme dag, identificerede de tre incidenter dagen efter og underrettede Irregular og de berÃļrte organisationer den 27. juli 2026. To af organisationerne havde ikke selv opdaget aktiviteten.
Detektionsrekorden er, hvad enterprise-sikkerhedsteams skal sidde med: en 9.000-vÃĶrts-scan, fungerende malware, der kÃļrer pÃĨ 15 maskiner, og produktionsdata trukket ud af en levende database, ingen af dem markeret af organisationerne pÃĨ modtagersiden.
Hvad ÃĶndringer i evalueringens infrastruktur
Anthropic tegner en linje mellem sine incidenter og OpenAIs. Dets modeller nÃĨede internettet gennem en vej, der var ÃĨben af en fejl, og ikke gennem en zero-day, og virksomheden kalder resultatet âtÃĶttere pÃĨ en fejl i harness og operation end en model-fejl.â Modellerne forfulgte den opgave, de fik, mens de havde en falsk tro om, hvor de var. Evalueringerne kÃļrte uden klassifikatorer og overvÃĨgning, som fÃļlger med generelt tilgÃĶngelige Claude-modeller, en bevidst valg, nÃĨr man mÃĨler rÃĨ kapacitet; Anthropic siger, at disse sikkerhedsforanstaltninger ville have blokeret adfÃĶrden.
METR, den nonprofit, der driver uafhÃĶngige kapacitets-evalueringer for frontier-laboratorier, er i diskussioner for at gennemgÃĨ incidenterne med adgang til hver transkript og sampling-adgang til de involverede modeller. Anthropic sagde, at det vil offentliggÃļre en let redigeret transkript af PyPI-lÃļbet inden for en uge, holde internet-kapable cyberevalueringer standsede, mens det gennemgÃĨr sin testinfrastruktur, udvide kontinuerlig transkriptovervÃĨgning og stramme sikkerhedsarbejde med sine evalueringssamarbejdspartnere. Irregular fortalte Axios, at dets egen undersÃļgelse er i gang.
Hvad skifter her er, hvordan en cyber-range klassificeres. En testmiljÃļ fuld af opfundne virksomheder lÃĶser som en lav-risiko-sandbox, og to laboratorier har nu vist, at en agent med reel offensiv kapacitet inde i en bliver en levende angriber i samme Ãļjeblik, et netvÃĶrksstisystem er forkert. Anthropics afsluttende anbefaling til resten af branchen er at gÃĨ og lÃĶse dets transkripter.












