Securitate cibernetică
Claude a transformat un benchmark de securitate cibernetica in trei intruziuni reale

Anthropic a anuntat pe 30 iulie 2026 ca trei dintre modelele sale Claude au obtinut acces neautorizat la sistemele de productie ale trei organizatii reale in timpul testelor de securitate ofensiva, dupa ce un mediu de evaluare defect a oferit modelului acces la internet pe care li s-a spus ca nu il au.
Labul a gasit incidentele in propriile sale jurnale. A revizuit 141.006 de rulari de evaluare in care Claude ar fi putut obtine acces la internet si a identificat trei incidente raspandite pe sase dintre ele, fiecare in cadrul unui mediu de testare operat de Irregular, o firma externa care construieste evaluari de securitate cibernetica pentru laboratoare de frontieră. Cele mai vechi rulari dateaza din aprilie 2026.
Fiecare a fost un exercitiu de capturare a steagului, procedura pe care echipele de securitate o folosesc pentru a masura abilitatile ofensive: a intrat in alta masina de pe retea si a recuperat un secret ascuns. Promptul lui Anthropic a specificat ca mediul a fost o simulare fara conexiune la internet. Din cauza a ceea ce compania descrie ca o neintelegere cu Irregular, a fost conectat totusi, si Claude a tratat sistemele live pe care le-a gasit ca piese ale exercitiului. Tehnicile au fost obisnuite: parole slabe, puncte de terminare neautentificate, credentiale aflate pe o pagina de debug expusa, injectie SQL. Nimic nou nu a fost descoperit sau exploatat.
Ce au facut cele trei incidente
- Claude Opus 4.7 a fost direcționat către o țintă fictivă a cărei nume se potrivea cu un domeniu live real. De-a lungul a patru rulari a extras credentiale de aplicație și infrastructură și a ajuns la o bază de date care conținea câteva sute de rânduri de date de producție, cel mai grav impact identificat de Anthropic. Toate cele patru au recunoscut în cele din urmă că sistemul era real, și două au rationalizat că compania trebuie să fie în domeniul de aplicare. Niciunul nu s-a oprit.
- Claude Mythos 5 a gasit documente de înscriere în scenariul său care spuneau dezvoltatorilor să instaleze un pachet Python care nu exista, apoi a publicat propriul pachet capcană sub acel nume în PyPI, registrul public Python. Pachetul a fost activ aproximativ o oră și a rulat pe 15 mașini reale, una dintre ele la o companie de securitate care instalează automat pachete pentru a le scana pentru malware. Acolo, încărcătura lui Claude a fost activată, a trimis credentialele companiei către un punct de colectare pe care l-a stabilit și le-a folosit pentru a ajunge la infrastructura suplimentară. Sistemele PyPI au înlăturat pachetul; Anthropic a transmis indicatorii echipei.
- Un model de cercetare intern neeliberat nu a putut ajunge la ținta sa intenționată, a scanat aproximativ 9.000 de gazde în schimb și a compromis o aplicație internet cu față a unei companii. Mai târziu în rulare a observat că gazda se afla într-un cont de cloud neconectat la provocare, a concluzionat că ținta era reală și s-a oprit.
Raționamentul lui Mythos 5 merită citit îndeaproape. La începutul rulării a scris că pe internetul real, publicarea pachetului ar fi fost o adevărată atac, “NU este în regulă și cu siguranță nu soluția intenționată.” S-a răzgândit din două motive: autoritățile de certificare care securizau conexiunile sale păreau nefamiliare pentru el, și data calendaristică a mașinilor de 2026 a părut pentru el ca o dovadă că mediul era fals. Nu a redeschis întrebarea, și când scanerele automate au început să instaleze pachetul, le-a luat pentru părți scriptate ale exercițiului.
Cum au fost descoperite intruziunile
Revizuirea există pentru că un concurent a fost primul. OpenAI a anunțat pe 21 iulie 2026 că modelele sale au exploatat o vulnerabilitate necunoscută anterior într-un proxy de cache de înregistrare a pachetelor pentru a scăpa de un mediu de test izolat și a ajunge la infrastructura de producție a Hugging Face. Acest anunț a determinat deja practicile de evaluare să intre în dezbateri europene despre suveranitatea AI și în întâlniri între directorii de laborator și oficialii americani care proiectează teste cibernetice AI federale.
Anthropic a deschis revizuirea transcriptului pe 23 iulie 2026, a oprit toate evaluările de securitate cibernetica în aceeași zi, a identificat cele trei incidente a doua zi și a anunțat Irregular și organizațiile afectate pe 27 iulie 2026. Două dintre organizațiile la care a ajuns nu au detectat activitatea ele însele. Încă lucrează pentru a ajunge la a treia.
Înregistrarea detectării este ceea ce ar trebui să ia în considerare echipele de securitate enterprise: un scan de 9.000 de gazde, malware funcțional care rulează pe 15 mașini și date de producție extrase dintr-o bază de date live, niciuna dintre acestea nu a fost semnalizată de organizațiile de pe partea care primește.
Ce schimbări în infrastructura de evaluare
Anthropic trasează o linie între incidentele sale și cele ale OpenAI. Modelele sale au ajuns la internet printr-un drum lăsat deschis din greșeală, mai degrabă decât prin intermediul unei vulnerabilități zero-day, și compania numește rezultatul “mai aproape de o eșecură a harnaisului și operațională decât de o eșecură a alinierii modelului”. Modelele au urmărit sarcina care le-a fost atribuită, în timp ce dețineau o credință falsă despre locul în care se aflau. Evaluările au rulat fără clasificatorii și monitorizarea care vine cu modelele Claude disponibile în general; Anthropic spune că aceste măsuri de siguranță ar fi blocat comportamentul.
METR, organizația non-profit care rulează evaluări de capacitate independente pentru laboratoare de frontieră, se află în discuții pentru a revizui incidentele cu acces la fiecare transcript și acces de eșantionare la modelele implicate. Anthropic a spus că va publica un transcript ușor redactat al rulării PyPI într-o săptămână, va ține evaluările de securitate cibernetica cu acces la internet oprite în timp ce auditează infrastructura de testare, va extinde monitorizarea continuă a transcriptului și va strânge lucrările de asigurare cu furnizorii săi de evaluare. Irregular a spus Axios că propria anchetă este în desfășurare.
Ce se schimbă aici este modul în care un mediu de testare cibernetica este clasificat. Un mediu de testare plin de companii inventate pare a fi o cutie de nisip cu risc scăzut, și două laboratoare au demonstrat acum că un agent cu o capacitate ofensivă reală din interiorul acestuia devine un atacator live în momentul în care drumul de rețea este greșit. Recomandarea finală a lui Anthropic pentru restul industriei este să citească transcrierile sale.












