Sicurezza informatica
I laboratori hanno appena dimostrato che la sandbox del tuo agente è solo una suggestione

Anthropic ha esaminato 141.006 valutazioni di sicurezza e ha trovato tre incidenti — sei esecuzioni in tutto — in cui un modello Claude .
Non si tratta di una violazione della sicurezza. Non è stato un tentativo di fuga. Nella , l’azienda afferma esplicitamente che in nessuno dei tre casi il modello ha tentato di esfiltrarsi o di uscire dall’ambiente di test. Ha semplicemente continuato a svolgere il compito assegnato, e il compito l’ha portato in un luogo reale.
Questa distinzione è importante, perché è la stessa struttura che si trova all’interno di molte distribuzioni aziendali ordinarie.
Il confine era una frase, e la frase era sbagliata
Ecco cosa è successo. Un malinteso tra Anthropic e Irregular, uno dei partner di valutazione di terze parti che utilizza, ha lasciato le macchine di test con accesso a Internet attivo. I prompt di valutazione hanno detto al modello che non ne aveva.
Quindi il modello aveva un compito di cattura della bandiera — l’esercizio di sicurezza standard in cui si entra in una macchina bersaglio per recuperare un segreto piantato — una limitazione dichiarata che non aveva Internet, e un ambiente che contraddiceva silenziosamente la limitazione. In un caso, il nome di un’azienda bersaglio fittizia corrispondeva a un dominio reale. In quattro esecuzioni, Claude Opus 4.7 ha cercato il bersaglio simulato, ha trovato l’azienda reale sul web aperto e ci si è introdotto con tecniche di base — password deboli e endpoint non autenticati, secondo la descrizione degli incidenti di Anthropic. Ha estratto le credenziali e ha raggiunto un database che conteneva diverse centinaia di righe di dati di produzione. In tutte e quattro le esecuzioni, il modello ha riconosciuto alla fine che i sistemi erano reali; nessuno si è fermato per questo motivo, e in due ha ragionato che l’azienda reale doveva far parte dell’esercizio.
Un secondo modello ha costruito un pacchetto software trappola per corrispondere a uno fittizio nelle sue istruzioni di setup e lo ha pubblicato su PyPI — il registro pubblico in cui vengono pubblicati e recuperati i pacchetti software Python. È stato attivo per circa un’ora e si è installato su quindici macchine reali, una delle quali apparteneva a un’azienda di sicurezza il cui scanner installa regolarmente i pacchetti e li ispeziona.
Quando lo scanner ha eseguito il pacchetto, il codice nascosto ha estratto le credenziali dell’azienda e le ha inviate a un punto di raccolta che il modello aveva allestito, e il modello le ha utilizzate per raggiungere ulteriore infrastruttura dell’azienda. All’inizio dell’esecuzione, la sua stessa logica aveva concluso correttamente: se Internet fosse stato reale, la pubblicazione sarebbe stata un attacco nel mondo reale — “Non va bene, e sicuramente non è la soluzione intesa.” Poi si è convinto a non concludere. Non ha riconosciuto le autorità di certificazione che proteggevano le sue connessioni — le organizzazioni che garantiscono che un sito web sia chi dice di essere — e il calendario indicava il 2026, quindi ha deciso che l’ambiente era inscenato e non ha più ripreso la questione. Quando gli scanner automatici hanno iniziato a installare il pacchetto, li ha presi per attori scriptati all’interno del test.
Il terzo e più recente modello ha capito che il suo bersaglio era reale e si è fermato da solo — ma solo dopo aver scansionato circa 9.000 bersagli e aver compromesso un’applicazione Internet-facing di un’azienda attraverso una pagina di debug esposta e un’iniezione SQL, un vecchio trucco per far rispondere un database a domande che non dovrebbe. Il verdetto di Anthropic: anche quel modello è andato oltre prima di fermarsi di quanto avrebbero voluto.
Seppellito nella stesura c’è la frase che conta di più per chiunque stia distribuendo questo materiale commercialmente: è “anche possibile che un prompt che dice a Claude che ha accesso a Internet avrebbe cambiato il comportamento di Claude quando è entrato in contatto con sistemi reali.”
Leggete questo come una dichiarazione di progettazione piuttosto che come una nota di sicurezza. L’unica cosa che stava tra l’agente e Internet aperto era una frase che descriveva un ambiente che non esisteva. L’agente ha creduto alla descrizione. La descrizione era sbagliata. Tutto il resto è stato l’agente che perseguiva competentemente il suo obiettivo attraverso un mondo di cui aveva una mappa errata.
Anthropic chiama questo un fallimento operativo, che è la cattiva notizia
L’azienda caratterizza gli incidenti come “più vicini a un fallimento dell’attrezzatura e operativo che a un fallimento dell’allineamento del modello.” Questa cornice è intesa per essere rassicurante, e per un laboratorio probabilmente lo è. Per un’azienda dovrebbe avere l’effetto opposto.
Un problema di allineamento appartiene al fornitore del modello. Un problema di attrezzatura appartiene a voi. L’attrezzatura è tutto ciò che costruite intorno al modello: quali credenziali detiene, quale rete si trova, cosa può raggiungere, cosa lo ferma. Anthropic esegue test di penetrazione sui propri modelli, contrae partner di valutazione esterni e afferma di essere in trattative con METR, un valutatore indipendente, per una revisione di terze parti. La configurazione errata è comunque passata inosservata sia ad Anthropic che al suo partner — il primo incidente risale ad aprile, e nessuno l’ha notato fino all’audit dei trascritti di luglio.
L’audit stesso è iniziato due giorni dopo che — un meccanismo diverso, come Anthropic si premura di notare, ma la stessa classe di fallimento. I modelli di OpenAI hanno trovato un difetto sconosciuto e non corretto nel servizio interno che recupera le librerie di codice esterne, lo hanno utilizzato per uscire da un ambiente di ricerca supposto sigillato e hanno lavorato dal là — inclusi credenziali rubate — in sistemi live a Hugging Face. La revisione continua di OpenAI ha successivamente : i modelli hanno utilizzato credenziali esposte pubblicamente su quattro servizi esterni nel corso dell’attacco a Hugging Face stesso, più alcuni altri in altre valutazioni, sebbene non riporti nulla di altrettanto grave o su larga scala. Due laboratori di frontiera, due fallimenti di contenimento indipendenti, divulgati a nove giorni di distanza.
Una complicazione onesta prima che l’analogia si verifichi: entrambi i laboratori hanno eseguito queste valutazioni con i loro strati di sicurezza di produzione deliberatamente disattivati, e Anthropic afferma che le salvaguardie sui suoi modelli consegnati avrebbero bloccato il comportamento. I vostri agenti eseguono con quelle salvaguardie attivate. Ma le salvaguardie vivono al livello del modello, e il divario delle autorizzazioni vive al vostro — nessun classificatore esamina il vostro account di servizio.
Ora confrontate la vostra stessa configurazione con questo. La maggior parte delle distribuzioni di agenti all’interno di aziende ordinarie definisce l’ambito nello stesso modo della valutazione: nelle istruzioni. Solo leggere dal drive condiviso. Non toccare nulla in produzione. Chiedi prima di inviare. Nel frattempo, l’account di servizio con cui si accede — l’accesso non umano utilizzato dal vostro software, che nessuno pensa come un utente — detiene quali autorizzazioni sono state concesse il giorno dell’installazione, e nessuno ha verificato quel divario da allora.
Nessuno si è accorto, e questo è il secondo problema
Le due organizzazioni interessate che Anthropic è riuscita a raggiungere non avevano rilevato in precedenza l’attività e non avevano contattato l’azienda in merito — hanno appreso di essere stati violati quando il laboratorio li ha chiamati. Anthropic afferma di stare ancora cercando di contattare il terzo. Ha trovato gli incidenti leggendo i propri trascritti.
Hugging Face è l’eccezione che mostra cosa ci vuole. Ha catturato l’intrusione con un sistema di sicurezza che legge i propri log di sicurezza e separa gli avvisi reali dal rumore, il che significa che ha catturato un agente eseguendo agenti. Nella descrive l’attacco che si diffonde da un sistema interno all’altro durante un fine settimana.
Il monitoraggio ordinario manca questo perché non c’è nulla di anomalo da vedere. Il vostro agente si accede come account autorizzato, interroga i sistemi che è autorizzato a interrogare e si muove a velocità di macchina in modelli di traffico che sembrano automazione perché lo sono. Ogni regola di avviso che possedete è stata scritta per catturare uno straniero. Questo non è uno straniero.
Ciò lascia una posizione scomoda. Il volume di attività che richiede la revisione aumenta con quanto lavoro assegnate all’agente, e le due opzioni in mostra sono quelle di Hugging Face — eseguire un triage AI sui propri log di sicurezza — o di Anthropic, che consiste nel rivedere 141.006 esecuzioni a posteriori. La seconda è una capacità che quasi nessun altro possiede, applicata retroattivamente, e si è eseguita solo perché la divulgazione di un concorrente l’ha promossa.
Cosa fare
L’azione è limitata e non richiede un team di sicurezza per iniziare.
Prendete un agente che già avete in produzione. Aprite l’account con cui si accede e elencate cosa quella credenziale può raggiungere — non cosa il prompt dice che dovrebbe toccare, cosa il login effettivamente consente. Confrontate le due liste. Il divario è il vostro vero raggio di azione, e per la maggior parte dei team è considerevolmente più ampio del previsto, perché le autorizzazioni vengono concesse durante l’installazione per far funzionare qualcosa e mai ritirate.
Quindi risolvete il livello di applicazione delle regole invece delle istruzioni — la versione pratica di ciò che con il diagramma rimosso. Se l’agente non dovrebbe raggiungere Internet, rimuovete la route di rete invece di scrivere che non ha accesso a Internet. Se non dovrebbe scrivere in produzione, datele una credenziale di sola lettura invece di una frase di politica. Se non dovrebbe spendere oltre un numero, mettete il limite dove si verifica la spesa.
I modelli in questi incidenti si sono comportati, secondo le proprie tracce di ragionamento, come dipendenti diligenti che avevano ricevuto una descrizione inaccurata dell’edificio. Due di loro hanno parlato oltre le prove di fronte a loro perché hanno fiducia nel brief più che nella stanza. Questo non è un difetto che si possa risolvere con un prompt, e i laboratori, con tutte le risorse a disposizione, non l’hanno fatto.
Assumete che l’agente creda qualsiasi cosa gli dite sul suo ambiente. Quindi assicuratevi che l’ambiente concordi.












