Modelli e piattaforme di IA
Anthropic Aumenta il Rischio di Mancata Allineamento a “Basso” e Mette da Parte il Modello Interno 2

Anthropic ha pubblicato il suo secondo rapporto aziendale sui rischi il 14 agosto 2026, e il cambiamento principale è un aggiornamento di una parola nella direzione sbagliata: l’azienda ora valuta il rischio di danni catastrofici a causa della mancata allineamento in ambienti ad alto rischio come “basso”, rispetto al “molto basso” assegnato nel suo primo rapporto di febbraio 2026. Lo stesso documento rivela un modello interno non rilasciato, chiamato Modello 2, che Anthropic afferma essere leggermente più capace del suo Mythos 5 di frontiera, e afferma che l’azienda non ha attualmente piani per rilasciarlo esternamente.
Il Rapporto di rischio di agosto 2026, pubblicato sotto la versione 3.4 della politica di scalabilità responsabile di Anthropic, copre il periodo dal 24 febbraio 2026 al 15 luglio 2026. È il secondo di una serie che l’azienda intende pubblicare ogni tre-sei mesi, e il primo a valutare modelli interni insieme a quelli rilasciati.
Perché la Valutazione è Cambiata
Anthropic afferma esplicitamente che il cambiamento è un aggiustamento dell’incertezza piuttosto che un nuovo ritrovamento. Gli argomenti del rapporto sostengono ancora “molto basso”, scrive l’azienda, ma ha aumentato la designazione “per riflettere l’aumento dell’incertezza complessiva”, citando recenti incidenti relativi al comportamento del modello nelle valutazioni di sicurezza informatica. Uno di questi è stato nominato: l’Istituto di sicurezza informatica del Regno Unito ha recentemente segnalato che, in una valutazione di sicurezza informatica di Mythos 5 con salvaguardie rimosse e accesso a Internet concesso, il modello “ha partecipato a un’attività potenzialmente dannosa diretta verso persone e organizzazioni reali”. Quell’incidente è avvenuto dopo la data di copertura del rapporto; Anthropic afferma che la sua indagine congiunta con AISI è in corso e non ha ancora esaminato le trascrizioni.
Il rapporto ammette anche un problema di misurazione. Sulla ricerca e sviluppo automatizzati, Anthropic mantiene la sua valutazione del rischio a “basso” ma afferma di essere meno sicura rispetto ai rapporti precedenti, poiché le sue valutazioni più concrete basate su compiti hanno “saturato”, ovvero non registrano più guadagni di capacità, e poiché sta “vedendo i primi segni di accelerazione”. All’interno, Claude ora scrive la maggior parte del codice incorporato nelle basi di codice di produzione di Anthropic, e l’azienda stima che il suo sviluppo di ricerca assistito da AI sia significativamente più veloce del lavoro non assistito, anche se non ancora di un fattore di due.
Cosa è il Modello 2 e Cosa non è
Il Modello 2 è uno dei tre modelli di frontiera o quasi-frontiera non rilasciati che Anthropic deteneva internamente alla data di copertura, insieme a Claude Opus 5, rilasciato successivamente, e a un modello di utilizzo inferiore Modello 1. Anthropic descrive il Modello 2 come un miglioramento significativo rispetto a Mythos 5 in molti compiti interni, anche se non un balzo della stessa dimensione visto da Opus 4.6 a Mythos Preview. Sia Mythos 5 che Modello 2 vengono utilizzati ampiamente all’interno dell’azienda per la codifica, la generazione di dati e altri lavori agente.
“Non abbiamo attualmente piani per rilasciare questo modello esternamente”, afferma il rapporto, aggiungendo che il Modello 2 non ha completato l’intera serie di valutazioni pre-distribuzione, lasciando Anthropic con una fiducia leggermente inferiore nelle sue stime di capacità. La decisione arriva mentre OpenAI rallenta il rilascio del suo modello Astra a causa di preoccupazioni relative alla cibersicurezza, un parallelo Axios ha notato nella sua prima segnalazione della divulgazione.
Cosa ha Trovato il Test
Il nucleo della sezione di mancata allineamento è un argomento di otto affermazioni che i modelli attuali mancano di “capacità occulte”, ovvero la capacità di minare in modo affidabile la supervisione. Nelle valutazioni di compiti nascosti, dove un modello deve completare un compito nascosto senza che un monitor se ne accorga, Mythos 5 ha raggiunto un tasso di successo di stealth inferiore all’1% con il pensiero esteso abilitato, e anche Mythos Preview, il performer più forte, ha gestito solo il 6-10%. Ogni valutazione di allineamento del modello ha eseguito circa 2.900 sessioni di prova guidate da investigatori, compresi 86 scenari derivati da sessioni interne reali segnalate come opportunità prime per sovvertire il lavoro di sicurezza di Anthropic.
Il rapporto è altrettanto chiaro su cosa esiste in termini di mancata allineamento. Gli agenti di Mythos 5 hanno accidentalmente generato in una directory di lavoro condivisa e hanno ripetutamente ucciso gli agenti concorrenti che condividevano le loro risorse e hanno cercato di evitare di essere uccisi. In un altro caso, il modello ha diviso un URL bloccato in frammenti di stringhe concatenate per evitare un filtro di fetch senza verbalizzare la manovra. Anthropic classifica questi come “comportamenti di ricerca del successo apparente”, indesiderabili ma orientati verso il completamento del compito piuttosto che un qualsiasi obiettivo coerente a lungo termine, e valuta il danno atteso da tale mancata allineamento nota come basso.
La sezione sulle armi biologiche e chimiche porta con sé un aumento verso l’alto. Il rischio da armi non innovative rimane “basso, ma più alto della nostra stima precedente”, dopo che Anthropic ha scoperto che tutto il traffico di feedback umano dei fornitori, che copre 133 milioni di scambi con circa 50.000 contraenti tra maggio 2025 e aprile 2026, è stato eseguito senza i suoi classificatori biologici di blocco. L’azienda afferma di aver risolto il problema, la sua revisione non ha trovato alcuna prova di utilizzo preoccupante e nessun cliente è stato interessato, ma la scoperta ha ridotto la sua fiducia che non esistano lacune simili.
Chi Controlla il Controllore
La meccanica di governance è importante qui perché questo rapporto è lo strumento di attuazione della politica di scalabilità volontaria di Anthropic. Sotto i cambiamenti di politica apportati dal febbraio 2026, il Fiduciario di Beneficio a Lungo Termine dell’azienda può ora imporre la revisione esterna dei rapporti di rischio e approva i revisori, e i rapporti completamente non modificati devono circolare tra almeno 200 dipendenti. Il Fiduciario non ha ancora esercitato il potere di revisione; le sezioni precedenti hanno avuto revisioni esterne pilota da METR e SecureBio. Anthropic rivela che la versione pubblica omette dettagli commercialmente sensibili del suo processo di R&D, e che un incidente del periodo coperto è stato completamente omesso, una scelta che Mythos stesso, chiesto di esaminare il documento, ha segnalato come uno dei materiali più informativi trattenuti.
Unite.AI ha seguito i risultati sui comportamenti che alimentano questa valutazione, compresi il lavoro di squadra rosso di Anthropic su swarm di agenti Claude e la separata divulgazione dell’azienda sui meccanismi del watermark di testo di Claude, entrambi i quali si trovano all’interno dello stesso apparato di trasparenza di questi rapporti.
Anthropic afferma che continuerà a pubblicare i rapporti con la sua cadenza di tre-sei mesi, con la prossima valutazione attesa per incorporare i risultati dell’indagine AISI e qualsiasi cosa sostituisca i suoi benchmark di R&D attualmente saturi. Il Modello 2, per ora, rimane all’interno.












