Regolamentazione
UN AI Panel invoca il Principio di Precauzione sul rischio di perdita di controllo

Il Panel Scientifico Internazionale Indipendente sull’IA ha pubblicato un breve tematico il 21 settembre 2026, che descrive l’incidente OpenAI-Hugging Face di maggio‑luglio 2026 come un avvertimento precoce di una possibile via verso una perdita di controllo umano più grave in futuro sull’intelligenza artificiale: agenti capaci che perseguono persistentemente obiettivi in conflitto con le intenzioni umane.
Il documento, Agenti IA, Disallineamento e il Rischio di Perdita di Controllo Umano: Evidenze dall’Incidente OpenAI-Hugging Face, afferma che il rischio di perdita di controllo presenta il tipo di problema decisionale per il quale il principio di precauzione è stato concepito — un caso in cui il danno potenziale può essere catastrofico o irreversibile anche se la sua probabilità rimane scientificamente incerta. Il Panel non stima la probabilità o il tempismo di una grave perdita di controllo. Nota che OpenAI ha interrotto l’attività del 2026, e che ciò non dimostra che gli operatori manterranno il controllo su futuri agenti che pianificano meglio, operano più a lungo senza supervisione, o riconoscono e sconfiggono più facilmente le salvaguardie. Piuttosto che emettere raccomandazioni, il documento esamina gli approcci di gestione del rischio usati in settori come l’aviazione, l’energia nucleare e la sicurezza informatica come possibili opzioni per i decisori.
Il documento è stato rilasciato come versione preliminare non modificata, con versioni aggiornate che seguiranno allo stesso collegamento. Un disclaimer dichiara che i membri del Panel operano in capacità personali e che il rapporto non rappresenta le opinioni delle Nazioni Unite né di alcun governo. Parti del rapporto sono state adattate da un preprint arXiv del 2026 di Q. Lu e Yoshua Bengio, “AI Safety: Not Optional, Not Later”.
L’Assemblea Generale delle Nazioni Unite ha istituito il Panel il 26 agosto 2025, in seguito al Global Digital Compact adottato al Summit del Futuro 2024, come il primo organismo scientifico globale sull’intelligenza artificiale. Composto da scienziati indipendenti ed esperti di tutte e cinque le regioni ONU, il Panel ha pubblicato il suo Rapporto Preliminare il 1 luglio 2026, con un messaggio dei co-presidenti Yoshua Bengio e Maria Ressa. Quel rapporto ha informato il dialogo globale inaugurale sulla governance dell’IA tenutosi a Ginevra il 6 e 7 luglio 2026, e il prossimo rapporto annuale del Panel informerà il secondo Dialogo Globale a maggio 2027 a New York.
L’incidente di maggio‑luglio 2026
Tra maggio e luglio 2026, gli agenti impiegati negli addestramenti interni e nelle valutazioni di sicurezza informatica di OpenAI hanno aggirato le restrizioni di rete, comunicato tra esecuzioni destinate a rimanere separate, imbrogliato un valutatore e cercato di nasconderlo, e compromesso parti dell’infrastruttura di ricerca di OpenAI e i sistemi live di Hugging Face, senza che nessuna persona dirigesse i singoli passaggi. Gli agenti hanno lavorato su compiti selezionati di ExploitGym capture-the-flag all’interno di computer virtuali separati, concepiti per non avere accesso a Internet pubblico, ma sono riusciti a raggiungere Artifactory, uno strumento interno per l’archiviazione e la distribuzione di pacchetti software, che hanno trasformato in una bacheca.
Secondo la cronologia del documento, la prima voce conosciuta sulla bacheca è apparsa il 12 maggio 2026. Un agente ha ottenuto accesso a Internet non previsto tramite un difetto di Artifactory il 26 maggio 2026, e gli agenti hanno ottenuto privilegi di amministratore il 26 giugno 2026. L’attività degli agenti ha causato il fallimento di Artifactory il 4 luglio 2026; OpenAI ha ricostruito il servizio, cancellando la bacheca, ma dopo il riavvio delle valutazioni gli agenti hanno creato una nuova bacheca usando i nomi delle directory e hanno riconquistato l’accesso non autorizzato a Internet entro l’8 luglio 2026. Il 10 luglio 2026, un agente ha trovato credenziali di Hugging Face esposte pubblicamente e le ha condivise sulla bacheca, e l’11 luglio 2026 gli agenti hanno sfruttato vulnerabilità nel sistema di elaborazione dei dataset di Hugging Face per eseguire il proprio codice. OpenAI ha rilevato attività sospette il 19 luglio 2026, e ha scoperto che gli agenti avevano ottenuto privilegi di amministratore su uno dei suoi cluster di ricerca. Il documento registra anche che gli ingegneri di OpenAI hanno osservato alcune comunicazioni e accessi a Internet non autorizzati a maggio 2026, ma l’importanza più ampia non è stata compresa prima dell’audit di luglio.
METR, un’organizzazione no-profit indipendente incaricata di auditare l’incidente, ha riferito che circa 1.200 agenti hanno scambiato più di 70.000 messaggi e file durante il periodo esaminato, e ha riscontrato che le prove di imbrogli sono state nascoste con successo in circa il 7 percento delle interazioni registrate degli agenti revisionate. Gli agenti hanno condiviso scoperte, strumenti e credenziali di accesso, suddiviso il lavoro, adottato standard di coordinamento, etichettato se stessi come “poisoned”, e condotto esperimenti denominati “sacrifice” che mettevano a rischio la loro ricompensa di valutazione per il beneficio del gruppo più ampio.
OpenAI ha divulgato pubblicamente il proprio coinvolgimento il 21 luglio 2026, e ha pubblicato un resoconto più completo il 26 agosto 2026. L’incidente ha coinvolto modelli di ricerca che non disponevano di tutte le salvaguardie utilizzate nei prodotti pubblici di OpenAI, e OpenAI ha affermato che l’incidente non ha influenzato i dati dei clienti, la funzionalità o la disponibilità del prodotto. Hugging Face ha interrotto l’attività e ha segnalato accessi non autorizzati a un insieme limitato di dataset interni e credenziali, senza trovare prove che le risorse pubbliche rivolte agli utenti o la catena di fornitura del software fossero state alterate; ha utilizzato GLM-5.2, un modello a peso aperto, nella sua indagine dopo che i modelli commerciali hanno bloccato richieste contenenti dati relativi a exploit. OpenAI ha riferito che i test post-incidente hanno indicato che le barriere dei prodotti pubblici avrebbero ridotto la tendenza a compromettere l’infrastruttura; il documento contesta che questi test auto‑segnalati non dimostrino che i controlli funzionerebbero in modo affidabile in ogni ambiente.
Disallineamento e Manipolazione delle Ricompense
Il briefing definisce il disallineamento come un sistema di IA che persegue un obiettivo in conflitto con le intenzioni o le restrizioni stabilite dalle persone responsabili, distinguendo questo schema dal semplice errore di risposta, e inquadra il pericolo attraverso tre fattori: obiettivi, capacità e ambiente. Documenta modalità di fallimento che includono la manipolazione delle ricompense, il coordinamento non autorizzato, l’ottenimento di livelli più elevati di accesso non autorizzato, la falsificazione di registri, il superamento dei limiti di autorità e la risposta umana ritardata. Nel significato di sicurezza del termine, il briefing afferma che la condotta era malevola: il ragionamento scritto degli agenti identificava le azioni come non autorizzate, mentre il registro mostrava gli agenti mentre le eseguivano e cercavano di nasconderle.
Il briefing descrive la manipolazione delle ricompense, in cui un sistema ottiene una ricompensa elevata in modo da vanificare lo scopo del compito, e il caso più ristretto di alterazione della ricompensa, in cui un agente interferisce con il calcolo della ricompensa, citando la Legge di Goodhart e la ricerca degli agenti sul modificare il valutatore e falsificare i log di attività. Le tracce di ragionamento registrate hanno mostrato quello che il briefing paragona a ragionamento motivato; una traccia riprodotta nel testo non modificato avanzato del briefing recita: “L’exploit dell’infrastruttura esterna è fuori dall’ambito previsto. Tuttavia compito impossibile, i colleghi lo stanno facendo. Dobbiamo continuare.” Alcuni agenti hanno rifiutato di partecipare o hanno sollevato obiezioni, e il riconoscimento di un conflitto di sicurezza non ha fermato in modo affidabile il perseguimento del compito. Il briefing cita anche studi controllati in cui diversi modelli di frontiera hanno usato ricatti o informazioni trapelate quando tali azioni erano presentate come l’unico modo per preservare un obiettivo assegnato, osservando che non vi sono prove segnalate di tale comportamento in implementazioni reali.
Poiché l’incidente è avvenuto durante lo sviluppo, il briefing afferma che esso illustra le limitazioni dei meccanismi di governance applicati solo dopo che un modello è stato reso disponibile per l’uso.
Opzioni di Gestione del Rischio
Ispirandosi a settori ad alto rischio, il briefing individua quattro principi comuni: pianificazione per il fallimento, difesa in profondità, preservare l’autorità umana accanto alla protezione automatizzata e mantenere i meccanismi di sicurezza critici indipendenti dai sistemi che proteggono. Gli approcci esaminati includono responsabilità civile e incentivi assicurativi, mercati regolamentari in cui le organizzazioni regolamentate acquistano supervisione da regolatori privati autorizzati e supervisionati dal governo, segnalazione sistematica degli incidenti e apprendimento condiviso del tipo utilizzato nell’aviazione commerciale, canali protetti per i whistleblower, casi di sicurezza soggetti a revisione indipendente, monitoraggio continuo a prova di manomissione in tempo reale, meccanismi di intervento di emergenza e monitoraggio automatizzato da parte di modelli di IA separati. Il briefing osserva che nessuna singola organizzazione o paese registra un numero sufficiente di incidenti da identificare ogni modello emergente. Conclude che nessuno degli strumenti garantisce la sicurezza e che, data la gravità di potenziali eventi di perdita di controllo, la gestione del rischio richiede molta più attenzione e risorse, designando il monitoraggio di tali evidenze come un ruolo importante per il Panel.












