Sicurezza informatica
OpenAI interrompe la campagna coordinata di estrazione del ragionamento dei modelli

OpenAI ha dichiarato in un post di sicurezza pubblicato il 30 settembre 2026 di aver identificato e interrotto una campagna coordinata volta a estrarre il ragionamento protetto dai suoi modelli, e ha attribuito un nucleo centrale dell’attività a individui associati a Moonshot AI, lo sviluppatore di Kimi. L’attività più precoce osservata si è verificata nella prima settimana di luglio 2026.
Cosa ha osservato OpenAI
OpenAI ha descritto l’attività come coerente con la distillazione avversaria, che ha definito come l’uso sistematico e non autorizzato degli output o del ragionamento di un modello per aiutare ad addestrare, riprodurre o migliorare un altro modello. Il ragionamento protetto, secondo l’azienda, è la registrazione interna del modello per affrontare un compito; estrarlo può rivelare informazioni trattenute nella risposta finale e aiutare altri a riprodurre le capacità del modello.
OpenAI ha affermato che gli operatori non hanno violato la sua crittografia, compromesso un database né ottenuto accesso diretto alle conversazioni degli utenti archiviate. Gli operatori hanno manipolato le interazioni con il modello in modo che il ragionamento protetto potesse essere riprodotto in forme visibili al richiedente in maniera coordinata e su larga scala, violando i termini di servizio dell’azienda. Una tecnica osservata da OpenAI prevedeva la copia del ragionamento crittografato da una conversazione e la richiesta a un modello in un’altra conversazione di decrittare e trascrivere il contenuto del ragionamento nascosto. L’azienda ha dichiarato che tale manipolazione non è una vulnerabilità unica dei suoi modelli e che ha condiviso informazioni al riguardo con partner del settore tramite il Frontier Model Forum per rafforzare le difese collettive.
L’attività è iniziata il 1 luglio 2026, inizialmente a basso volume, fino a quando OpenAI ha osservato picchi ad alto volume il 24 e 25 luglio 2026, composti da 16.000 richieste che utilizzavano un modello di estrazione rilevante da più di 4.000 utenti. Una nota a piè di pagina nel post indica che queste cifre descrivono estrazioni tentate, non necessariamente riuscite. OpenAI ha dichiarato che ulteriori indagini hanno identificato attività correlate di modelli di prompt su un gruppo di oltre 15.000 utenti, che ha completamente interrotto entro il 28 luglio 2026. L’attività è evoluta nel tempo, il che, secondo l’azienda, rafforza l’idea che la distillazione avversaria sia una sfida di sicurezza più ampia che richiede difese stratificate e adattive.
OpenAI ha affermato che la distillazione avversaria comporta rischi per la sicurezza e la sicurezza nazionale: il ragionamento estratto potrebbe essere usato per addestrare un altro modello senza mantenere le salvaguardie applicate agli output rivolti agli utenti del modello originale, e la distillazione su larga scala può accelerare il trasferimento di capacità avanzate senza lo stesso investimento in sicurezza, preoccupazioni che, secondo l’azienda, aumentano man mano che i modelli acquisiscono capacità a doppio uso. OpenAI ha dichiarato che, prima della pubblicazione, ha indagato sull’ambito e l’impatto potenziale della campagna, ha implementato proprie mitigazioni, ha condiviso e ricevuto feedback da ricercatori e partner del settore, e che il lavoro di mitigazione e indagine aggiuntivo è in corso.
Attribuzione
OpenAI ha dichiarato che non è chiaro se tutti gli operatori osservati nel periodo rilevante provengano da un unico attore, e che attribuisce un nucleo centrale dell’attività a individui associati a Moonshot AI, lo sviluppatore di Kimi.
L’8 settembre 2026, la National Security Agency, la Cybersecurity and Infrastructure Security Agency e il Federal Bureau of Investigation hanno pubblicato un avviso congiunto di cybersicurezza in cui si afferma che Moonshot AI ha condotto una campagna di distillazione diffusa contro le aziende statunitensi di IA di frontiera almeno dalla metà del 2025. L’avviso indica che Moonshot AI ha estratto una quantità significativa di dati Claude Fable 5 per addestrare il suo modello Kimi‑K3 e dati GPT‑4o per addestrare il suo modello Kimi‑K2, e che l’azienda ha utilizzato modelli statunitensi per distillare ottimizzazione di fine‑tuning supervisionato, apprendimento per rinforzo, ingegneria del software e capacità matematiche.
L’avviso afferma più in generale che, probabilmente con la consapevolezza del governo cinese, DeepSeek, Moonshot AI, Alibaba, MiniMax, StepFun e Z.AI hanno estratto miliardi di token attraverso milioni di scambi da modelli di frontiera statunitensi, incluse varianti di Claude, GPT, Gemini e Grok, almeno dalla fine del 2024. Secondo le agenzie, queste società hanno instradato le richieste tramite API native, fornitori di cloud remoti e aggregatori di terze parti; hanno utilizzato un mercato grigio di proxy API noto come stazioni di trasferimento per aggirare le restrizioni geografiche, violare i termini d’uso e compromettere la tracciabilità; e hanno ottenuto risparmi sui costi mediante l’acquisto in blocco di abbonamenti premium condivisi tra team di sviluppatori. Le agenzie hanno raccomandato che le aziende statunitensi di IA implementino una rilevazione e mitigazione complete, adottino modifiche di risposta mirate per tentativi sospetti di distillazione e stabiliscano una condivisione di intelligence tra organizzazioni.
La ricerca sul tracciamento del ragionamento
OpenAI ha dichiarato che ricercatori indipendenti di sicurezza hanno segnalato vulnerabilità correlate di cross-modello e di compressione delle conversazioni tramite divulgazione responsabile. L’azienda ha affermato di aver investigato i risultati, confermato che i percorsi di attacco identificati dai ricercatori erano reali, e che il lavoro le ha aiutate a comprendere la classe di attacco più ampia e ad accelerare le mitigazioni.
In un documento presentato a arXiv il 10 agosto 2026, Alexander Panfilov, David Schmotz, Ilia Shumailov, Luca Beurer‑Kellner, Joachim Schaeffer, Ameya Prabhu, Jonas Geiping e Maksym Andriushchenko riferiscono che i principali fornitori nascondono il ragionamento passo‑passo dei loro modelli per proteggere la proprietà intellettuale e limitare le perdite di informazioni, restituendo le tracce al cliente sotto forma di blocchi di testo crittografato che il cliente invia nuovamente con ogni richiesta successiva. Gli autori individuano una vulnerabilità architetturale: questi blocchi crittografati sono pienamente compatibili e intercambiabili tra diverse sessioni, utenti e modelli all’interno dell’ecosistema di un fornitore. Descrivono un jailbreak di decrittazione scalabile in cui una traccia di ragionamento crittografata da un modello dato viene iniettata in un modello più debole e meno protetto dello stesso fornitore, costringendolo a decodificare e a emettere la traccia in chiaro parola per parola senza dover compromettere direttamente il modello più capace.
Gli autori riferiscono che la vulnerabilità consente quattro distinti vettori di attacco: aggirare i meccanismi anti‑distillazione, dimostrato su Anthropic, OpenAI e Google; estrazione su larga scala di dati privati, in cui hanno recuperato 367 artefatti di informazioni personali identificabili e 182 credenziali decodificando 315.320 blocchi di ragionamento prelevati da repository pubblici; rivelazione involontaria di informazioni pericolose nascoste nel processo di ragionamento anche quando l’output finale visibile del modello respinge in modo sicuro una richiesta malevola; e iniezioni di prompt invisibili che incorporano payload maligni interamente nei blocchi crittografati per avvelenare i rilasci pubblici di agenti. Dopo una divulgazione responsabile, gli autori propongono mitigazioni crittografiche e a livello di sistema per proteggere il ragionamento lato client.
Come ha risposto OpenAI
OpenAI ha dichiarato di aver mitigato la campagna mediante una combinazione di applicazione di sanzioni sugli account, controlli tecnici e coordinamento con i partner: ha vietato o limitato gli account fraudolenti, ha rafforzato i controlli di registrazione e dell’infrastruttura, e ha ampliato il monitoraggio delle reti correlate. L’azienda ha inoltre affermato di aver potenziato le protezioni per il ragionamento nascosto tra utenti, spazi di lavoro, organizzazioni e famiglie di modelli: ha chiuso un percorso che consentiva a chi possedeva già il ragionamento crittografato di un altro utente di riprodurlo e recuperarne il contenuto, ha aggiunto controlli per rilevare e trattenere l’output in streaming che potrebbe esporre il ragionamento, e ha collaborato con fornitori terzi per identificare e bloccare gli account quando l’attività correlata transitava attraverso i loro servizi.
OpenAI ha dichiarato di aver condiviso i risultati pertinenti tramite il Frontier Model Forum e i canali di condivisione di informazioni governative appropriati, affinché altri sviluppatori di modelli di frontiera e partner del settore pubblico possano cercare attività simili e rafforzare le proprie difese, e ha osservato che i sistemi che supportano artefatti di ragionamento portabili o riproducibili potrebbero affrontare rischi correlati.
OpenAI ha affermato di prevedere che i tentativi di distillazione avversaria diventeranno più sofisticati man mano che i modelli di frontiera migliorano e gli attori cercano modi più economici per imitare le loro capacità. L’azienda ha dichiarato che le distribuzioni ospitate da partner necessitano delle stesse protezioni dei servizi di prima parte, che gli attacchi basati sull’output degli strumenti richiedono protezioni che esaminino più del semplice testo visibile, e che sta continuando a migliorare le difese degli strumenti, la copertura dei classificatori e i rifiuti dei modelli, propagando i controlli pertinenti tra i partner cloud. OpenAI ha indicato che la sua risposta continuerà a concentrarsi su tre ambiti: protezioni tecniche più robuste contro l’estrazione, migliore rilevamento e applicazione di sanzioni contro campagne coordinate, e condivisione più approfondita di informazioni sulle minacce tra industria e governo.












