Sicurezza informatica
Il tuo strumento di sicurezza AI non ti sta proteggendo: ti sta solo facendo sentire meglio

Nel giugno 2025, Microsoft (MSFT ) ha risolto la vulnerabilità CVE-2025-32711, conosciuta come EchoLeak: una vulnerabilità zero-click in Microsoft 365 Copilot, valutata 9,3 su CVSS. Un’e-mail appositamente creata, mai aperta dalla vittima, poteva far sì che il motore di recupero di Copilot esfiltrasse silenziosamente qualsiasi contesto sensibile a cui aveva accesso. Il dettaglio che dovrebbe preoccuparvi: il payload è passato direttamente oltre XPIA, il classificatore di iniezione di prompt di Microsoft, che era presente, in esecuzione e funzionava esattamente come progettato.
Bruce Schneier ci ha dato il vocabolario per questo già nel 2009. Security theater, ha scritto, descrive misure che fanno sentire le persone più sicure senza fare nulla per migliorare la loro sicurezza. La sensazione e la realtà sono due cose diverse e si divergono.
Diciassette anni dopo, l’AI ha industrializzato la divergenza, su entrambi i lati dell’equazione. Gli strumenti di sicurezza alimentati da AI sono venduti sulla base di capacità che non possono dimostrare sotto misurazione, e gli strumenti di sicurezza per l’AI sono venduti come soluzioni a un problema che la loro stessa documentazione ammette essere irrisolto. Il ciclo di iper-inflazione di Gartner del 2025 ha collocato la gestione della fiducia, del rischio e della sicurezza dell’AI al picco delle aspettative gonfiate. Gli analisti vi stanno dicendo dove siamo. La domanda è cosa fare al riguardo.
La lacuna tra il datasheet e la misurazione
Iniziate con ciò che accade quando qualcuno testa i controlli distribuiti invece di leggere il loro marketing.
Il Rapporto Blu di Picus del 2025 ha analizzato oltre 160 milioni di simulazioni di attacchi reali eseguite contro ambienti di produzione nel primo semestre del 2025. Picus vende la piattaforma di simulazione, quindi ponderate la fonte di conseguenza, ma i numeri sono difficili da ignorare. L’efficacia della prevenzione è stata del 62% in media, in calo rispetto al 69% dell’anno precedente. Nonostante la copertura dei log del 54%, solo il 14% degli attacchi simulati ha generato un allarme. Gli attacchi che utilizzavano credenziali valide sono riusciti nel 98% dei casi. E delle tentativi di esfiltrazione dei dati simulati, i controlli in atto hanno bloccato il 3%.
Il 3%. Questi sono ambienti con stack di sicurezza moderne, spesso con badge AI, e il test di esfiltrazione è quello che si collega più direttamente a ciò che un attaccante vuole fare.
I punteggi dei benchmark che appaiono nei deck dei vendor meritano la stessa scetticismo. Quando i vendor hanno iniziato a sostenere di aver ottenuto voti perfetti nelle valutazioni MITRE ATT&CK, l’analista di Forrester Allie Mellen ha pubblicato un promemoria pungente: le valutazioni non hanno vincitori o perdenti, e le pretese del 100% si basano tipicamente su configurazioni irrealistiche, sottorisultati selezionati o impostazioni di rilevamento che seppellirebbero un vero SOC nel rumore.
Nessuna di queste cose è nuova, il che è la parte deprimente. Nel 2019, i ricercatori di Skylight Cyber hanno smontato l’antivirus “puro AI” di Cylance appendendo stringhe dal videogioco Rocket League ai campioni di malware, capovolgendo il verdetto del classificatore nel 100% delle prime dieci famiglie di malware del giorno e nell’83% di un set di campioni più ampio. La lezione, che i modelli di apprendimento automatico statici falliscono contro gli avversari che li studiano, è stata pubblicata sette anni fa. La risposta del mercato è stata quella di spedire più modelli di apprendimento automatico statici.
Il problema del guardrail è peggiore
Se la rilevazione alimentata da AI vende più di quanto può dimostrare, gli strumenti venduti per proteggere l’AI stesso sono in una posizione più strana: l’organismo di standardizzazione che definisce la minaccia dice che la minaccia potrebbe non essere risolvibile.
La iniezione di prompt si trova al primo posto nella OWASP Top 10 per le applicazioni LLM, e la guida pratica di OWASP è insolitamente franca: dato la natura stocastica dei modelli, “non è chiaro se esistano metodi di prevenzione infallibili per l’iniezione di prompt”. Il fine-tuning e il RAG, aggiunge, non mitigano completamente il problema. Questo è il problema che il mercato del prompt-shield esiste per risolvere, descritto come possibilmente irrisolvibile dall’organizzazione che lo ha catalogato.
I lavori empirici sostengono lo scetticismo. I ricercatori dell’Università di Lancaster e di Mindgard hanno testato sei sistemi di guardrail di produzione, tra cui Azure Prompt Shield di Microsoft e Prompt Guard di Meta, e hanno raggiunto fino al 100% di successo di evasione utilizzando tecniche di iniezione di caratteri e perturbazione avversariale, mantenendo gli attacchi sottostanti funzionali. HiddenLayer è andata oltre, pubblicando un modello di prompt “Policy Puppetry” trasferibile che afferma di bypassare ogni modello principale sul mercato. Quello è un lavoro di ricerca del fornitore e non è stato revisionato tra pari, quindi trattate il “tutti” con cura, ma canali indipendenti hanno riprodotto le rivendicazioni di base.
La testimonianza più credibile non ha nulla da vendere. L’Istituto per la sicurezza dell’AI del Regno Unito, valutando cinque LLM principali, ha riferito che “tutti i modelli erano altamente vulnerabili ai nostri attacchi di base”, con ogni modello che ha obbedito almeno una volta in cinque tentativi per quasi ogni domanda dannosa quando sono stati applicati attacchi interni. Attacchi di base. Non tradecraft di uno stato-nazione. Un organismo di valutazione del governo, notando cortesemente che il filtro di input dell’imperatore non ha abiti.
La copertura di Unite.AI ha catalogato le classi di vulnerabilità e le tecniche di iniezione da anni. Nessuna di queste cose è segreta. Non compare solo sulle datasheet.
La parte pericolosa è la sensazione
Ecco dove il titolo di questo articolo smette di essere retorico. Se questi strumenti semplicemente non consegnano, la perdita sarebbe solo di budget. La ricerca suggerisce qualcosa di peggio: la fiducia che generano degrada attivamente il comportamento.
I ricercatori sulla sicurezza lo chiamano compensazione del rischio, o l’effetto Peltzman: le persone protette corrono più rischi. I guidatori con cinture di sicurezza guidano più veloci. E le organizzazioni con dashboard di sicurezza AI, si scopre, smettono di fare le cose noiose.
I numeri si allineano in modo scomodo. L’indice di prontezza alla sicurezza di Cisco del 2025, che ha intervistato 8.000 leader della sicurezza, ha scoperto che l’86% delle organizzazioni aveva subito un incidente di sicurezza legato all’AI nei precedenti dodici mesi, mentre solo il 10% considerava l’AI la cosa più difficile da proteggere, e il 60% ammetteva di non avere visibilità su come i dipendenti utilizzano l’AI generativa in assoluto. Incidenti quasi universali; preoccupazione, un errore di arrotondamento.
Il rapporto di IBM del 2025 sui costi di una violazione dei dati completa il quadro. Delle organizzazioni che hanno subito violazioni di modelli o applicazioni AI, il 97% mancava di controlli di accesso AI adeguati. Una su cinque violazioni risaliva all’AI ombra, aggiungendo circa 670.000 dollari al costo medio di una violazione, e il 63% delle organizzazioni violate non aveva alcuna politica di governance dell’AI. Leggete questi numeri insieme e emerge un modello: i fallimenti sono noiosi. In assenza di fondamentali, in organizzazioni che si sentivano coperte.
La dashboard non ha funzionato male. Ha consegnato il suo prodotto reale, che era la fiducia.
Com’è la versione onesta
Nessuna di queste cose sostiene che gli strumenti di sicurezza dell’AI siano inutili, e la miglior prova contraria merita spazio. I Classificatori costituzionali di Anthropic hanno superato più di 3.000 ore di red-teaming da parte di 183 ricercatori senza un jailbreak universale, riducendo il successo del jailbreak dall’86% sul modello non difeso al 4,4%, al costo di un aumento di 0,38 punti nelle rinunce e di circa il 24% di sovraccarico computazionale. Poi Anthropic ha lanciato una sfida pubblica, e su 339 partecipanti, quattro hanno superato ogni livello e uno ha trovato un jailbreak universale funzionante comunque.
Questo è il profilo onesto dell’intero settore in un solo risultato: un guardrail ben costruito ha aumentato enormemente il costo dell’attaccante, ha portato un onere misurabile e è comunque caduto di fronte a un essere umano sufficientemente determinato. Se dovessi comprimere questo articolo in un principio di acquisto, è questo: un controllo venduto come un aumento del costo con modalità di fallimento pubblicate è degno di essere valutato; un controllo venduto come un problema risolto sta vendendo la sensazione.
Controllo o coperta di conforto: tre domande
Puoi separare l’uno dall’altro senza un budget di ricerca. Tre domande, poste a ogni strumento di sicurezza AI che possiedi o stai per acquistare.
Qual è il suo tasso di bypass misurato nel mio ambiente? Non il benchmark del fornitore. Il tuo. La convalida continua e gli esercizi di purple team esistono proprio perché, come mostrano i dati di Picus, i controlli distribuiti scivolano silenziosamente verso il fallimento. Un numero che non hai misurato è un numero che stai accettando per fede.
Cosa succede quando fallisce? Non se. La guida pratica di OWASP punta nella stessa direzione di ogni incidente sopra: accesso con privilegi minimi per i modelli, cancelli di approvazione umana per azioni sensibili e segmentazione che assume che il filtro finirà per far passare qualcosa. EchoLeak era sopravvivibile per le organizzazioni il cui Copilot semplicemente non poteva raggiungere nulla di valore.
La rivendicazione del fornitore è un fatto o un’ipotesi? Anche i fornitori concedono più di quanto facciano i loro datasheet. La stessa indagine di Vectra su 2.000 professionisti del SOC, ricerca del fornitore, ha scoperto che i team sono in grado di gestire solo il 38% degli allarmi generati dai loro strumenti, con il 60% che afferma che i fornitori vendono strumenti che creano rumore invece di chiarezza, e la metà che definisce la loro strumentazione più di ostacolo che di aiuto. Quando i clienti dell’industria riferiscono questo, “fidati del datasheet” smette di essere una strategia.
Il modello sopravvive alla patch
EchoLeak è stato risolto in un Patch Tuesday. Il modello che ha dimostrato, un guardrail di produzione che filtra con fiducia la porta d’ingresso mentre l’attacco arriva dalla feritoia, non è stato, e il record di ricerca sopra dice che non lo sarà presto.
La distinzione di Schneier ha diciassette anni e non è mai stata più costosa da ignorare. La sensazione di sicurezza è un prodotto, e l’era dell’AI la vende in livelli di abbonamento. La realtà della sicurezza è una misurazione, e nessuno può venderla a te, perché devi andare a prenderla.












