Leader di pensiero
Il tuo strumento di sicurezza AI non ti sta proteggendo: ti sta solo facendo sentire meglio

Nel giugno 2025, Microsoft ha risolto la vulnerabilità CVE-2025-32711, conosciuta come EchoLeak: una vulnerabilità zero-click in Microsoft 365 Copilot, valutata 9,3 su CVSS. Unâe-mail appositamente creata, mai aperta dalla vittima, poteva far sÃŽ che il motore di recupero di Copilot esfiltrasse silenziosamente qualsiasi contesto sensibile a cui aveva accesso. Il dettaglio che dovrebbe preoccuparvi: il payload ÃĻ passato direttamente oltre XPIA, il classificatore di iniezione di prompt di Microsoft, che era presente, in esecuzione e funzionava esattamente come progettato.
Bruce Schneier ci ha dato il vocabolario per questo già nel 2009. Security theater, ha scritto, descrive misure che fanno sentire le persone piÃđ sicure senza fare nulla per migliorare la loro sicurezza. La sensazione e la realtà sono due cose diverse e si divergono.
Diciassette anni dopo, lâAI ha industrializzato la divergenza, su entrambi i lati dellâequazione. Gli strumenti di sicurezza alimentati da AI sono venduti sulla base di capacità che non possono dimostrare sotto misurazione, e gli strumenti di sicurezza per lâAI sono venduti come soluzioni a un problema che la loro stessa documentazione ammette essere irrisolto. Il ciclo di iper-inflazione di Gartner del 2025 ha collocato la gestione della fiducia, del rischio e della sicurezza dellâAI al picco delle aspettative gonfiate. Gli analisti vi stanno dicendo dove siamo. La domanda ÃĻ cosa fare al riguardo.
La lacuna tra il datasheet e la misurazione
Iniziate con ciÃē che accade quando qualcuno testa i controlli distribuiti invece di leggere il loro marketing.
Il Rapporto Blu di Picus del 2025 ha analizzato oltre 160 milioni di simulazioni di attacchi reali eseguite contro ambienti di produzione nel primo semestre del 2025. Picus vende la piattaforma di simulazione, quindi ponderate la fonte di conseguenza, ma i numeri sono difficili da ignorare. Lâefficacia della prevenzione ÃĻ stata del 62% in media, in calo rispetto al 69% dellâanno precedente. Nonostante la copertura dei log del 54%, solo il 14% degli attacchi simulati ha generato un allarme. Gli attacchi che utilizzavano credenziali valide sono riusciti nel 98% dei casi. E delle tentativi di esfiltrazione dei dati simulati, i controlli in atto hanno bloccato il 3%.
Il 3%. Questi sono ambienti con stack di sicurezza moderne, spesso con badge AI, e il test di esfiltrazione ÃĻ quello che si collega piÃđ direttamente a ciÃē che un attaccante vuole fare.
I punteggi dei benchmark che appaiono nei deck dei vendor meritano la stessa scetticismo. Quando i vendor hanno iniziato a sostenere di aver ottenuto voti perfetti nelle valutazioni MITRE ATT&CK, lâanalista di Forrester Allie Mellen ha pubblicato un promemoria pungente: le valutazioni non hanno vincitori o perdenti, e le pretese del 100% si basano tipicamente su configurazioni irrealistiche, sottorisultati selezionati o impostazioni di rilevamento che seppellirebbero un vero SOC nel rumore.
Nessuna di queste cose ÃĻ nuova, il che ÃĻ la parte deprimente. Nel 2019, i ricercatori di Skylight Cyber hanno smontato lâantivirus âpuro AIâ di Cylance appendendo stringhe dal videogioco Rocket League ai campioni di malware, capovolgendo il verdetto del classificatore nel 100% delle prime dieci famiglie di malware del giorno e nellâ83% di un set di campioni piÃđ ampio. La lezione, che i modelli di apprendimento automatico statici falliscono contro gli avversari che li studiano, ÃĻ stata pubblicata sette anni fa. La risposta del mercato ÃĻ stata quella di spedire piÃđ modelli di apprendimento automatico statici.
Il problema del guardrail ÃĻ peggiore
Se la rilevazione alimentata da AI vende piÃđ di quanto puÃē dimostrare, gli strumenti venduti per proteggere lâAI stesso sono in una posizione piÃđ strana: lâorganismo di standardizzazione che definisce la minaccia dice che la minaccia potrebbe non essere risolvibile.
La iniezione di prompt si trova al primo posto nella OWASP Top 10 per le applicazioni LLM, e la guida pratica di OWASP ÃĻ insolitamente franca: dato la natura stocastica dei modelli, ânon ÃĻ chiaro se esistano metodi di prevenzione infallibili per lâiniezione di promptâ. Il fine-tuning e il RAG, aggiunge, non mitigano completamente il problema. Questo ÃĻ il problema che il mercato del prompt-shield esiste per risolvere, descritto come possibilmente irrisolvibile dallâorganizzazione che lo ha catalogato.
I lavori empirici sostengono lo scetticismo. I ricercatori dellâUniversità di Lancaster e di Mindgard hanno testato sei sistemi di guardrail di produzione, tra cui Azure Prompt Shield di Microsoft e Prompt Guard di Meta, e hanno raggiunto fino al 100% di successo di evasione utilizzando tecniche di iniezione di caratteri e perturbazione avversariale, mantenendo gli attacchi sottostanti funzionali. HiddenLayer ÃĻ andata oltre, pubblicando un modello di prompt âPolicy Puppetryâ trasferibile che afferma di bypassare ogni modello principale sul mercato. Quello ÃĻ un lavoro di ricerca del fornitore e non ÃĻ stato revisionato tra pari, quindi trattate il âtuttiâ con cura, ma canali indipendenti hanno riprodotto le rivendicazioni di base.
La testimonianza piÃđ credibile non ha nulla da vendere. LâIstituto per la sicurezza dellâAI del Regno Unito, valutando cinque LLM principali, ha riferito che âtutti i modelli erano altamente vulnerabili ai nostri attacchi di baseâ, con ogni modello che ha obbedito almeno una volta in cinque tentativi per quasi ogni domanda dannosa quando sono stati applicati attacchi interni. Attacchi di base. Non tradecraft di uno stato-nazione. Un organismo di valutazione del governo, notando cortesemente che il filtro di input dellâimperatore non ha abiti.
La copertura di Unite.AI ha catalogato le classi di vulnerabilità e le tecniche di iniezione da anni. Nessuna di queste cose ÃĻ segreta. Non compare solo sulle datasheet.
La parte pericolosa ÃĻ la sensazione
Ecco dove il titolo di questo articolo smette di essere retorico. Se questi strumenti semplicemente non consegnano, la perdita sarebbe solo di budget. La ricerca suggerisce qualcosa di peggio: la fiducia che generano degrada attivamente il comportamento.
I ricercatori sulla sicurezza lo chiamano compensazione del rischio, o lâeffetto Peltzman: le persone protette corrono piÃđ rischi. I guidatori con cinture di sicurezza guidano piÃđ veloci. E le organizzazioni con dashboard di sicurezza AI, si scopre, smettono di fare le cose noiose.
I numeri si allineano in modo scomodo. Lâindice di prontezza alla sicurezza di Cisco del 2025, che ha intervistato 8.000 leader della sicurezza, ha scoperto che lâ86% delle organizzazioni aveva subito un incidente di sicurezza legato allâAI nei precedenti dodici mesi, mentre solo il 10% considerava lâAI la cosa piÃđ difficile da proteggere, e il 60% ammetteva di non avere visibilità su come i dipendenti utilizzano lâAI generativa in assoluto. Incidenti quasi universali; preoccupazione, un errore di arrotondamento.
Il rapporto di IBM del 2025 sui costi di una violazione dei dati completa il quadro. Delle organizzazioni che hanno subito violazioni di modelli o applicazioni AI, il 97% mancava di controlli di accesso AI adeguati. Una su cinque violazioni risaliva allâAI ombra, aggiungendo circa 670.000 dollari al costo medio di una violazione, e il 63% delle organizzazioni violate non aveva alcuna politica di governance dellâAI. Leggete questi numeri insieme e emerge un modello: i fallimenti sono noiosi. In assenza di fondamentali, in organizzazioni che si sentivano coperte.
La dashboard non ha funzionato male. Ha consegnato il suo prodotto reale, che era la fiducia.
ComâÃĻ la versione onesta
Nessuna di queste cose sostiene che gli strumenti di sicurezza dellâAI siano inutili, e la miglior prova contraria merita spazio. I Classificatori costituzionali di Anthropic hanno superato piÃđ di 3.000 ore di red-teaming da parte di 183 ricercatori senza un jailbreak universale, riducendo il successo del jailbreak dallâ86% sul modello non difeso al 4,4%, al costo di un aumento di 0,38 punti nelle rinunce e di circa il 24% di sovraccarico computazionale. Poi Anthropic ha lanciato una sfida pubblica, e su 339 partecipanti, quattro hanno superato ogni livello e uno ha trovato un jailbreak universale funzionante comunque.
Questo ÃĻ il profilo onesto dellâintero settore in un solo risultato: un guardrail ben costruito ha aumentato enormemente il costo dellâattaccante, ha portato un onere misurabile e ÃĻ comunque caduto di fronte a un essere umano sufficientemente determinato. Se dovessi comprimere questo articolo in un principio di acquisto, ÃĻ questo: un controllo venduto come un aumento del costo con modalità di fallimento pubblicate ÃĻ degno di essere valutato; un controllo venduto come un problema risolto sta vendendo la sensazione.
Controllo o coperta di conforto: tre domande
Puoi separare lâuno dallâaltro senza un budget di ricerca. Tre domande, poste a ogni strumento di sicurezza AI che possiedi o stai per acquistare.
Qual ÃĻ il suo tasso di bypass misurato nel mio ambiente? Non il benchmark del fornitore. Il tuo. La convalida continua e gli esercizi di purple team esistono proprio perchÃĐ, come mostrano i dati di Picus, i controlli distribuiti scivolano silenziosamente verso il fallimento. Un numero che non hai misurato ÃĻ un numero che stai accettando per fede.
Cosa succede quando fallisce? Non se. La guida pratica di OWASP punta nella stessa direzione di ogni incidente sopra: accesso con privilegi minimi per i modelli, cancelli di approvazione umana per azioni sensibili e segmentazione che assume che il filtro finirà per far passare qualcosa. EchoLeak era sopravvivibile per le organizzazioni il cui Copilot semplicemente non poteva raggiungere nulla di valore.
La rivendicazione del fornitore ÃĻ un fatto o unâipotesi? Anche i fornitori concedono piÃđ di quanto facciano i loro datasheet. La stessa indagine di Vectra su 2.000 professionisti del SOC, ricerca del fornitore, ha scoperto che i team sono in grado di gestire solo il 38% degli allarmi generati dai loro strumenti, con il 60% che afferma che i fornitori vendono strumenti che creano rumore invece di chiarezza, e la metà che definisce la loro strumentazione piÃđ di ostacolo che di aiuto. Quando i clienti dellâindustria riferiscono questo, âfidati del datasheetâ smette di essere una strategia.
Il modello sopravvive alla patch
EchoLeak ÃĻ stato risolto in un Patch Tuesday. Il modello che ha dimostrato, un guardrail di produzione che filtra con fiducia la porta dâingresso mentre lâattacco arriva dalla feritoia, non ÃĻ stato, e il record di ricerca sopra dice che non lo sarà presto.
La distinzione di Schneier ha diciassette anni e non ÃĻ mai stata piÃđ costosa da ignorare. La sensazione di sicurezza ÃĻ un prodotto, e lâera dellâAI la vende in livelli di abbonamento. La realtà della sicurezza ÃĻ una misurazione, e nessuno puÃē venderla a te, perchÃĐ devi andare a prenderla.












