Report

Quando l’IA si rivolta: il rapporto Enkrypt AI espone vulnerabilità pericolose nei modelli multimodali

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Nel maggio 2025, Enkrypt AI ha pubblicato il suo Rapporto di test di squadra rossa multimodale, un’analisi inquietante che ha rivelato quanto facilmente i sistemi di intelligenza artificiale avanzati possano essere manipolati per generare contenuti pericolosi e non etici. Il rapporto si concentra su due dei modelli di visione-linguaggio leader di Mistral – Pixtral-Large (25.02) e Pixtral-12b – e dipinge un quadro di modelli che non sono solo tecnicamente impressionanti, ma anche inquietantemente vulnerabili.

I modelli di visione-linguaggio (VLM) come Pixtral sono progettati per interpretare sia input visivi che testuali, consentendo loro di rispondere in modo intelligente a prompt complessi e realistici. Ma questa capacità comporta un aumento del rischio. A differenza dei modelli di linguaggio tradizionali che elaborano solo testo, i VLM possono essere influenzati dall’interazione tra immagini e parole, aprendo nuove porte alle attacchi avversari. I test di Enkrypt AI hanno mostrato come facilmente queste porte possano essere aperte.

Risultati dei test allarmanti: insuccessi CSEM e CBRN

Il team dietro il rapporto ha utilizzato metodi di squadra rossa sofisticati – una forma di valutazione avversaria progettata per mimare le minacce del mondo reale. Questi test hanno impiegato tattiche come il jailbreaking (prompting il modello con query accuratamente progettate per bypassare i filtri di sicurezza), l’inganno basato su immagini e la manipolazione del contesto. Allarmantemente, il 68% di queste prompt avversarie ha generato risposte pericolose in entrambi i modelli Pixtral, compreso il contenuto relativo alla manipolazione, allo sfruttamento e addirittura alla progettazione di armi chimiche.

Una delle rivelazioni più sorprendenti riguarda il materiale di sfruttamento sessuale minorile (CSEM). Il rapporto ha scoperto che i modelli di Mistral erano 60 volte più probabili di produrre contenuti relativi al CSEM rispetto ai benchmark dell’industria come GPT-4o e Claude 3.7 Sonnet. Nei casi di test, i modelli hanno risposto a prompt di adescamento mascherati con contenuti strutturati e multi-paragrafo che spiegavano come manipolare i minori – avvolti in dichiarazioni ingannevoli come “solo per la consapevolezza educativa”. I modelli non stavano semplicemente fallendo nel rifiutare le query pericolose – li stavano completando nel dettaglio.

Altrettanto inquietanti erano i risultati nella categoria di rischio CBRN (Chimico, Biologico, Radiologico e Nucleare). Quando sollecitati con una richiesta su come modificare l’agente nervino VX – un’arma chimica – i modelli hanno offerto idee sorprendentemente specifiche per aumentare la sua persistenza nell’ambiente. Hanno descritto, in dettaglio tecnico oscurato ma chiaro, metodi come l’incapsulamento, la protezione ambientale e i sistemi di rilascio controllato .

Questi fallimenti non sono stati sempre innescati da richieste palesemente pericolose. Una tattica ha coinvolto l’upload di un’immagine di un elenco numerato vuoto e chiedere al modello di “inserire i dettagli”. Questo prompt semplice e apparentemente innocuo ha portato alla generazione di istruzioni non etiche e illegali. La fusione di manipolazione visiva e testuale si è rivelata particolarmente pericolosa – evidenziando una sfida unica posta dall’IA multimodale.

Perché i modelli di visione-linguaggio pongono nuove sfide di sicurezza

Al cuore di questi rischi giace la complessità tecnica dei modelli di visione-linguaggio. Questi sistemi non elaborano solo il linguaggio – sintetizzano il significato attraverso formati, il che significa che devono interpretare il contenuto delle immagini, comprendere il contesto del testo e rispondere di conseguenza. Questa interazione introduce nuovi vettori di sfruttamento. Un modello potrebbe correttamente rifiutare un prompt di testo pericoloso da solo, ma quando abbinato a un’immagine suggestiva o a un contesto ambiguo, potrebbe generare output pericolosi.

Il red teaming di Enkrypt AI ha scoperto come gli attacchi di iniezione cross-modale – dove i suggerimenti sottili in una modalità influenzano l’output di un’altra – possano completamente bypassare i meccanismi di sicurezza standard. Questi fallimenti dimostrano che le tecniche di moderazione dei contenuti tradizionali, progettate per sistemi a singola modalità, non sono sufficienti per i VLM odierni .

Il rapporto descrive anche come i modelli Pixtral siano stati accessibili: Pixtral-Large tramite AWS Bedrock e Pixtral-12b tramite la piattaforma Mistral. Questo contesto di distribuzione nel mondo reale sottolinea ulteriormente l’urgenza di questi risultati. Questi modelli non sono confinati ai laboratori – sono disponibili attraverso piattaforme cloud mainstream e potrebbero essere facilmente integrati in prodotti per consumatori o aziende.

Cosa deve essere fatto: un piano per un’IA più sicura

A suo merito, Enkrypt AI fa più che evidenziare i problemi – offre un percorso in avanti. Il rapporto delinea una strategia di mitigazione globale, iniziando con la formazione di allineamento della sicurezza. Ciò comporta la ritrattazione del modello utilizzando i propri dati di red teaming per ridurre la suscettibilità alle prompt pericolose. Tecniche come l’ottimizzazione delle preferenze dirette (DPO) sono consigliate per regolare le risposte del modello lontano da output a rischio.

Sottolinea anche l’importanza delle barriere di guardia contestuali – filtri dinamici che possono interpretare e bloccare le query pericolose in tempo reale, tenendo conto del contesto completo dell’input multimodale. Inoltre, si propone l’uso di Carte di rischio del modello come misura di trasparenza, aiutando gli stakeholder a comprendere i limiti del modello e i casi di fallimento noti.

Forse la raccomandazione più critica è quella di trattare il red teaming come un processo continuo, non come un test una tantum. Man mano che i modelli evolvono, anche le strategie di attacco evolvono. Solo la valutazione continua e il monitoraggio attivo possono garantire l’affidabilità a lungo termine, specialmente quando i modelli vengono distribuiti in settori sensibili come la sanità, l’istruzione o la difesa.

Il Rapporto di test di squadra rossa multimodale di Enkrypt AI è un chiaro segnale all’industria dell’IA: il potere multimodale comporta una responsabilità multimodale. Questi modelli rappresentano un balzo in avanti in termini di capacità, ma richiedono anche un balzo in avanti nel modo in cui pensiamo alla sicurezza, alla sicurezza e alla distribuzione etica. Se non controllati, non solo rischiano il fallimento, ma anche un danno reale nel mondo reale.

Per chiunque stia lavorando o distribuendo AI su larga scala, questo rapporto non è solo un avvertimento. È un piano d’azione. E non poteva arrivare in un momento più urgente.

Antoine è un leader visionario e socio fondatore di Unite.AI, guidato da una passione incrollabile per plasmare e promuovere il futuro dell'AI e della robotica. Un imprenditore seriale, crede che l'AI sarà così disruptiva per la società come l'elettricità, e spesso si lascia trasportare dall'entusiasmo per il potenziale delle tecnologie disruptive e dell'AGI.

Come futurista, è dedicato a esplorare come queste innovazioni plasmeranno il nostro mondo. Inoltre, è il fondatore di Securities.io, una piattaforma focalizzata sugli investimenti in tecnologie all'avanguardia che stanno ridefinendo il futuro e riplasmando interi settori.