Modelli e piattaforme di IA
Algoritmo TextFooler Inganna l’Intelligenza Artificiale NLP
Nonostante gli impressionanti progressi degli algoritmi e dei sistemi di elaborazione del linguaggio naturale negli ultimi anni, essi sono ancora vulnerabili a un tipo di sfruttamento noto come “esempio avversario”. Gli esempi avversari sono frasi attentamente progettate che possono causare un comportamento inaspettato e indesiderato in un sistema NLP. I programmi AI possono essere indotti a comportarsi male con questi esempi strani e, di conseguenza, i ricercatori di intelligenza artificiale stanno cercando di progettare modi per proteggersi dagli effetti degli esempi avversari.
Recentemente, un team di ricercatori dell’Università di Hong Kong e dell’Agenzia per la scienza, la tecnologia e la ricerca di Singapore ha collaborato per creare un algoritmo che dimostra il pericolo degli esempi avversari. Come riportato da Wired, l’algoritmo è stato chiamato TextFooler dal team di ricerca e funziona modificando sottilmente parti di una frase, influenzando così la possibile interpretazione della frase da parte di un classificatore NLP. Ad esempio, l’algoritmo ha convertito una frase in un’altra frase simile e la frase è stata inserita in un classificatore progettato per determinare se una recensione fosse negativa o positiva. La frase originale era:
“I personaggi, inseriti in situazioni artificialmente create, sono completamente estraniati dalla realtà.”
È stata convertita nella seguente frase:
“I personaggi, inseriti in situazioni progettate artificialmente, sono completamente estraniati dalla realtà.”
Queste modifiche sottili hanno indotto il classificatore di testo a classificare la recensione come positiva anziché negativa. Il team di ricerca ha testato lo stesso approccio (sostituendo alcune parole con sinonimi) su diversi dataset e algoritmi di classificazione del testo. Il team di ricerca riporta di essere riuscito a ridurre la precisione di classificazione di un algoritmo al 10%, rispetto al 90% iniziale. Ciò nonostante, le persone che leggono queste frasi le interpreterebbero come aventi lo stesso significato.
I risultati sono preoccupanti in un’era in cui gli algoritmi NLP e l’intelligenza artificiale sono utilizzati sempre più frequentemente e per compiti importanti come la valutazione delle richieste mediche o l’analisi dei documenti legali. Non è noto quanto pericolosi siano gli esempi avversari per gli algoritmi attualmente utilizzati. I team di ricerca di tutto il mondo stanno ancora cercando di capire quanto grande sia l’impatto che possono avere. Recentemente, un rapporto pubblicato dal gruppo di intelligenza artificiale umano-centrica di Stanford ha suggerito che gli esempi avversari potrebbero ingannare gli algoritmi di intelligenza artificiale e essere utilizzati per commettere frodi fiscali.
Esistono alcune limitazioni nello studio recente. Ad esempio, Sameer Singh, professore assistente di scienze informatiche alla UC Irvine, nota che il metodo avversario utilizzato era efficace, ma dipende dalla conoscenza dell’architettura dell’AI. L’AI deve essere sottoposta a ripetuti test fino a quando non viene trovato un gruppo di parole efficace e tali attacchi ripetuti potrebbero essere rilevati dai programmi di sicurezza. Singh e i suoi colleghi hanno condotto le loro ricerche sull’argomento e hanno scoperto che i sistemi avanzati come gli algoritmi OpenAI possono produrre testi razzisti e dannosi quando stimolati con determinate frasi di attivazione.
Gli esempi avversari sono anche un problema potenziale quando si ha a che fare con dati visivi come foto o video. Un esempio famoso coinvolge l’applicazione di trasformazioni digitali sottili a un’immagine di un gattino, inducendo il classificatore di immagini a interpretarlo come un monitor o un computer da scrivania. In un altro esempio, la ricerca condotta dal professore della UC Berkeley Dawn Song ha scoperto che gli esempi avversari possono essere utilizzati per modificare la percezione dei segnali stradali da parte dei sistemi di visione artificiale, il che potrebbe essere pericoloso per i veicoli autonomi.
La ricerca come quella condotta dal team di Hong Kong-Singapore potrebbe aiutare gli ingegneri di intelligenza artificiale a comprendere meglio quali sono le vulnerabilità degli algoritmi di intelligenza artificiale e potenzialmente progettare modi per proteggersi da queste vulnerabilità. Ad esempio, i classificatori ensemble possono essere utilizzati per ridurre la possibilità che un esempio avversario inganni il sistema di visione artificiale. Con questa tecnica, vengono utilizzati più classificatori e vengono apportate modifiche sottili all’immagine di input. La maggior parte dei classificatori sarà in grado di discernere aspetti del contenuto reale dell’immagine, che verranno poi aggregati insieme. Il risultato è che anche se alcuni classificatori vengono ingannati, la maggior parte di essi non lo sarà e l’immagine verrà classificata correttamente.












