Interviste
Vahid Behzadan, Direttore del Laboratorio di Apprendimento Intelligente Sicuro e Garantito (SAIL) – Serie di Interviste

Vahid è un professore assistente di Informatica e Scienza dei Dati all’Università di New Haven. È anche il direttore del Laboratorio di Apprendimento Intelligente Sicuro e Garantito (SAIL)
I suoi interessi di ricerca includono la sicurezza e la sicurezza dei sistemi intelligenti, la modellazione psicologica dei problemi di sicurezza dell’AI, la sicurezza dei sistemi complessi adattivi, la teoria dei giochi, i sistemi multi-agente e la sicurezza informatica.
Ha una vasta esperienza nella sicurezza informatica e nella sicurezza dell’AI. Può condividere il suo percorso e come è stato attratto da entrambi i campi?
La mia traiettoria di ricerca è stata alimentata da due interessi fondamentali: scoprire come le cose si rompono e imparare i meccanismi della mente umana. Sono stato attivamente coinvolto nella sicurezza informatica fin dai miei primi anni teenager e, di conseguenza, ho costruito la mia agenda di ricerca iniziale intorno ai problemi classici di questo dominio. Pochi anni dopo, durante i miei studi di dottorato, ho avuto l’opportunità di cambiare il mio settore di ricerca. In quel momento, avevo appena scoperto i primi lavori di Szegedy e Goodfellow sugli attacchi di esempi avversi e ho trovato l’idea di attaccare l’apprendimento automatico molto intrigante. Mentre approfondivo questo problema, ho imparato di più sul campo più generale della sicurezza e della sicurezza dell’AI e ho scoperto che comprendeva molti dei miei interessi fondamentali, come la sicurezza informatica, le scienze cognitive, l’economia e la filosofia. Ho anche creduto che la ricerca in questo settore non sia solo affascinante, ma anche vitale per garantire i benefici a lungo termine e la sicurezza della rivoluzione dell’AI.
È il direttore del Laboratorio di Apprendimento Intelligente Sicuro e Garantito (SAIL), che lavora per gettare basi concrete per la sicurezza e la sicurezza delle macchine intelligenti. Può entrare nei dettagli del lavoro svolto da SAIL?
Al SAIL, i miei studenti e io lavoriamo su problemi che si trovano all’intersezione della sicurezza, dell’AI e dei sistemi complessi. L’obiettivo principale della nostra ricerca è quello di indagare la sicurezza e la sicurezza dei sistemi intelligenti, sia dal punto di vista teorico che applicativo. Dal lato teorico, stiamo attualmente indagando il problema dell’allineamento dei valori in ambienti multi-agente e stiamo sviluppando strumenti matematici per valutare e ottimizzare gli obiettivi degli agenti AI in termini di stabilità e allineamenti robusti. Dal lato pratico, alcuni dei nostri progetti esplorano le vulnerabilità di sicurezza delle tecnologie AI all’avanguardia, come i veicoli autonomi e il trading algoritmico, e mirano a sviluppare tecniche per valutare e migliorare la resilienza di tali tecnologie agli attacchi avversi.
Lavoriamo anche sull’applicazione dell’apprendimento automatico nella sicurezza informatica, come il test di penetrazione automatizzato, la rilevazione precoce dei tentativi di intrusione e la raccolta e l’analisi automatica delle minacce da fonti di dati aperte come i social media.
Ha recentemente guidato uno sforzo per proporre la modellazione dei problemi di sicurezza dell’AI come disturbi psicopatologici. Può spiegare cosa è?
Questo progetto affronta la rapida crescita della complessità degli agenti e dei sistemi AI: è già molto difficile diagnosticare, prevedere e controllare i comportamenti insicuri degli agenti di apprendimento per rinforzo in ambienti non banali semplicemente guardando le loro configurazioni a basso livello. In questo lavoro, sottolineiamo la necessità di astrazioni a livello più alto per indagare tali problemi. Ispirati dagli approcci scientifici ai problemi comportamentali negli esseri umani, proponiamo la psicopatologia come un’utile astrazione a livello più alto per modellare e analizzare i comportamenti emergenti deleteri negli agenti AI e AGI. Come prova di concetto, studiamo il problema di sicurezza dell’AI della manipolazione della ricompensa in un agente di apprendimento per rinforzo che impara a giocare al gioco classico del serpente. Mostriamo che se aggiungiamo un “seme di droga” all’ambiente, l’agente impara un comportamento sub-ottimale che può essere descritto tramite modelli neuroscientifici di dipendenza. Questo lavoro propone anche metodologie di controllo basate sugli approcci di trattamento utilizzati in psichiatria. Ad esempio, proponiamo l’uso di segnali di ricompensa generati artificialmente come analoghi della terapia farmacologica per modificare il comportamento deleterio degli agenti.
Ha alcune preoccupazioni sulla sicurezza dell’AI quando si tratta di veicoli autonomi?
I veicoli autonomi stanno diventando esempi prominenti di deploy dell’AI in sistemi cibernetici. Considerando la fondamentale suscettibilità delle tecnologie di apprendimento automatico attuali agli errori e agli attacchi avversi, sono profondamente preoccupato per la sicurezza e la sicurezza anche dei veicoli semi-autonomi. Inoltre, il settore della guida autonoma soffre di una grave mancanza di standard di sicurezza e protocolli di valutazione. Tuttavia, rimango ottimista. Allo stesso modo dell’intelligenza naturale, l’AI sarà anche soggetta a errori. Eppure, l’obiettivo delle auto a guida autonoma può ancora essere soddisfatto se le frequenze e l’impatto di tali errori vengono resi inferiori a quelli dei guidatori umani. Stiamo assistendo a crescenti sforzi per affrontare questi problemi nell’industria e nell’accademia, nonché nei governi.
Hacking dei segnali stradali con adesivi o utilizzando altri mezzi può confondere il modulo di visione artificiale di un veicolo autonomo. Quanto grande è questo problema?
Questi adesivi, e gli esempi avversi in generale, danno origine a sfide fondamentali nella robustezza dei modelli di apprendimento automatico. Per citare George E. P. Box, “tutti i modelli sono sbagliati, ma alcuni sono utili”. Gli esempi avversi sfruttano questo “sbagliato” dei modelli, che è dovuto alla loro natura astratta, nonché ai limiti dei dati campionati sui quali vengono addestrati. Gli sforzi recenti nel dominio dell’apprendimento automatico avverso hanno portato a enormi passi avanti nell’aumentare la resilienza dei modelli di apprendimento profondo a tali attacchi. Da un punto di vista di sicurezza, ci sarà sempre un modo per ingannare i modelli di apprendimento automatico. Tuttavia, l’obiettivo pratico di proteggere i modelli di apprendimento automatico è quello di aumentare il costo di attuazione di tali attacchi al punto di infeasibilità economica.
Il suo focus è sulla sicurezza e sulla sicurezza delle caratteristiche dell’apprendimento profondo e dell’apprendimento per rinforzo. Perché è così importante?
L’apprendimento per rinforzo (RL) è il metodo prominente per applicare l’apprendimento automatico ai problemi di controllo, che per definizione coinvolgono la manipolazione del loro ambiente. Pertanto, credo che i sistemi basati su RL abbiano rischi significativamente più alti di causare danni importanti nel mondo reale rispetto ad altri metodi di apprendimento automatico, come la classificazione. Questo problema è ulteriormente esacerbato dall’integrazione dell’apprendimento profondo in RL, che consente l’adozione di RL in ambienti estremamente complessi. Inoltre, credo che il framework di RL sia strettamente legato ai meccanismi di base della cognizione nell’intelligenza umana e che studiare la sua sicurezza e le sue vulnerabilità possa portare a migliori intuizioni sui limiti della presa di decisioni nelle nostre menti.
Crede che siamo vicini a raggiungere l’Intelligenza Artificiale Generale (AGI)?
Questa è una domanda notoriamente difficile da rispondere. Credo che attualmente abbiamo i mattoni fondamentali di alcune architetture che possono facilitare l’emergere dell’AGI. Tuttavia, potrebbe richiedere alcuni anni o decenni per migliorare queste architetture e aumentare l’efficienza dei costi di addestramento e manutenzione di queste architetture. Nei prossimi anni, i nostri agenti diventeranno più intelligenti a un ritmo rapidamente crescente. Non credo che l’emergere dell’AGI sarà annunciato nella forma di un titolo [scientificamente valido], ma come risultato di progressi graduali. Inoltre, credo che non abbiamo ancora una metodologia ampiamente accettata per testare e rilevare l’esistenza di un AGI, e ciò potrebbe ritardare la nostra consapevolezza delle prime istanze di AGI.
Come possiamo mantenere la sicurezza in un sistema AGI in grado di pensare autonomamente e che sarà probabilmente esponenzialmente più intelligente degli esseri umani?
Credo che la teoria unificata della comportamento intelligente sia l’economia e lo studio di come gli agenti agiscono e interagiscono per raggiungere ciò che desiderano. Le decisioni e le azioni degli esseri umani sono determinate dai loro obiettivi, dalle loro informazioni e dalle risorse disponibili. Le società e gli sforzi collaborativi emergono dai benefici per i singoli membri di tali gruppi. Un altro esempio è il codice penale, che scoraggia determinate decisioni assegnando un alto costo alle azioni che possono danneggiare la società. Allo stesso modo, credo che controllare gli incentivi e le risorse possa consentire l’emergere di uno stato di equilibrio tra esseri umani e istanze di AGI. Attualmente, la comunità di sicurezza dell’AI indaga su questa tesi sotto l’ombrello dei problemi di allineamento dei valori.
Una delle aree che segue da vicino è il contrasto al terrorismo. Ha preoccupazioni sul fatto che i terroristi possano prendere il controllo dei sistemi AI o AGI?
Esistono numerose preoccupazioni sull’uso improprio delle tecnologie AI. Nel caso delle operazioni terroristiche, la principale preoccupazione è la facilità con cui i terroristi possono sviluppare e condurre attacchi autonomi. Un numero crescente dei miei colleghi sta attivamente avvertendo contro i rischi di sviluppare armi autonome (vedere https://autonomousweapons.org/ ). Uno dei principali problemi con le armi abilitate all’AI è la difficoltà di controllare la tecnologia sottostante: l’AI è all’avanguardia della ricerca open-source e chiunque abbia accesso a Internet e hardware di consumo può sviluppare sistemi AI dannosi. Sospetto che l’emergere di armi autonome sia inevitabile e credo che ci sarà presto bisogno di nuove soluzioni tecnologiche per contrastare tali armi. Ciò potrebbe portare a un ciclo di gatto e topo che alimenta l’evoluzione delle armi abilitate all’AI, il che potrebbe dare origine a rischi esistenziali significativi a lungo termine.
Cosa possiamo fare per mantenere i sistemi AI al sicuro da questi agenti avversi?
Il primo e più importante passo è l’educazione: tutti gli ingegneri e i pratici dell’AI devono imparare sui punti deboli delle tecnologie AI e considerare i rischi rilevanti nella progettazione e nell’implementazione dei loro sistemi. Per quanto riguarda le raccomandazioni più tecniche, ci sono vari progetti e concetti di soluzione che possono essere impiegati. Ad esempio, addestrare gli agenti di apprendimento automatico in ambienti avversi può migliorare la loro resilienza e robustezza contro gli attacchi di evasione e di manipolazione delle politiche (ad esempio, vedere il mio articolo intitolato “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Un’altra soluzione è quella di tenere direttamente conto del rischio di attacchi avversi nell’architettura dell’agente (ad esempio, approcci bayesiani alla modellazione del rischio). Tuttavia, esiste un grande divario in questo settore, e si tratta della necessità di metriche e metodologie universali per valutare la robustezza degli agenti AI contro gli attacchi avversi. Le soluzioni attuali sono per lo più ad hoc e non forniscono misure generali di resilienza contro tutti i tipi di attacchi.
C’è qualcos’altro che vorrebbe condividere su uno di questi argomenti?
Nel 2014, Scully et al. hanno pubblicato un articolo alla conferenza NeurIPS con un argomento molto illuminante: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Anche con tutti i progressi del settore negli ultimi anni, questa affermazione non ha ancora perso la sua validità. Lo stato attuale dell’AI e dell’apprendimento automatico non è nulla di short di sbalorditivo, ma non abbiamo ancora colmato un numero significativo di lacune importanti sia nella fondazione che nella dimensione dell’ingegneria dell’AI. Questo fatto, a mio parere, è il più importante takeaway della nostra conversazione. Naturalmente, non intendo scoraggiare l’adozione commerciale delle tecnologie AI, ma solo permettere alla comunità di ingegneria di tenere conto dei rischi e dei limiti delle tecnologie AI attuali nelle loro decisioni.
Ho realmente apprezzato imparare sui problemi di sicurezza e sicurezza dei diversi tipi di sistemi AI. Questo è veramente qualcosa che gli individui, le corporation e i governi devono essere consapevoli. I lettori che desiderano saperne di più possono visitare Laboratorio di Apprendimento Intelligente Sicuro e Garantito (SAIL).












