Interviste
Bo Li, CEO, Virtue AI – Intervista

Bo Li, CEO di Virtue AI, è un noto ricercatore e imprenditore specializzato nella sicurezza e nella protezione dei sistemi di intelligenza artificiale. Guida Virtue AI mentre lavora anche come professore all’Università dell’Illinois a Urbana-Champaign, dove la sua ricerca si concentra sulla sicurezza del machine learning, sull’AI affidabile e sulla robustezza avversariale. La sua carriera abbraccia sia l’ambito accademico che quello industriale, consentendole di tradurre la ricerca avanzata sull’AI in applicazioni pratiche che aiutano le organizzazioni a costruire tecnologie di intelligenza artificiale più sicure e resilienti.
Virtue AI è un’azienda che si concentra sulla protezione e sulla governance dei sistemi di intelligenza artificiale utilizzati in ambienti aziendali. La sua piattaforma fornisce funzionalità come il red-teaming automatizzato, le guardrails in tempo reale e il monitoraggio continuo per identificare vulnerabilità come l’iniezione di prompt, le allucinazioni e la perdita di dati. Integrando direttamente nei flussi di lavoro di sviluppo e distribuzione dell’AI, l’azienda aiuta le organizzazioni a utilizzare in modo sicuro i modelli linguistici di grandi dimensioni e le applicazioni alimentate dall’AI, mantenendo allo stesso tempo elevate norme di sicurezza e governance.
Cosa ti ha motivato a passare da una carriera puramente accademica a fondare e guidare Virtue AI, e quale problema ritenevi che l’industria non stesse affrontando a livello aziendale?
Gli strumenti di sicurezza tradizionali sono stati progettati per applicazioni prevedibili con percorsi fissi. Non sono stati progettati per sistemi che ragionano, si adattano e agiscono in modo autonomo. Io e i miei co-fondatori abbiamo visto un divario tra ciò che la ricerca fondamentale sulla sicurezza dell’AI aveva prodotto e ciò che le aziende avevano effettivamente a disposizione. La ricerca esisteva. La realtà della produzione non lo era. È questo che abbiamo cercato di cambiare.
Virtue AI si concentra sulla sicurezza, sulla protezione e sulla conformità per i modelli linguistici di grandi dimensioni e gli agenti autonomi. Quale di queste aree ritiene che le aziende sottovalutino maggiormente oggi?
Le aziende comprendono tutte queste aree in qualche misura, soprattutto la sicurezza, ma c’è ancora una grande lacuna.
Le aziende hanno iniziato a prendere seriamente la sicurezza del modello, almeno a livello superficiale. Ma gli agenti sono un problema diverso. Stanno ricevendo l’accesso alle parti più sensibili dell’infrastruttura aziendale: esecuzione di codice, chiamate API, navigazione web e decisioni a catena che toccano dati, finanze e operazioni. La maggior parte dei team di sicurezza non è preparata a ragionare su quel tipo di sistema. Gli strumenti che hanno non sono stati costruiti per questo.
Il rischio non è teorico. Senza una sicurezza costruita specificamente per i sistemi agente, piccoli fallimenti possono accumularsi rapidamente. Una chiamata di strumento inaspettata, un’istruzione ambigua, un prompt che supera le guardrails – qualsiasi cosa può escalation in azioni non autorizzate o esposizione dei dati prima che qualcuno si accorga che qualcosa è andato storto.
Il red-teaming continuo è centrale nell’approccio di Virtue AI. Quali tipi di fallimenti o rischi tendono a emergere solo una volta che i sistemi sono live in produzione?
La maggior parte di quelli gravi.
In un ambiente controllato, si testa il modello e gli agenti. In produzione, si testa il sistema – e queste sono cose diverse. Una volta che un modello è connesso a strumenti, pipeline di recupero, input utente e altri agenti, lo spazio di comportamento si espande in modi che il test pre-distribuzione non cattura. Un agente “configurato in modo sicuro” può agire in modo molto diverso quando è connesso a database reali, nuovi server MCP o altri agenti. Il sistema diventa non deterministico. Inizia a prendere decisioni basate sul contesto che non esisteva durante la valutazione.
È allora che si trovano i fallimenti che veramente contano.
Come pensi di misurare la “sicurezza dell’AI” nella pratica, soprattutto quando i sistemi evolvono attraverso il fine-tuning, il recupero e l’utilizzo degli strumenti?
Nella pratica, la sicurezza dell’AI non può essere misurata attraverso un singolo benchmark statico perché i moderni sistemi di intelligenza artificiale continuano a evolversi attraverso il fine-tuning, l’aumento del recupero e le interazioni con gli strumenti o gli agenti. Invece, la sicurezza deve essere valutata come una proprietà a livello di sistema in tutta la durata di vita di un’applicazione di intelligenza artificiale. Ciò include test di stress sui modelli e sugli agenti con attacchi di red-teaming diversificati, monitoraggio dei comportamenti in tempo reale come prompt, chiamate di strumenti e azioni, e valutazione degli esiti rispetto a politiche di rischio definite (ad esempio, abuso, allucinazione, perdita di dati o azioni non autorizzate).
Ad esempio, il nostro articolo vincitore del premio (Miglior articolo all’NSA e NeurIPS), DecodingTrust, ha fornito una valutazione completa della sicurezza e della sicurezza per i modelli fondamentali. La nostra piattaforma DecodingTrust-Agent ha costruito un simulatore di agenti realistico che ospita ambienti diversificati con agenti di red-teaming nativi per eseguire test di red-teaming dinamici, adattivi e continui.
È importante notare che la misurazione della sicurezza deve essere continua e adattiva, poiché gli aggiornamenti dei prompt, delle fonti di recupero o degli strumenti possono introdurre nuove vulnerabilità. Nella pratica, ciò significa combinare il red-teaming automatizzato, le guardrails in tempo reale e l’osservabilità per misurare non solo le risposte del modello ma anche la sicurezza del sistema di intelligenza artificiale operante nel mondo reale.
Qual è l’area che si è rivelata più difficile da tradurre in difese del mondo reale, considerando la tua esperienza di ricerca su robustezza, privacy e attacchi avversari?
Tradurre la ricerca sulla robustezza, sulla privacy e sugli attacchi avversari in difese del mondo reale è in realtà molto fattibile. In effetti, molte delle direzioni di ricerca nel mio gruppo sono direttamente ispirate dalle sfide di sicurezza pratiche osservate nei sistemi di intelligenza artificiale distribuiti. La vera difficoltà non sta nel costruire le difese, ma nel fornire garanzie di sicurezza affidabili in ambienti dinamici e reali.
Nella ricerca accademica, il nostro gruppo ha fatto progressi significativi come la robustezza certificata e le garanzie di privacy, ma questi risultati tipicamente si basano su assunzioni che potrebbero non essere completamente valide in sistemi di produzione complessi. Le applicazioni moderne di intelligenza artificiale continuano a evolversi attraverso nuovi dati, il fine-tuning, le pipeline di recupero e le integrazioni con gli strumenti, il che può introdurre nuove vulnerabilità nel tempo.
Di conseguenza, la sicurezza efficace dell’AI non può affidarsi a una protezione una tantum – richiede un red-teaming continuo, la scoperta dei rischi e delle guardrails adattive che evolvono insieme al sistema. Questo è esattamente la filosofia dietro Virtue AI: combinare la nostra lunga esperienza di ricerca sulla sicurezza dell’AI con il red-teaming automatizzato su larga scala e la protezione in tempo reale per continuare a identificare i rischi emergenti e aggiornare le difese, consentendo una sicurezza pratica e scalabile per i sistemi di intelligenza artificiale del mondo reale.
Cosa rende la sicurezza degli agenti di intelligenza artificiale autonomi fondamentalmente diversa dalla sicurezza del software tradizionale o anche dei chatbot?
Gli agenti non sono programmi statici. Non seguono percorsi prevedibili e non rimangono all’interno del perimetro che si è disegnato per loro al momento della distribuzione.
La sicurezza tradizionale presume percorsi di esecuzione fissi, API stabili e comportamento deterministico. Gli agenti autonomi violano tutte queste assunzioni. Ragionano su cosa fare dopo, scelgono gli strumenti in base al contesto e producono effetti su più sistemi in una singola esecuzione.
Non puoi semplicemente esaminare un prompt, consolidare un modello o monitorare una singola chiamata API e considerare il lavoro fatto. Devi assicurarti dell’agente come sistema completo – la sua ragione, l’utilizzo degli strumenti, l’ambiente e ciò che accade a valle.
Questo è il punto centrale che i controlli non possono risolvere. Non sono stati progettati per questo.
Dove gli strumenti di sicurezza esistenti falliscono quando gli agenti possono agire su molti sistemi, strumenti e fonti di dati contemporaneamente?
Ti lasciano ciechi su come l’agente abbia effettivamente operato a livello di sistema.
La maggior parte degli strumenti è stata costruita per applicazioni con perimetri chiari e comportamento stabile. Possono dirti come appariva una singola chiamata API. Non possono dirti come un agente abbia ragionato il suo percorso attraverso cinque chiamate di strumenti per produrre un esito che nessuno aveva inteso.
Il divario di visibilità è il problema. Se non puoi vedere la catena completa di azioni e decisioni, non puoi governarla e non puoi auditarla dopo il fatto.
Come le guardrails in tempo reale riducono il rischio rispetto al monitoraggio o alla registrazione soltanto?
La registrazione ti dice cosa è andato storto dopo che il danno è stato fatto. È utile per la forensic e la conformità, ma non ferma nulla.
Con gli agenti autonomi, il ritardo tra azione e rilevamento può essere davvero costoso. Un agente che ha già eseguito una chiamata API cattiva o ha esfiltrato dati non ha aspettato che la tua pipeline di registrazione si aggiornasse.
Le guardrails in tempo reale intercettano l’azione prima dell’esecuzione. Se un agente tenta qualcosa di non conforme alle politiche, viene bloccato o segnalato prima che venga eseguito, non dopo.
La combinazione è importante anche. La prevenzione in tempo reale più un punto di applicazione coerente delle politiche in tutte le interazioni tra agente e strumento è un profilo di rischio diverso rispetto al monitoraggio passivo dei singoli componenti.
Virtue AI è stata fondata da ricercatori profondamente tecnici. Come questo influenza le decisioni sui prodotti rispetto a startup di intelligenza artificiale più commercialmente guidate?
La sicurezza e la governance dell’AI sono fondamentalmente un problema tecnico profondo. I sistemi che stiamo proteggendo – come i modelli linguistici di grandi dimensioni, i modelli multimodali e i sistemi agente – sono essi stessi costruiti su ricerche avanzate. Senza una forte competenza fondamentale nell’AI, è quasi impossibile progettare soluzioni di sicurezza efficaci per loro.
In molti casi, la sfida più grande nella sicurezza dell’AI è quando un algoritmo di red-teaming avanzato identifica vulnerabilità degli agenti di intelligenza artificiale in un articolo di ricerca – come si traduce quell’intuizione in una difesa di produzione che possa proteggere in modo affidabile i sistemi reali su larga scala? A Virtue AI, colmare questo divario tra ricerca e distribuzione è centrale per il nostro modo di operare e per ciò di cui abbiamo esperienza.
Poiché Virtue AI è stata fondata da ricercatori che hanno trascorso decenni lavorando sulla robustezza dell’AI, sull’apprendimento avversario e sull’AI affidabile, i nostri team di ricerca e ingegneria lavorano sugli stessi problemi contemporaneamente. I nostri ricercatori studiano continuamente le nuove architetture dei modelli, i nuovi flussi di lavoro degli agenti e le tecniche di attacco in evoluzione, mentre i nostri team di ingegneria integrano direttamente queste intuizioni nei sistemi di produzione.
Quando identifichiamo una nuova vulnerabilità – come un nuovo modello di iniezione di prompt o una strategia di manipolazione dell’agente – può essere rapidamente tradotta in nuovi modelli di rilevamento, guardrails o strategie di red-teaming. Ciò accade continuamente, non solo su una roadmap di prodotto trimestrale.
Di conseguenza, i nostri prodotti rimangono all’avanguardia e pronti per l’uso aziendale, aiutando le organizzazioni a proteggere i loro sistemi di intelligenza artificiale mentre li costruiscono e li distribuiscono. Molti dei nostri clienti ci dicono che questo approccio basato sulla ricerca è esattamente ciò che consente loro di muoversi più velocemente mantenendo la sicurezza e la conformità.
Al contrario, le squadre guidate esclusivamente dal commercio spesso ottimizzano ciò che i clienti chiedono oggi, il che può portare a funzionalità incrementali ma potrebbe ritardare il panorama delle minacce in evoluzione dei sistemi di intelligenza artificiale. Nella sicurezza dell’AI, le minacce evolvono rapidamente quanto la tecnologia stessa. Una fondazione basata sulla ricerca ci consente di anticipare nuovi rischi prima e di costruire difese prima che diventino problemi diffusi.
Qual è il malinteso più comune che le aziende hanno sulla sicurezza dell’AI quando si rivolgono per la prima volta a Virtue AI?
Uno dei malintesi più comuni che le aziende hanno quando si rivolgono per la prima volta a Virtue AI è che la sicurezza dell’AI possa essere affrontata semplicemente applicando strumenti di sicurezza tradizionali o filtri di moderazione del contenuto di base.
In realtà, i sistemi di intelligenza artificiale introducono nuove superfici di attacco, come l’iniezione di prompt, le evasioni, l’abuso guidato dalle allucinazioni, la perdita di dati attraverso i sistemi di recupero e la manipolazione degli agenti attraverso strumenti o API esterne. Questi rischi emergono dal comportamento e dalla ragione del modello stesso, non solo dall’infrastruttura circostante.
Di conseguenza, proteggere i sistemi di intelligenza artificiale richiede meccanismi di sicurezza che comprendono gli input, gli output e i processi decisionali del modello e degli agenti in tutta la durata di vita di un’applicazione di intelligenza artificiale, il che richiede capacità di ricerca fondamentale sull’AI.
È per questo che enfatizziamo la sicurezza nativa dell’AI: combinando il red-teaming automatizzato per scoprire le vulnerabilità, le guardrails in tempo reale per applicare le politiche e l’osservabilità del sistema per monitorare i prompt, le chiamate di strumenti e le azioni degli agenti.
Una volta che le aziende vedono quanto diversi sono i rischi dell’AI rispetto ai rischi del software tradizionale, si rendono rapidamente conto che proteggere l’AI richiede uno stack di sicurezza fondamentalmente nuovo.
Infine, cosa significa per te il “deploy di AI responsabile” nella pratica – non in teoria, ma all’interno di un’azienda che sta spedendo prodotti oggi?
Più veloce e più sicuro non sono opposti, anche se la maggior parte delle aziende li tratta come tali. L’assunzione è che la sicurezza seria rallenti – più cicli di revisione, più cancelli, più attrito prima che qualcosa venga spedito.
Nella pratica, le aziende che distribuiscono gli agenti con fiducia sono quelle che costruiscono la sicurezza nel processo piuttosto che applicarla alla fine: red-teaming automatizzato prima della distribuzione, controlli in tempo reale una volta che l’agente è live e visibilità centralizzata in tutta la durata di vita dell’agente.
Non si tratta di un esercizio di conformità. È ciò che ti consente di muoverti velocemente, perché non stai scoprendo in produzione ciò che avresti dovuto cogliere in precedenza.
Il deploy responsabile, in termini concreti, significa che sai cosa possono fare i tuoi agenti, puoi vedere cosa stanno facendo e puoi fermarli quando qualcosa va storto.
Lo sviluppo di AI responsabile consente il deploy continuo e su larga scala dei sistemi di intelligenza artificiale con fiducia, piuttosto che rallentare l’innovazione dell’AI.
Grazie per la grande intervista, i lettori che desiderano saperne di più possono visitare Virtue AI.












