Entretiens

Bo Li, PDG, Virtue AI – Série d’entretiens

mm
Ajouter Unite.AI à vos sources préférées sur Google

Bo Li, PDG de Virtue AI, est un chercheur éminent et entrepreneur spécialisé dans la sécurité et la sûreté des systèmes d’intelligence artificielle. Elle dirige Virtue AI tout en étant professeur à l’Université de l’Illinois à Urbana-Champaign, où ses recherches portent sur la sécurité de l’apprentissage automatique, la confiance dans l’IA et la robustesse aux attaques adverses. Sa carrière s’étend à la fois dans le monde académique et l’industrie, ce qui lui permet de traduire les recherches avancées en intelligence artificielle en applications pratiques qui aident les organisations à construire des technologies d’IA plus sûres et plus résilientes.

Virtue AI est une entreprise qui se concentre sur la protection et la gouvernance des systèmes d’IA utilisés dans les environnements d’entreprise. Sa plateforme offre des capacités telles que la simulation d’attaques, les garde-fous en temps réel et la surveillance continue pour identifier les vulnérabilités telles que les injections de prompt, les hallucinations et les fuites de données. En s’intégrant directement dans les flux de travail de développement et de déploiement de l’IA, l’entreprise aide les organisations à déployer en toute sécurité les modèles de langage et les applications alimentées par l’IA à grande échelle tout en maintenant des normes de sécurité et de gouvernance solides.

Qu’est-ce qui vous a motivé à passer d’une carrière universitaire à la fondation et à la direction de Virtue AI, et quel problème sentiez-vous que l’industrie ne résolvait pas à grande échelle ?

Les outils de sécurité traditionnels ont été conçus pour des applications prévisibles avec des chemins fixes. Ils n’ont jamais été conçus pour des systèmes qui raisonnent, s’adaptent et agissent de manière autonome. Mes co-fondateurs et moi avons constaté un écart entre les résultats de la recherche fondamentale sur la sécurité de l’IA et ce dont disposaient les entreprises. La recherche existait. La réalité de production ne l’était pas. C’est ce que nous avons cherché à changer.

Virtue AI se concentre sur la sûreté, la sécurité et la conformité pour les grands modèles de langage et les agents autonomes. Quel est l’un de ces domaines que les entreprises sous-estiment le plus aujourd’hui ?

Les entreprises comprennent tous ces domaines jusqu’à un certain point, en particulier la sécurité, mais il y a encore un grand écart.

Les entreprises ont commencé à prendre au sérieux la sécurité des modèles, au moins en surface. Mais les agents sont un problème différent. Ils ont accès aux parties les plus sensibles de l’infrastructure d’entreprise : exécuter du code, appeler des API, parcourir le Web et prendre des décisions en chaîne qui touchent les données, les finances et les opérations. La plupart des équipes de sécurité ne sont pas équipées pour raisonner sur ce type de système. Les outils dont elles disposent n’ont pas été conçus pour cela.

Le risque n’est pas théorique. Sans une sécurité spécifiquement conçue pour les systèmes d’agents, de petites défaillances peuvent s’accumuler rapidement. Un appel d’outil inattendu, une instruction ambiguë, un prompt qui passe les garde-fous — n’importe lequel de ces éléments peut s’aggraver en actions non autorisées ou en exposition de données avant que quiconque ne remarque que quelque chose a mal tourné.

La simulation d’attaques en continu est au cœur de l’approche de Virtue AI. Quels types de défaillances ou de risques ne sont généralement visibles qu’une fois les systèmes en production ?

La plupart des défaillances graves.

Dans un environnement contrôlé, vous testez le modèle et les agents. En production, vous testez le système — et ce sont deux choses différentes. Une fois qu’un modèle est connecté à des outils, des pipelines de récupération, des entrées utilisateur et d’autres agents, l’espace de comportement s’étend de manière que les tests préalables au déploiement ne capturent pas. Un agent « configuré en toute sécurité » peut agir très différemment lorsqu’il est connecté à des bases de données réelles, de nouveaux serveurs MCP ou d’autres agents. Le système devient non déterministe. Il commence à prendre des décisions basées sur un contexte qui n’existait pas lors de l’évaluation.

C’est là que vous découvrez les défaillances qui comptent vraiment.

Comment réfléchissez-vous à la mesure de la « sécurité de l’IA » dans la pratique, en particulier lorsque les systèmes évoluent grâce à l’ajustement fin, à la récupération et à l’utilisation d’outils ?

Dans la pratique, la sécurité de l’IA ne peut pas être mesurée à l’aide d’un seul benchmark statique, car les systèmes d’IA modernes évoluent continuellement grâce à l’ajustement fin, à la récupération et aux interactions avec les outils ou les agents. Au lieu de cela, la sécurité doit être évaluée comme une propriété au niveau du système sur l’ensemble du cycle de vie d’une application d’IA. Cela inclut des tests de résistance aux attaques de simulation, la surveillance en temps réel des comportements tels que les prompts, les appels d’outils et les actions, et l’évaluation des résultats par rapport à des politiques de risque définies (par exemple, utilisation abusive, hallucination, fuite de données ou actions non autorisées).

Par exemple, notre article primé (Meilleur article de l’Agence de sécurité nationale et NeurIPS), DecodingTrust, a fourni des tests de sécurité et de sûreté complets pour les modèles de base. Notre plateforme DecodingTrust-Agent a créé un simulateur d’agent réaliste hébergeant des environnements diversifiés avec des agents de simulation d’attaques natifs pour effectuer des tests de simulation d’attaques dynamiques, adaptatifs et continus.

Il est important de noter que la mesure de la sécurité doit être continue et adaptative, car les mises à jour des prompts, des sources de récupération ou des outils peuvent introduire de nouvelles vulnérabilités. Dans la pratique, cela signifie combiner la simulation d’attaques automatisée, les garde-fous en temps réel et l’observabilité pour mesurer non seulement les réponses du modèle, mais aussi la sûreté du système d’IA dans son ensemble en fonctionnement dans le monde réel.

Votre expérience de recherche couvre la robustesse, la confidentialité et les attaques adverses. Lequel de ces domaines s’est avéré le plus difficile à traduire en défenses du monde réel ?

Traduire la recherche sur la robustesse, la confidentialité et les attaques adverses en défenses du monde réel est en fait très réalisable. En fait, de nombreuses directions de recherche dans mon groupe sont directement inspirées par des défis de sécurité pratiques observés dans les systèmes d’IA déployés. La difficulté réelle réside non pas dans la construction de défenses, mais dans la fourniture de garanties de sécurité fiables dans des environnements dynamiques et du monde réel.

Dans la recherche universitaire, notre groupe a réalisé des avancées solides telles que la robustesse certifiée et les garanties de confidentialité, mais ces résultats reposent généralement sur des hypothèses qui peuvent ne pas être entièrement valables dans des systèmes de production complexes. Les applications d’IA modernes évoluent continuellement grâce à de nouvelles données, à l’ajustement fin, aux pipelines de récupération et aux intégrations d’outils, ce qui peut introduire de nouvelles vulnérabilités au fil du temps.

En conséquence, la sécurité efficace de l’IA ne peut pas reposer sur une protection unique — elle nécessite une simulation d’attaques continue, une découverte de risques et des garde-fous adaptatifs qui évoluent aux côtés du système. C’est exactement la philosophie derrière Virtue AI : combiner notre recherche de longue date sur la sécurité de l’IA avec une simulation d’attaques automatisée à grande échelle et une protection en temps réel pour continuellement identifier les risques émergents et mettre à jour les défenses, permettant ainsi une sécurité pratique et évolutive pour les systèmes d’IA du monde réel.

Qu’est-ce qui rend fondamentalement différent la sécurisation des agents d’IA autonomes par rapport à la sécurisation des logiciels traditionnels ou même des chatbots ?

Les agents ne sont pas des programmes statiques. Ils ne suivent pas des chemins prévisibles et ne restent pas dans les limites que vous leur avez fixées au déploiement.

La sécurité traditionnelle suppose des chemins d’exécution fixes, des API stables et un comportement déterministe. Les agents autonomes violent toutes ces hypothèses. Ils raisonnent sur ce qu’ils doivent faire ensuite, choisissent des outils en fonction du contexte et produisent des effets à travers plusieurs systèmes en une seule exécution.

Vous ne pouvez pas analyser un prompt, durcir un modèle ou surveiller un seul appel d’API et considérer que la tâche est accomplie. Vous devez sécuriser l’agent comme un système complet — sa logique, son utilisation d’outils, son environnement et ce qui se passe en aval.

C’est le point clé du problème que les contrôles ne peuvent pas résoudre. Ils n’ont jamais été conçus pour cela.

À quel point les outils de sécurité existants sont-ils défaillants lorsqu’il s’agit d’agents qui peuvent agir sur de multiples systèmes, outils et sources de données à la fois ?

Ils vous laissent aveugle sur la façon dont l’agent a réellement fonctionné de bout en bout.

La plupart des outils ont été conçus pour des applications avec des limites claires et un comportement stable. Ils peuvent vous dire à quoi ressemblait un seul appel d’API. Ils ne peuvent pas vous dire comment un agent a raisonné son chemin à travers cinq appels d’outils pour produire un résultat que personne n’avait l’intention de produire.

Le fossé de visibilité est le problème. Si vous ne pouvez pas voir la chaîne complète d’actions et de décisions, vous ne pouvez pas la gouverner et vous ne pouvez pas l’auditer après coup.

Comment les garde-fous en temps réel réduisent-ils les risques par rapport à la surveillance ou à la journalisation seuls ?

La journalisation vous indique ce qui s’est mal passé après que le mal est fait. C’est utile pour la forensique et la conformité, mais cela n’arrête rien.

Avec les agents autonomes, le délai entre l’action et la détection peut être vraiment coûteux. Un agent qui a déjà exécuté un appel d’API malveillant ou exfiltré des données n’a pas attendu que votre pipeline de journalisation rattrape son retard.

Les garde-fous en temps réel interceptent l’action avant son exécution. Si un agent tente quelque chose qui va à l’encontre de la politique, il est bloqué ou signalé avant d’être exécuté, et non après.

La combinaison compte également. La prévention en temps réel plus un point d’application cohérent pour toutes les interactions entre l’agent et les outils est un profil de risque différent de la surveillance passive de composants individuels.

Virtue AI a été fondée par des chercheurs profondément techniques. Comment cela influence-t-il les décisions de produit par rapport aux startups d’IA plus axées sur le commerce ?

La sécurité et la gouvernance de l’IA sont fondamentalement des problèmes techniques profonds. Les systèmes que nous protégeons — tels que les grands modèles de langage, les modèles multimodaux et les systèmes d’agents — sont eux-mêmes construits sur des recherches avancées. Sans une solide expertise en intelligence artificielle, il est presque impossible de concevoir des solutions de sécurité efficaces pour ceux-ci.

Dans de nombreux cas, le plus grand défi de la sécurité de l’IA est de traduire les résultats de la recherche en défenses de production qui peuvent protéger de manière fiable les systèmes réels à grande échelle. Chez Virtue AI, combler cet écart entre la recherche et le déploiement est au cœur de notre fonctionnement et de notre expérience.

Puisque Virtue AI a été fondée par des chercheurs qui ont passé des décennies à travailler sur la robustesse de l’IA, l’apprentissage adverse et l’IA de confiance, nos équipes de recherche et d’ingénierie travaillent sur les mêmes problèmes simultanément. Nos chercheurs étudient continuellement les architectures de modèles émergentes, les flux de travail d’agents et les techniques d’attaque en évolution, tandis que nos équipes d’ingénierie intègrent ces connaissances directement dans les systèmes de production.

Lorsque nous identifions une nouvelle vulnérabilité — telle qu’un nouveau modèle d’injection de prompt ou une stratégie de manipulation d’agent — elle peut être rapidement traduite en nouveaux modèles de détection, des garde-fous ou des stratégies de simulation d’attaques. Cela se produit en continu, et non juste sur une feuille de route de produit trimestrielle.

En conséquence, nos produits restent à la fois à la pointe de la technologie et prêts pour l’entreprise, aidant les organisations à sécuriser leurs systèmes d’IA tandis qu’elles les construisent et les déployent. Beaucoup de nos clients nous disent que cette approche axée sur la recherche est exactement ce qui leur permet de progresser plus rapidement tout en maintenant la sûreté et la conformité.

À l’inverse, les équipes purement axées sur le commerce optimisent souvent ce que les clients demandent aujourd’hui, ce qui peut les amener à être en retard sur le paysage des menaces en constante évolution des systèmes d’IA. Dans la sécurité de l’IA, les menaces évoluent aussi rapidement que la technologie elle-même. Une fondation axée sur la recherche nous permet d’anticiper de nouveaux risques plus tôt et de construire des défenses avant qu’ils ne deviennent des problèmes généralisés.

Quelle est la méconception la plus courante que les entreprises ont sur la sécurité de l’IA lorsqu’elles viennent chez Virtue AI pour la première fois ?

L’une des méconceptions les plus courantes que les entreprises ont lorsqu’elles viennent chez Virtue AI pour la première fois est que la sécurité de l’IA peut être abordée simplement en appliquant des outils de sécurité traditionnels ou des filtres de modération de contenu de base.

En réalité, les systèmes d’IA introduisent de nouvelles surfaces d’attaque, telles que les injections de prompt, les jailbreaks, les utilisations abusives basées sur des hallucinations, les fuites de données via les systèmes de récupération et la manipulation d’agents via des outils ou des API externes. Ces risques émergent du comportement et du raisonnement du modèle lui-même, et non seulement de l’infrastructure environnante.

Par conséquent, la protection des systèmes d’IA nécessite des mécanismes de sécurité qui comprennent le modèle d’IA et les processus de décision des agents sur l’ensemble du cycle de vie d’une application d’IA, ce qui nécessite des capacités de recherche fondamentale en IA.

C’est pourquoi nous mettons l’accent sur la sécurité native de l’IA : en combinant la simulation d’attaques automatisée pour découvrir les vulnérabilités, les garde-fous en temps réel pour appliquer les politiques et l’observabilité du système pour surveiller les prompts, les appels d’outils et les actions des agents.

Une fois que les entreprises réalisent à quel point les risques de l’IA diffèrent des risques logiciels traditionnels, elles comprennent rapidement que la sécurisation de l’IA nécessite une pile de sécurité fondamentalement nouvelle.

Enfin, qu’est-ce que le « déploiement responsable de l’IA » signifie pour vous dans la pratique — pas en théorie, mais au sein d’une entreprise qui livre des produits aujourd’hui ?

Plus rapide et plus sûr ne sont pas des opposés, même si la plupart des entreprises les traitent comme tels. L’hypothèse est que la sécurité sérieuse ralentit — plus de cycles de révision, plus de portes, plus de friction avant que quelque chose ne soit livré.

Dans la pratique, les entreprises qui déployent des agents avec confiance sont celles qui intègrent la sécurité dans le processus plutôt que de la greffer à la fin : simulation d’attaques automatisée avant le déploiement, contrôles en temps réel une fois l’agent en fonction, et visibilité centralisée sur l’ensemble du cycle de vie de l’agent.

Ce n’est pas un exercice de conformité. C’est ce qui vous permet réellement de progresser rapidement, car vous ne découvrez pas en production ce que vous auriez dû détecter plus tôt.

Le déploiement responsable, en termes concrets, signifie que vous savez ce que vos agents peuvent faire, vous pouvez voir ce qu’ils font, et vous pouvez les arrêter lorsque quelque chose va mal.

Le développement responsable de l’IA permet le déploiement continu et à grande échelle des systèmes d’IA avec confiance, plutôt que de ralentir l’innovation de l’IA.

Merci pour cette grande interview. Les lecteurs qui souhaitent en savoir plus peuvent visiter Virtue AI.

Antoine est un leader visionnaire et associé fondateur d'Unite.AI, animé par une passion inébranlable pour façonner et promouvoir l'avenir de l'IA et de la robotique. Un entrepreneur en série, il croit que l'IA sera aussi perturbatrice pour la société que l'électricité, et se fait souvent prendre en train de vanter le potentiel des technologies perturbatrices et de l'AGI.

En tant que futuriste, il se consacre à explorer comment ces innovations vont façonner notre monde. En outre, il est le fondateur de Securities.io, une plateforme axée sur l'investissement dans les technologies de pointe qui redéfinissent l'avenir et remodelent des secteurs entiers.