Interviews
Bo Li, CEO, Virtue AI – Interviewreeks

Bo Li, CEO van Virtue AI, is een vooraanstaand onderzoeker en ondernemer die zich specialiseert in de veiligheid en beveiliging van kunstmatige intelligentiesystemen. Zij leidt Virtue AI en is tevens professor aan de University of Illinois Urbana-Champaign, waar haar onderzoek zich richt op machine learningbeveiliging, betrouwbaar AI en tegenstrijdige robuustheid. Haar carrière omvat zowel de academische als de industriële wereld, waardoor zij in staat is om geavanceerd AI-onderzoek om te zetten in praktische toepassingen die organisaties helpen om veiligere en veerkrachtigere AI-technologieën te bouwen.
Virtue AI is een bedrijf dat zich richt op het beschermen en beheren van AI-systemen die in enterprise-omgevingen worden gebruikt. Het platform biedt functionaliteiten zoals geautomatiseerde red teaming, real-time guardrails en continue monitoring om kwetsbaarheden zoals promptinjectie, hallucinaties en gegevenslekkage te identificeren. Door rechtstreeks te integreren in AI-ontwikkelings- en implementatieprocessen, helpt het bedrijf organisaties om het gebruik van grote taalmodellen en AI-aangedreven toepassingen veilig op te schalen, terwijl ze strenge beveiligings- en governance-standaarden handhaven.
Wat motiveerde u om van een puur academische carrière over te stappen op het oprichten en leiden van Virtue AI, en welk probleem voelde u dat de industrie niet aanpakte op grote schaal?
Traditionele beveiligingstools waren ontwikkeld voor voorspelbare applicaties met vaste paden. Ze waren nooit ontworpen voor systemen die redeneren, aanpassen en autonoom handelen. Mijn mede-oprichters en ik zagen een kloof tussen wat fundamenteel AI-beveiligingsonderzoek had opgeleverd en wat ondernemingen daadwerkelijk ter beschikking hadden. Het onderzoek bestond. De productierealiteit niet. Dat is wat we wilden veranderen.
Virtue AI richt zich op veiligheid, beveiliging en compliance voor grote taalmodellen en autonome agenten. Welk van deze gebieden denkt u dat ondernemingen het meest onderschatten vandaag de dag?
Ondernemingen begrijpen al deze gebieden tot op zekere hoogte, vooral beveiliging, maar er is nog steeds een grote kloof.
Ondernemingen zijn begonnen met het serieus nemen van modelbeveiliging, tenminste aan de oppervlakte. Maar agenten vormen een ander probleem. Ze krijgen toegang tot de meest gevoelige delen van de ondernemingsinfrastructuur: code uitvoeren, API’s aanroepen, het web browsen en gekoppelde beslissingen nemen die gegevens, financiën en operaties aanraken. De meeste beveiligingsteams zijn niet ingericht om over dat soort systeem na te denken. De tooling die ze hebben, was niet voor dat doel ontwikkeld.
Het risico is niet theoretisch. Zonder beveiliging die specifiek is ontworpen voor agentensystemen, kunnen kleine fouten snel escaleren. Een onverwachte toolaanroep, een dubieuze instructie, een prompt die langs de guardrails glipt—elk van deze kan escaleren naar ongeautoriseerde acties of gegevensblootstelling voordat iemand merkt dat er iets mis is gegaan.
Continue red teaming is centraal in de aanpak van Virtue AI. Welke soorten fouten of risico’s komen meestal pas aan het licht wanneer systemen live in productie zijn?
De meeste ernstige.
In een gecontroleerde omgeving test je het model en de agenten. In productie test je het systeem—anders zijn dat. Zodra een model is verbonden met tools, retrievalpijpleidingen, gebruikersinvoer en andere agenten, breidt het gedragsgebied zich uit op manieren die voorafgaand aan de implementatie niet worden getest. Een “veilig geconfigureerde” agent kan zich heel anders gedragen wanneer hij is verbonden met echte databases, nieuwe MCP-servers of andere agenten. Het systeem wordt niet-deterministisch. Het begint beslissingen te nemen op basis van context die tijdens de evaluatie niet bestond.
Dat is wanneer je de fouten vindt die er echt toe doen.
Hoe denkt u over het meten van “AI-veiligheid” in de praktijk, vooral wanneer systemen evolueren door fine-tuning, retrieval en toolgebruik?
In de praktijk kan AI-veiligheid niet worden gemeten door middel van een enkele statische benchmark, omdat moderne AI-systemen continu evolueren door fine-tuning, retrievalaugmentatie en tool- of agentinteracties. In plaats daarvan moet veiligheid worden geëvalueerd als een systeemeigenschap op het hele levenscyclus van een AI-toepassing. Dit omvat stress-testen van modellen en agenten met diverse red teaming-aanvallen, real-time gedrag zoals prompts, toolaanroepen en acties monitoren, en resultaten evalueren tegen gedefinieerde risicobeleid (bijv. misbruik, hallucinatie, gegevenslekkage of ongeautoriseerde acties).
Bijvoorbeeld, ons prijswinnende artikel (Best Paper at the National Security Agency en NeurIPS), DecodingTrust, heeft een uitgebreide beveiliging en veiligheidstest voor foundationmodellen geleverd. Ons DecodingTrust-Agent-platform heeft een realistische agentsimulator gebouwd met diverse omgevingen met native red teaming-agenten om dynamische, adaptieve en continue red teaming-testen uit te voeren.
Belangrijk is dat veiligheidsmeting continu en adaptief moet zijn, omdat updates van prompts, retrievalbronnen of tools nieuwe kwetsbaarheden kunnen introduceren. In de praktijk betekent dit het combineren van geautomatiseerde red teaming, runtime-guardrails en observabiliteit om niet alleen modelreacties te meten, maar ook de veiligheid van het eind-tot-eind AI-systeem dat in de echte wereld werkt.
Uw onderzoeksachtergrond omvat robuustheid, privacy en tegenstrijdige aanvallen. Welk van deze gebieden is het moeilijkst gebleken om om te zetten in reële verdedigingen?
Het omzetten van onderzoek naar robuustheid, privacy en tegenstrijdige aanvallen in reële verdedigingen is eigenlijk heel goed mogelijk. In feite zijn veel van de onderzoeksrichtingen in mijn groep rechtstreeks geïnspireerd door praktische beveiligingsuitdagingen die zijn waargenomen in geïmplementeerde AI-systemen. De echte moeilijkheid ligt niet in het bouwen van verdedigingen, maar in het bieden van betrouwbare beveiligingsgaranties in dynamische, reële omgevingen.
In academisch onderzoek heeft onze groep sterke vooruitgang geboekt, zoals gecertificeerde robuustheid en privacygaranties, maar deze resultaten zijn meestal gebaseerd op aannamen die mogelijk niet volledig van toepassing zijn in complexe productiesystemen. Moderne AI-toepassingen evolueren continu door nieuwe gegevens, fine-tuning, retrievalpijpleidingen en toolintegraties, wat nieuwe kwetsbaarheden over tijd kan introduceren.
Als gevolg hiervan kan effectieve AI-beveiliging niet afhankelijk zijn van eenmalige bescherming—het vereist continue red teaming, risicobeperking en adaptieve guardrails die samen met het systeem evolueren. Dit is precies de filosofie achter Virtue AI: het combineren van ons langdurig onderzoek naar AI-beveiliging met geautomatiseerde grootschalige red teaming en real-time bescherming om continue opkomende risico’s te identificeren en verdedigingen bij te werken, waardoor praktische en schaalbare beveiliging voor reële AI-systemen mogelijk wordt.
Wat maakt het beveiligen van autonome AI-agenten fundamenteel anders dan het beveiligen van traditionele software of zelfs chatbots?
Agenten zijn geen statische programma’s. Ze volgen geen voorspelbare paden en blijven niet binnen de perimeter die je voor hen hebt getrokken bij de implementatie.
Traditionele beveiliging gaat ervan uit dat er vaste uitvoeringspaden, stabiele API’s en deterministisch gedrag zijn. Autonome agenten schenden al deze aannamen. Ze redeneren over wat ze het volgende moeten doen, kiezen tools op basis van context en produceren effecten over meerdere systemen in één run.
Je kunt een prompt niet scannen, een model niet verharden of een enkele API-aanroep monitoren en denken dat de klus geklaard is. Je moet de agent als een compleet systeem beveiligen—zijn redenering, zijn toolgebruik, zijn omgeving en wat er downstream gebeurt.
Dat is het kernprobleem dat puntcontroles niet kunnen oplossen. Ze waren nooit voor dat doel ontworpen.
Waar falen bestaande beveiligingstools wanneer agenten kunnen handelen over meerdere systemen, tools en gegevensbronnen tegelijk?
Ze laten je blind voor hoe de agent daadwerkelijk operationeel was van begin tot eind.
De meeste tools zijn gebouwd voor applicaties met duidelijke perimeters en stabiel gedrag. Ze kunnen je vertellen hoe een enkele API-aanroep eruitzag. Ze kunnen je niet vertellen hoe een agent zijn weg redeneerde door vijf toolaanroepen om een resultaat te produceren dat niemand had bedoeld.
De zichtbaarheidskloof is het probleem. Als je de volledige keten van acties en beslissingen niet kunt zien, kun je het niet beheren en kun je het niet auditen na afloop.
Hoe verlagen real-time guardrails het risico in vergelijking met alleen monitoren of loggen?
Loggen vertelt je wat er mis is gegaan nadat de schade al is aangericht. Het is nuttig voor forensisch onderzoek en compliance, maar het stopt niets.
Bij autonome agenten kan de vertraging tussen actie en detectie echt kostbaar zijn. Een agent die al een slechte API-aanroep heeft uitgevoerd of gegevens heeft geëxtraheerd, wachtte niet op je logpijplijn om bij te blijven.
Real-time guardrails onderscheppen de actie voordat deze wordt uitgevoerd. Als een agent iets probeert te doen dat niet overeenkomt met het beleid, wordt het geblokkeerd of gemarkeerd voordat het wordt uitgevoerd, niet erna.
De combinatie is ook belangrijk. Real-time preventie plus een enkel consistent afdwingingspunt voor alle agent-tot-tool-interacties is een ander risicoprofiel dan passief monitoren van individuele componenten.
Virtue AI is opgericht door diep technische onderzoekers. Hoe beïnvloedt dit productbeslissingen in vergelijking met meer commercieel gedreven AI-startups?
AI-beveiliging en -governance is fundamenteel een diep technisch probleem. De systemen die we beschermen—zoals grote taalmodellen, multimodale modellen en agentensystemen—zijn zelf gebouwd op geavanceerd onderzoek. Zonder sterke fundamentele AI-expertise is het bijna onmogelijk om effectieve beveiligingsoplossingen voor hen te ontwerpen.
In veel gevallen is de grootste uitdaging in AI-beveiliging wanneer een geavanceerd red teaming-algoritme kwetsbaarheden van AI-agenten in een onderzoeksartikel identificeert—hoe vertaal je die inzicht in een productieklare verdediging die realistische systemen op grote schaal kan beschermen? Bij Virtue AI is het overbruggen van deze kloof tussen onderzoek en implementatie essentieel voor hoe we opereren en waar we ervaring mee hebben.
Omdat Virtue AI is opgericht door onderzoekers die decennialang hebben gewerkt aan AI-robuustheid, tegenstrijdige leerprocessen en betrouwbaar AI, werken onze onderzoeks- en engineersteams aan dezelfde problemen tegelijk. Onze onderzoekers bestuderen voortdurend opkomende modelarchitecturen, nieuwe agentenwerkprocessen en evoluerende aanvalstechnieken, terwijl onze engineersteams deze inzichten rechtstreeks integreren in productiesystemen.
Wanneer we een nieuwe kwetsbaarheid identificeren—zoals een nieuw promptinjectiepatroon of agentmanipulatiestrategie—kan dit snel worden omgezet in nieuwe detectiemodellen, guardrails of red teaming-strategieën. Dit gebeurt continu, niet alleen op een kwartaalproductroadmap.
Als gevolg hiervan blijven onze producten zowel state-of-the-art als enterprise-ready, waardoor organisaties hun AI-systemen kunnen beveiligen terwijl ze deze bouwen en implementeren. Veel van onze klanten vertellen ons dat deze onderzoeksgerichte aanpak precies is wat hen in staat stelt om sneller te bewegen terwijl ze veiligheid en compliance handhaven.
In tegenstelling tot puur commercieel gedreven teams, die vaak optimaliseren voor wat klanten vandaag vragen, wat kan leiden tot incrementele functies, maar mogelijk achterblijft bij de snel evoluerende bedreigingslandschap van AI-systemen. In AI-beveiliging evolueren bedreigingen even snel als de technologie zelf. Een onderzoeksgerichte basis stelt ons in staat om nieuwe risico’s eerder te anticiperen en verdedigingen te bouwen voordat ze wijdverspreide problemen worden.
Wat is de meest voorkomende misvatting die ondernemingen hebben over AI-beveiliging wanneer ze voor het eerst naar Virtue AI komen?
Een van de meest voorkomende misvattingen die ondernemingen hebben wanneer ze voor het eerst naar Virtue AI komen, is dat AI-beveiliging kan worden aangepakt door simpelweg traditionele beveiligingstools of basisinhoudsfilter te gebruiken.
In werkelijkheid introduceren AI-systemen geheel nieuwe bedreigingsoppervlakken, zoals promptinjectie, jailbreaks, hallucinatie-gedreven misbruik, gegevenslekkage via retrievalsystemen en agentmanipulatie via tools of externe API’s. Deze risico’s ontstaan uit het gedrag en de redenering van het model zelf, niet alleen uit de omliggende infrastructuur.
Als gevolg hiervan is het beschermen van AI-systemen niet mogelijk met traditionele beveiligingsmechanismen die het AI-model en de agenteninhoud, -uitvoer en -beslissingsprocessen in de hele levenscyclus van een AI-toepassing begrijpen, wat fundamentele AI-onderzoeks capaciteiten vereist.
Dit is waarom we de nadruk leggen op AI-native beveiliging: het combineren van geautomatiseerde red teaming om kwetsbaarheden te ontdekken, real-time guardrails om beleid af te dwingen en systeemniveau-observabiliteit om prompts, toolaanroepen en agentacties te monitoren.
Zodra ondernemingen zien hoe anders AI-risico’s zijn dan traditionele software-risico’s, realiseren ze zich snel dat het beveiligen van AI een fundamenteel nieuw beveiligingsstack vereist.
Tenslotte, wat betekent “verantwoorde AI-implementatie” voor u in de praktijk—niet in theorie, maar binnen een onderneming die producten vandaag de dag verzendt?
Sneller en veiliger zijn geen tegenpolen, hoewel de meeste ondernemingen ze zo behandelen. De aanname is dat serieuze beveiliging vertraagt—meer reviewcycli, meer poorten, meer wrijving voordat iets wordt verzonden.
In de praktijk zijn de ondernemingen die agenten met vertrouwen implementeren, degene die beveiliging in het proces integreren in plaats van het later toe te voegen: geautomatiseerde red teaming vóór implementatie, real-time controles zodra de agent live is, en centrale zichtbaarheid over de hele levenscyclus van de agent.
Dat is geen compliance-oefening. Het is wat je echt in staat stelt om snel te bewegen, omdat je niet in productie ontdekt wat je eerder had moeten vinden.
Verantwoorde implementatie, in concrete termen, betekent dat je weet wat je agenten kunnen doen, je kunt zien wat ze doen, en je kunt ze stoppen wanneer er iets mis gaat.
Verantwoorde AI-ontwikkeling maakt het mogelijk om AI-systemen op grote schaal en met vertrouwen te implementeren, in plaats van AI-innovatie te vertragen.
Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Virtue AI bezoeken Virtue AI.












