Intervjuer

Bo Li, VD, Virtue AI – Intervjuerien

mm
Lägg till Unite.AI bland dina föredragna källor på Google

Bo Li, VD för Virtue AI, är en framstående forskare och entreprenör som specialiserat sig på säkerheten och säkerheten för artificiella intelligenssystem. Hon leder Virtue AI samtidigt som hon är professor vid University of Illinois Urbana-Champaign, där hennes forskning fokuserar på maskinlärningssäkerhet, tillförlitlig AI och motståndskraft mot antagonistiska attacker. Hennes karriär spänner över både akademi och industri, vilket gör att hon kan översätta avancerad AI-forskning till praktiska tillämpningar som hjälper organisationer att bygga säkrare och mer motståndskraftiga AI-teknologier.

Virtue AI är ett företag som fokuserar på att skydda och styra AI-system som används i företagsmiljöer. Deras plattform tillhandahåller funktioner som automatiserad röd teamning, realtidsväggar och kontinuerlig övervakning för att identifiera sårbarheter som promptinjektion, hallucinationer och dataläckage. Genom att integreras direkt i AI-utvecklings- och distributionsflöden hjälper företaget organisationer att säkert skala användningen av stora språkmodeller och AI-drivna applikationer samtidigt som de upprätthåller starka säkerhets- och styrningsstandarder.

Vad motiverade dig att gå från en rent akademisk karriär till att grunda och leda Virtue AI, och vilket problem kände du att branschen inte adresserade i tillräcklig utsträckning?

Traditionella säkerhetsverktyg var byggda för förutsägbara applikationer med fasta banor. De var aldrig utformade för system som resonerar, anpassar sig och agerar autonomt. Min medgrundare och jag såg en lucka mellan vad grundläggande AI-säkerhetsforskning hade producerat och vad företag faktiskt hade tillgängligt för sig. Forskningen fanns. Produktionsverkligheten inte. Det var det vi satte oss för att ändra på.

Virtue AI fokuserar på säkerhet, säkerhet och regelefterlevnad för stora språkmodeller och autonoma agenter. Vilket av dessa områden tror du att företag underskattar mest idag?

Företag förstår alla dessa områden till viss del, särskilt säkerhet, men det finns fortfarande en stor lucka.

Företag har börjat ta modellsäkerhet på allvar, åtminstone på ytan. Men agenter är ett annat problem. De får tillgång till de känsligaste delarna av företagsinfrastrukturen: exekverar kod, anropar API:er, bläddrar på webben och fattar kedjade beslut som berör data, finanser och verksamhet. De flesta säkerhetsteam är inte utrustade för att resonera om den typen av system. Verktygen de har var inte byggda för det.

Risken är inte teoretisk. Utan säkerhet som är specifikt utformad för agenter kan små fel snabbt förvärras. En oväntad verktygsanrop, en tvetydig instruktion, en prompt som glider förbi väggar—någon av dessa kan eskalera till obehöriga åtgärder eller dataexponering innan någon märker att något gick fel.

Kontinuerlig röd teamning är central i Virtue AI:s tillvägagångssätt. Vilka typer av fel eller risker tenderar att dyka upp först när system är live i produktion?

De flesta allvarliga.

I en kontrollerad miljö testar du modellen och agenterna. I produktion testar du systemet—and those är olika saker. När en modell är ansluten till verktyg, hämtningspipeliner, användarindata och andra agenter expanderar beteendeytan på sätt som förtestning inte fångar. En “säkert konfigurerad” agent kan bete sig mycket annorlunda när den är ansluten till riktiga databaser, nya MCP-servrar eller andra agenter. Systemet blir icke-deterministiskt. Det börjar fatta beslut baserat på sammanhang som inte fanns under utvärdering.

Då är det du hittar felen som faktiskt betyder något.

Hur tänker du på att mäta “AI-säkerhet” i praktiken, särskilt när system utvecklas genom finjustering, hämtning och verktygsanvändning?

I praktiken kan AI-säkerhet inte mätas genom en enda statisk benchmark eftersom moderna AI-system kontinuerligt utvecklas genom finjustering, hämtningsförstärkning och verktygs- eller agentinteraktioner. Istället måste säkerhet utvärderas som en systemnivåegenskap över hela livscykeln för en AI-applikation. Detta inkluderar stress-testning av modeller och agenter med diversifierad röd teamning, övervakning av realtidsbeteende som promptrar, verktygsanrop och åtgärder, och utvärdering av resultat mot definierade riskpolicyer (t.ex. missbruk, hallucination, dataläckage eller obehöriga åtgärder).

Till exempel har vår prisbelönta artikel (Bästa artikel på National Security Agency och NeurIPS), DecodingTrust, tillhandahållit omfattande säkerhets- och säkerhetstestning för grundmodeller. Vår DecodingTrust-Agent-plattform har byggt en realistisk agentsimulator som värdar diversifierade miljöer med infödda röd team-agenter för att utföra dynamisk, anpassad och kontinuerlig röd teamningstestning.

Viktigt är att säkerhetsmätning måste vara kontinuerlig och anpassad, eftersom uppdateringar av promptrar, hämtningskällor eller verktyg kan introducera nya sårbarheter. I praktiken betyder detta att kombinera automatiserad röd teamning, realtidsväggar och övervakbarhet för att mäta inte bara modellsvar utan säkerheten för hela AI-systemet som opererar i den riktiga världen.

Din forskningsbakgrund spänner över robusthet, integritet och antagonistiska attacker. Vilket av dessa områden har visat sig vara svårast att översätta till verkliga försvar?

Att översätta forskning inom robusthet, integritet och antagonistiska attacker till verkliga försvar är faktiskt mycket genomförbart. Många av forskningsriktningarna i min grupp är direkt inspirerade av praktiska säkerhetsutmaningar som observerats i distribuerade AI-system. Den verkliga svårigheten ligger inte i att bygga försvar, utan i att tillhandahålla tillförlitliga säkerhetsgarantier i dynamiska, riktiga miljöer.

I akademisk forskning har vår grupp gjort starka framsteg som certifierad robusthet och integritetsgarantier, men dessa resultat förutsätter ofta antaganden som kanske inte fullständigt gäller i komplexa produktionsystem. Moderna AI-applikationer utvecklas kontinuerligt genom ny data, finjustering, hämtningspipeliner och verktygsintegrationer, vilket kan introducera nya sårbarheter över tid.

Som ett resultat kan effektiv AI-säkerhet inte förlita sig på enstaka skydd—det kräver kontinuerlig röd teamning, riskupptäckt och anpassade väggar som utvecklas tillsammans med systemet. Detta är exakt filosofin bakom Virtue AI: att kombinera vår långvariga forskning inom AI-säkerhet med automatiserad storstskalig röd teamning och realtids skydd för att kontinuerligt identifiera nya risker och uppdatera försvar, vilket möjliggör praktisk och skalbar säkerhet för riktiga AI-system.

Vad gör att säkra autonoma AI-agenter fundamentalt annorlunda än att säkra traditionell programvara eller till och med chatbots?

Agenter är inte statiska program. De följer inte förutsägbara banor, och de stannar inte inom den periferi du ritade för dem vid distribution.

Traditionell säkerhet förutsätter fasta exekveringsbanor, stabila API:er och deterministiskt beteende. Autonoma agenter bryter mot alla dessa antaganden. De resonerar om vad de ska göra härnäst, väljer verktyg baserat på sammanhang och producerar effekter över flera system i en enda körning.

Du kan inte skanna en prompt, härdar en modell eller övervaka en enskild API-anrop och anse att jobbet är gjort. Du måste säkra agenten som ett komplett system—dess resonemang, dess verktygsanvändning, dess miljö och vad som händer nedströms.

Det är den centrala problematiken som punktkontroller inte kan lösa. De var aldrig utformade för det.

Var brister befintliga säkerhetsverktyg när agenter kan agera över många system, verktyg och datakällor på en gång?

De lämnar dig blind för hur agenten faktiskt opererade slutligt.

De flesta verktyg var byggda för applikationer med tydliga periferier och stabilt beteende. De kan berätta för dig hur ett enskilt API-anrop såg ut. De kan inte berätta för dig hur en agent resonerade sig igenom fem verktygsanrop för att producera ett resultat som ingen avsåg.

Synlighetsgapet är problemet. Om du inte kan se hela kedjan av åtgärder och beslut, kan du inte styra det, och du kan inte granska det efteråt.

Hur minskar realtidsväggar risken jämfört med övervakning eller loggning ensam?

Loggning berättar för dig vad som gick fel efter att skadan är skedd. Det är användbart för forensik och regelefterlevnad, men det stoppar ingenting.

Med autonoma agenter kan fördröjningen mellan åtgärd och upptäckt vara genuint kostsam. En agent som redan har exekverat ett dåligt API-anrop eller exfiltrerat data väntade inte på att din loggningspipeline skulle hinna ikapp.

Realtidsväggar fångar upp åtgärden innan exekvering. Om en agent försöker göra något som strider mot policyn, blockeras eller flaggas den innan den körs, inte efter.

Kombinationen är också viktig. Realtidsförhindrande plus en enda konsekvent verkställande punkt över alla agent-till-verktyg-interaktioner är en annan riskprofil än passiv övervakning av enskilda komponenter.

Virtue AI grundades av djupt tekniska forskare. Hur formar det produktbeslut jämfört med mer kommersiellt drivna AI-startups?

AI-säkerhet och styrning är i grunden ett djupt tekniskt problem. Systemen vi skyddar—såsom stora språkmodeller, multimodala modeller och agenter—är byggda på avancerad forskning. Utan stark grundläggande AI-expertis är det nästan omöjligt att designa effektiva säkerhetslösningar för dem.

I många fall är den största utmaningen inom AI-säkerhet när en avancerad röd teamning-algoritm identifierar sårbarheter i AI-agenter i en forskningsartikel—hur översätter man den insikten till ett produktionsklart försvar som kan tillförlitligt skydda riktiga system i stor skala? Hos Virtue AI är att stänga gapet mellan forskning och distribution kärnan i hur vi opererar och vad vi är erfarna av.

Eftersom Virtue AI grundades av forskare som har tillbringat decennier med att arbeta med AI-robusthet, antagonistiskt lärande och tillförlitlig AI, arbetar våra forsknings- och ingenjörsteam med samma problem samtidigt. Våra forskare studerar kontinuerligt nya modellarkitekturer, nya agenter-arbetsflöden och utvecklande attacktekniker, medan våra ingenjörsteam integrerar dessa insikter direkt i produktions-system.

När vi identifierar en ny sårbarhet—såsom en ny promptinjektionsmönster eller agentmanipulationstrategi—kan den snabbt översättas till nya upptäcktsmodeller, väggar eller röd teamning-strategier. Detta sker kontinuerligt, inte bara på en kvartalsvis produktvägkarta.

Som ett resultat förblir våra produkter både toppmoderna och företagsklara, vilket hjälper organisationer att säkra sina AI-system medan de bygger och distribuerar dem. Många av våra kunder berättar för oss att detta forskningsdrivna tillvägagångssätt är exakt vad som låter dem flytta snabbare samtidigt som de upprätthåller säkerhet och regelefterlevnad.

I kontrast är renodlat kommersiellt drivna team ofta optimerade för vad kunderna ber om idag, vilket kan leda till inkrementella funktioner men kan ligga efter den snabbt utvecklande hotbilden för AI-system. I AI-säkerhet utvecklas hot så snabbt som tekniken själv. En forskningsbaserad grund låter oss förutse nya risker tidigare och bygga försvar innan de blir utbredda problem.

Vad är den vanligaste missuppfattningen företag har om AI-säkerhet när de först kommer till Virtue AI?

En av de vanligaste missuppfattningarna företag har när de först kommer till Virtue AI är att AI-säkerhet kan hanteras enkelt genom att tillämpa traditionella säkerhetsverktyg eller grundläggande innehållsfilter.

I verkligheten introducerar AI-system helt nya hotytor, såsom promptinjektion, fängelsebrott, hallucinationsdriven missbruk, dataläckage via hämtnings-system och agentmanipulation via verktyg eller externa API:er. Dessa risker uppstår från beteendet och resonemanget hos modellen själv, inte bara från den omgivande infrastrukturen.

Som ett resultat kräver skydd av AI-system säkerhetsmekanismer som förstår AI-modellens och agenternas indata, utdata och beslutsprocesser över hela livscykeln för en AI-applikation, vilket kräver grundläggande AI-forskningsförmågor.

Detta är varför vi betonar AI-nativ säkerhet: att kombinera automatiserad röd teamning för att upptäcka sårbarheter, realtidsväggar för att verkställa policyer och systemnivåövervakbarhet för att övervaka promptrar, verktygsanrop och agentåtgärder.

När företag ser hur olika AI-risker är från traditionella programvarurisker, inser de snabbt att att säkra AI kräver en grundligt ny säkerhetsstack.

Slutligen, vad betyder “ansvarsfull AI-distribution” för dig i praktiken—inte i teorin, utan inom ett företag som skickar produkter idag?

Snabbare och säkrare är inte motsatser, även om de flesta företag behandlar dem som sådana. Antagandet är att allvarlig säkerhet saktar ner—fler granskningscykler, fler grindar, mer friktion innan något skickas.

I praktiken är de företag som distribuerar agenter med tillförsikt de som bygger säkerhet in i processen snarare än att montera den på slutet: automatiserad röd teamning före distribution, realtidskontroller när agenten är live och central synlighet över hela agentlivscykeln.

Det är inte en regelefterlevnadsövning. Det är vad som faktiskt låter dig flytta snabbt, eftersom du inte upptäcker i produktion vad du borde ha upptäckt tidigare.

Ansvarsfull distribution, i konkreta termer, betyder att du vet vad dina agenter kan göra, du kan se vad de gör, och du kan stoppa dem när något går fel.

Ansvarsfull AI-utveckling möjliggör kontinuerlig, storstskalig AI-systemdistribution med tillförsikt, snarare än att sakta ner AI-innovation.

Tack för den underbara intervjun, läsare som vill lära sig mer bör besöka Virtue AI.

Antoine är en visionär ledare och medgrundare av Unite.AI, driven av en outtröttlig passion för att forma och främja framtidens AI och robotik. En serieentreprenör, han tror att AI kommer att vara lika störande för samhället som elektricitet, och han fångas ofta i att prata om potentialen för störande teknologier och AGI.

Som en futurist är han dedikerad till att utforska hur dessa innovationer kommer att forma vår värld. Dessutom är han grundare av Securities.io, en plattform som fokuserar på att investera i banbrytande teknologier som omdefinierar framtiden och omformar hela sektorer.