Wywiady

Bo Li, CEO, Virtue AI – Wywiad z serii

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Bo Li, CEO Virtue AI, to wybitny badacz i przedsiębiorca specjalizujący się w bezpieczeństwie i ochronie systemów sztucznej inteligencji. Kieruje Virtue AI, a także jest profesorem na Uniwersytecie Illinois w Urbana-Champaign, gdzie jego badania koncentrują się na bezpieczeństwie uczenia maszynowego, zaufanym AI i odporności na ataki. Jego kariera obejmuje zarówno środowisko akademickie, jak i przemysł, co pozwala mu tłumaczyć zaawansowane badania AI na praktyczne aplikacje, które pomagają organizacjom budować bezpieczniejsze i bardziej odporne technologie AI.

Virtue AI to firma koncentrująca się na ochronie i zarządzaniu systemami AI wykorzystywanymi w środowiskach przedsiębiorstw. Ich platforma oferuje funkcje takie jak automatyczne testowanie penetracyjne, bariery w czasie rzeczywistym i ciągłe monitorowanie w celu identyfikacji luk w zabezpieczeniach, takich jak wstrzyknięcie poleceń, halucynacje i wyciek danych. Poprzez integrację bezpośrednio z procesami rozwoju i wdrożenia AI, firma pomaga organizacjom bezpiecznie skalować wykorzystanie dużych modeli językowych i aplikacji zasilanych przez AI, utrzymując przy tym wysokie standardy bezpieczeństwa i zarządzania.

Co skłoniło Cię do odejścia od kariery wyłącznie akademickiej i założenia oraz kierowania Virtue AI, a jaki problem uważałeś, że przemysł nie rozwiązuje na odpowiedniej skali?

Tradycyjne narzędzia bezpieczeństwa były zaprojektowane dla aplikacji przewidywalnych z ustalonymi ścieżkami. Nie były one przeznaczone dla systemów, które rozumieją, adaptują się i działają autonomicznie. Mój współzałożyciel i ja zauważyliśmy lukę między tym, co podstawowe badania nad bezpieczeństwem AI wyprodukowały, a tym, co przedsiębiorstwa mają dostępne. Badania istniały. Rzeczywistość produkcyjna nie.

Virtue AI koncentruje się na bezpieczeństwie, ochronie i zgodności z przepisami dla dużych modeli językowych i autonomicznych agentów. Który z tych obszarów uważasz, że przedsiębiorstwa najbardziej zaniżają dzisiaj?

Przedsiębiorstwa rozumieją wszystkie te obszary w pewnym stopniu, szczególnie bezpieczeństwo, ale nadal istnieje duża luka.

Przedsiębiorstwa zaczęły traktować bezpieczeństwo modeli poważnie, przynajmniej na powierzchni. Ale agenci to inny problem. Mają dostęp do najbardziej wrażliwych części infrastruktury przedsiębiorstwa: wykonują kod, wywołują interfejsy API, przeglądają internet i podejmują łańcuchowe decyzje, które dotykają danych, finansów i operacji. Większość zespołów bezpieczeństwa nie jest przygotowana do myślenia o takim systemie. Narzędzia, których używają, nie zostały zbudowane z myślą o tym.

Ryzyko nie jest teoretyczne. Bez zabezpieczeń specjalnie zaprojektowanych dla systemów agencji, niewielkie awarie mogą szybko przerodzić się w nieautoryzowane działania lub ujawnienie danych, zanim ktokolwiek zauważy, że coś poszło nie tak.

Ciągłe testowanie penetracyjne jest kluczowym elementem podejścia Virtue AI. Jakie rodzaje awarii lub ryzyka pojawiają się dopiero wtedy, gdy systemy są już na żywo w produkcji?

Większość poważnych.

W kontrolowanym środowisku testujesz model i agenci. W produkcji testujesz system — i to są różne rzeczy. Gdy model jest połączony z narzędziami, potokami pobierania, danymi wejściowymi użytkowników i innymi agentami, przestrzeń zachowań rozszerza się w sposób, który nie jest pojmowany przez testy przed wdrożeniem. “Bezpiecznie skonfigurowany” agent może zachowywać się zupełnie inaczej, gdy jest połączony z rzeczywistymi bazami danych, nowymi serwerami MCP lub innymi agentami. System staje się nieprzewidywalny. Zaczyna podejmować decyzje na podstawie kontekstu, który nie istniał podczas oceny.

To wtedy znajdujesz awarie, które naprawdę mają znaczenie.

Jak myślisz o pomiarze “bezpieczeństwa AI” w praktyce, szczególnie gdy systemy ewoluują przez dostrajanie, pobieranie i użycie narzędzi?

W praktyce bezpieczeństwo AI nie może być mierzone za pomocą jednego statycznego benchmarku, ponieważ nowoczesne systemy AI ciągle ewoluują przez dostrajanie, pobieranie i interakcje z narzędziami lub agentami. Zamiast tego, bezpieczeństwo musi być oceniane jako właściwość systemu na poziomie całego cyklu życia aplikacji AI. Obejmuje to testowanie modeli i agentów z różnymi atakami testowania penetracyjnego, monitorowanie zachowań w czasie rzeczywistym, takich jak polecenia, wywołania narzędzi i działania, oraz ocenę wyników w oparciu o określone zasady ryzyka.

Na przykład nasz nagrodzony artykuł, DecodingTrust, zapewnił kompleksowe bezpieczeństwo i testy bezpieczeństwa dla modeli podstawowych. Nasza platforma DecodingTrust-Agent zbudowała symulator agenta z różnymi środowiskami i rodzimymi agentami testowania penetracyjnego w celu przeprowadzenia dynamicznego, adaptacyjnego i ciągłego testowania penetracyjnego.

Pomiar bezpieczeństwa musi być ciągły i adaptacyjny, ponieważ aktualizacje poleceń, źródeł pobierania lub narzędzi mogą wprowadzać nowe słabości. W praktyce oznacza to łączenie automatycznego testowania penetracyjnego, barier w czasie rzeczywistym i obserwowalności, aby mierzyć nie tylko odpowiedzi modelu, ale także bezpieczeństwo końcowego systemu AI działającego w świecie rzeczywistym.

Twoje tło badawcze obejmuje odporność, prywatność i ataki o charakterze nieprzyjaznym. Który z tych obszarów okazał się najtrudniejszy do przetłumaczenia na rzeczywiste mechanizmy obronne?

Przetłumaczenie badań nad odpornością, prywatnością i atakami o charakterze nieprzyjaznym na mechanizmy obronne w świecie rzeczywistym jest tak naprawdę bardzo wykonalne. Wiele kierunków badawczych w mojej grupie jest bezpośrednio zainspirowanych praktycznymi wyzwaniami bezpieczeństwa obserwowanymi w wdrożonych systemach AI. Prawdziwe trudności leżą nie w budowaniu obron, ale w zapewnieniu niezawodnych gwarancji bezpieczeństwa w dynamicznych, rzeczywistych środowiskach.

W badaniach akademickich nasza grupa osiągnęła silne postępy, takie jak certyfikowana odporność i gwarancje prywatności, ale te wyniki zwykle opierają się na założeniach, które mogą nie w pełni obowiązywać w złożonych systemach produkcyjnych. Nowoczesne aplikacje AI ciągle ewoluują przez nowe dane, dostrajanie, potoki pobierania i integrację narzędzi, co może wprowadzać nowe słabości w czasie.

Skuteczne bezpieczeństwo AI nie może polegać na ochronie jednorazowej — wymaga ciągłego testowania penetracyjnego, odkrywania ryzyka i adaptacyjnych barier, które ewoluują wraz z systemem. To jest właśnie filozofia Virtue AI: łączenie naszych długoterminowych badań nad bezpieczeństwem AI z automatycznym, dużym testowaniem penetracyjnym i ochroną w czasie rzeczywistym, aby ciągle identyfikować pojawiające się ryzyka i aktualizować obrony, umożliwiając praktyczne i skalowalne bezpieczeństwo dla systemów AI w świecie rzeczywistym.

Co sprawia, że zabezpieczanie autonomicznych agentów AI jest fundamentalnie różne od zabezpieczania tradycyjnego oprogramowania lub nawet czatbotów?

Agenci nie są statycznymi programami. Nie podążają przewidywalnymi ścieżkami i nie pozostają w obrębie granic, które wyznaczyłeś im podczas wdrożenia.

Tradycyjne bezpieczeństwo zakłada ustalone ścieżki wykonania, stabilne interfejsy API i deterministyczne zachowanie. Autonomiczni agenci naruszają wszystkie te założenia. Rozumieją, co robić dalej, wybierają narzędzia w oparciu o kontekst i produkują efekty w wielu systemach w jednym przebiegu.

Nie możesz przeskanować polecenia, zahardować modelu ani monitorować jednego wywołania interfejsu API i uznać, że zadanie jest wykonane. Musisz zabezpieczyć agenta jako cały system — jego rozumowanie, użycie narzędzi, środowisko i to, co dzieje się na dalszym planie.

To jest podstawowy problem, którego nie mogą rozwiązać punkty kontrolne. Nie zostały one zaprojektowane do tego.

Gdzie istniejące narzędzia bezpieczeństwa zawodzą, gdy agenci mogą działać na wielu systemach, narzędziach i źródłach danych jednocześnie?

Zostawiają Cię ślepego co do tego, jak agent działał naprawdę od końca do końca.

Większość narzędzi została zbudowana dla aplikacji z wyraźnymi granicami i stabilnym zachowaniem. Mogą powiedzieć, jak wyglądało pojedyncze wywołanie interfejsu API. Nie mogą powiedzieć, jak agent rozumował swoją drogę przez pięć wywołań narzędzi, aby wyprodukować wynik, którego nikt nie zamierzał.

Luka widoczności jest problemem. Jeśli nie możesz zobaczyć pełnej sekwencji działań i decyzji, nie możesz nimi zarządzać i nie możesz ich audytować po fakcie.

Jak bariery w czasie rzeczywistym redukują ryzyko w porównaniu z samym monitorowaniem lub logowaniem?

Logowanie mówi Ci, co poszło nie tak po tym, jak szkoda została wyrządzona. Jest to przydatne do celów forensycznych i zgodności, ale nie zatrzymuje niczego.

W przypadku autonomicznych agentów opóźnienie między działaniem a wykryciem może być naprawdę kosztowne. Agent, który już wykonał nieprawidłowe wywołanie interfejsu API lub wyciek danych, nie czekał na to, aż twoje logowanie dogoni.

Bariery w czasie rzeczywistym przechwytują działanie przed wykonaniem. Jeśli agent próbuje czegoś sprzecznego z zasadami, zostaje zablokowany lub oznaczony przed wykonaniem, a nie po.

Kombinacja również ma znaczenie. Prawdziwa prewencja w czasie rzeczywistym plus jeden spójny punkt egzekwowania przepisów na wszystkie interakcje agenta z narzędziami to inny profil ryzyka niż bierna obserwacja poszczególnych komponentów.

Virtue AI została założona przez głęboko technicznych badaczy. Jak to kształtuje decyzje dotyczące produktów w porównaniu z bardziej komercyjnymi startupami AI?

Bezpieczeństwo i zarządzanie AI jest fundamentalnie głębokim problemem technicznym. Systemy, które chronimy — takie jak duże modele językowe, wielomodalne modele i agenci — same są zbudowane na zaawansowanych badaniach. Bez silnej podstawowej wiedzy na temat AI jest prawie niemożliwe zaprojektowanie skutecznych rozwiązań bezpieczeństwa dla nich.

W wielu przypadkach największym wyzwaniem w bezpieczeństwie AI jest to, gdy zaawansowany algorytm testowania penetracyjnego identyfikuje słabości agentów AI w artykule badawczym — jak przetłumaczyć tę wiedzę na mechanizm obronny, który może niezawodnie chronić rzeczywiste systemy na dużą skalę? W Virtue AI zamykanie tej luki między badaniami a wdrożeniem jest kluczowe dla naszego działania i doświadczenia.

Ponieważ Virtue AI została założona przez badaczy, którzy spędzili dziesięciolecia pracując nad odpornością AI, nasze zespoły badawcze i inżynieryjne pracują nad tymi samymi problemami jednocześnie. Nasi badacze nieustannie studiują nowe architektury modeli, nowe przepływy pracy agentów i ewoluujące techniki ataków, podczas gdy nasze zespoły inżynieryjne integrują te spostrzeżenia bezpośrednio w systemy produkcyjne.

Gdy identyfikujemy nową słabość — taką jak nowy wzorzec wstrzyknięcia polecenia lub strategia manipulacji agentem — może być szybko przetłumaczona na nowe modele wykrywania, bariery lub strategie testowania penetracyjnego. Dzieje się to ciągle, a nie tylko na kwartalnym planie produktu.

W efekcie nasze produkty pozostają zarówno na najwyższym poziomie, jak i gotowe do wdrożenia w przedsiębiorstwach, pomagając organizacjom zabezpieczyć swoje systemy AI, gdy je budują i wdrażają. Wiele z naszych klientów mówi nam, że to podejście oparte na badaniach pozwala im poruszać się szybciej, utrzymując przy tym bezpieczeństwo i zgodność.

W przeciwieństwie do tego, zespoły wyłącznie komercyjne często optymalizują to, o co klienci proszą dzisiaj, co może prowadzić do funkcjonalności przyrostowych, ale może pozostawać w tyle za dynamicznie ewoluującym krajobrazem zagrożeń systemów AI. W bezpieczeństwie AI zagrożenia ewoluują tak szybko, jak sama technologia. Podstawowe założenie oparte na badaniach pozwala nam wcześniej przewidywać nowe ryzyka i budować obrony, zanim staną się powszechnymi problemami.

Jaki jest najczęstszy błąd, jaki przedsiębiorstwa popełniają w kwestii bezpieczeństwa AI, gdy po raz pierwszy przychodzą do Virtue AI?

Jednym z najczęstszych błędów, jakie przedsiębiorstwa popełniają, gdy po raz pierwszy przychodzą do Virtue AI, jest to, że bezpieczeństwo AI można rozwiązać, stosując tradycyjne narzędzia bezpieczeństwa lub podstawowe filtry moderacji treści.

W rzeczywistości systemy AI wprowadzają całkowicie nowe powierzchnie ataków, takie jak wstrzyknięcie poleceń, ucieczki, halucynacje prowadzące do nadużyć, wyciek danych przez systemy pobierania i manipulacja agentami za pomocą narzędzi lub zewnętrznych interfejsów API. Te ryzyka pochodzą z samego zachowania i procesów decyzyjnych modelu, a nie tylko z otaczającej infrastruktury.

Dlatego podkreślamy bezpieczeństwo rodzime dla AI: łącząc automatyczne testowanie penetracyjne w celu odkrywania słabości, bariery w czasie rzeczywistym w celu egzekwowania zasad i obserwowalność systemu w celu monitorowania poleceń, wywołań narzędzi i działań agenta.

Gdy przedsiębiorstwa zobaczą, jak różne są ryzyka AI od tradycyjnych ryzyk oprogramowania, szybko zrozumieją, że zabezpieczanie AI wymaga fundamentalnie nowego stosu bezpieczeństwa.

Wreszcie, co “odpowiednie wdrożenie AI” oznacza dla Ciebie w praktyce — nie w teorii, ale wewnątrz przedsiębiorstwa wysyłającego produkty dzisiaj?

Szybciej i bezpieczniej nie są przeciwieństwami, chociaż większość przedsiębiorstw traktuje je w ten sposób. Założenie jest takie, że poważne bezpieczeństwo spowalnia — więcej cykli przeglądu, więcej bramek, więcej tarcia przed wysłaniem czegoś.

W praktyce przedsiębiorstwa, które wdrażają agenci z zaufaniem, są tymi, które budują bezpieczeństwo w proces, a nie bolt je na końcu: automatyczne testowanie penetracyjne przed wdrożeniem, kontrole w czasie rzeczywistym, gdy agent jest na żywo, i scentralizowana widoczność na całym cyklu życia agenta.

To nie jest ćwiczenie zgodności. To pozwala im poruszać się szybko, ponieważ nie odkrywają w produkcji tego, co powinni byli złapać wcześniej.

Odpowiednie wdrożenie, w konkretnych słowach, oznacza, że wiesz, co Twoi agenci mogą zrobić, widzisz, co robią, i możesz ich zatrzymać, gdy coś pójdzie nie tak.

Odpowiednie rozwinięcie AI umożliwia ciągłe, dużoskalowe wdrożenie systemów AI z zaufaniem, a nie spowalnia innowacje AI.

Dziękujemy za wspaniały wywiad. Czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Virtue AI.

Antoine jest wizjonerskim liderem i współzałożycielem Unite.AI, który jest zmotywowany niezachwianą pasją do kształtowania i promowania przyszłości sztucznej inteligencji i robotyki. Jako serialowy przedsiębiorca, wierzy, że sztuczna inteligencja będzie tak samo przełomowa dla społeczeństwa, jak elektryczność, i często jest złapany na tym, że zachwala potencjał przełomowych technologii i AGI.

Jako futurysta, jest poświęcony badaniu, jak te innowacje ukształtują nasz świat. Ponadto, jest założycielem Securities.io, platformy skupiającej się na inwestowaniu w najnowocześniejsze technologie, które zmieniają przyszłość i przebudowują całe sektory.