Rozhovory

Bo Li, CEO, Virtue AI – Rozhovorová série

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Bo Li, CEO Virtue AI, je prominentní výzkumník a podnikatel specializující se na bezpečnost a ochranu umělých inteligencí. Věnuje se Virtue AI a zároveň působí jako profesor na University of Illinois Urbana-Champaign, kde se jeho výzkum zaměřuje na bezpečnost strojového učení, důvěryhodnou umělou inteligenci a odolnost vůči adversářským útokům. Jeho kariéra zahrnuje jak akademickou, tak průmyslovou sféru, což mu umožňuje přetvořit pokročilý výzkum do praktických aplikací, které pomáhají organizacím budovat bezpečnější a odolnější technologie umělé inteligence.

Virtue AI je společnost zaměřená na ochranu a správu systémů umělé inteligence používaných v podnikovém prostředí. Jejich platforma poskytuje funkce, jako je automatizované testování na odolnost, bezpečnostní zábrany v reálném čase a nepřetržité monitorování, aby identifikovala zranitelnosti, jako je injekce příkazů, halucinace a únik dat. Integrací přímo do procesů vývoje a nasazení umělé inteligence pomáhá společnost organizacím bezpečně škálovat použití velkých jazykových modelů a aplikací poháněných umělou inteligencí,同时 udržuje vysoké standardy bezpečnosti a správy.

Co vás motivovalo k přechodu z čistě akademické kariéry na založení a vedení Virtue AI, a jaký problém jste cítil, že průmysl nedokáže řešit v dostatečném měřítku?

Tradiční bezpečnostní nástroje byly vytvořeny pro předvídatelné aplikace s pevnými cestami. Nebyly navrženy pro systémy, které rozumí, přizpůsobují se a jednají autonomně. Moji spoluzakladatelé a já jsme viděli mezeru mezi tím, co základní výzkum bezpečnosti umělé inteligence přinesl, a tím, co podniky skutečně měly k dispozici. Výzkum existoval, ale realita produkce ne.

Virtue AI se zaměřuje na bezpečnost, ochranu a dodržování předpisů pro velké jazykové modely a autonomní agenty. Kterou z těchto oblastí podle vás podniky目前 nejvíce podceňují?

Podniky rozumí všem těmto oblastem do určité míry, zejména bezpečnosti, ale stále existuje velká mezera.

Podniky začaly brát bezpečnost modelů vážně, alespoň na povrchu. Ale agenti jsou jiný problém. Mají přístup k nejcitlivějším částem podnikové infrastruktury: spouštění kódu, volání API, procházení webu a činění řetězových rozhodnutí, která se dotýkají dat, financí a operací. Most bezpečnostních týmů není vybaven pro myšlení o takovém systému. Nástroje, které mají, nebyly pro to vytvořeny.

Riziko není teoretické. Bezpečnost specificky navržená pro agenty není dostatečná. Malé selhání se rychle sčítají. Neočekávané volání nástroje, nejednoznačný příkaz, příkaz, který projde bezpečnostními zábranami—jakékoli z toho může eskalovat v neautorizované akce nebo únik dat, bevor někdo si uvědomí, že něco šlo špatně.

Continuální testování na odolnost je klíčovou součástí přístupu Virtue AI. Jaké typy selhání nebo rizik se obvykle objevují až poté, co jsou systémy nasazeny v produkci?

Většina závažných problémů.

V kontrolovaném prostředí testujete model a agenty. V produkci testujete systém—a to jsou dvě různé věci. Jakmile je model připojen k nástrojům, pipeline pro načítání dat, vstupům uživatelů a dalším agentům, chování se rozšiřuje způsoby, které testování před nasazením nezachytí. “Bezpečně nakonfigurovaný” agent může jednat velmi jinak, když je připojen k reálným databázím, novým serverům nebo dalším agentům. Systém se stává nedeterministickým. Začíná dělat rozhodnutí založená na kontextu, který během hodnocení neexistoval.

To je okamžik, kdy najdete selhání, která skutečně záleží.

Jak přemýšlíte o měření “bezpečnosti umělé inteligence” v praxi, zejména když systémy procházejí jemným laděním, načítáním a použitím nástrojů?

V praxi nelze bezpečnost umělé inteligence měřit prostřednictvím jediného statického testu, protože moderní systémy umělé inteligence neustále evoluují prostřednictvím jemného ladění, načítání a interakcí agentů nebo nástrojů. Místo toho musí být bezpečnost hodnocena jako systémová vlastnost napříč celým životním cyklem aplikace umělé inteligence. To zahrnuje testování modelů a agentů pomocí různých útoků, monitorování reálného chování, jako jsou příkazy, volání nástrojů a akce, a hodnocení výsledků proti definovaným rizikovým politikám (například zneužití, halucinace, únik dat nebo neautorizované akce).

Například naše oceněná práce (Nejlepší článek na National Security Agency a NeurIPS), DecodingTrust, poskytla komplexní bezpečnostní a bezpečnostní testování pro základní modely. Naše platforma DecodingTrust-Agent vytvořila realistický simulátor agenta hostujícího různé prostředí s nativními agenty pro provádění dynamického, adaptivního a kontinuálního testování na odolnost.

Důležité je, že měření bezpečnosti musí být kontinuální a adaptivní, protože aktualizace příkazů, zdrojů načítání nebo nástrojů mohou zavést nová zranitelnost. V praxi to znamená kombinaci automatizovaného testování na odolnost, bezpečnostních zábran v reálném čase a monitorování, aby se měřila nejen odpověď modelu, ale také bezpečnost celého systému umělé inteligence fungujícího ve skutečném světě.

Vaše výzkumná pozadí zahrnuje robustnost, soukromí a adversářské útoky. Která z těchto oblastí se ukázala být nejobtížnější při překladu do reálných obran?

Překlad výzkumu robustnosti, soukromí a adversářských útoků do reálných obran je vlastně velmi proveditelný. Ve skutečnosti mnoho výzkumných směrů v naší skupině je přímo inspirováno praktickými bezpečnostními výzvami pozorovanými v nasazených systémech umělé inteligence. Skutečná obtíž spočívá ne v budování obran, ale v poskytování spolehlivých bezpečnostních záruk v dynamických, reálných prostředích.

Ve výzkumné práci naší skupiny jsme dosáhli silných pokroků, jako je certifikovaná robustnost a soukromí, ale tyto výsledky obvykle spoléhají na předpoklady, které nemusí plně platit v komplexních produkčních systémech. Moderní aplikace umělé inteligence neustále evoluují prostřednictvím nových dat, jemného ladění, pipeline načítání a integrace nástrojů, což může zavést nová zranitelnost v čase.

Efektivní bezpečnost umělé inteligence proto nemůže spoléhat na jednorázovou ochranu—vyžaduje kontinuální testování na odolnost, objevování rizik a adaptivní bezpečnostní zábrany, které evoluují spolu se systémem. To je přesně filozofie za Virtue AI: kombinace našeho dlouhodobého výzkumu v oblasti bezpečnosti umělé inteligence s automatizovaným velkým měřítkem testování na odolnost a ochranou v reálném čase, aby kontinuálně identifikovala vznikající rizika a aktualizovala obrany, umožňující praktickou a škálovatelnou bezpečnost pro reálné systémy umělé inteligence.

Co dělá zabezpečení autonomních agentů umělé inteligence fundamentálně odlišným od zabezpečení tradičního softwaru nebo dokonce chatbotů?

Agenti nejsou statickými programy. Nesledují předvídatelné cesty a nezůstávají uvnitř perimetru, který jste pro ně nakreslili při nasazení.

Tradiční bezpečnost předpokládá pevné cesty, stabilní API a deterministické chování. Autonomní agenti porušují všechny tyto předpoklady. Rozhodují se o tom, co dělat dál, volí nástroje na základě kontextu a produkují účinky napříč několika systémy v jednom běhu.

Nemůžete prohlédnout příkaz, zpevnit model nebo monitorovat jeden API volání a považovat práci za hotovou. Musíte zabezpečit agenta jako kompletní systém—jeho rozhodnutí, použití nástrojů, prostředí a to, co se stane dále.

To je jádro problému, které kontrolní body nemohou vyřešit. Byly vytvořeny pro něco jiného.

Kde stávající bezpečnostní nástroje selhávají, když agenti mohou jednat napříč mnoha systémy, nástroji a zdroji dat najednou?

Zanechávají vás slepé k tomu, jak agent skutečně fungoval od začátku do konce.

Většina nástrojů byla vytvořena pro aplikace s jasnými perimetry a stabilním chováním. Mohou vám říci, jak vypadalo jedno API volání. Nemohou vám říci, jak agent rozuměl svým způsobem skrz pět volání nástrojů, aby produkoval výsledek, který nikdo nezamýšlel.

Mezera ve viditelnosti je problém. Pokud nemůžete vidět plnou řetězec akcí a rozhodnutí, nemůžete je řídit a nemůžete je auditovat poté.

Jak bezpečnostní zábrany v reálném čase snižují rizika ve srovnání s monitorováním nebo protokolováním alone?

Protokolování vám řekne, co šlo špatně poškození. Je to užitečné pro forenzní analýzu a dodržování předpisů, ale nezastaví nic.

U autonomních agentů může zpoždění mezi akcí a detekcí být skutečně nákladné. Agent, který již spustil špatné API volání nebo vyňal data, nečekal, až se váš protokolovací pipeline chytil.

Bezpečnostní zábrany v reálném čase zachytí akci před provedením. Pokud se agent pokusí o něco mimo politiku, je zablokován nebo označen předtím, než běží, ne poté.

Kombinace také záleží. Prevence v reálném čase plus jeden konzistentní bod vynucování napříč všemi interakcemi agenta a nástroje je jiný profil rizika než pasivní monitorování jednotlivých komponent.

Virtue AI byla založena hluboce technickými výzkumníky. Jak to ovlivňuje produktová rozhodnutí ve srovnání s komerčně řízenými startupy umělé inteligence?

Bezpečnost a správa umělé inteligence je fundamentálně hluboký technický problém. Systémy, které chráníme—jako velké jazykové modely, multimodální modely a agentic systémy—jsou sami postaveny na pokročilém výzkumu. Bez silné základní odbornosti v oblasti bezpečnosti umělé inteligence je téměř nemožné navrhnout efektivní bezpečnostní řešení pro ně.

V mnoha případech je největší výzvou v bezpečnosti umělé inteligence, když pokročilý algoritmus pro testování na odolnost identifikuje zranitelnosti agentů umělé inteligence ve výzkumném článku—jak přeložit tuto inspiraci do produkční obrany, která může spolehlivě chránit reálné systémy v měřítku? U Virtue AI je uzavření této mezery mezi výzkumem a nasazením jádrem toho, jak fungujeme a čemu jsme zkušeni.

Protože Virtue AI byla založena výzkumníky, kteří strávili desetiletí prací na robustnosti umělé inteligence, odolnosti vůči adversářským útokům a důvěryhodné umělé inteligenci, naše výzkumné a inženýrské týmy pracují na stejných problémech současně. Naši výzkumníci neustále studují vznikající architektury modelů, nové agentic pracovní postupy a evoluční útočné techniky, zatímco naše inženýrské týmy integrují tyto poznatky přímo do produkčních systémů.

Když identifikujeme novou zranitelnost—jako novou injekci příkazu nebo strategii manipulace agentem—může být rychle přeložena do nových detekčních modelů, bezpečnostních zábran nebo strategií pro testování na odolnost. To se děje kontinuálně, ne jen na čtvrtletním produktovém plánu.

V důsledku toho naše produkty zůstávají jak špičkové, tak připravené pro podniky, pomáhají organizacím zabezpečit své systémy umělé inteligence, zatímco je budují a nasazují. Mnozí z našich zákazníků nám říkají, že právě tento výzkumem řízený přístup jim umožňuje pohybovat se rychleji, zatímco udržují bezpečnost a dodržování předpisů.

Naopak čistě komerčně řízené týmy často optimalizují to, co zákazníci požadují dnes, což může vést k inkrementálním funkcím, ale může zůstat pozadu za rychle se vyvíjejícím ohrožením systémů umělé inteligence. V bezpečnosti umělé inteligence se hrozby vyvíjejí stejně rychle jako technologie sama. Základ založený na výzkumu umožňuje předvídat nová rizika dříve a budovat obrany, bevor se stanou široce rozšířenými problémy.

Jaký je nejčastější omyl, který podniky mají o bezpečnosti umělé inteligence, když poprvé přijdou do Virtue AI?

Jedním z nejčastějších omylů, které podniky mají, když poprvé přijdou do Virtue AI, je, že bezpečnost umělé inteligence lze řešit jednoduše aplikací tradičních bezpečnostních nástrojů nebo základních filtrů pro moderování obsahu.

Ve skutečnosti systémy umělé inteligence zavádějí zcela nové ohrožené povrchy, jako je injekce příkazů, úniky z vězení, zneužití vyvolané halucinacemi, únik dat prostřednictvím systémů načítání a manipulace agentů prostřednictvím nástrojů nebo externích API. Tato rizika vznikají z chování a rozhodování modelu samotného, ne pouze z okolní infrastruktury.

Proto je zdůrazňujeme bezpečnost umělé inteligence: kombinujeme automatizované testování na odolnost, aby objevilo zranitelnosti, bezpečnostní zábrany v reálném čase, aby vynutily politiky, a systémovou viditelnost, aby monitorovala příkazy, volání nástrojů a akce agentů.

Jakmile podniky uvidí, jak se rizika umělé inteligence liší od tradičních softwarových rizik, rychle si uvědomí, že zabezpečení umělé inteligence vyžaduje fundamentálně novou bezpečnostní sadu.

Nakonec, co “odpovědné nasazení umělé inteligence” znamená pro vás v praxi—ne v teorii, ale uvnitř podniku, který dodává produkty dnes?

Rychlejší a bezpečnější nejsou protiklady, i když většina podniků je považuje za takové. Předpoklad je, že vážná bezpečnost zpomaluje—více recenzních cyklů, více bran, více tření předtím, než něco odešle.

V praxi jsou podniky, které nasazují agenty s důvěrou, ty, které budují bezpečnost do procesu, spíše než ji přidávají na konci: automatizované testování na odolnost před nasazením, bezpečnostní kontroly, když je agent živý, a centralizovaná viditelnost napříč celým životním cyklem agenta.

To není cvičení pro dodržování předpisů. Je to to, co vám skutečně umožňuje pohybovat se rychle, protože neobjevujete v produkci to, co byste měli chytit dříve.

Odpovědné nasazení, v konkrétních termínech, znamená, že víte, co vaši agenti mohou dělat, můžete vidět, co dělají, a můžete je zastavit, když něco jde špatně.

Odpovědný vývoj umělé inteligence umožňuje kontinuální, velkým měřítkem nasazení systémů umělé inteligence s důvěrou, spíše než zpomalování inovací umělé inteligence.

Děkuji za skvělý rozhovor, čtenáři, kteří chtějí se dozvědět více, by měli navštívit Virtue AI.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.