Rozhovory

Vahid Behzadan, ředitel laboratoře Secured and Assured Intelligent Learning (SAIL) – Interview Series

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Vahid je asistent profesorem počítačových věd a datové vědy na University of New Haven. Je také ředitelem laboratoře Secure and Assured Intelligent Learning (SAIL) Lab

Jeho výzkumné zájmy zahrnují bezpečnost a bezpečnost inteligentních systémů, psychologický modelování problémů bezpečnosti AI, bezpečnost komplexních adaptivních systémů, teorii her, multi-agentní systémy a kybernetickou bezpečnost.

Máte rozsáhlé zkušenosti s kybernetickou bezpečností a zajišťováním bezpečnosti AI. Můžete sdílet svou cestu, jak jste se stal přitahován k oběma oblastem?

Má výzkumná dráha byla poháněna dvěma základními zájmy: zjistit, jak věci fungují, a naučit se o mechanismech lidského myšlení. Aktivně se účastním kybernetické bezpečnosti od svých raných teenage let a následně jsem postavil svou ranou výzkumnou agendu kolem klasických problémů této domény. Několik let do svého postgraduálního studia jsem měl vzácnou příležitost změnit oblast svého výzkumu. V té době jsem právě objevil rané práce Szegedyho a Goodfellowa o útocích na machine learning a našel jsem tuto myšlenku velmi zajímavou. Když jsem se více zabýval tímto problémem, dozvěděl jsem se o obecnějším poli bezpečnosti a bezpečnosti AI a zjistil, že zahrnuje mnoho mých základních zájmů, jako je kybernetická bezpečnost, kognitivní vědy, ekonomie a filozofie. Také jsem uvěřil, že výzkum v této oblasti není pouze fascinující, ale také životně důležitý pro zajištění dlouhodobých výhod a bezpečnosti AI revoluce.

 

Jste ředitelem laboratoře Secure and Assured Intelligent Learning (SAIL), která se zaměřuje na vytváření konkrétních základů pro bezpečnost a bezpečnost inteligentních strojů. Můžete sdílet některé podrobnosti o práci, kterou laboratoř SAIL provádí?

V laboratoři SAIL můj studenti a já pracujeme na problémech, které leží na rozhraní bezpečnosti, AI a komplexních systémů. Hlavní zaměření našeho výzkumu je na zkoumání bezpečnosti a bezpečnosti inteligentních systémů, z teoretického i praktického hlediska. Na teoretické straně目前 zkoumáme problém value-alignment v multi-agentních prostředích a vyvíjíme matematické nástroje pro hodnocení a optimalizaci cílů AI agentů s ohledem na stabilitu a robustní zarovnání. Na praktické straně některé naše projekty zkoumají bezpečnostní zranitelnosti nejmodernějších AI technologií, jako jsou autonomní vozidla a algoritmické obchodování, a snažíme se vyvinout techniky pro hodnocení a zlepšování odolnosti těchto technologií proti útokům.

Také pracujeme na aplikacích machine learningu v kybernetické bezpečnosti, jako je automatizované testování pronikání, časná detekce pokusů o proniknutí a automatizovaná sběr a analýza hrozeb z otevřených zdrojů dat, jako je sociální média.

 

Nedávno jste vedl úsilí o navržení modelování problémů bezpečnosti AI jako psychopatologických poruch. Můžete vysvětlit, co to je?

Tento projekt se zabývá rychle rostoucí složitostí AI agentů a systémů: již je velmi obtížné diagnostikovat, předpovídat a kontrolovat nebezpečné chování učení posilováním v nebanálních prostředích pouze pohledem na jejich nízkoúrovňové konfigurace. V této práci zdůrazňujeme potřebu vyšších abstrakcí při zkoumání těchto problémů. Inspirováni vědeckými přístupy k behaviorálním problémům u lidí, navrhujeme psychopatologii jako užitečnou vysokou abstrakci pro modelování a analýzu emergentních škodlivých chování v AI a AGI. Jako důkaz konceptu studujeme problém bezpečnosti AI při hackování odměn v RL agentovi, který se učí hrát klasickou hru Had. Ukazujeme, že pokud přidáme “drogu” semeno do prostředí, agent se naučí suboptimální chování, které lze popsat pomocí neurovědních modelů závislosti. Tato práce také navrhuje kontrolní metodologie založené na léčebných přístupech používaných v psychiatrii. Například navrhujeme použití umělých odměnových signálů jako analogií lékové terapie pro modifikaci škodlivého chování agentů.

 

Máte nějaké obavy s bezpečností AI, pokud jde o autonomní vozidla?

Autonomní vozidla se stávají prominentními příklady nasazení AI v kybernetických systémech. Při zvažování fundamentální zranitelnosti současných technologií machine learningu vůči chybám a útokům, jsem hluboce znepokojen bezpečností a bezpečností даже poloautonomních vozidel. Také oblast autonomního řízení trpí vážným nedostatkem bezpečnostních standardů a evaluačních protokolů. Nicméně, zůstávám optimistický. Podobně jako přirozená inteligence, AI bude také náchylná k chybám. Přesto, cíl samořízených vozidel může být stále splněn, pokud se sníží míra a dopad těchto chyb na nižší úroveň než u lidských řidičů. Svědky rostoucích úsilí o řešení těchto problémů v průmyslu a akademii, stejně jako ve vládách.

 

Hacking street signs pomocí samolepek nebo jiných prostředků může zmást počítačové vidění autonomního vozidla. Jak velký problém to podle vás je?

Tyto samolepky a obecně příklady protiútoků dávají vzniknout základním výzvám v robustnosti modelů machine learningu. Cituji George E. P. Boxe: “všechny modely jsou špatné, ale některé jsou užitečné”. Příklady protiútoků využívají tuto “špatnost” modelů, která je způsobena jejich abstraktní povahou, stejně jako omezení vzorkovaných dat, na kterých jsou trénovány. Nedávné úsilí v oblasti adversarialního machine learningu vedlo k obrovským pokrokům ve zvýšení odolnosti hlubokých modelů learningu vůči takovým útokům. Z bezpečnostního hlediska bude vždy existovat způsob, jak zmást modely machine learningu. Nicméně, praktický cíl zabezpečení modelů machine learningu je zvýšit náklady na implementaci takových útoků na úroveň ekonomické nevhodnosti.

 

Vaše zaměření je na bezpečnostních a bezpečnostních funkcích hlubokého učení a hlubokého učení posilováním. Proč je to tak důležité?

Učení posilováním je prominentní metodou aplikování machine learningu na kontrolní problémy, které z definice zahrnují manipulaci s jejich prostředím. Proto jsem přesvědčen, že systémy založené na učení posilováním mají významně vyšší rizika způsobení velkých škod v reálném světě ve srovnání s jinými metodami machine learningu, jako je klasifikace. Tento problém je dále zhoršen integrací hlubokého učení do učení posilováním, což umožňuje přijetí učení posilováním v vysoce komplexních prostředích. Také je mé názoru, že rámec učení posilováním je úzce spojen s základními mechanismy kognice v lidské inteligenci a studium jeho bezpečnosti a zranitelností může vést k lepšímu pochopení limitů rozhodování v našich myslích.

 

Domníváte se, že jsme blízko dosažení umělé obecné inteligence (AGI)?

Toto je extrémně obtížná otázka na odpověď. Domnívám se, že目前 máme stavební bloky některých architektur, které mohou usnadnit vznik AGI. Nicméně, může to trvat několik let nebo desetiletí, než budeme moci tyto architektury vylepšit a zvýšit efektivitu jejich trénování a údržby. V nadcházejících letech naše agenty budou růst stále inteligentnější rychlostí. Nemyslím si, že vznik AGI bude oznámen ve formě [vědecky platné] titulní stránky, ale jako výsledek postupného pokroku. Také si myslím, že dosud nemáme široce přijímanou metodologii pro testování a detekci existence AGI, a to může zpomalit naše uvědomění si prvních instancí AGI.

 

Jak můžeme udržet bezpečnost v systému AGI, který je schopen myslet sám za sebe a bude pravděpodobně mnohem inteligentnější než lidé?

Domnívám se, že sjednocená teorie inteligentního chování je ekonomie a studium, jak agenty jednají a interagují, aby dosáhli toho, co chtějí. Rozhodnutí a akce lidí jsou určeny jejich cíli, jejich informacemi a dostupnými zdroji. Společnosti a spolupráce jsou emergentní z jejich přínosů pro jednotlivé členy těchto skupin. Další příklad je trestní zákon, který odrazuje určitá rozhodnutí tím, že připojuje vysokou cenu k akcím, které mohou poškodit společnost. Stejně tak si myslím, že kontrola incentiv a zdrojů může umožnit vznik stavu rovnováhy mezi lidmi a instancemi AGI. Současně komunita bezpečnosti AI zkoumá tuto tezi pod názvem value-alignment problému.

 

Jedna z oblastí, které jste blízce sledujete, je protiterorismus. Máte obavy s tím, že teroristé převezmou AI nebo AGI systémy?

Existuje řada obav o zneužití technologií AI. V případě teroristických operací je hlavním problémem snadnost, s jakou teroristé mohou vyvinout a provést autonomní útoky. Rostoucí počet mých kolegů aktivně varuje před riziky vývoje autonomních zbraní (viz https://autonomousweapons.org/ ). Jeden z hlavních problémů s AI-powernými zbraněmi je obtížnost kontroly základních technologií: AI je na špici otevřeného výzkumu a kdokoli s přístupem k internetu a spotřebitelskému hardwaru může vyvinout škodlivé AI systémy. Domnívám se, že vznik autonomních zbraní je nevyhnutelný a věřím, že brzy bude potřeba nových technických řešení, aby se tyto zbraně potlačily. To může vést k cyklu kočky a myši, který pohání evoluci AI-powerných zbraní, což může vést k vážným existenčním rizikům v dlouhodobém horizontu.

 

Co můžeme udělat, abychom udrželi AI systémy v bezpečí před těmito protiagentními agenty?

Prvním a nejzákladnějším krokem je vzdělávání: Všichni inženýři a praktici AI musí se naučit o zranitelnostech technologií AI a musí zvažovat relevantní rizika při návrhu a implementaci svých systémů. Pokud jde o technické doporučení, existuje řada návrhů a řešení, která lze použít. Například trénování agentů machine learningu v protiútocích může zlepšit jejich odolnost a robustnost proti útokům na vyhýbání a manipulaci politikou (například viz mou práci s názvem “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Další řešení spočívá v přímém zohlednění rizika protiútoků v architektuře agenta (například Bayesian přístupy k modelování rizika). Existuje však velká mezera v této oblasti, a to je potřeba univerzálních metrik a metodologií pro hodnocení odolnosti AI agentů proti protiútokům. Současné řešení jsou většinou ad hoc a nezajišťují obecná měřítka odolnosti proti všem typům útoků.

 

Je něco jiného, co byste chtěl sdílet o některé z těchto témat?

V roce 2014, Scully et al. publikovali práci na konferenci NeurIPS s velmi osvětlujícím tématem: “Machine Learning: The High-Interest Credit Card of Technical Debt“. I přes všechny pokroky v oblasti v posledních letech, tato výpověď dosud neztratila svou platnost. Současný stav AI a machine learningu není ničím jiným než úžasným, ale dosud jsme nevyplnili řadu velkých mezer v obou základních a inženýrských rozměrech AI. Tento fakt, podle mého názoru, je nejvýznamnějším závěrem našeho rozhovoru. Samozřejmě nemyslím si, že bych chtěl zdiskreditovat komerční přijetí technologií AI, ale pouze chci umožnit inženýrské komunitě zohlednit rizika a omezení současných technologií AI ve svých rozhodnutích.

Skutečně jsem si užil učení o bezpečnostních a bezpečnostních výzvách různých typů AI systémů. To je skutečně něco, čeho by si měli být vědomi jednotlivci, korporace a vlády. Čtenáři, kteří si přejí se dozvědět více, by měli navštívit Secure and Assured Intelligent Learning (SAIL) Lab.

Antoine je vizionářský líder a spoluzakladatel Unite.AI, který je poháněn neotřesitelnou vášní pro formování a propagaci budoucnosti umělé inteligence a robotiky. Jako sériový podnikatel věří, že umělá inteligence bude mít na společnost stejně disruptivní vliv jako elektřina, a často se chvála na potenciál disruptivních technologií a AGI.