Interviews
Vahid Behzadan, direktør for Secure and Assured Intelligent Learning (SAIL) Lab – Interview Serie

Vahid er adjunkt i datalogi og datavidenskab på University of New Haven. Han er også direktør for Secure and Assured Intelligent Learning (SAIL) Lab
Hans forskningsinteresser omfatter sikkerhed og sikkerhed af intelligente systemer, psykologisk modellering af AI-sikkerhedsproblemer, sikkerhed af komplekse adaptive systemer, spilteori, multi-agent-systemer og cybersikkerhed.
De har en omfattende baggrund i cybersikkerhed og sikkerhed af AI. Kan du dele din rejse om, hvordan du blev tiltrukket af begge fag?
Min forskningsbane har været drevet af to kerneinteresser af mine: At finde ud af, hvordan ting bryder sammen, og at lære om mekanismerne bag det menneskelige sind. Jeg har været aktivt involveret i cybersikkerhed siden mine teenageår, og har derefter bygget min tidlige forskningsagenda omkring de klassiske problemer i dette domæne. Nogle år inde i min graduate-uddannelse fik jeg en sjælden mulighed for at skifte mit forskningsområde. På det tidspunkt havde jeg lige opdaget de tidlige arbejder af Szegedy og Goodfellow om adversarial eksempler-angreb, og fandt idéen om at angribe maskinlæring meget interessant. Da jeg dykkede dybere ind i dette problem, fik jeg at vide om det mere generelle felt af AI-sikkerhed og sikkerhed, og fandt, at det omfattede mange af mine kerneinteresser, såsom cybersikkerhed, kognitionsvidenskab, økonomi og filosofi. Jeg kom også til at tro, at forskning i dette område ikke kun er fascinerende, men også vital for at sikre de langsigtede fordele og sikkerheden af AI-revolutionen.
Du er direktør for Secure and Assured Intelligent Learning (SAIL) Lab, som arbejder på at lægge konkrete grundlag for sikkerheden og sikkerheden af intelligente maskiner. Kan du gå i detaljer omkring arbejdet, der udføres af SAIL?
På SAIL arbejder mine studerende og jeg på problemer, der ligger i skæringspunktet mellem sikkerhed, AI og komplekse systemer. Det primære fokus for vores forskning er på at undersøge sikkerheden og sikkerheden af intelligente systemer, både fra teoretisk og praktisk synspunkt. På den teoretiske side undersøger vi i øjeblikket værdi-alignment-problemet i multi-agent-miljøer og udvikler matematiske værktøjer til at evaluere og optimere mål for AI-agenter i forhold til stabilitet og robuste alignment. På den praktiske side udforsker nogle af vores projekter sikkerheds-sårbarhederne i den nyeste AI-teknologi, såsom autonome køretøjer og algoritme-handel, og sigter mod at udvikle teknikker til at evaluere og forbedre robustheden af sådanne teknologier over for adversarial angreb.
Vi arbejder også på anvendelsen af maskinlæring i cybersikkerhed, såsom automatiseret penetrationstest, tidlig opdagelse af indtrængningsforsøg og automatiseret trussels-intelligenssamling og -analyse fra åbne datakilder såsom sociale medier.
Du har nylig ledt en indsats for at foreslå modelleringen af AI-sikkerhedsproblemer som psykopatologiske lidelser
Dette projekt omhandler den hurtigt voksende kompleksitet af AI-agenter og -systemer: det er allerede meget svært at diagnosticere, forudsige og kontrollere usikre adfærd hos forstærkning-læringsagenter i ikke-trivielle indstillinger ved blot at se på deres lav-niveu-konfigurationer. I dette arbejde understreger vi behovet for højere-abstraktionsniveauer i undersøgelsen af sådanne problemer. Inspireret af de videnskabelige tilgange til adfærdsproblemer hos mennesker, foreslår vi psykopatologi som en nyttig højere-abstraktionsniveauer for modellering og analyse af emergente skadelige adfærd hos AI og AGI. Som et bevis på begrebet studerer vi AI-sikkerhedsproblemet omkring reward-hacking i en RL-agent, der lærer at spille det klassiske spil Snake. Vi viser, at hvis vi tilføjer en “stof”-frø til miljøet, lærer agenten en suboptimal adfærd, der kan beskrives via neurovidenskabelige modeller af afhængighed. Dette arbejde foreslår også kontrolmetoder baseret på behandlings-tilgange, der bruges i psykiatri. For eksempel foreslår vi brugen af kunstigt genererede belønnings-signaler som analoger til medicin-terapi for at modificere den skadelige adfærd hos agenter.
Har du nogen bekymringer om AI-sikkerhed, når det kommer til autonome køretøjer?
Autonome køretøjer bliver fremhævede eksempler på implementering af AI i cyber-fysiske systemer. Med tanke på den fundamentale sårbarhed af nuværende maskinlærings-teknologier over for fejl og adversarial angreb, er jeg dybt bekymret for sikkerheden og sikkerheden af selv semi-autonome køretøjer. Desuden lider feltet af autonome kørsel under en alvorlig mangel på sikkerhedsstandarder og evalueringsprotokoller. Jeg er dog stadig optimistisk. Ligesom naturlig intelligens vil AI også være tilbøjelig til at begå fejl. Dog kan målet med selv-kørende biler stadig opnås, hvis fejl- og påvirknings-raterne kan gøres lavere end dem for menneskelige chauffører. Vi er vidne til voksende bestræbelser på at løse disse problemer i industrien og akademiet samt regeringerne.
Hacking af vejsskilte med klistermærker eller ved andre midler kan forvirre computer-vision-modulen i et autonomt køretøj. Hvor stort et problem tror du, det er?
Disse klistermærker og adversarial eksempler i almindelighed giver anledning til fundamentale udfordringer i robustheden af maskinlæringsmodeller. For at citerer George E. P. Box: “Alle modeller er forkerte, men nogle er nyttige”. Adversarial eksempler udnytter denne “forkert-hed” af modeller, som skyldes deres abstrakte natur samt begrænsningerne af de sampede data, de er trænet på. Seneste bestræbelser på området for adversarial maskinlæring har resulteret i enorme fremskridt i forhold til at øge robustheden af dybe læringsmodeller over for sådanne angreb. Fra et sikkerhedssynspunkt vil der altid være en måde at narre maskinlæringsmodeller på. Dog er det praktiske mål med at sikre maskinlæringsmodeller at øge omkostningerne ved at implementere sådanne angreb til et punkt af økonomisk umulighed.
Dit fokus er på sikkerheds- og sikkerhedsfunktionerne af både dyb lærings- og dyb forstærkning-lærings-systemer. Hvorfor er det så vigtigt?
Forstærkning-læringsmetoden er den fremherskende metode til at anvende maskinlæring på kontrol-problemer, som per definition involverer manipulation af deres omgivelser. Derfor tror jeg, at systemer baseret på forstærkning-læringsmetoden har væsentligt højere risiko for at forårsage store skader i den virkelige verden i forhold til andre maskinlæringsmetoder såsom klassificering. Dette problem forværres yderligere med integrationen af dyb lærings-teknologi i forstærkning-læringsmetoden, som muliggør adoptionen af forstærkning-læringsmetoden i højkomplekse indstillinger. Desuden er det min opfattelse, at forstærkning-læringsrammen er tæt relateret til de underliggende mekanismer for kognition i menneskelig intelligens, og at studiet af dets sikkerhed og sårbarheder kan føre til bedre indsigt i begrænsningerne for beslutningstagning i vores sind.
Tror du, at vi er tæt på at opnå kunstig almen intelligens (AGI)?
Dette er et notorisk svært spørgsmål at besvare. Jeg tror, at vi i øjeblikket har byggestenene til nogle arkitekturer, der kan muliggøre opståelsen af AGI. Dog kan det tage nogle år eller årtier at forbedre disse arkitekturer og forbedre omkostningerne ved at træne og vedligeholde disse arkitekturer. Over de kommende år vil vores agenter blive mere intelligente i en hurtigt voksende rate. Jeg tror ikke, at opståelsen af AGI vil blive annonceret i form af en [videnskabeligt gyldig] overskrift, men som resultatet af gradvis fremgang. Desuden tror jeg, at vi endnu ikke har en bredt accepteret metode til at teste og opdage eksistensen af en AGI, og dette kan forsinke vores realisering af de første eksempler på AGI.
Hvordan kan vi opretholde sikkerhed i et AGI-system, der er i stand til at tænke for sig selv og sandsynligvis vil være eksponentielt mere intelligent end mennesker?
Jeg tror, at den samlede teori om intelligent adfærd er økonomi og studiet af, hvordan agenter handler og interagerer for at opnå, hvad de vil have. Beslutningerne og handlingerne hos mennesker bestemmes af deres mål, deres information og de tilgængelige ressourcer. Samfund og fælles bestræbelser opstår af deres fordele for de enkelte medlemmer af sådanne grupper. Et andet eksempel er den straffelov, der afholder bestemte beslutninger ved at tilknytte en høj omkostning til handlinger, der kan skade samfundet. På samme måde tror jeg, at kontrollen af incitamenter og ressourcer kan muliggøre opståelsen af en tilstand af ligevægt mellem mennesker og eksempler på AGI. I øjeblikket undersøger AI-sikkerhedsfællesskabet denne tese under paraplyen for værdi-alignment-problemer.
En af de områder, du følger tæt, er bekæmpelse af terrorisme. Har du bekymringer om, at terrorister overtager AI- eller AGI-systemer?
Der er mange bekymringer om misbrug af AI-teknologier. I tilfælde af terroristoperationer er den primære bekymring, hvor let terrorister kan udvikle og gennemføre autonome angreb. Et voksende antal af mine kolleger advarer aktivt mod risikoen for at udvikle autonome våben (se https://autonomousweapons.org/ ). Et af de primære problemer med AI-aktiveret våben er svigtigheden ved at kontrollere den underliggende teknologi: AI er i frontlinjen for åben forskning, og enhver med adgang til internettet og forbruger-grads-hardware kan udvikle skadelige AI-systemer. Jeg formoder, at opståelsen af autonome våben er uundgåelig, og tror, at der snart vil være behov for nye teknologiske løsninger til at modvirke sådanne våben. Dette kan resultere i en kat-og-mus-cyklus, der driver udviklingen af AI-aktiverede våben, hvilket kan give anledning til alvorlige eksistensielle risici på lang sigt.
Hvad kan vi gøre for at holde AI-systemer sikre fra disse adversarial-agenter?
Det første og vigtigste skridt er uddannelse: Alle AI-ingeniører og -praktikere skal lære om sårbarhederne af AI-teknologier og overveje de relevante risici i design og implementering af deres systemer. For mere tekniske anbefalinger findes der forskellige forslag og løsningskoncepter, der kan anvendes. For eksempel kan træning af maskinlærings-agenter i adversarial-indstillinger forbedre deres robusthed og modstandskraft over for undgåelse og politik-manipulationsangreb (f.eks. se min artikel med titlen “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). En anden løsning er at direkte tage hensyn til risikoen for adversarial angreb i arkitekturen af agenten (f.eks. Bayesian-tilgange til risikomodellering). Der er dog et stort hul i dette område, og det er behovet for universelle metrikker og metoder til at evaluere robustheden af AI-agenter over for adversarial angreb. Nuværende løsninger er primært ad hoc og giver ikke generelle målinger af robusthed over for alle typer angreb.
Er der noget andet, du gerne vil dele om nogen af disse emner?
I 2014 offentliggjorde Scully et al. en artikel på NeurIPS-konferencen med et meget oplysende emne: “Maskinlæring: Den høje-rentekredit af teknisk gæld“. Selv med alle fremskridtene i feltet i de seneste år har denne udtalelse endnu ikke mistet sin gyldighed. Den nuværende tilstand af AI og maskinlæring er intet mindre end imponerende, men vi er endnu ikke nået til at udfylde et betydeligt antal store huller i både grundlaget og den tekniske dimension af AI. Dette faktum er i min mening det vigtigste, der kan tages fra vores samtale. Jeg mener naturligvis ikke at afrette den kommercielle adoption af AI-teknologier, men kun at enable engineering-fællesskabet til at tage hensyn til risikoen og begrænsningerne af nuværende AI-teknologier i deres beslutninger.
Jeg nød virkelig at lære om sikkerheds- og sikkerhedsudfordringerne for forskellige typer AI-systemer. Dette er virkelig noget, som individer, virksomheder og regeringer skal være bekendt med. Læsere, der ønsker at lære mere, kan besøge Secure and Assured Intelligent Learning (SAIL) Lab.












