Intervjuer
Vahid Behzadan, direktør for Secured and Assured Intelligent Learning (SAIL) Lab – Intervju-serie

Vahid er en assistentprofessor i datavitenskap og dataanalyse ved University of New Haven. Han er også direktør for Secure and Assured Intelligent Learning (SAIL) Lab
Hans forskningsinteresser inkluderer sikkerhet og sikring av intelligente systemer, psykologisk modellering av AI-sikkerhetsproblemer, sikkerhet av komplekse adaptive systemer, spillteori, multi-agent systemer og cybersikkerhet.
Du har en omfattende bakgrunn i cybersikkerhet og å holde AI trygg. Kan du dele din reise og hvordan du ble tiltrukket av begge felt?
Min forskningsbane har blitt drevet av to kjerneinteresser av mine: å finne ut hvordan ting bryter sammen, og å lære om mekanismene i det menneskelige sinnet. Jeg har vært aktivt engasjert i cybersikkerhet siden mine tidlige tenår, og bygget min tidlige forskningsagenda rundt de klassiske problemene i dette domenet. Et par år inn i mine doktorgradsstudier, støtte jeg på en sjelden mulighet til å endre mitt forskningsområde. Da hadde jeg nettopp kommet over de tidlige arbeidene til Szegedy og Goodfellow om adversarial eksempel-angrep, og fant ideen om å angripe maskinlæring svært interessant. Da jeg dykket dyptere inn i dette problemet, kom jeg til å lære om det mer generelle feltet AI-sikkerhet og -sikring, og fant at det omfatter mange av mine kjerneinteresser, som cybersikkerhet, kognitiv vitenskap, økonomi og filosofi. Jeg kom også til å tro at forskning i dette området ikke bare er fascinerende, men også vitalt for å sikre de langvarige fordelene og sikkerheten til AI-revolusjonen.
Du er direktør for Secure and Assured Intelligent Learning (SAIL) Lab, som arbeider med å legge konkrete grunnlag for sikkerhet og sikring av intelligente maskiner. Kan du gå inn på noen detaljer om arbeidet som utføres av SAIL?
Ved SAIL arbeider mine studenter og jeg med problemer som ligger i skjæringspunktet mellom sikkerhet, AI og komplekse systemer. Hovedfokus for vår forskning er å undersøke sikkerheten og sikringen av intelligente systemer, både fra teoretisk og praktisk synspunkt. På den teoretiske siden, undersøker vi for tiden verdialignering-problemet i multi-agent-miljøer og utvikler matematiske verktøy for å evaluere og optimere målene for AI-agenter med hensyn til stabilitet og robuste aligneringer. På den praktiske siden, utforsker noen av våre prosjekter sikkerhetssvakheter i de nyeste AI-teknologiene, som autonome kjøretøy og algoritmer for handel, og sikter på å utvikle teknikker for å evaluere og forbedre robustheten til slike teknologier mot adversarial angrep.
Vi arbeider også med anvendelser av maskinlæring i cybersikkerhet, som automatisert penetrerings-testing, tidlig oppdagelse av innbruddsforsøk og automatisert trussel-intelligens-samling og -analyse fra åpne datakilder som sosiale medier.
Du ledet nylig en innsats for å foreslå modellering av AI-sikkerhetsproblemer som psykopatologiske lidelser. Kan du forklare hva dette er?
Dette prosjektet omhandler den raskt voksende kompleksiteten til AI-agenter og -systemer: det er allerede svært vanskelig å diagnostisere, forutsi og kontrollere usikre atferder hos forsterkingslæring-agenter i ikke-trivielle settinger bare ved å se på deres lav-nivå-konfigurasjoner. I dette arbeidet, understreker vi behovet for høyere-nivå-abstraksjoner i å undersøke slike problemer. Inspirert av vitenskapelige tilnærminger til atferdsproblemer hos mennesker, foreslår vi psykopatologi som en nyttig høyere-nivå-abstraksjon for å modellere og analysere emergente skadelige atferder i AI og AGI. Som et bevis på konseptet, studerer vi AI-sikkerhetsproblemet med belønning-hacking i en RL-agent som lærer å spille det klassiske spillet Snake. Vi viser at hvis vi legger til en “medisin”-frø i miljøet, lærer agenten en sub-optimale atferd som kan beskrives via nevrovitenskapelige modeller for avhengighet. Dette arbeidet foreslår også kontroll-metodologier basert på behandlings-tilnærminger brukt i psykiatri. For eksempel, foreslår vi bruk av kunstig-genererte belønningssignaler som analoger til medikament-terapi for å modifisere de skadelige atferdene til agenter.
Har du noen bekymringer med AI-sikkerhet når det gjelder autonome kjøretøy?
Autonome kjøretøy blir mer og mer fremtredende eksempler på å deployere AI i kybernetiske systemer. Med tanke på den grunnleggende sårbarheten til nåværende maskinlærings-teknologier for feil og adversarial angrep, er jeg dypt bekymret for sikkerheten og sikringen av selv semi-autonome kjøretøy. Dessuten lider feltet autonome kjøring av en alvorlig mangel på sikkerhetsstandarder og evaluering-protokoller. Likevel, forblir jeg optimistisk. Liksom naturlig intelligens, vil AI også være utsatt for å gjøre feil. Likevel, kan målet med selv-kjørende biler likevel bli oppfylt hvis feil- og påvirknings-ratene til slike feil blir gjort lavere enn de til menneskelige sjåfører. Vi er vitne til økende innsats for å løse disse problemene i industrien og akademia, samt regjeringer.
Hacking av veiskilt med klistermerker eller andre midler kan forvirre datavisjonsmodulen til et autonomt kjøretøy. Hvor stort problem mener du dette er?
Disse klistermerkene, og adversarial eksempler generelt, gir opphav til fundamentale utfordringer i robustheten til maskinlærings-modeller. For å sitere George E. P. Box, “alle modeller er feil, men noen er nyttige”. Adversarial eksempler utnytter denne “feil”-heten til modeller, som skyldes deres abstrakte natur, samt begrensningene til samplet data som de er trent på. Nylige innsatser i domenet adversarial maskinlæring har resultert i enorme fremskritt mot å øke robustheten til dyplærings-modeller mot slike angrep. Fra et sikkerhetsperspektiv, vil det alltid være en måte å narre maskinlærings-modeller på. Likevel, er det praktiske målet med å sikre maskinlærings-modeller å øke kostnadene til å implementere slike angrep til et punkt av økonomisk umulighet.
Din fokus er på sikkerhets- og sikringsfunksjonene til både dyplæring og dyplæring med forsterkning. Hvorfor er dette så viktig?
Forsterkingslæring (RL) er den fremtredende metoden for å anvende maskinlæring til kontroll-problemer, som per definisjon involverer manipulering av deres miljø. Derfor mener jeg at systemer basert på RL har betydelig høyere risiko for å forårsake større skader i den virkelige verden sammenlignet med andre maskinlærings-metoder som klassifisering. Dette problemet er ytterligere forverret med integreringen av dyplæring i RL, som muliggjør adopsjonen av RL i svært komplekse settinger. Dessuten er det min mening at RL-rammeverket er nært beslektet med de underliggende mekanismene til kognisjon i menneskelig intelligens, og at studiet av dens sikkerhet og sårbarhet kan føre til bedre innsikt i grensene til beslutningstagning i våre sinn.
Tror du at vi er nærme å oppnå kunstig generell intelligens (AGI)?
Dette er et svært vanskelig spørsmål å svare på. Jeg tror at vi for øyeblikket har byggesteinene til noen arkitekturer som kan muliggjøre oppblomstringen av AGI. Likevel, kan det ta noen få år eller tiår å forbedre disse arkitekturene og forbedre kost- effektiviteten til trening og vedlikehold av disse arkitekturene. Over de kommende årene, vil våre agenter bli mer intelligente i en raskt voksende rate. Jeg tror ikke at oppblomstringen av AGI vil bli annonsert i form av en [vitenskapelig gyldig] overskrift, men som resultat av gradvis fremgang. Dessuten, tror jeg at vi fortsatt ikke har en allmenn akseptert metode for å teste og oppdage eksistensen av en AGI, og dette kan forsinke vår realisering av de første instansene av AGI.
Hvordan kan vi opprettholde sikkerhet i et AGI-system som er i stand til å tenke for seg selv og sannsynligvis vil være eksponentielt mer intelligent enn mennesker?
Jeg tror at den store, forente teorien om intelligent atferd er økonomi og studiet av hvordan agenter handler og samarbeider for å oppnå hva de ønsker. Beslutningene og handlingene til mennesker bestemmes av deres mål, deres informasjon og de tilgjengelige ressursene. Samfunn og samarbeidsinnsats er emergent fra dens fordeler for enkeltmedlemmer av slike grupper. Et annet eksempel er straffeloven, som avskrekker bestemte beslutninger ved å knytte en høy kostnad til handlinger som kan skade samfunnet. På samme måte, tror jeg at kontroll av incitamenter og ressurser kan muliggjøre oppblomstringen av en tilstand av likevekt mellom mennesker og instanser av AGI. For øyeblikket, undersøker AI-sikkerhets-samfunnet denne tesen under paraplyen til verdialignering-problemer.
En av områdene du følger nøye er motterrorisme. Har du bekymringer med at terrorister tar over AI- eller AGI-systemer?
Det finnes mange bekymringer om misbruk av AI-teknologier. I tilfelle terror-operasjoner, er hoved-bekymringen lettheten med hvilken terrorister kan utvikle og gjennomføre autonome angrep. Et økende antall av mine kolleger advarer aktivt mot risikoen for å utvikle autonome våpen (se https://autonomousweapons.org/ ). Et av hoved-problemene med AI-aktiverte våpen er vanskeligheten med å kontrollere den underliggende teknologien: AI er i fremtredende åpen kilde-forskning, og hvem som helst med tilgang til internett og forbruker-gradert maskinvare kan utvikle skadelige AI-systemer. Jeg mistenker at oppblomstringen av autonome våpen er uunngåelig, og tror at det snart vil være behov for nye teknologiske løsninger for å motvirke slike våpen. Dette kan resultere i en kat-og-mus-syklus som driver utviklingen av AI-aktiverte våpen, som kan føre til alvorlige eksistensielle risikoer på lang sikt.
Hva kan vi gjøre for å holde AI-systemer trygge fra disse adversarial agentene?
Det første og viktigste steget er utdanning: Alle AI-ingeniører og -praktikere må lære om sårbarhetene til AI-teknologier og vurdere de relevante risikoene i design og implementering av sine systemer. For mer tekniske anbefalinger, finnes det flere forslag og løsningskonsepter som kan bli anvendt. For eksempel, kan trening av maskinlærings-agenter i adversarial settinger forbedre deres robusthet og motstandskraft mot unngåelse og policy-manipulasjons-angrep (se for eksempel min artikkel med tittelen “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Et annet løsning er å direkte regne med risikoen for adversarial angrep i arkitekturen til agenten (se for eksempel Bayesian-tilnærminger til risikomodellering). Likevel, er det et stort gap i dette området, og det er behov for universelle målinger og metoder for å evaluere robustheten til AI-agenter mot adversarial angrep. Nåværende løsninger er hovedsakelig ad-hoc, og mangler å gi generelle målinger av motstandskraft mot alle typer angrep.
Er det noe annet du ønsker å dele om noen av disse emnene?
I 2014, publiserte Scully et al. en artikkel på NeurIPS-konferansen med et svært opplysende tema: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Selv med alle fremgangene i feltet de siste årene, har denne uttalelsen ennå ikke tapt sin gyldighet. Nåværende tilstand av AI og maskinlæring er ingen ting mindre enn imponerende, men vi er ennå ikke fylt et betydelig antall store gap i både grunnleggende og ingeniør-dimensjoner av AI. Dette faktum, mener jeg, er det viktigste take-away fra vår samtale. Jeg ønsker ikke å avskrekke den kommersielle adopsjonen av AI-teknologier, men bare å muliggjøre at ingeniør-samfunnet kan regne med risikoene og begrensningene til nåværende AI-teknologier i sine beslutninger.
Jeg nøt virkelig å lære om sikkerhets- og sikringsutfordringene til ulike typer AI-systemer. Dette er virkelig noe som individer, bedrifter og regjeringer må bli mer bevisst på. Lesere som ønsker å lære mer, bør besøke Secure and Assured Intelligent Learning (SAIL) Lab.












