Interviews

Vahid Behzadan, directeur van Secured and Assured Intelligent Learning (SAIL) Lab – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Vahid is een assistant professor in de computerwetenschappen en datawetenschappen aan de University of New Haven. Hij is ook directeur van de Secure and Assured Intelligent Learning (SAIL) Lab

Zijn onderzoeksinteresses omvatten de veiligheid en beveiliging van intelligente systemen, psychologische modellering van AI-veiligheidsproblemen, beveiliging van complexe adaptieve systemen, speltheorie, multi-agent systemen en cyberbeveiliging.

U heeft een uitgebreide achtergrond in cybersecurity en het houden van AI-veilig. Kunt u uw reis vertellen over hoe u geïnteresseerd raakte in beide gebieden?

Mijn onderzoeksroute is gestimuleerd door twee kerninteresses van mij: het ontdekken van hoe dingen kapot gaan en het leren over de mechanismen van de menselijke geest. Ik ben al sinds mijn vroege tienerjaren actief betrokken bij cybersecurity en heb mijn vroege onderzoeksagenda gebouwd rond de klassieke problemen van dit domein. Een paar jaar later, tijdens mijn graduate studies, stuitte ik op een zeldzame gelegenheid om mijn onderzoeksgebied te veranderen. Toen had ik net de vroege werken van Szegedy en Goodfellow over adversarial example-aanvallen ontdekt en vond het idee van het aanvallen van machine learning erg intrigerend. Toen ik dieper keek naar dit probleem, kwam ik te weten over het bredere veld van AI-veiligheid en -beveiliging en vond ik dat het veel van mijn kerninteresses omvatte, zoals cybersecurity, cognitieve wetenschappen, economie en filosofie. Ik kwam ook tot de overtuiging dat onderzoek in dit gebied niet alleen fascinerend is, maar ook essentieel voor het waarborgen van de langetermijnvoordelen en -veiligheid van de AI-revolutie.

 

U bent de directeur van de Secure and Assured Intelligent Learning (SAIL) Lab, die werkt aan het leggen van concrete fundamenten voor de veiligheid en beveiliging van intelligente machines. Kunt u details geven over het werk dat door SAIL wordt uitgevoerd?

Bij SAIL werken mijn studenten en ik aan problemen die op het snijvlak van beveiliging, AI en complexe systemen liggen. De primaire focus van ons onderzoek ligt op het onderzoeken van de veiligheid en beveiliging van intelligente systemen, vanuit zowel theoretisch als praktisch perspectief. Aan de theoretische kant onderzoeken we momenteel het waarde-alignmentprobleem in multi-agentomgevingen en ontwikkelen we wiskundige instrumenten om de doelstellingen van AI-agenten te evalueren en te optimaliseren met betrekking tot stabiliteit en robuuste alignering. Aan de praktische kant onderzoeken enkele van onze projecten de beveiligingskwetsbaarheden van state-of-the-art AI-technologieën, zoals autonome voertuigen en algoritmische handel, en hebben we als doel technieken te ontwikkelen voor het evalueren en verbeteren van de veerkracht van dergelijke technologieën tegen adversarial aanvallen.

We werken ook aan de toepassingen van machine learning in cybersecurity, zoals geautomatiseerde penetratietests, vroegtijdige detectie van inbraakpogingen en geautomatiseerde dreigingsinformatieverzameling en -analyse van open bronnen van gegevens, zoals sociale media.

 

U leidde onlangs een inspanning om de modellering van AI-veiligheidsproblemen als psychopathologische stoornissen voor te stellen. Kunt u uitleggen wat dit is?

Dit project richt zich op de snel groeiende complexiteit van AI-agenten en -systemen: het is al moeilijk om onveilige gedragingen van versterking leeragenten in niet-triviale instellingen te diagnosticeren, te voorspellen en te controleren door alleen naar hun lage-niveauconfiguratie te kijken. In dit onderzoek benadrukken we de noodzaak van hogere abstractieniveaus bij het onderzoeken van dergelijke problemen. Geïnspireerd door de wetenschappelijke benaderingen van gedragsproblemen bij mensen, stellen we psychopathologie voor als een nuttige hogere abstractie voor het modelleren en analyseren van emergente schadelijke gedragingen in AI en AGI. Als bewijs van concept onderzoeken we het AI-veiligheidsprobleem van reward hacking in een RL-agent die leert het klassieke spel Snake te spelen. We laten zien dat als we een “drug” zaadje aan de omgeving toevoegen, de agent een suboptimale gedraging leert die kan worden beschreven met behulp van neuroscientifice modellen van verslaving. Dit onderzoek stelt ook controlemethoden voor op basis van de behandelingsbenaderingen die in de psychiatrie worden gebruikt. Bijvoorbeeld stellen we het gebruik van kunstmatig gegenereerde beloningsignalen voor als analogie van medicatietherapie voor het modificeren van het schadelijke gedrag van agenten.

 

Heeft u bezorgdheden over AI-veiligheid met betrekking tot autonome voertuigen?

Autonome voertuigen worden prominente voorbeelden van het inzetten van AI in cyberfysieke systemen. Gezien de fundamentele kwetsbaarheid van huidige machine learning-technologieën voor fouten en adversarial aanvallen, maak ik me ernstige zorgen over de veiligheid en beveiliging van zelfs semi-autonome voertuigen. Bovendien lijdt het veld van autonome rijden aan een ernstig gebrek aan veiligheidsnormen en evaluatieprotocollen. Toch blijf ik hoopvol. Net als bij natuurlijke intelligentie, zal AI ook vatbaar zijn voor het maken van fouten. Toch kan het doel van zelfrijdende auto’s nog steeds worden bereikt als de frequentie en impact van dergelijke fouten lager zijn dan die van menselijke bestuurders. We zien een groeiende inspanning om deze problemen in de industrie en de academische wereld aan te pakken, evenals de overheden.

 

Hacking van verkeersborden met stickers of andere middelen kan de computer visie-module van een autonoom voertuig in de war brengen. Hoe groot is dit probleem volgens u?

Deze stickers en adversarial examples in het algemeen geven aanleiding tot fundamentele uitdagingen in de robuustheid van machine learning-modellen. Om George E. P. Box te citeren: “alle modellen zijn verkeerd, maar sommige zijn nuttig”. Adversarial examples exploiteren deze “verkeerdheid” van modellen, die te wijten is aan hun abstracte aard, evenals de beperkingen van de gesamplede gegevens waarop ze getraind zijn. Recent onderzoek in het domein van adversarial machine learning heeft geleid tot enorme vooruitgang in het vergroten van de veerkracht van diepe learning-modellen tegen dergelijke aanvallen. Vanuit een beveiligingsperspectief zal er altijd een manier zijn om machine learning-modellen te misleiden. Toch is het praktische doel van het beveiligen van machine learning-modellen het verhogen van de kosten van het uitvoeren van dergelijke aanvallen tot het punt van economische onhaalbaarheid.

 

Uw focus ligt op de veiligheids- en beveiligingsfuncties van zowel diepe learning als diepe versterking learning. Waarom is dit zo belangrijk?

Versterking learning (RL) is de meest gebruikte methode voor het toepassen van machine learning op controleproblemen, die per definitie het manipuleren van hun omgeving inhouden. Daarom geloof ik dat systemen die op RL zijn gebaseerd, een significant hoger risico hebben om grote schade in de echte wereld aan te richten in vergelijking met andere machine learning-methoden, zoals classificatie. Dit probleem wordt verergerd door de integratie van diepe learning in RL, waardoor RL kan worden toegepast in zeer complexe omgevingen. Bovendien is het mijn mening dat het RL-kader nauw verwant is aan de onderliggende mechanismen van cognitie in de menselijke intelligentie en dat het onderzoeken van de veiligheid en kwetsbaarheden ervan kan leiden tot betere inzichten in de grenzen van besluitvorming in onze geest.

 

Gelooft u dat we dicht bij het bereiken van Artificial General Intelligence (AGI) zijn?

Dit is een notoire lastige vraag om te beantwoorden. Ik geloof dat we momenteel de bouwstenen hebben van enkele architectuur die de opkomst van AGI kan faciliteren. Toch kan het nog een paar jaar of decennia duren om deze architectuur te verbeteren en de kosten van het trainen en onderhouden van deze architectuur te verhogen. In de komende jaren zullen onze agenten snel intelligenter worden. Ik denk niet dat de opkomst van AGI zal worden aangekondigd in de vorm van een [wetenschappelijk valide] kop, maar als resultaat van geleidelijke vooruitgang. Bovendien denk ik dat we nog steeds geen breed aanvaarde methodologie hebben om de existentie van een AGI te testen en te detecteren en dat dit onze realisatie van de eerste instanties van AGI kan vertragen.

 

Hoe kunnen we veiligheid in stand houden in een AGI-systeem dat in staat is om zelf te denken en waarschijnlijk exponentieel slimmer zal zijn dan mensen?

Ik geloof dat de enige theorie van intelligent gedrag economie is en het onderzoeken van hoe agenten handelen en interageren om hun doelen te bereiken. De beslissingen en acties van mensen worden bepaald door hun doelen, hun informatie en de beschikbare middelen. Samenlevingen en gezamenlijke inspanningen zijn emergent uit de voordelen voor individuele leden van dergelijke groepen. Een ander voorbeeld is de strafwet, die bepaalde beslissingen ontmoedigt door een hoge prijs te hechten aan acties die de samenleving kunnen schaden. Op dezelfde manier geloof ik dat het controleren van de prikkels en middelen de opkomst van een evenwichtstoestand tussen mensen en instanties van AGI kan mogelijk maken. Momenteel onderzoekt de AI-veiligheidscommunity deze these onder de paraplu van waarde-alignmentproblemen.

 

Een van de gebieden die u nauwlettend volgt, is counterterrorism. Heeft u bezorgdheden over terroristen die AI- of AGI-systemen overnemen?

Er zijn tal van bezorgdheden over het misbruik van AI-technologieën. In het geval van terroristische operaties is de belangrijkste bezorgdheid de gemakkelijkheid waarmee terroristen autonome aanvallen kunnen ontwikkelen en uitvoeren. Een groeiend aantal van mijn collega’s waarschuwt actief tegen de risico’s van het ontwikkelen van autonome wapens (zie https://autonomousweapons.org/ ). Een van de belangrijkste problemen met AI-geactiveerde wapens is de moeilijkheid om de onderliggende technologie te controleren: AI is aan de vooravond van open-source onderzoek en iedereen met toegang tot internet en consumentenklasse hardware kan schadelijke AI-systemen ontwikkelen. Ik vermoed dat de opkomst van autonome wapens onvermijdelijk is en geloof dat er binnenkort een behoefte zal zijn aan nieuwe technische oplossingen om dergelijke wapens te bestrijden. Dit kan leiden tot een kat-en-muisspel dat de evolutie van AI-geactiveerde wapens stimuleert, wat op lange termijn tot ernstige existentiële risico’s kan leiden.

 

Wat kunnen we doen om AI-systemen te beschermen tegen deze adversarial agenten?

De eerste en belangrijkste stap is onderwijs: alle AI-ingenieurs en -praktijkmensen moeten leren over de kwetsbaarheden van AI-technologieën en de relevante risico’s in het ontwerp en de implementatie van hun systemen overwegen. Wat betreft meer technische aanbevelingen, zijn er verschillende voorstellen en oplossingsconcepten die kunnen worden toegepast. Bijvoorbeeld kan het trainen van machine learning-agenten in adversarial omgevingen hun veerkracht en robuustheid tegen ontwijkings- en beleidsmanipulatieaanvallen verbeteren (zie bijvoorbeeld mijn paper getiteld “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Een andere oplossing is om rechtstreeks rekening te houden met het risico van adversarial aanvallen in de architectuur van de agent (bijvoorbeeld Bayesiaanse benaderingen van risicomodellering). Er is echter een grote kloof in dit gebied en dat is de noodzaak van universele metrics en methodologieën voor het evalueren van de robuustheid van AI-agenten tegen adversarial aanvallen. Huidige oplossingen zijn meestal ad hoc en bieden geen algemene maatstaven van veerkracht tegen alle soorten aanvallen.

 

Is er nog iets anders dat u zou willen delen over een van deze onderwerpen?

In 2014 publiceerden Scully et al. een paper op de NeurIPS-conferentie met een zeer verhelderend onderwerp: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Zelfs met alle vooruitgang in het veld in de afgelopen jaren, heeft deze verklaring nog steeds niet aan geldigheid ingeboet. De huidige staat van AI en machine learning is niets minder dan verbijsterend, maar we zijn nog steeds ver van het invullen van een aanzienlijk aantal grote lacunes in zowel de fundamenten als de ingenieursdimensies van AI. Dit feit is, naar mijn mening, de belangrijkste conclusie van ons gesprek. Ik bedoel niet om de commerciële adoptie van AI-technologieën te ontmoedigen, maar alleen om de ingenieursgemeenschap in staat te stellen de risico’s en beperkingen van de huidige AI-technologieën in hun beslissingen te betrekken.

Ik heb echt genoten van het leren over de veiligheids- en beveiligingsuitdagingen van verschillende soorten AI-systemen. Dit is echt iets waar individuen, bedrijven en overheden zich bewust van moeten zijn. Lezers die meer willen leren, kunnen het Secure and Assured Intelligent Learning (SAIL) Lab bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.