Interviuri
Vahid Behzadan, Director al laboratorului Secured and Assured Intelligent Learning (SAIL) – Seria de interviuri

Vahid este profesor asistent de științe computaționale și științe ale datelor la Universitatea New Haven. El este, de asemenea, director al laboratorului Secure and Assured Intelligent Learning (SAIL) SAIL Lab
Interesele sale de cercetare includ siguranța și securitatea sistemelor inteligente, modelarea psihologică a problemelor de siguranță a inteligenței artificiale, securitatea sistemelor complexe adaptive, teoria jocurilor, sistemele multi-agente și securitatea cibernetică.
Aveți o experiență vastă în domeniul securității cibernetice și al siguranței inteligenței artificiale. Puteți împărtăși drumul dvs. în aceste două domenii?
Traectoria mea de cercetare a fost alimentată de două interese de bază: descoperirea modului în care lucrurile se strică și învățarea mecanismelor minții umane. Am fost implicat activ în securitatea cibernetică din adolescență și, în consecință, am construit agenda mea de cercetare în jurul problemelor clasice din acest domeniu. Câțiva ani mai târziu, în timpul studiilor mele de master, am avut ocazia rară de a schimba domeniul meu de cercetare. Atunci, tocmai descoperisem lucrările timpurii ale lui Szegedy și Goodfellow despre atacurile de exemple adverse și am găsit ideea de a ataca învățarea mașinilor foarte interesantă. Pe măsură ce am cercetat mai profund această problemă, am învățat despre domeniul mai general al siguranței și securității inteligenței artificiale și am constatat că încorporează multe dintre interesele mele de bază, cum ar fi securitatea cibernetică, științele cognitive, economia și filosofia. Am ajuns, de asemenea, să cred că cercetarea în acest domeniu nu numai că este fascinantă, dar și vitală pentru asigurarea beneficiilor pe termen lung și a siguranței revoluției inteligenței artificiale.
Sunteți director al laboratorului Secure and Assured Intelligent Learning (SAIL), care lucrează pentru a pune bazele concrete pentru siguranța și securitatea mașinilor inteligente. Puteți oferi detalii despre munca efectuată de SAIL?
La SAIL, studenții mei și eu lucrăm la probleme care se află la intersecția dintre securitate, inteligență artificială și sisteme complexe. Obiectivul principal al cercetării noastre este de a investiga siguranța și securitatea sistemelor inteligente, atât din perspectiva teoretică, cât și din cea aplicată. Din punct de vedere teoretic, suntem în prezent implicați în investigarea problemei de aliniere a valorilor în setări multi-agente și dezvoltarea unor instrumente matematice pentru a evalua și optimiza obiectivele agenților inteligenței artificiale în ceea ce privește stabilitatea și alinierea robustă. Din punct de vedere practic, unele dintre proiectele noastre explorează vulnerabilitățile de securitate ale tehnologiilor de inteligență artificială de ultimă generație, cum ar fi vehiculele autonome și tranzacționarea algoritmică, și urmăresc să dezvolte tehnici pentru evaluarea și îmbunătățirea rezilienței acestor tehnologii la atacuri adverse.
De asemenea, lucrăm la aplicațiile învățării mașinilor în securitatea cibernetică, cum ar fi testarea de penetrare automată, detectarea timpurie a încercărilor de intruziune și colectarea și analiza automată a informațiilor despre amenințări din surse deschise de date, cum ar fi rețelele sociale.
Ați condus recent un efort pentru a propune modelarea problemelor de siguranță a inteligenței artificiale ca tulburări psihopatologice
Acest proiect abordează complexitatea în creștere a agenților și sistemelor de inteligență artificială: deja este foarte dificil să se diagnosticheze, să se prevadă și să se controleze comportamentele nesigure ale agenților de învățare prin întărire în setări ne-triviale prin simpla examinare a configurațiilor lor de nivel scăzut. În această lucrare, subliniem nevoia de abstracții de nivel superior pentru investigarea unor astfel de probleme. Inspirat de abordările științifice ale problemelor comportamentale la oameni, propunem psihopatologia ca o abstracție utilă de nivel superior pentru modelarea și analiza comportamentelor dăunătoare emergente în inteligența artificială și în inteligența artificială generală. Ca demonstrație, studiem problema de siguranță a inteligenței artificiale a atacurilor de “hacking” a recompenselor într-un agent de învățare prin întărire care învață să joace jocul clasic Snake. Arătăm că, dacă adăugăm o “sămânță de drog” în mediu, agentul învață un comportament suboptimal care poate fi descris prin modele neuroștiințifice ale dependenței. Această lucrare propune, de asemenea, metodologii de control bazate pe abordările de tratament utilizate în psihiatrie. De exemplu, propunem utilizarea semnalelor de recompensă generate artificial ca analogi ai terapiei medicamentoase pentru modificarea comportamentului dăunător al agenților.
Aveți preocupări cu privire la siguranța inteligenței artificiale atunci când vine vorba de vehicule autonome?
Vehiculele autonome devin exemple proeminente de implementare a inteligenței artificiale în sisteme cibernetice. Având în vedere susceptibilitatea fundamentală a tehnologiilor actuale de învățare mașinilor la greșeli și atacuri adverse, sunt profund preocupat de siguranța și securitatea chiar și a vehiculelor semi-autonome. De asemenea, domeniul conducerii autonome suferă de o lipsă gravă de standarde și protocoale de evaluare a siguranței. Cu toate acestea, rămân optimist. Asemenea inteligenței naturale, inteligența artificială va fi, de asemenea, predispusă la greșeli. Cu toate acestea, obiectivul mașinilor cu conducere autonomă poate fi încă satisfăcut dacă rata și impactul unor astfel de greșeli sunt făcute să fie mai mici decât cele ale șoferilor umani. Suntem martorii unor eforturi crescânde pentru a aborda aceste probleme în industrie și în mediul academic, precum și în guverne.
Hacking-ul semnelor de circulație cu etichete sau prin alte mijloace poate confunda modulul de vedere computerizată al unui vehicul autonom. Cât de mare este această problemă?
Aceste etichete, și exemplele adverse în general, dau naștere la provocări fundamentale în ceea ce privește robustețea modelelor de învățare mașinilor. Pentru a cita lui George E. P. Box, “toate modelele sunt greșite, dar unele sunt utile”. Exemplele adverse exploatează “greșeala” acestor modele, care se datorează naturii lor abstracte, precum și limitărilor datelor eșantionate pe care sunt antrenate. Eforturile recente în domeniul învățării mașinilor adverse au dus la progrese uriașe în creșterea rezilienței modelelor de învățare profundă la astfel de atacuri. Din punct de vedere al securității, va exista întotdeauna o modalitate de a păcăli modelele de învățare mașinilor. Cu toate acestea, obiectivul practic al securității modelelor de învățare mașinilor este de a crește costul implementării unor astfel de atacuri până la punctul de ineficiență economică.
Focusul dvs. este pe caracteristicile de siguranță și securitate ale învățării profunde și ale învățării prin întărire profundă. De ce este acesta atât de important?
Învățarea prin întărire (RL) este metoda principală de aplicare a învățării mașinilor la probleme de control, care, prin definiție, implică manipularea mediului. Prin urmare, cred că sistemele bazate pe RL au riscuri semnificativ mai mari de a provoca daune majore în lumea reală în comparație cu alte metode de învățare mașinilor, cum ar fi clasificarea. Această problemă este exacerbată și mai mult de integrarea învățării profunde în RL, care permite adoptarea RL în setări complexe. De asemenea, este opinia mea că cadrul RL este strâns legat de mecanismele subiacente ale cogniției în inteligența umană, și studiul siguranței și vulnerabilităților sale poate duce la o înțelegere mai bună a limitelor procesului de luare a deciziilor în mințile noastre.
Credeti că suntem aproape de a atinge Inteligența Artificială Generală (AGI)?
Acesta este un răspuns extrem de dificil de dat. Cred că, în prezent, avem blocurile de construcție ale unor arhitecturi care pot facilita apariția AGI. Cu toate acestea, ar putea dura câțiva ani sau decenii pentru a îmbunătăți aceste arhitecturi și a crește eficiența costurilor de antrenare și întreținere a acestor arhitecturi. În următorii ani, agenții noștri vor deveni din ce în ce mai inteligenți la un ritm în creștere rapidă. Nu cred că apariția AGI va fi anunțată sub forma unui titlu științific valid, ci ca rezultat al progresului gradual. De asemenea, cred că încă nu avem o metodologie larg acceptată pentru testarea și detectarea existenței AGI, și acest lucru poate întârzia realizarea noastră a primelor instanțe de AGI.
Cum putem menține siguranța într-un sistem AGI care este capabil să gândească singur și va fi, probabil, exponențial mai inteligent decât oamenii?
Cred că teoria unificată a comportamentului inteligent este economia și studiul modului în care agenții acționează și interacționează pentru a-și atinge obiectivele. Deciziile și acțiunile oamenilor sunt determinate de obiectivele, informațiile și resursele disponibile. Societățile și eforturile de colaborare sunt emergente din beneficiile pentru membrii individuali ai unor astfel de grupuri. Un alt exemplu este codul penal, care descurajează anumite decizii prin atașarea unui cost ridicat acțiunilor care pot dăuna societății. În același mod, cred că controlul stimulentelor și resurselor poate permite apariția unui echilibru între oameni și instanțele AGI. În prezent, comunitatea de siguranță a inteligenței artificiale investighează această teză sub umbrela problemelor de aliniere a valorilor.
Una dintre domeniile pe care le urmăriți îndeaproape este contraterorismul. Aveți preocupări cu privire la teroriști care preiau controlul asupra sistemelor de inteligență artificială sau AGI?
Există numeroase preocupări cu privire la utilizarea necorespunzătoare a tehnologiilor de inteligență artificială. În cazul operațiunilor teroriste, principala preocupare este ușurința cu care teroriștii pot dezvolta și duce la îndeplinire atacuri autonome. Un număr tot mai mare de colegi ai mei avertizează activ împotriva riscurilor dezvoltării armelor autonome (a se vedea https://autonomousweapons.org/ ). Una dintre principalele probleme cu armamentul bazat pe inteligență artificială este dificultatea de a controla tehnologia subiacentă: inteligența artificială se află în fruntea cercetărilor deschise, și oricine are acces la internet și hardware de consum poate dezvolta sisteme de inteligență artificială dăunătoare. Suspectez că apariția armelor autonome este inevitabilă și cred că, în curând, va fi nevoie de soluții tehnologice noi pentru a contracara astfel de arme. Acest lucru poate duce la un ciclu de urmărire care alimentează evoluția armelor bazate pe inteligență artificială, ceea ce poate da naștere la riscuri existențiale grave pe termen lung.
Ce putem face pentru a păstra sistemele de inteligență artificială în siguranță de la acești agenți adversi?
Primul și cel mai important pas este educația: toți inginerii și practicienii de inteligență artificială trebuie să învețe despre vulnerabilitățile tehnologiilor de inteligență artificială și să ia în considerare riscurile relevante în proiectarea și implementarea sistemelor lor. În ceea ce privește recomandările tehnice, există diverse propuneri și concepte de soluții care pot fi utilizate. De exemplu, antrenarea agenților de învățare mașinilor în medii adverse poate îmbunătăți reziliența și robustețea lor împotriva atacurilor de evaziune și manipulare a politicilor (de exemplu, a se vedea lucrarea mea intitulată “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). O altă soluție este de a lua în considerare direct riscul atacurilor adverse în arhitectura agentului (de exemplu, abordări bayesiene pentru modelarea riscurilor). Cu toate acestea, există o lacună majoră în acest domeniu, și anume nevoia de metrice și metodologii universale pentru evaluarea robusteții agenților de inteligență artificială împotriva atacurilor adverse. Soluțiile actuale sunt, în mare parte, ad-hoc și nu oferă măsuri generale de reziliență împotriva tuturor tipurilor de atacuri.
Există altceva pe care ați dori să-l împărtășiți despre oricare dintre aceste subiecte?
În 2014, Scully și alții au publicat un articol la conferința NeurIPS cu un subiect foarte edificator: “Învățarea mașinilor: cardul de credit cu dobândă ridicată a datoriei tehnice“. Chiar și cu toate progresele din domeniu în ultimii ani, această afirmație încă nu și-a pierdut valabilitatea. Starea actuală a inteligenței artificiale și a învățării mașinilor nu este nimic altceva decât uimitoare, dar încă nu am umplut un număr semnificativ de lacune majore atât în dimensiunea de fundamente, cât și în cea de inginerie a inteligenței artificiale. Acest lucru, în opinia mea, este cel mai important lucru de reținut din conversația noastră. Desigur, nu încerc să descurajez adoptarea comercială a tehnologiilor de inteligență artificială, ci doar să permit inginerilor să ia în considerare riscurile și limitele tehnologiilor actuale de inteligență artificială în deciziile lor.
Mi-a plăcut foarte mult să aflu despre provocările de siguranță și securitate ale diferitelor tipuri de sisteme de inteligență artificială. Acesta este cu adevărat ceva de care indivizii, corporațiile și guvernele trebuie să fie conștienți. Citiitorii care doresc să afle mai multe informații ar trebui să viziteze Laboratorul de Învățare Inteligentă Sigură și Asigurată (SAIL).












