Wywiady
Vahid Behzadan, Dyrektor Secured and Assured Intelligent Learning (SAIL) Lab – Wywiad

Vahid jest asystentem profesora informatyki i nauki o danych na Uniwersytecie New Haven. Jest również dyrektorem Secure and Assured Intelligent Learning (SAIL) Lab
Jego zainteresowania badawcze obejmują bezpieczeństwo i ochronę inteligentnych systemów, modelowanie psychologiczne problemów związanych z bezpieczeństwem AI, bezpieczeństwo złożonych systemów adaptacyjnych, teorię gier, systemy wieloagentowe i cyberbezpieczeństwo.
Masz obszerną wiedzę na temat cyberbezpieczeństwa i bezpieczeństwa AI. Czy możesz opowiedzieć o swojej drodze do zainteresowania się oboma dziedzinami?
Moja ścieżka badawcza była napędzana przez dwa podstawowe zainteresowania: odkrywanie, jak rzeczy się psują, i uczenie się o mechanizmach ludzkiego umysłu. Aktywnie zajmowałem się cyberbezpieczeństwem od wczesnej młodości i odpowiednio zbudowałem swoją wczesną agendę badawczą wokół klasycznych problemów tej dziedziny. Kilka lat później, podczas studiów podyplomowych, natknąłem się na rzadką okazję do zmiany obszaru badań. W tym czasie właśnie odkryłem wczesne prace Szegedy’ego i Goodfellowa na temat ataków przykładowych i znalazłem tę ideę bardzo interesującą. Gdy zagłębiłem się w ten problem, zacząłem się uczyć o ogólniejszej dziedzinie bezpieczeństwa i ochrony AI i odkryłem, że obejmuje wiele moich podstawowych zainteresowań, takich jak cyberbezpieczeństwo, nauki kognitywne, ekonomia i filozofia. Uważam również, że badania w tej dziedzinie są nie tylko fascynujące, ale także niezbędne do zapewnienia długoterminowych korzyści i bezpieczeństwa rewolucji AI.
Jesteś dyrektorem Secure and Assured Intelligent Learning (SAIL) Lab, które zajmuje się tworzeniem konkretnych podstaw dla bezpieczeństwa i ochrony inteligentnych maszyn. Czy możesz opowiedzieć o szczegółach dotyczących pracy prowadzonej przez SAIL?
W SAIL, moi studenci i ja zajmujemy się problemami, które leżą na przecięciu bezpieczeństwa, AI i złożonych systemów. Główny cel naszych badań to zbadanie bezpieczeństwa i ochrony inteligentnych systemów, zarówno z teoretycznego, jak i praktycznego punktu widzenia. Po stronie teoretycznej aktualnie badamy problem wartościowania w ustawieniach wieloagentowych i rozwijamy matematyczne narzędzia do oceny i optymalizacji celów agentów AI w odniesieniu do stabilności i wytrzymałości. Po stronie praktycznej niektóre z naszych projektów badają podatność na ataki bezpieczeństwa najnowszych technologii AI, takich jak samochody autonomiczne i handel algorytmiczny, i mają na celu rozwinięcie technik do oceny i poprawy wytrzymałości takich technologii na ataki.
Również zajmujemy się zastosowaniem uczenia maszynowego w cyberbezpieczeństwie, takim jak testowanie penetracyjne, wczesne wykrywanie prób włamania i automatyczne zbieranie i analiza informacji o zagrożeniach z otwartych źródeł danych, takich jak media społecznościowe.
Niedawno poprowadziłeś wysiłek, aby zaproponować modelowanie problemów bezpieczeństwa AI jako zaburzeń psychopatologicznych. Czy możesz wyjaśnić, co to jest?
Ten projekt dotyczy szybko rosnącej złożoności agentów i systemów AI: już teraz bardzo trudno jest diagnozować, przewidywać i kontrolować niebezpieczne zachowania agentów uczenia się wzmocnionego w niebanalnych ustawieniach, po prostu patrząc na ich niskopoziomowe konfiguracje. W tej pracy podkreślamy potrzebę wyższych abstrakcji w badaniu takich problemów. Zainspirowani naukowymi podejściami do problemów behawioralnych u ludzi, proponujemy psychopatologię jako użyteczną abstrakcję poziomu wyższego do modelowania i analizy wynikających szkodliwych zachowań w AI i AGI. Jako dowód koncepcyjny, badamy problem bezpieczeństwa AI związany z hakowaniem nagród w agencie RL uczącym się grać w klasyczną grę Snake. Pokazujemy, że jeśli dodamy “narkotyk” do środowiska, agent uczy się suboptymalnego zachowania, które można opisać za pomocą neuro naukowych modeli uzależnienia. Ta praca również proponuje metody kontroli oparte na podejściach stosowanych w psychiatrii. Na przykład, proponujemy użycie sztucznie wygenerowanych sygnałów nagradzania jako analogii do terapii lekowej w celu modyfikacji szkodliwego zachowania agentów.
Czy masz jakieś obawy dotyczące bezpieczeństwa AI w odniesieniu do samochodów autonomicznych?
Samochody autonomiczne stają się prominentnymi przykładami wdrożenia AI w systemach cyber-fizycznych. Biorąc pod uwagę fundamentalną podatność obecnych technologii uczenia maszynowego na błędy i ataki, jestem głęboko zaniepokojony bezpieczeństwem i ochroną nawet półautonomicznych pojazdów. Również dziedzina jazdy autonomicznej cierpi na brak standardów bezpieczeństwa i protokołów oceny. Jednak pozostaję optymistą. Podobnie jak inteligencja naturalna, AI również będzie podatna na popełnianie błędów. Cel samochodów samochodowych może być jednak spełniony, jeśli wskaźnik i wpływ takich błędów będą niższe niż w przypadku kierowców ludzkich. Świadkowie rosnących wysiłków w celu rozwiązania tych problemów w przemyśle i na uczelniach, a także w rządach.
Hakowanie znaków drogowych za pomocą naklejek lub innych środków może spowodować dezorientację modułu widzenia komputerowego samochodu autonomicznego. Jak duży problem uważasz, że jest to?
Te naklejki, a także przykładowe ataki, dają początek podstawowym wyzwaniom w zakresie wytrzymałości modeli uczenia maszynowego. Jak powiedział George E. P. Box, “wszystkie modele są błędne, ale niektóre są użyteczne”. Przykładowe ataki wykorzystują tę “błędność” modeli, która wynika z ich abstrakcyjnej natury, a także z ograniczeń danych, na których są szkolone. Ostatnie wysiłki w dziedzinie ataków na uczenie maszynowe doprowadziły do ogromnych postępów w zwiększaniu wytrzymałości modeli głębokiego uczenia na takie ataki. Z punktu widzenia bezpieczeństwa zawsze będzie sposób, aby oszukać modele uczenia maszynowego. Niemniej, praktyczny cel zabezpieczenia modeli uczenia maszynowego polega na zwiększeniu kosztu wdrożenia takich ataków do punktu nieopłacalności ekonomicznej.
Twoim celem jest bezpieczeństwo i ochrona zarówno głębokiego uczenia, jak i głębokiego uczenia wzmocnionego. Dlaczego jest to takie ważne?
Uczenie wzmocnione jest dominującą metodą stosowania uczenia maszynowego do problemów sterowania, które z definicji obejmują manipulację ich środowiskiem. Dlatego uważam, że systemy oparte na RL mają znacznie wyższe ryzyko powodowania znacznych szkód w świecie rzeczywistym w porównaniu z innymi metodami uczenia maszynowego, takimi jak klasyfikacja. Problem ten jest dodatkowo zaostrzony przez integrację głębokiego uczenia w RL, co umożliwia przyjęcie RL w wysoce złożonych ustawieniach. Uważam również, że ramy RL są ściśle związane z podstawowymi mechanizmami poznawczymi w ludzkiej inteligencji, a badanie ich bezpieczeństwa i podatności może prowadzić do lepszych spostrzeżeń na temat granic podejmowania decyzji w naszych umysłach.
Czy uważasz, że jesteśmy blisko osiągnięcia sztucznej inteligencji ogólnej (AGI)?
To jest niezwykle trudne pytanie do odpowiedzi. Uważam, że obecnie mamy bloki budowlane niektórych architektur, które mogą ułatwić powstanie AGI. Niemniej, może to potrwać kilka lat lub dziesięcioleci, aby ulepszyć te architektury i poprawić efektywność kosztową ich szkolenia i utrzymania. W nadchodzących latach nasze agenci będą rosły w inteligencji w szybko rosnącym tempie. Nie sądzę, że powstanie AGI zostanie ogłoszone w formie [naukowo poprawnej] nagłówka, ale jako wynik stopniowego postępu. Uważam również, że nie mamy jeszcze powszechnie akceptowanej metodyki testowania i wykrywania istnienia AGI, co może opóźnić nasze zrozumienie pierwszych przypadków AGI.
Jak utrzymać bezpieczeństwo w systemie AGI, który jest w stanie myśleć samodzielnie i prawdopodobnie będzie wykładniczo bardziej inteligentny niż ludzie?
Uważam, że zunifikowana teoria zachowania inteligentnego jest ekonomią i badaniem, w jaki sposób agenci działają i interaktywnie osiągają to, czego chcą. Decyzje i działania ludzi są determinowane przez ich cele, informacje i dostępne zasoby. Społeczeństwa i współpraca są wynikiem korzyści dla poszczególnych członków takich grup. Innym przykładem jest kodeks karny, który odstraszający określone decyzje, przypisując wysoki koszt do działań, które mogą szkodzić społeczeństwu. W ten sam sposób uważam, że kontrolowanie zachęt i zasobów może umożliwić powstanie stanu równowagi między ludźmi a przypadkami AGI. Obecnie społeczność bezpieczeństwa AI bada tę tezę pod hasłem problemów wartościowania.
Jedną z dziedzin, które śledzisz uważnie, jest przeciwdziałanie terroryzmowi. Czy masz obawy dotyczące terroryzmu, który przejmie systemy AI lub AGI?
Istnieje wiele obaw dotyczących nadużywania technologii AI. W przypadku operacji terrorystycznych główną obawą jest łatwość, z jaką terroryści mogą rozwijać i prowadzić autonomiczne ataki. Rosnąca liczba moich kolegów aktywnie ostrzega przed ryzykiem rozwoju broni autonomicznych (patrz https://autonomousweapons.org/ ). Jednym z głównych problemów związanych z bronią AI jest trudność w kontrolowaniu podstawowej technologii: AI jest na czele badań otwartoźródłowych, a każdy z dostępem do internetu i sprzętu konsumenckiego może rozwijać szkodliwe systemy AI. Podejrzewam, że powstanie broni autonomicznych jest nieuniknione, a wkrótce będzie potrzeba nowych rozwiązań technologicznych, aby przeciwdziałać takim bronim. Może to prowadzić do cyklu kot i mysz, który napędza ewolucję broni AI, co może prowadzić do poważnych ryzyk egzystencjalnych w długim okresie.
Co możemy zrobić, aby utrzymać systemy AI w bezpieczeństwie przed tymi agentami wrogimi?
Pierwszym i najważniejszym krokiem jest edukacja: wszyscy inżynierowie i praktycy AI muszą nauczyć się o podatnościach technologii AI i uwzględnić odpowiednie ryzyka w projekcie i wdrożeniu swoich systemów. Co się tyczy bardziej technicznych zaleceń, istnieją różne propozycje i koncepcje rozwiązań, które można zastosować. Na przykład, szkolenie agentów uczenia maszynowego w ustawieniach wrogich może poprawić ich wytrzymałość i odporność na ataki ominięcia i manipulacji polityki (patrz mój artykuł pt. “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Innym rozwiązaniem jest bezpośrednie uwzględnienie ryzyka ataków wrogich w architekturze agenta (np. podejścia bayesowskie do modelowania ryzyka). Istnieje jednak duża luka w tej dziedzinie, a mianowicie potrzeba powszechnych metryk i metodologii do oceny wytrzymałości agentów AI na ataki wrogie. Obecne rozwiązania są w większości przypadkowych i nie zapewniają ogólnych miar wytrzymałości na wszystkie typy ataków.
Czy jest coś jeszcze, co chciałbyś podzielić się na temat któregokolwiek z tych tematów?
W 2014 roku Scully i inni opublikowali artykuł na konferencji NeurIPS z bardzo pouczającym tematem: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Nawet pomimo wszystkich postępów w tej dziedzinie w ciągu ostatnich kilku lat, ta wypowiedź nie straciła jeszcze swojej ważności. Obecny stan AI i uczenia maszynowego jest niczym niezwykłym, ale wciąż mamy wiele luk w podstawowych i inżynierskich wymiarach AI. To, moim zdaniem, jest najważniejszym wnioskiem z naszej rozmowy. Oczywiście nie chcę zniechęcić do komercyjnego wdrożenia technologii AI, ale tylko umożliwić społeczności inżynierskiej uwzględnienie ryzyk i ograniczeń obecnych technologii AI w swoich decyzjach.
Bardzo się cieszyłem, ucząc się o wyzwaniach związanych z bezpieczeństwem i ochroną różnych systemów AI. To jest naprawdę coś, czego powinni być świadomi poszczególne osoby, korporacje i rządy. Czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Secure and Assured Intelligent Learning (SAIL) Lab.












