Interviews

Vahid Behzadan, Direktor des Secure and Assured Intelligent Learning (SAIL) Lab – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Vahid ist Assistant Professor für Informatik und Data Science an der University of New Haven. Er ist auch Direktor des Secure and Assured Intelligent Learning (SAIL) Lab

Seine Forschungsinteressen umfassen die Sicherheit und Sicherung intelligenter Systeme, psychologische Modellierung von AI-Sicherheitsproblemen, Sicherheit komplexer adaptiver Systeme, Spieltheorie, Multi-Agenten-Systeme und Cybersicherheit.

Sie haben eine umfassende Erfahrung in Cybersicherheit und der Sicherung von KI-Systemen. Können Sie uns Ihre Reise erzählen, wie Sie sich für beide Bereiche interessiert haben?

Meine Forschungsarbeit wurde von zwei grundlegenden Interessen getrieben: herauszufinden, wie Dinge funktionieren, und die Mechanismen des menschlichen Geistes zu verstehen. Ich bin seit meiner frühen Teenagerzeit in der Cybersicherheit aktiv und habe meine frühe Forschungsarbeit auf die klassischen Probleme dieses Bereichs konzentriert. Einige Jahre später, während meines Studiums, hatte ich die seltene Gelegenheit, mein Forschungsgebiet zu wechseln. Zu diesem Zeitpunkt hatte ich gerade die frühen Arbeiten von Szegedy und Goodfellow über adversarial example-Angriffe entdeckt und fand die Idee, Machine-Learning-Systeme anzugreifen, sehr faszinierend. Als ich mich tiefer mit diesem Problem auseinandersetzte, erfuhr ich mehr über den allgemeineren Bereich der KI-Sicherheit und -Sicherung und fand heraus, dass er viele meiner grundlegenden Interessen umfasst, wie Cybersicherheit, Kognitionsforschung, Wirtschaft und Philosophie. Ich glaube auch, dass Forschung in diesem Bereich nicht nur faszinierend ist, sondern auch für die langfristigen Vorteile und die Sicherheit der KI-Revolution von entscheidender Bedeutung ist.

 

Sie sind der Direktor des Secure and Assured Intelligent Learning (SAIL) Lab, das darauf abzielt, konkrete Grundlagen für die Sicherheit und Sicherung intelligenter Maschinen zu schaffen. Können Sie uns einige Details über die Arbeit des SAIL Lab erzählen?

Im SAIL Lab arbeiten meine Studenten und ich an Problemen, die an der Schnittstelle zwischen Sicherheit, KI und komplexen Systemen liegen. Der primäre Fokus unserer Forschung liegt auf der Untersuchung der Sicherheit und Sicherung intelligenter Systeme, sowohl aus theoretischer als auch aus praktischer Sicht. Theoretisch untersuchen wir derzeit das Wert-Alignierungsproblem in Multi-Agenten-Systemen und entwickeln mathematische Werkzeuge, um die Ziele von KI-Agenten in Bezug auf Stabilität und Robustheit zu bewerten und zu optimieren. Praktisch erforschen einige unserer Projekte die Sicherheitslücken der neuesten KI-Technologien, wie autonomer Fahrzeuge und algorithmischer Handel, und zielen darauf ab, Techniken zur Bewertung und Verbesserung der Widerstandsfähigkeit solcher Technologien gegenüber adversarialen Angriffen zu entwickeln.

Wir arbeiten auch an der Anwendung von Machine-Learning-Verfahren in der Cybersicherheit, wie automatisierter Penetrationstests, früher Erkennung von Eindringversuchen und automatisierter Bedrohungsanalyse und -sammlung aus offenen Datenquellen wie sozialen Medien.

 

Sie haben kürzlich eine Initiative geleitet, um die Modellierung von KI-Sicherheitsproblemen als psychopathologische Störungen vorzuschlagen. Können Sie uns erklären, was das ist?

Dieses Projekt behandelt die rasch wachsende Komplexität von KI-Systemen: Es ist bereits sehr schwierig, unsichere Verhaltensweisen von Verstärkungslern-Systemen in nicht-trivialen Umgebungen zu diagnostizieren, vorherzusagen und zu kontrollieren, indem man einfach ihre Konfigurationen betrachtet. In dieser Arbeit betonen wir die Notwendigkeit höherer Abstraktionen bei der Untersuchung solcher Probleme. Inspiriert von den wissenschaftlichen Ansätzen zu Verhaltensproblemen beim Menschen, schlagen wir Psychopathologie als nützliche höhere Abstraktion für die Modellierung und Analyse von schädlichen Verhaltensweisen in KI- und AGI-Systemen vor. Als Beweis dafür untersuchen wir das KI-Sicherheitsproblem des Reward-Hackings in einem RL-System, das das klassische Spiel Snake spielt. Wir zeigen, dass, wenn wir einen “Drogen”-Seed in die Umgebung einfügen, der Agent ein suboptimales Verhalten lernt, das durch neuroscientifische Modelle der Sucht beschrieben werden kann. Diese Arbeit schlägt auch Kontrollmethoden vor, die auf den Behandlungsansätzen in der Psychiatrie basieren. Zum Beispiel schlagen wir die Verwendung künstlich generierter Belohnungssignale als Analogon zur Medikamententherapie zur Modifizierung des schädlichen Verhaltens von Agenten vor.

 

Haben Sie Bedenken hinsichtlich der KI-Sicherheit bei autonomen Fahrzeugen?

Autonome Fahrzeuge werden zu prominenten Beispielen für die Einsetzung von KI in cyber-physischen Systemen. Angesichts der grundlegenden Anfälligkeit aktueller Machine-Learning-Technologien für Fehler und adversarialen Angriffe bin ich tief besorgt über die Sicherheit und Sicherung sogar semi-autonomer Fahrzeuge. Außerdem leidet das Gebiet der autonomen Fahrzeugtechnik unter einem ernsthaften Mangel an Sicherheitsstandards und Bewertungsprotokollen. Ich bleibe jedoch optimistisch. Ähnlich wie die natürliche Intelligenz wird auch die KI fehleranfällig sein. Dennoch kann das Ziel der selbstfahrenden Autos noch erfüllt werden, wenn die Rate und der Einfluss solcher Fehler geringer sind als die von menschlichen Fahrern. Wir sind Zeugen wachsender Bemühungen, diese Probleme in der Industrie und der Wissenschaft zu lösen, sowie in den Regierungen.

 

Das Hacken von Straßenschildern mit Aufklebern oder anderen Mitteln kann das Computer-Vision-Modul eines autonomen Fahrzeugs verwirren. Wie groß ist dieses Problem?

Diese Aufkleber und allgemein adversarialen Beispiele werfen grundlegende Herausforderungen in der Robustheit von Machine-Learning-Modellen auf. Um George E. P. Box zu zitieren: “Alle Modelle sind falsch, aber einige sind nützlich”. Adversarial-Beispiele nutzen diese “Falschheit” von Modellen aus, die aufgrund ihrer abstrakten Natur und der Begrenzungen der trainierten Daten entsteht. Jüngste Bemühungen im Bereich des adversarialen Machine Learning haben zu enormen Fortschritten bei der Erhöhung der Widerstandsfähigkeit von Deep-Learning-Modellen gegenüber solchen Angriffen geführt. Aus sicherheitstechnischer Sicht wird es immer eine Möglichkeit geben, Machine-Learning-Modelle zu täuschen. Das praktische Ziel der Sicherung von Machine-Learning-Modellen besteht jedoch darin, die Kosten für die Umsetzung solcher Angriffe so hoch zu treiben, dass sie wirtschaftlich unrentabel werden.

 

Ihr Fokus liegt auf den Sicherheits- und Sicherheitsfunktionen von Deep-Learning- und Deep-Reinforcement-Learning-Systemen. Warum ist das so wichtig?

Reinforcement Learning (RL) ist die prominenteste Methode, um Machine Learning auf Kontrollprobleme anzuwenden, die per Definition die Manipulation ihrer Umgebung beinhalten. Deshalb glaube ich, dass Systeme, die auf RL basieren, ein wesentlich höheres Risiko haben, im realen Leben größere Schäden zu verursachen, im Vergleich zu anderen Machine-Learning-Methoden wie der Klassifikation. Dieses Problem wird noch verschärft durch die Integration von Deep Learning in RL, die die Anwendung von RL in hochkomplexen Umgebungen ermöglicht. Außerdem ist es meine Meinung, dass das RL-Framework eng mit den zugrunde liegenden Mechanismen der kognitiven Prozesse in der menschlichen Intelligenz verbunden ist, und die Untersuchung seiner Sicherheit und Verwundbarkeit kann zu besseren Einblicken in die Grenzen der Entscheidungsfindung in unserem Gehirn führen.

 

Glauben Sie, dass wir nahe daran sind, künstliche allgemeine Intelligenz (AGI) zu erreichen?

Diese Frage ist sehr schwer zu beantworten. Ich glaube, dass wir derzeit die Bausteine einiger Architekturen haben, die die Entstehung von AGI ermöglichen können. Es wird jedoch noch einige Jahre oder Jahrzehnte dauern, um diese Architekturen zu verbessern und die Kosten für die Schulung und Wartung dieser Architekturen zu senken. In den kommenden Jahren werden unsere Agenten mit zunehmender Geschwindigkeit intelligenter. Ich denke nicht, dass die Entstehung von AGI in Form einer [wissenschaftlich gültigen] Schlagzeile angekündigt wird, sondern als Ergebnis graduellen Fortschritts. Außerdem denke ich, dass wir noch keine allgemein anerkannte Methode haben, um die Existenz von AGI zu testen und zu erkennen, und dies kann unsere Erkenntnis der ersten Instanzen von AGI verzögern.

 

Wie können wir die Sicherheit in einem AGI-System gewährleisten, das in der Lage ist, selbstständig zu denken und wahrscheinlich exponentiell intelligenter als der Mensch sein wird?

Ich glaube, dass die vereinigte Theorie des intelligenten Verhaltens die Ökonomie und das Studium ist, wie Agenten handeln und interagieren, um zu erreichen, was sie wollen. Die Entscheidungen und Handlungen von Menschen werden durch ihre Ziele, ihre Informationen und die verfügbaren Ressourcen bestimmt. Gesellschaften und kooperative Bemühungen entstehen aus den Vorteilen für die einzelnen Mitglieder solcher Gruppen. Ein weiteres Beispiel ist der Strafcode, der bestimmte Entscheidungen durch die Anbindung hoher Kosten an Handlungen, die der Gesellschaft schaden könnten, abschreckt. Auf ähnliche Weise glaube ich, dass die Kontrolle der Anreize und Ressourcen die Entstehung eines Gleichgewichtszustands zwischen Menschen und AGI-Instanzen ermöglichen kann. Derzeit untersucht die KI-Sicherheitsgemeinschaft diese These unter dem Schirm der Wert-Alignierungsprobleme.

 

Eines der Gebiete, das Sie genau verfolgen, ist die Terrorismusbekämpfung. Haben Sie Bedenken hinsichtlich des Missbrauchs von KI- oder AGI-Systemen durch Terroristen?

Es gibt zahlreiche Bedenken hinsichtlich des Missbrauchs von KI-Technologien. Im Falle von Terroroperationen ist das Hauptproblem die Leichtigkeit, mit der Terroristen autonome Angriffe entwickeln und durchführen können. Eine wachsende Zahl meiner Kollegen warnt eindringlich vor den Risiken der Entwicklung autonomer Waffen (siehe https://autonomousweapons.org/ ). Eines der Hauptprobleme mit KI-gesteuerter Bewaffnung ist die Schwierigkeit, die zugrunde liegende Technologie zu kontrollieren: KI ist an der Spitze der Open-Source-Forschung, und jeder mit Zugang zum Internet und Consumer-Hardware kann schädliche KI-Systeme entwickeln. Ich vermute, dass die Entstehung autonomer Waffen unvermeidlich ist und bald der Bedarf an neuen technologischen Lösungen entsteht, um solche Waffen zu bekämpfen. Dies kann zu einem Katz-und-Maus-Spiel führen, das die Evolution von KI-gesteuerter Bewaffnung antreibt, was zu ernsthaften existenziellen Risiken auf lange Sicht führen kann.

 

Was können wir tun, um KI-Systeme vor diesen adversarialen Agenten zu schützen?

Der erste und wichtigste Schritt ist die Bildung: Alle KI-Ingenieure und -Praktiker müssen über die Verwundbarkeiten von KI-Technologien informiert werden und die relevanten Risiken bei der Konzeption und Implementierung ihrer Systeme berücksichtigen. Was die technischen Empfehlungen betrifft, gibt es verschiedene Vorschläge und Lösungskonzepte, die eingesetzt werden können. Zum Beispiel kann die Schulung von Machine-Learning-Agenten in adversarialen Umgebungen ihre Widerstandsfähigkeit und Robustheit gegenüber Evasion- und Policy-Manipulationsangriffen verbessern (z. B. siehe mein Paper mit dem Titel “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Eine weitere Lösung besteht darin, direkt die Risiken von adversarialen Angriffen in der Architektur des Agents zu berücksichtigen (z. B. bayessche Ansätze zur Risikomodellierung). Es gibt jedoch eine große Lücke in diesem Bereich, und das ist die Notwendigkeit universeller Metriken und Methoden zur Bewertung der Widerstandsfähigkeit von KI-Agenten gegenüber adversarialen Angriffen. Die aktuellen Lösungen sind meist ad hoc und bieten keine allgemeinen Maßstäbe für die Widerstandsfähigkeit gegenüber allen Arten von Angriffen.

 

Gibt es noch etwas, das Sie zu diesen Themen mitteilen möchten?

Im Jahr 2014 veröffentlichten Scully et al. ein Paper auf der NeurIPS-Konferenz mit einem sehr aufschlussreichen Thema: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Selbst mit all den Fortschritten in diesem Bereich in den letzten Jahren hat diese Aussage noch nicht an Gültigkeit verloren. Der aktuelle Stand von KI und Machine Learning ist nichts anderes als beeindruckend, aber wir haben noch nicht viele große Lücken in der Grundlage und der technischen Dimension von KI gefüllt. Dies ist, meiner Meinung nach, der wichtigste Punkt, den wir aus unserem Gespräch mitnehmen sollten. Ich möchte natürlich nicht die kommerzielle Anwendung von KI-Technologien entmutigen, sondern lediglich die Ingenieurgemeinschaft in die Lage versetzen, die Risiken und Grenzen der aktuellen KI-Technologien in ihren Entscheidungen zu berücksichtigen.

Ich habe wirklich Spaß daran, über die Sicherheits- und Sicherheitsprobleme verschiedener KI-Systeme zu lernen. Dies ist wirklich etwas, worüber sich Einzelpersonen, Unternehmen und Regierungen im Klaren sein sollten. Leser, die mehr erfahren möchten, sollten das Secure and Assured Intelligent Learning (SAIL) Lab besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.