Συνεντεύξεις

Βαχίντ Μπεζαντάν, Διευθυντής του Εργαστηρίου Ασφαλών και Εγγυημένων Ευφυών Μαθημάτων (SAIL) – Σειρά Συνεντεύξεων

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ο Βαχίντ είναι Επίκουρος Καθηγητής Πληροφορικής και Επιστήμης Δεδομένων στο Πανεπιστήμιο του Νιου Χέιβεν. Είναι επίσης διευθυντής του Εργαστηρίου Ασφαλών και Εγγυημένων Ευφυών Μαθημάτων (SAIL)

Τα ερευνητικά του ενδιαφέροντα περιλαμβάνουν την ασφάλεια και την ασφάλεια των ευφυών συστημάτων, την ψυχολογική μοντελοποίηση των προβλημάτων ασφαλείας του AI, την ασφάλεια των σύνθετων προσαρμοστικών συστημάτων, τη θεωρία παιγνίων, τα συστήματα πολλαπλών πρακτόρων και την κυβερνοασφάλεια.

Έχετε μια εκτεταμένη εμπειρία στην κυβερνοασφάλεια και στην ασφάλεια του AI. Μπορείτε να μοιραστείτε το ταξίδι σας και πώς σας έκανε να ενδιαφερθείτε για τα δύο πεδία;

Η ερευνητική μου πορεία έχει τροφοδοτηθεί από δύο βασικά ενδιαφέροντα μου: το να ανακαλύψω πώς τα πράγματα σπάει και το να μάθω για τις μηχανικές του ανθρώπινου μυαλού. Έχω συμμετάσχει ενεργά στην κυβερνοασφάλεια από τα πρώτα έτη της εφηβείας μου και, ως εκ τούτου, έχω χτίσει το πρώτο ερευνητικό μου πρόγραμμα γύρω από τα κλασικά προβλήματα του τομέα. Λίγα χρόνια μετά τις μεταπτυχιακές μου σπουδές, ήρθα σε μια σπάνια ευκαιρία να αλλάξω τον τομέα της έρευνάς μου. Την εποχή εκείνη, είχα μόλις ανακαλύψει τις πρώτες εργασίες των Szegedy και Goodfellow για επιθέσεις αντιφατικών παραδειγμάτων και βρήκα την ιδέα της επίθεσης στο machine learning πολύ ενδιαφέρουσα. Όσο έψαχνα πιο sâu σε αυτό το πρόβλημα, ήρθα να μάθω για το πιο γενικό πεδίο της ασφάλειας και ασφάλειας του AI και βρήκα ότι περιλαμβάνει πολλά από τα βασικά μου ενδιαφέροντα, όπως η κυβερνοασφάλεια, οι khoaτικές επιστήμες, η οικονομία και η φιλοσοφία. Επίσης, ήρθα να πιστεύω ότι η έρευνα σε αυτό το πεδίο δεν είναι μόνο ενδιαφέρουσα, αλλά και ζωτικής σημασίας για τη διασφάλιση των μακροπρόθεσμων οφελών και της ασφάλειας της επανάστασης του AI.

 

Είστε ο διευθυντής του Εργαστηρίου Ασφαλών και Εγγυημένων Ευφυών Μαθημάτων (SAIL), το οποίο εργάζεται για τη δημιουργία συγκεκριμένων θεμελίων για την ασφάλεια και την ασφάλεια των ευφυών μηχανών. Μπορείτε να μας δώσετε κάποιες λεπτομέρειες σχετικά με το έργο που αναλαμβάνει το SAIL;

Στο SAIL, οι φοιτητές μου και εγώ εργαζόμαστε σε προβλήματα που βρίσκονται στη διασταύρωση της ασφάλειας, του AI και των σύνθετων συστημάτων. Ο πρωταρχικός στόχος της έρευνάς μας είναι η διερεύνηση της ασφάλειας και της ασφάλειας των ευφυών συστημάτων, τόσο από τη θεωρητική όσο και από την εφαρμοσμένη πλευρά. Από τη θεωρητική πλευρά, ερευνήσουμε目前 το πρόβλημα της ευθυγράμμισης των τιμών σε περιβάλλοντα πολλαπλών πρακτόρων και αναπτύσσουμε μαθηματικά εργαλεία για την αξιολόγηση και την βελτίωση των στόχων των πρακτόρων του AI σε σχέση με τη σταθερότητα και τη ρομποτική ευθυγράμμισή τους. Από την πρακτική πλευρά, κάποια από τα έργα μας διερευνούν τις ασφαλειες των τεχνολογιών του AI, όπως τα αυτόνομα οχήματα και η αλγοριθμική διαπραγμάτευση, και στοχεύουν στην ανάπτυξη τεχνικών για την αξιολόγηση και την βελτίωση της ανθεκτικότητας τέτοιων τεχνολογιών σε επιθέσεις αντιφατικών παραδειγμάτων.

Επίσης, εργαζόμαστε στις εφαρμογές του machine learning στην κυβερνοασφάλεια, όπως η αυτοματοποιημένη διείσδυση, η έγκαιρη ανίχνευση των προσπαθειών εισβολής και η αυτοματοποιημένη συλλογή και ανάλυση πληροφοριών απειλών από ανοιχτές πηγές δεδομένων, όπως τα μέσα κοινωνικής δικτύωσης.

 

Πρόσφατα ηγήθητε μιας προσπάθειας για την πρόταση της μοντελοποίησης των προβλημάτων ασφαλείας του AI ως ψυχοπαθολογικών διαταραχών. Μπορείτε να εξηγήσετε τι είναι αυτό;

Αυτό το έργο αντιμετωπίζει την ταχέως αυξανόμενη πολυπλοκότητα των πρακτόρων και συστημάτων του AI: ήδη είναι πολύ δύσκολο να διαγνώσουμε, να προβλέψουμε και να ελέγξουμε τις ασφαλείς συμπεριφορές των πρακτόρων του machine learning σε μη τριβές ρυθμίσεις, απλώς κοιτάζοντας τις χαμηλού επιπέδου ρυθμίσεις τους. Σε αυτή την εργασία, τονίζουμε την ανάγκη για υψηλότερες αφηγήσεις στην διερεύνηση τέτοιων προβλημάτων. Εμπνευσμένοι από τις επιστημονικές προσεγγίσεις στα προβλήματα συμπεριφοράς των ανθρώπων, προτείνουμε την ψυχοπαθολογία ως μια χρήσιμη υψηλή αφήγηση για την μοντελοποίηση και την ανάλυση των εκρηκτικών συμπεριφορών στα AI και AGI. Ως απόδειξη της концепції, μελετάμε το πρόβλημα ασφαλείας του AI της επίθεσης ανταγωνιστικών παραδειγμάτων σε ένα πρακτόρα του machine learning που μαθαίνει να παίζει το κλασικό παιχνίδι της Οφίδας. Δείχνουμε ότι αν προσθέσουμε ένα “φάρμακο” σπόρο στο περιβάλλον, ο πρακτόρας μαθαίνει μια υπο-βέλτιστη συμπεριφορά που μπορεί να περιγραφεί μέσω νευροεπιστημονικών μοντέλων της εθισμού. Αυτή η εργασία προτείνει επίσης μεθόδους ελέγχου βασισμένες στις προσεγγίσεις θεραπείας που χρησιμοποιούνται στην ψυχιατρική. Για παράδειγμα, προτείνουμε τη χρήση τεχνητά-παραγόμενων σήματα ανταμοιβής ως αναλόγων της θεραπείας φαρμάκων για την τροποποίηση της επιζήμιας συμπεριφοράς των πρακτόρων.

 

Έχετε κάποια ανησυχίες σχετικά με την ασφάλεια του AI όταν πρόκειται για αυτόνομα οχήματα;

Τα αυτόνομα οχήματα γίνονται προεξέχουσες περιπτώσεις της εφαρμογής του AI σε κυβερνο-φυσικά συστήματα. Λαμβάνοντας υπόψη την θεμελιώδη ευαλωτότητα των τρεχουσών τεχνολογιών του machine learning σε λάθη και επιθέσεις αντιφατικών παραδειγμάτων, είμαι βαθιά ανήσυχος για την ασφάλεια και την ασφάλεια ακόμη και των ημι-αυτόνομων οχημάτων. Επίσης, ο τομέας της αυτόνομης οδήγησης πλήττεται από μια σοβαρή έλλειψη προτύπων ασφαλείας και πρωτοκόλλων αξιολόγησης. Ωστόσο, παραμένω αισιόδοξος. Όμοια με τη φυσική νοημοσύνη, το AI θα είναι επίσης ευάλωτο σε λάθη. Πάντως, ο στόχος των αυτονομών οχημάτων μπορεί ακόμη να ικανοποιηθεί εάν οι ταχύτητες και ο αντίκτυπος των λαθών γίνουν μικρότεροι από εκείνους των ανθρώπινων οδηγών. Βλέπουμε αυξανόμενες προσπάθειες για την αντιμετώπιση αυτών των ζητημάτων στη βιομηχανία και την ακαδημία, καθώς και τις κυβερνήσεις.

 

Η επίθεση σε σημάδια οδικής κυκλοφορίας με αυτοκόλλητα ή με άλλα μέσα μπορεί να συγχύσει το模块 οπτικής του αυτόνομου οχήματος. Πόσο μεγάλο πρόβλημα πιστεύετε ότι είναι αυτό;

Αυτά τα αυτοκόλλητα και τα αντιφατικά παραδείγματα γενικά δίνουν rise σε θεμελιώδεις προκλήσεις στη ρομποτική του machine learning. Για να παραθέσω τον George E. P. Box, “όλα τα μοντέλα είναι λάθος, αλλά κάποια είναι χρήσιμα”. Τα αντιφατικά παραδείγματα εκμεταλλεύονται αυτή την “λαθωσότητα” των μοντέλων, η οποία οφείλεται στην αφηρημένη φύση τους, καθώς και τις περιορισμούς των δειγμάτων δεδομένων στα οποία εκπαιδεύονται. Πρόσφατες προσπάθειες στον τομέα του αντιφατικού machine learning έχουν οδηγήσει σε τεράστιες προόδους προς την αύξηση της ανθεκτικότητας των μοντέλων του deep learning σε τέτοιες επιθέσεις. Από μια ασφαλιστική πλευρά, θα υπάρχει πάντα ένας τρόπος να εξαπατήσουμε τα μοντέλα του machine learning. Ωστόσο, ο πρακτικός στόχος της ασφάλειας των μοντέλων του machine learning είναι να αυξήσουμε το κόστος της υλοποίησης τέτοιων επιθέσεων στο σημείο της οικονομικής αδιαθεσιμότητας.

 

Η εστίασή σας είναι στις ασφαλείς και ασφαλείς λειτουργίες του deep learning και του deep reinforcement learning. Γιατί είναι αυτό τόσο σημαντικό;

Το Reinforcement Learning (RL) είναι η εξέχουσα μέθοδος εφαρμογής του machine learning σε προβλήματα ελέγχου, τα οποία από τη φύση τους περιλαμβάνουν τη χειραγώγηση του περιβάλλοντος. Ως εκ τούτου, πιστεύω ότι τα συστήματα που βασίζονται στο RL έχουν σημαντικά υψηλότερα рисks να προκαλέσουν μεγάλες ζημιές στον πραγματικό κόσμο σε σύγκριση με άλλα μοντέλα του machine learning, όπως η ταξινόμηση. Αυτό το πρόβλημα είναι ακόμη περισσότερο εντείνεται με την ενσωμάτωση του deep learning στο RL, το οποίο επιτρέπει την υιοθέτηση του RL σε υψηλά σύνθετα περιβάλλοντα. Επίσης, είναι η γνώμη μου ότι το πλαίσιο του RL είναι στενά συνδεδεμένο με τις υποκείμενες μηχανισμούς της γνώσης στον ανθρώπινο νου, και η μελέτη της ασφάλειας και των ευαλωτότητων του μπορεί να οδηγήσει σε καλύτερη κατανόηση των ορίων της λήψης αποφάσεων στο μυαλό μας.

 

Πιστεύετε ότι είμαστε κοντά στην επίτευξη της Γενικής Νοημοσύνης (AGI);

Αυτό είναι ένα εξαιρετικά δύσκολο ερώτημα να απαντηθεί. Πιστεύω ότι τώρα έχουμε τα θεμέλια κάποιων αρχιτεκτονικών που μπορούν να διευκολύνουν την εμφάνιση της AGI. Ωστόσο, μπορεί να χρειαστούν quelques χρόνια ή δεκαετίες για να βελτιώσουμε αυτές τις αρχιτεκτονικές και να ενισχύσουμε την κόστος-αποτελεσματικότητα της εκπαίδευσης και της διατήρησης αυτών των αρχιτεκτονικών. Τα επόμενα χρόνια, οι πράκτορές μας θα γίνουν πιο ευφυείς με一个 ταχέως αυξανόμενο ρυθμό. Δεν πιστεύω ότι η εμφάνιση της AGI θα ανακοινωθεί με τη μορφή μιας [επιστημονικά έγκυρης] επικεφαλίδας, αλλά ως αποτέλεσμα της σταδιακής πρόοδου. Επίσης, πιστεύω ότι ακόμη δεν έχουμε μια ευρέως αποδεκτή μεθοδολογία για τον έλεγχο και την ανίχνευση της ύπαρξης μιας AGI, και αυτό μπορεί να καθυστερήσει την πραγματοποίηση των πρώτων περιπτώσεων της AGI.

 

Πώς διατηρούμε την ασφάλεια σε ένα σύστημα AGI που είναι ικανό να σκέφτεται για τον εαυτό του και θα είναι πιθανότατα εκθετικά πιο ευφυές από τους ανθρώπους;

Πιστεύω ότι η ενιαία θεωρία της ευφυούς συμπεριφοράς είναι η οικονομία και η μελέτη του πώς οι πράκτορες ενεργούν και αλληλεπιδρούν για να επιτύχουν αυτό που θέλουν. Οι αποφάσεις και οι ενέργειες των ανθρώπων καθορίζονται από τους στόχους τους, τις πληροφορίες τους και τους διαθέσιμους πόρους. Οι κοινωνίες και οι συνεργατικές προσπάθειες είναι εκρηκτικές από τα οφέλη για τα άτομα αυτών των ομάδων. Ένα άλλο παράδειγμα είναι ο κώδικας ποινικής δίκης, ο οποίος αποτρέπει ορισμένες αποφάσεις με την προσάρτηση ενός υψηλού κόστους σε ενέργειες που μπορεί να βλάψουν την κοινωνία. Σε τον ίδιο τρόπο, πιστεύω ότι ο έλεγχος των κινήτρων και των πόρων μπορεί να επιτρέψει την εμφάνιση μιας κατάστασης ισορροπίας μεταξύ των ανθρώπων και των περιπτώσεων της AGI. Τώρα, η κοινότητα της ασφάλειας του AI ερευνά αυτή τη θέση υπό την ομπρέλα των προβλημάτων ευθυγράμμισης των τιμών.

 

Μια από τις περιοχές που ακολουθείτε στενά είναι η καταπολέμηση της τρομοκρατίας. Έχετε ανησυχίες σχετικά με την κατάληψη των συστημάτων AI ή AGI από τρομοκράτες;

Υπάρχουν πολλές ανησυχίες σχετικά με την κακοποίηση των τεχνολογιών του AI. Σε περίπτωση τρομοκρατικών επιχειρήσεων, η κύρια ανησυχία είναι η ευκολία με την οποία οι τρομοκράτες μπορούν να αναπτύξουν και να εκτελέσουν αυτόνομες επιθέσεις. Ένας αυξανόμενος αριθμός των συναδέλφων μου προειδοποιεί ενεργά για τους κινδύνους της ανάπτυξης αυτόνομων όπλων (δείτε https://autonomousweapons.org/ ). Ένα από τα κύρια προβλήματα με τα όπλα του AI είναι η δυσκολία ελέγχου της υποκείμενης τεχνολογίας: το AI είναι στην πρώτη γραμμή της ανοιχτής έρευνας και οποιοσδήποτε με πρόσβαση στο διαδίκτυο και υλικό καταναλωτών μπορεί να αναπτύξει επιζήμιες τεχνολογίες του AI. Υποψιάζομαι ότι η εμφάνιση των αυτόνομων όπλων είναι αναπόφευκτη και πιστεύω ότι θα υπάρξει σύντομα ανάγκη για νέες τεχνολογικές λύσεις για την αντιμετώπιση τέτοιων όπλων. Αυτό μπορεί να οδηγήσει σε einen κατ’ οίκον κύκλο που τροφοδοτεί την εξέλιξη των όπλων του AI, τα οποία μπορεί να δώσουν rise σε σοβαρά υπαρξιακά ρίσκα στη μακροπρόθεσμη.

 

Τι μπορούμε να κάνουμε για να διατηρήσουμε τα συστήματα AI ασφαλή από αυτούς τους αντιφατικούς πράκτορες;

Ο πρώτος και ο πιο σημαντικός βήμας είναι η εκπαίδευση: Όλοι οι μηχανικοί και οι praktikoi του AI πρέπει να μάθουν για τις ευαλωτότητες των τεχνολογιών του AI και να λάβουν υπόψη τους σχετικούς κινδύνους στη σχεδίαση και την υλοποίηση των συστημάτων τους. Όσον αφορά τις πιο τεχνικές συστάσεις, υπάρχουν διάφορες προτάσεις και λύσεις που μπορούν να χρησιμοποιηθούν. Για παράδειγμα, η εκπαίδευση των μοντέλων του machine learning σε αντιφατικά περιβάλλοντα μπορεί να βελτιώσει την ανθεκτικότητά τους και τη ρομποτική τους ανθεκτικότητα έναντι επιθέσεων αντιφατικών παραδειγμάτων (π.χ. δείτε την εργασία μου με τίτλο “Whatever Does Not Kill Deep Reinforcement Learning, Makes it Stronger“). Μια άλλη λύση είναι να ληφθεί υπόψη trực tiếp ο κίνδυνος των επιθέσεων αντιφατικών παραδειγμάτων στη δομή του πράκτορα (π.χ. προσεγγίσεις Bayesian για την μοντελοποίηση του ρίσκου). Υπάρχει ωστόσο ένα μεγάλο κενό σε αυτόν τον τομέα, και είναι η ανάγκη για καθολικές μετρήσεις και μεθοδολογίες για την αξιολόγηση της ανθεκτικότητας των πρακτόρων του AI έναντι των επιθέσεων αντιφατικών παραδειγμάτων. Οι τρέχουσες λύσεις είναι κυρίως ad hoc και δεν παρέχουν γενικές μέτρες ανθεκτικότητας έναντι όλων των τύπων επιθέσεων.

 

Υπάρχει κάτι άλλο που θα ήθελε να μοιραστείτε σχετικά με οποιοδήποτε από αυτά τα θέματα;

Το 2014, ο Scully και οι συνεργάτες του δημοσίευσαν μια εργασία στη διάσκεψη NeurIPS με ένα πολύ ενδιαφέρον θέμα: “Machine Learning: The High-Interest Credit Card of Technical Debt“. Ακόμη και με όλες τις προόδους του πεδίου τα τελευταία χρόνια, αυτή η δήλωση δεν έχει ακόμη χάσει την εγκυρότητά της. Η τρέχουσα κατάσταση του AI και του machine learning δεν είναι τίποτα λιγότερο από εκπληκτική, αλλά ακόμη δεν έχουμε γεμίσει ένα σημαντικό αριθμό από κενά στη θεμελιώδη και την μηχανική διάσταση του AI. Αυτό το γεγονός, κατά την γνώμη μου, είναι το πιο σημαντικό σημείο της συζήτησής μας. Φυσικά, δεν εννοώ να αποθαρρύνω την εμπορική υιοθέτηση των τεχνολογιών του AI, αλλά μόνο να επιτρέψω στην κοινότητα της μηχανικής να λάβει υπόψη τους κινδύνους και τα όρια των τρεχουσών τεχνολογιών του AI στις αποφάσεις τους.

Πραγματικά απολαύσατε να μάθετε για τις προκλήσεις ασφαλείας και ασφάλειας των διαφόρων τύπων συστημάτων AI. Αυτό είναι πραγματικά κάτι που τα άτομα, οι εταιρείες και οι κυβερνήσεις πρέπει να γίνουν ενήμερες. Οι αναγνώστες που επιθυμούν να μάθουν περισσότερα πρέπει να επισκεφθούν το Εργαστήριο Ασφαλών και Εγγυημένων Ευφυών Μαθημάτων (SAIL).

Ο Antoine είναι ένας οραματιστής ηγέτης και συνιδρυτής της Unite.AI, οδηγείται από μια αμετάβλητη страсть για το σχήμα και την προώθηση του μέλλοντος της τεχνητής νοημοσύνης και της ρομποτικής. Ένας σειριακός επιχειρηματίας, πιστεύει ότι η τεχνητή νοημοσύνη θα είναι τόσο διαταρακτική για την κοινωνία όσο και η ηλεκτρική ενέργεια, και συχνά πιάνεται να μιλάει για το δυναμικό των διαταρακτικών τεχνολογιών και της AGI.

Ως μελλοντολόγος, είναι αφιερωμένος στο να εξερευνήσει πώς αυτές οι καινοτομίες θα σχήματίσουν τον κόσμο μας. Επιπλέον, είναι ο ιδρυτής του Securities.io, μιας πλατφόρμας που επικεντρώνεται στις επενδύσεις σε ακριβές τεχνολογίες που ανασχεδιάζουν το μέλλον και αναμορφώνουν ολόκληρες βιομηχανίες.