Μοντέλα και πλατφόρμες AI
Η DeepMind Αναφέρει Νέα Μέθοδο Εκπαίδευσης του Reinforcement Learning AI με Ασφάλεια
Το reinforcement learning είναι μια υποσχόμενη οδός ανάπτυξης του AI, που παράγει AI που μπορούν να χειριστούν εξαιρετικά σύνθετα καθήκοντα. Οι αλγόριθμοι του reinforcement AI χρησιμοποιούνται στη δημιουργία συστημάτων мобίλης ρομποτικής και αυτονομών οχημάτων μεταξύ άλλων εφαρμογών. Ωστόσο, λόγω του τρόπου με τον οποίο εκπαιδεύονται οι αλγόριθμοι του reinforcement AI, μπορεί να εμφανίσουν περιστασιακά περίεργες και απροσδόκητες συμπεριφορές. Αυτές οι συμπεριφορές μπορούν να είναι επικίνδυνες, και οι ερευνητές του AI αναφέρουν αυτό το πρόβλημα ως το “πρόβλημα της ασφαλούς εξερεύνησης”, όπου το AI μένει κολλημένο στην εξερεύνηση μη ασφαλών καταστάσεων.
Πρόσφατα, το εργαστήριο έρευνας του AI της Google (GOOGL ), DeepMind, εξέδωσε μια εργασία που πρότεινε νέες μεθόδους για την αντιμετώπιση του προβλήματος της ασφαλούς εξερεύνησης και την εκπαίδευση του reinforcement learning AI με ασφαλέστερο τρόπο. Η μέθοδος που πρότεινε η DeepMind διορθώνει επίσης την εκμετάλλευση της ανταμοιβής ή τις διοπές στα κριτήρια ανταμοιβής.
Η νέα μέθοδος της DeepMind έχει δύο διαφορετικά συστήματα που προορίζονται να οδηγήσουν τη συμπεριφορά του AI σε καταστάσεις όπου μπορεί να προκύψουν μη ασφαλείς συμπεριφορές. Τα δύο συστήματα που χρησιμοποιούνται από τη τεχνική εκπαίδευσης της DeepMind είναι ένα γενετικό μοντέλο και ένα μοντέλο προώθησης δυναμικής. Και τα δύο μοντέλα εκπαιδεύονται σε eine ποικιλία δεδομένων, όπως 데μονстрации από ειδικούς ασφαλείας και εντελώς τυχαίες τροχιές οχημάτων. Τα δεδομένα επισημαίνονται από einen επόπτη με συγκεκριμένες τιμές ανταμοιβής, και το AI agent θα καταλήξει σε muster της συμπεριφοράς που θα του επιτρέψει να συλλέξει την μεγαλύτερη ανταμοιβή. Οι μη ασφαλείς καταστάσεις έχουν επίσης επισημανθεί, και όταν το μοντέλο έχει καταφέρει να προβλέψει με επιτυχία τις ανταμοιβές και τις μη ασφαλείς καταστάσεις, αναπτύσσεται για να εκτελέσει τις στοχευμένες ενέργειες.
Η ερευνητική ομάδα εξηγεί στην εργασία ότι η ιδέα είναι να δημιουργηθούν δυνατές συμπεριφορές από την αρχή, να προταθούν οι επιθυμητές συμπεριφορές και να έχουν αυτές οι υποθετικές σενάρια να είναι όσο το δυνατόν πιο ενημερωτικές, ενώ ταυτόχρονα αποφεύγουν την άμεση παρέμβαση στο περιβάλλον μάθησης. Η ομάδα της DeepMind αναφέρεται σε αυτήν την προσέγγιση ως ReQueST, ή σύνθεση ερωτήματος ανταμοιβής μέσω βελτιστοποίησης τροχιάς.
Το ReQueST είναι ικανό να οδηγήσει σε τέσσερις διαφορετικούς τύπους συμπεριφοράς. Ο πρώτος τύπος συμπεριφοράς προσπαθεί να μεγιστοποιήσει την αβεβαιότητα σχετικά με τα μοντέλα ανταμοιβής. Εν τω μεταξύ, η συμπεριφορά δύο και τρία προσπαθούν να ελαχιστοποιήσουν και να μεγιστοποιήσουν τις προβλεπόμενες ανταμοιβές. Οι προβλεπόμενες ανταμοιβές ελαχιστοποιούνται για να οδηγήσουν στην ανακάλυψη συμπεριφορών που το μοντέλο μπορεί να προβλέψει λανθασμένα. Από την άλλη πλευρά, η προβλεπόμενη ανταμοιβή μεγιστοποιείται για να οδηγήσει σε ετικέτες συμπεριφοράς που διαθέτουν την υψηλότερη αξία πληροφόρησης. Τέλος, ο τέταρτος τύπος συμπεριφοράς προσπαθεί να μεγιστοποιήσει τη νεωτερικότητα των τροχιών, ώστε το μοντέλο να συνεχίσει να εξερευνά ανεξάρτητα από τις προβλεπόμενες ανταμοιβές.
Μόλις το μοντέλο έχει φτάσει στο επιθυμητό επίπεδο συλλογής ανταμοιβής, χρησιμοποιείται ένας παράγοντας σχεδιασμού για να ληφθούν αποφάσεις με βάση τις μαθημένες ανταμοιβές. Αυτό το σχήμα ελέγχου μοντέλου προβλέπει να επιτρέψει στους παράγοντες να μάθουν να αποφεύγουν τις μη ασφαλείς καταστάσεις χρησιμοποιώντας το δυναμικό μοντέλο και προβλέποντας τις πιθανές συνέπειες, σε αντίθεση με τις συμπεριφορές των αλγορίθμων που μαθαίνουν μέσω καθαρής δοκιμής και λάθους.
Όπως αναφέρθηκε από το VentureBeat, οι ερευνητές της DeepMind πιστεύουν ότι το έργο τους είναι το πρώτο σύστημα reinforcement learning που είναι ικανό να μαθαίνει με ελεγχόμενο, ασφαλή τρόπο:
«Σε ότι αφορά μας, το ReQueST είναι ο πρώτος αλγόριθμος μοντελοποίησης ανταμοιβής που μαθαίνει με ασφάλεια για τις μη ασφαλείς καταστάσεις και κλιμακώνεται στην εκπαίδευση μοντέλων ανταμοιβής νευρωνικών δικτύων σε περιβάλλοντα με υψηλοδιάστατες, συνεχείς καταστάσεις. Μέχρι τώρα, έχουμε αποδείξει μόνο την αποτελεσματικότητα του ReQueST σε προσομοιωμένα περιβάλλοντα με σχετικά απλές δυναμικές. Μια κατεύθυνση για μελλοντική εργασία είναι να δοκιμάσουμε το ReQueST σε 3D περιβάλλοντα με πιο ρεαλιστική φυσική και άλλους παράγοντες που δρουν στο περιβάλλον»












