Μοντέλα και πλατφόρμες AI
DeepMind και Google Brain Στόχο να Δημιουργήσουν Μέθοδους για τη Βελτίωση της Αποδοτικότητας του Ενισχυτικού Μάθησης

Τα συστήματα ενισχυτικού μάθησης μπορούν να είναι ισχυρά και ανθεκτικά,能够 να εκτελούν εξαιρετικά σύνθετες εργασίες μέσω χιλιάδων επαναλήψεων εκπαίδευσης. Ενώ οι αλγόριθμοι ενισχυτικού μάθησης είναι ικανοί να ενεργοποιούν εξελιγμένες και μερικές φορές आश्चηróες συμπεριφορές, χρειάζονται πολύ χρόνο για την εκπαίδευση και απαιτούν τεράστια ποσά δεδομένων. Αυτά τα στοιχεία καθιστούν τις τεχνικές ενισχυτικού μάθησης σχετικά αναποτελεσματικές, και πρόσφατα οι ερευνητικές ομάδες από το Alphabet (GOOG ) (GOOGL ) DeepMind και το Google Brain έχουν προσπαθήσει να βρουν πιο αποτελεσματικές μεθόδους για τη δημιουργία συστημάτων ενισχυτικού μάθησης.
Όπως αναφέρθηκε από το VentureBeat, η συνδυασμένη ερευνητική ομάδα πρόσφατα πρότεινε μεθόδους για την cải thiện της αποδοτικότητας της εκπαίδευσης ενισχυτικού μάθησης. Μια από τις προτεινόμενες βελτιώσεις ήταν ένας αλγόριθμος που ονομάζεται Adaptive Behavior Policy Sharing (ABPS), ενώ η άλλη ήταν ένα πλαίσιο που ονομάζεται Universal Value Function Approximators (UVFA). Το ABPS επιτρέπει σε πισίνες από πράκτορες AI να μοιράζονται τις εμπειρίες τους που έχουν επιλεγεί προσαρμοστικά, ενώ το UVFA επιτρέπει στους πράκτορες AI να ερευνήσουν ταυτόχρονα τις πολιτικές εξερεύνησης που έχουν κατευθυνθεί.
Το ABPS προορίζεται να επιταχύνει την προσαρμογή των υπερπαραμέτρων κατά την εκπαίδευση ενός μοντέλου. Το ABPS κάνει την εύρεση των βέλτιστων υπερπαραμέτρων πιο γρήγορη, επιτρέποντας σεหลาย διαφορετικούς πράκτορες με διαφορετικές υπερπαράμετρους να μοιράζονται τις εμπειρίες τους από την πολιτική συμπεριφοράς. Για να seja πιο ακριβής, το ABPS επιτρέπει στους πράκτορες ενισχυτικού μάθησης να επιλέγουν ενέργειες από τις ενέργειες που μια πολιτική έχει κριθεί ως αποδεκτή και στη συνέχεια να λάβουν μια ανταμοιβή και μια παρατήρηση με βάση την επόμενη κατάσταση.
Οι πράκτορες AI ενισχυτικού μάθησης εκπαιδεύονται με διάφορες συνδυασίες πιθανών υπερπαραμέτρων, όπως ο ρυθμός εκπτώσης και ο ρυθμός μάθησης. Κατά την εκπαίδευση ενός μοντέλου, ο στόχος είναι το μοντέλο να συγκλίνει στην συνδυασμό υπερπαραμέτρων που του δίνει την καλύτερη απόδοση, και σε αυτή την περίπτωση αυτές που βελτιώνουν επίσης την αποδοτικότητα των δεδομένων. Η αποδοτικότητα αυξάνεται με την εκπαίδευση πολλών πρακτόρων ταυτόχρονα και την επιλογή της συμπεριφοράς μόνο ενός πράκτορα για την ανάπτυξη κατά την επόμενη βήμα. Η πολιτική που έχει ο στόχος πράκτορας χρησιμοποιείται για να δειγματίζει ενέργειες. Οι μεταβάσεις καταγράφονται σε ένα κοινό χώρο και αυτός ο χώρος αξιολογείται συνεχώς, ώστε η επιλογή πολιτικής δεν χρειάζεται να συμβαίνει τόσο συχνά. Στο τέλος της εκπαίδευσης, ένα σύνολο πρακτόρων επιλέγεται και οι κορυφαίοι πράκτορες επιλέγονται για την τελική ανάπτυξη.
Όσον αφορά το UVFA, αυτό προσπαθεί να αντιμετωπίσει ένα από τα κοινά προβλήματα του ενισχυτικού μάθησης, ότι οι αδύναμες ενισχυμένες πολιτικές συχνά δεν μαθαίνουν τις εργασίες. Το UVFA προσπαθεί να λύσει το ζήτημα αυτό με τον τρόπο που ο πράκτορας μαθαίνει ένα ξεχωριστό σύνολο πολιτικών εκμετάλλευσης και εξερεύνησης ταυτόχρονα. Η διάκριση των εργασιών δημιουργεί ένα πλαίσιο που επιτρέπει στις πολιτικές εξερεύνησης να συνεχίσουν να εξερευνούν το περιβάλλον, ενώ οι πολιτικές εκμετάλλευσης συνεχίζουν να προσπαθούν να μεγιστοποιήσουν την ανταμοιβή για την τρέχουσα εργασία. Οι πολιτικές εξερεύνησης του UVFA χρησιμεύουν ως μια βασική αρχιτεκτονική που θα συνεχίσει να βελτιώνεται ακόμη και αν δεν υπάρχουν φυσικές ανταμοιβές που βρέθηκαν. Σε τέτοια περίπτωση, μια συνάρτηση που αντιστοιχεί σε εσωτερικές ανταμοιβές προσεγγίζεται, η οποία ωθεί τους πράκτορες να εξερευνήσουν όλες τις καταστάσεις σε ένα περιβάλλον, ακόμη και αν επιστρέφουν συχνά σε οικείες καταστάσεις.
Όπως εξήγησε το VentureBeat, όταν το πλαίσιο UVFA είναι σε λειτουργία, οι εσωτερικές ανταμοιβές του συστήματος δίνονται απευθείας στον πράκτορα ως εισόδους. Ο πράκτορας στη συνέχεια διατηρεί μια αναπαράσταση όλων των εισόδων (όπως ανταμοιβές, ενέργειες και κατάσταση) κατά τη διάρκεια eines επεισοδίου. Το αποτέλεσμα είναι ότι η ανταμοιβή διατηρείται με τον χρόνο και η πολιτική του πράκτορα είναι τουλάχιστον κάπως ενημερωμένη από αυτήν σε όλες τις στιγμές.
Αυτό επιτυγχάνεται με τη χρήση ενός “επεισοδίου καινοτομίας” και ενός “δια βίου καινοτομίας” mod. Η λειτουργία του πρώτου mod είναι να κρατήσει την τρέχουσα, επεισοδιακή μνήμη και να χαρτογραφήσει τις τρέχουσες ανακαλύψεις στην προαναφερθείσα αναπαράσταση, επιτρέποντας στον πράκτορα να καθορίσει μια εσωτερική επεισοδιακή ανταμοιβή για κάθε βήμα της εκπαίδευσης. Στη συνέχεια, η κατάσταση που συνδέεται με την τρέχουσα παρατήρηση προστίθεται στη μνήμη. Εν τω μεταξύ, το mod δια βίου καινοτομίας είναι υπεύθυνο για την επίδραση του πόσο συχνά ο πράκτορας εξερευνά κατά τη διάρκεια πολλών επεισοδίων.
Σύμφωνα με τις ομάδες του Alphabet/Google, οι νέες τεχνικές εκπαίδευσης έχουν ήδη αποδείξει τη δυνατότητα για σημαντική βελτίωση κατά την εκπαίδευση ενός συστήματος ενισχυτικού μάθησης. Το UVFA ήταν σε θέση να διπλασιάσει την απόδοση ορισμένων από τις βασικές πολιτικές που έπαιξαν διάφορα παιχνίδια Atari. Εν τω μεταξύ, το ABPS ήταν σε θέση να αυξήσει την απόδοση σε ορισμένα από τα ίδια παιχνίδια Atari, μειώνοντας την διακύμανση μεταξύ των κορυφαίων πρακτόρων περίπου 25%. Το αλγόριθμο που εκπαιδεύτηκε με το UVFA ήταν σε θέση να επιτύχει υψηλό σκορ στο Pitfall από μόνο του, χωρίς τις μηχανικές λειτουργίες των ανθρώπινων demos.












