Μοντέλα και πλατφόρμες AI
Το νέο σύστημα AI της DeepMind μπορεί να μάθει τους κανόνες ενός παιχνιδιού καθώς το παίζει

Η θυγατρική της Alphabet (GOOG ) (GOOGL ), DeepMind, έχει αναπτύξει πρόσφατα ένα σύστημα AI που μπορεί να μάθει τους κανόνες ενός παιχνιδιού καθώς το παίζει. Ενώ η DeepMind έχει δημιουργήσει εντυπωσιακά μοντέλα AI που μπορούν να εξαπλωθούν σε παιχνίδια όπως το Σκάκι, το Σόγκι, το Γκο και τα βιντεοπαιχνίδια, αυτά τα μοντέλα πρέπει να παρέχονται με τους κανόνες του παιχνιδιού εκ των προτέρων. Ως εκ τούτου, το νέο σύστημα AI της DeepMind αντιπροσωπεύει μια σημαντική βελτίωση σε σχέση με τις προηγούμενες αλγόριθμους AI που μαθαίνουν να παίζουν παιχνίδια μέσω ενισχυτικής μάθησης.
Σύστημα AI – MuZero
Σε một έγγραφο πρόσφατα δημοσιευμένο στο περιοδικό Nature, η DeepMind περιέγραψε πώς λειτουργεί το νέο σύστημα AI. Το νέο σύστημα AI, που ονομάζεται MuZero, μπορεί να μάθει τους κανόνες ενός παιχνιδιού καθώς το παίζει χάρη σε ένα принцип που ονομάζεται “αναζήτηση προς τα εμπρός”. Όπως αναφέρθηκε από το Engadget, το MuZero χρησιμοποιεί την αναζήτηση προς τα εμπρός για να καθορίσει ποιες κινήσεις πρέπει να εκτελεστούν με βάση τις πιο πιθανές απαντήσεις των αντιπάλων.
Όταν λαμβάνονται υπόψη όλες οι πιθανές κινήσεις που μπορούν να γίνουν σε παιχνίδια όπως το σκάκι, το MuZero μπορεί να προτεραιοποιήσει, στενεύοντας τις κινήσεις σε αυτές που είναι πιο πιθανές και σχετικές. Το MuZero θα μάθει και από επιτυχημένες και αποτυχημένες манέβρες. Αντί να μοντελοποιήσει όλους τους πιθανούς παράγοντες, λαμβάνει υπόψη μόνο τους παράγοντες που είναι πιο σχετικοί με την απόφαση που πρέπει να ληφθεί. Το MuZero βασικά λαμβάνει το πλήθος των πιθανών μεταβλητών που μπορούν να ληφθούν υπόψη και τις αποστάζει σε αυτές που είναι πιο σημαντικές, επηρεάζουσες. Αυτές οι μεταβλητές αντιπροσωπεύονται σε ένα αλγόριθμο αναζήτησης με βάση το δέντρο. Οι δυνατότητες στο δέντρο συνδυάζονται με ένα μοντέλο που έχει μάθει με βάση τα χαρακτηριστικά του περιβάλλοντος δοκιμής. Η αναζήτηση προς τα εμπρός πραγματοποιείται μετά την αναγνώριση των πιο σχετικών πτυχών του περιβάλλοντος.
Για να ληφθεί μια τελική απόφαση, λαμβάνονται υπόψη τρεις παράγοντες.
Το MuZero λαμβάνει υπόψη το αποτέλεσμα της προηγούμενης επιλογής, τη τρέχουσα θέση που κατέχει και τις πιθανές ενέργειες που μπορεί να thựcέσει την επόμενη στιγμή. Αυτή η προσέγγιση ξεπερνά τις προηγούμενες προσεγγίσεις που χρησιμοποιήθηκαν από τη DeepMind, συμπεριλαμβανομένης της βασικής αναζήτησης προς τα εμπρός και των μοντέλων με βάση το δέντρο. Το MuZero αποδείχθηκε ότι είναι τουλάχιστον τόσο καλό στο σκάκι, το σόγκι και το γκο όσο και το AlphaZero, και όταν έπαιξε το παιχνίδι Ms. Pac-Man, το MuZero ήταν σε θέση να λάβει υπόψη μόνο έξι ή επτά κινήσεις κάθε φορά. Παρά το όριο αυτό, το AI ήταν ακόμα σε θέση να εκτελέσει πολύ καλά. Η DeepMind πειραματίστηκε επίσης με τις ικανότητες του MuZero, περιορίζοντας τον αριθμό των προσομοιώσεων που μπορούσε να εκτελέσει πριν από την υποβολή μιας κίνησης. Γενικά, όσο περισσότερο χρόνο είχε το πρόγραμμα για να λάβει υπόψη τις πιθανές κινήσεις, τόσο καλύτερα εκτελούσε.
Ο επικεφαλής ερευνητής επιστήμονας της DeepMind, David Silver, εξήγησε μέσω του TechXplore ότι το MuZero είναι το πρώτο μοντέλο AI που μπορεί να δημιουργήσει τη δική του αναπαράσταση των κανόνων του περιβάλλοντος, χρησιμοποιώντας αυτήν την αναπαράσταση για να σχεδιάσει ενέργειες.
“Για πρώτη φορά, έχουμε πραγματικά ένα σύστημα που μπορεί να δημιουργήσει τη δική του κατανόηση του πώς λειτουργεί ο κόσμος και να χρησιμοποιήσει αυτήν την κατανόηση για να κάνει αυτό είδος σύνθετης αναζήτησης προς τα εμπρός που έχετε δει προηγουμένως για παιχνίδια όπως το σκάκι,” είπε ο Silver. “(Το MuZero) μπορεί να αρχίσει από το μηδέν και, απλώς μέσω της δοκιμής και του λάθους, να ανακαλύψει τους κανόνες του κόσμου και να χρησιμοποιήσει αυτούς τους κανόνες για να επιτύχει είδος υπεράνθρωπης απόδοσης.”
Πιθανές Εφαρμογές
Ένα AI που είναι πραγματικά σε θέση να μάθει τους περιορισμούς μιας εργασίας και να λειτουργήσει εντός αυτών των περιορισμών έχει eine ποικιλία πιθανών εφαρμογών. Το MuZero θα μπορούσε να χρησιμοποιηθεί για εργασίες όπως η συμπίεση βίντεο, η οποία ιστορικά ήταν δύσκολο να αυτοματοποιηθεί χρησιμοποιώντας AI, λόγω των πολλών διαφορετικών πιθανών μορφών βίντεο και τρόπων συμπίεσης. Το MuZero ήταν σε θέση να επιτύχει μια βελτίωση της συμπίεσης περίπου 5%. Αυτό θα μπορούσε να έχει επιπτώσεις για τον großen αριθμό βίντεο που φιλοξενούνται από τη Google και το YouTube. Πέρα από τα βίντεο, η DeepMind εξετάζει επίσης τη χρήση των ίδιων τεχνικών MuZero για τη σχεδίαση αρχιτεκτονικής πρωτεϊνών και τη προγραμματισμό ρομποτικής.
Σύμφωνα με την Wendy Hall, καθηγήτρια Πληροφορικής στο Πανεπιστήμιο του Southampton, το MuZero αντιπροσωπεύει “ένα σημαντικό βήμα προς τα εμπρός” για τις αλγόριθμους ενισχυτικής μάθησης. Ωστόσο, η Hall είναι ανήσυχος ότι οι αλγόριθμοι θα μπορούσαν να χρησιμοποιηθούν λανθασμένα. Για παράδειγμα, η αμερικανική πολεμική αεροπορία έχει ήδη αναφερθεί σε πρώιμες έρευνες που καλύπτουν το MuZero για να δημιουργήσει ένα σύστημα AI που θα μπορούσε να εκτοξεύσει βέλη από αεροσκάφη-σκοπευτές U-2. Αυτό συμβαίνει παρά την αντίθεση των ερευνητών της DeepMind στην उपयποίηση των αλγορίθμων τους για οποιαδήποτε θανατηφόρο όπλο, υπογράφοντας την Υπόσχεση για τα Αυτόνομα Θανατηφόρα Όπλα για να υποστηρίξουν ότι οποιαδήποτε θανατηφόρα τεχνολογία πρέπει να παραμείνει υπό τον έλεγχο των ανθρώπων.
Ο Silver εξήγησε ότι η DeepMind κοιτάζει μπροστά στο μέλλον, με στόχο να αναπτύξει αλγόριθμους τόσο ισχυρούς και ευέλικτους όσο ο εγκέφαλος. Ο πρώτος βήμας για τη δημιουργία ευέλικτων αλγορίθμων είναι να κατανοήσουμε τι σημαίνει για ένα σύστημα να είναι έξυπνο, και η ευφυΐα συνδέεται με την ικανότητα να διακρίνει τα πρότυπα και τους κανόνες ενός σύνθετου περιβάλλοντος.












