Μοντέλα και πλατφόρμες AI

Ερευνητές του AI Δημιουργούν Μοντέλο Παιχνιδιού Βίντεο που Μπορεί να Θυμάται Προηγούμενα Γεγονότα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια ομάδα ερευνητών στο εργαστήριο AI της Uber έχει αναπτύξει πρόσφατα ένα σύστημα αλγορίθμων AI που υπερέβη τόσο τους ανθρώπινους παίκτες όσο και άλλα συστήματα AI σε κλασικά παιχνίδια Atari. Το σύστημα AI που αναπτύχθηκε από τους ερευνητές είναι ικανό να θυμάται προηγουμένως επιτυχημένες στρατηγικές, δημιουργώντας νέες στρατηγικές με βάση αυτά που δούλεψαν στο παρελθόν. Η μελέτη της ερευνητικής ομάδας πιστεύει ότι οι αλγόριθμοι που αναπτύχθηκαν έχουν потенτικές εφαρμογές σε άλλους τεχνικούς τομείς όπως η επεξεργασία γλώσσας και η ρομποτική.

Η τυπική μέθοδος που χρησιμοποιείται για τη δημιουργία συστημάτων AI ικανών να παίζουν παιχνίδια βίντεο είναι η χρήση αλγορίθμων ενισχυμένης μάθησης. Οι αλγόριθμοι ενισχυμένης μάθησης μαθαίνουν πώς να εκτελέσουν μια εργασία εξερευνώντας eine σειρά πιθανών ενεργειών και μετά από κάθε ενέργεια, τους παρέχονται ένα είδος ενίσχυσης (एक ανταμοιβή ή τιμωρία). Με τον καιρό, το μοντέλο AI μαθαίνει ποιες ενέργειες οδηγούν σε μεγαλύτερες ανταμοιβές και γίνεται πιο πιθανό να εκτελέσει αυτές τις ενέργειες. Δυστυχώς, τα μοντέλα ενισχυμένης μάθησης αντιμετωπίζουν δυσκολίες όταν συναντούν δεδομένα που δεν συμφωνούν με άλλα στο σύνολο δεδομένων.

Σύμφωνα με την ερευνητική ομάδα, ο λόγος που η προσέγγισή τους δεν είχε θεωρηθεί από άλλους ερευνητές AI είναι ότι η στρατηγική διαφέρει από την “εγγενή мотιβάση” που χρησιμοποιείται συνήθως στην ενισχυμένη μάθηση. Το πρόβλημα με την εγγενή мотιβάση είναι ότι το μοντέλο μπορεί να είναι склонικό στο “λήθη” για πιθανώς ανταποδοτικές περιοχές που εξακολουθούν να αξίζουν εξερεύνηση. Αυτό το φαινόμενο ονομάζεται “αποσύνδεση”. Ως αποτέλεσμα, όταν το μοντέλο συναντά απροσδόκητα δεδομένα, μπορεί να λησμονήσει περιοχές που πρέπει ακόμα να εξερευνηθούν.

Σύμφωνα με το TechXplore, η ερευνητική ομάδα αποφάσισε να δημιουργήσει ένα μοντέλο μάθησης που ήταν πιο ευέλικτο και能够 να ανταποκριθεί σε απροσδόκητα δεδομένα. Οι ερευνητές υπερέβησαν αυτό το πρόβλημα εισαγωγώντας έναν αλγόριθμο ικανό να θυμάται όλες τις ενέργειες που έλαβε μια προηγούμενη έκδοση του μοντέλου όταν προσπάθησε να λύσει ένα πρόβλημα. Όταν το μοντέλο AI συναντά ένα σημείο δεδομένων που δεν είναι συνεπές με αυτά που έχει μάθει μέχρι τώρα, το μοντέλο ελέγχει τον χάρτη μνήμης του. Το μοντέλο θα αναγνωρίσει ποιες στρατηγικές πέτυχαν και απέτυχαν και θα επιλέξει στρατηγικές αντίστοιχα.

Όταν παίζει ένα παιχνίδι βίντεο, το μοντέλο συλλέγει στιγμιότυπα του παιχνιδιού καθώς παίζει, δημιουργώντας ένα αρχείο των ενεργειών του. Οι εικόνες ομαδοποιούνται μαζί με βάση την ομοιότητα, σχηματίζοντας σαφείς σημεία στο χρόνο που το μοντέλο μπορεί να αναφερθεί. Ο αλγόριθμος μπορεί να χρησιμοποιήσει τα αρχειοθετημένα στιγμιότυπα για να επιστρέψει σε ένα ενδιαφέρον σημείο στο χρόνο και να συνεχίσει την εξερεύνηση από εκεί. Όταν το μοντέλο διαπιστώνει ότι χάνει, θα αναφερθεί στα στιγμιότυπα που πάρθηκαν και θα δοκιμάσει μια διαφορετική στρατηγική.

Σύμφωνα με το BBC, υπάρχει επίσης το πρόβλημα της αντιμετώπισης επικίνδυνων καταστάσεων για το μοντέλο AI που παίζει το παιχνίδι. Αν το μοντέλο συναντήσει ένα κίνδυνο που μπορεί να το σκοτώσει, αυτό θα εμπόδιζε την επιστροφή του σε περιοχές που αξίζουν περισσότερη εξερεύνηση, ένα πρόβλημα που ονομάζεται “αποσύνδεση”. Το μοντέλο AI αντιμετωπίζει προβλήματα αποσύνδεσης μέσω μιας ξεχωριστής διαδικασίας από αυτή που χρησιμοποιείται για την ενθάρρυνση της εξερεύνησης παλαιών περιοχών.

Η ερευνητική ομάδα είχε το μοντέλο να παίξει 55 παιχνίδια Atari. Αυτά τα παιχνίδια χρησιμοποιούνται συνήθως για να αξιολογήσουν την απόδοση των μοντέλων AI, αλλά οι ερευνητές πρόσθεσαν μια στροφή για το μοντέλο τους. Οι ερευνητές εισήγαγαν πρόσθετους κανόνες στα παιχνίδια, οδηγώντας το μοντέλο να επιτύχει όχι μόνο τον υψηλότερο δυνατό σκορ αλλά και να επιτύχει ένα ακόμα υψηλότερο σκορ κάθε φορά. Όταν αναλύθηκαν τα αποτελέσματα της απόδοσης του μοντέλου, οι ερευνητές διαπίστωσαν ότι το σύστημα AI τους υπερέβη άλλα συστήματα AI στα παιχνίδια περίπου το 85% του χρόνου. Το μοντέλο AI εκτέλεσε ιδιαίτερα καλά στο παιχνίδι Montezuma’s Revenge, ένα παιχνίδι πλατφόρμας όπου ο παίκτης αποφεύγει κινδύνους και συλλέγει θησαυρούς. Το παιχνίδι νίκησε το ρεκόρ για έναν ανθρώπινο παίκτη και επίσης σημείωσε υψηλότερο από οποιοδήποτε άλλο σύστημα AI.

Σύμφωνα με τους ερευνητές AI της Uber, οι στρατηγικές που χρησιμοποιήθηκαν από την ερευνητική ομάδα έχουν εφαρμογές σε βιομηχανίες όπως η ρομποτική. Οι ρομποτές ωφελούνται από την ικανότητα να θυμάται ποιες ενέργειες ήταν επιτυχημένες, ποιες δεν δούλεψαν και ποιες δεν έχουν δοκιμαστεί ακόμα.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.