Μοντέλα και πλατφόρμες AI

Οι πράκτορες του AI αποδεικνύουν ιδιότητες emergent νοημοσύνης σε εικονικό κρυφτό

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ένα από τα ενδιαφέροντα γεγονότα σχετικά με την έρευνα του AI είναι ότι μπορεί συχνά να εκτελεί ενέργειες και να ακολουθεί στρατηγικές που驚ουν ακόμη και τους ερευνητές που τις σχεδιάζουν. Αυτό συνέβη κατά τη διάρκεια eines πρόσφατου εικονικού παιχνιδιού κρυφτού, όπου πολλοί πράκτορες του AI αντιτάχθηκαν ο ένας στον άλλον. Οι ερευνητές στην OpenAI, μια εταιρεία AI με έδρα το Σαν Φρανσίσκο, были驚ουν να διαπιστώσουν ότι οι πράκτορες του AI τους ξεκίνησαν να εκμεταλλεύονται στρατηγικές στο εικονικό κόσμο του παιχνιδιού, τις οποίες οι ερευνητές δεν γνώριζαν ότι υπήρχαν.

Η OpenAI έχει εκπαιδεύσει μια ομάδα πρακτόρων του AI να παίζουν ένα παιχνίδι κρυφτού ο ένας με τον άλλον. Τα προγράμματα του AI εκπαιδεύονται με την τεχνική της ενισχυτικής μάθησης, όπου η επιθυμητή συμπεριφορά εξαγεται από τους αλγόριθμους του AI παρέχοντας στους αλγόριθμους ανατροφοδότηση. Ο πράκτορας του AI αρχίζει να λαμβάνει τυχαίες ενέργειες και κάθε φορά που λαμβάνει μια ενέργεια που τον φέρνει πιο κοντά στο στόχο του, ο πράκτορας ανταποκρίνεται. Ο πράκτορας του AI επιθυμεί να αποκτήσει το μέγιστο δυνατό ανταπόκριση, οπότε θα πειραματιστεί για να δει ποιες ενέργειες του προσφέρουν περισσότερη ανταπόκριση. Μέσω της δοκιμής και του λάθους, ο πράκτορας του AI είναι ικανός να διακρίνει τις στρατηγικές που θα τον οδηγήσουν στη νίκη, αυτές που θα του προσφέρουν την περισσότερη ανταπόκριση.

Η ενισχυτική μάθηση έχει ήδη αποδείξει την επιτυχία της στη μάθηση των κανόνων των παιχνιδιών. Η OpenAI πρόσφατα εκπαίδευσε μια ομάδα πρακτόρων του AI να παίξει το MMORPG DOTA 2, και ο πράκτορας του AI νίκησε μια ομάδα ανθρώπων που ήταν πρωταθλητές στον κόσμο. Κάτι παρόμοιο συνέβη με το παιχνίδι StarCraft όταν ένας πράκτορας του AI εκπαιδεύτηκε στο παιχνίδι από την DeepMind. Η ενισχυτική μάθηση έχει επίσης χρησιμοποιηθεί για να διδάξει προγράμματα του AI να παίζουν Pictionary με ανθρώπους, μαθαίνοντας να ερμηνεύουν εικόνες και να χρησιμοποιούν βασική λογική.

Στο εικονικό παιχνίδι κρυφτού που δημιούργησαν οι ερευνητές, πολλοί πράκτορες του AI αντιτάχθηκαν ο ένας στον άλλον. Το αποτέλεσμα ήταν ένας αγώνας, όπου κάθε πράκτορας ήθελε να ξεπεράσει τον άλλον και να αποκτήσει τους περισσότερους πόντους ανταπόκρισης. Μια νέα στρατηγική που υιοθετήθηκε από έναν πράκτορα θα προκαλούσε στον αντίπαλό του να αναζητήσει μια νέα στρατηγική για να την αντιμετωπίσει, και αντίστροφα. Ο Igor Mordatch, ερευνητής στην OpenAI, εξήγησε στο IEEE Spectrum ότι το πείραμα αποδεικνύει ότι αυτή η διαδικασία της δοκιμής και του λάθους μεταξύ των πρακτόρων “είναι αρκετή για τους πρακτόρες να μάθουν εκπληκτικές συμπεριφορές με δική τους πρωτοβουλία – είναι σαν τα παιδιά να παίζουν ο ένας με τον άλλον”.

Ποίες ήταν οι εκπληκτικές συμπεριφορές ακριβώς; Οι ερευνητές είχαν τέσσερις βασικές στρατηγικές που περίμεναν να μάθουν οι πράκτορες του AI, και τις έμαθαν αρκετά γρήγορα, γινόταν ικανοί σε αυτές μετά από 25 εκατομμύρια προσομοιωμένα παιχνίδια. Το παιχνίδι έλαβε χώρα σε ένα 3D περιβάλλον γεμάτο ράμπες, μπλοκ και τοίχους. Οι πράκτορες του AI έμαθαν να κυνηγούν ο ένας τον άλλον, να μετακινούν μπλοκ για να χτίσουν οχυρά όπου θα μπορούσαν να κρυφτούν, και να μετακινούν ράμπες. Οι πράκτορες του AI που έψαχναν έμαθαν να σύρουν ράμπες για να μπαίνουν στα οχυρά των κρυφτών, ενώ οι κρυφτοί έμαθαν να προσπαθούν να πάρουν τις ράμπες μέσα στα οχυρά τους.

Ωστόσο, γύρω στο σημείο των 380 εκατομμυρίων παιχνιδιών, συνέβη κάτι απρόσμενο. Οι πράκτορες του AI έμαθαν να χρησιμοποιούν δύο στρατηγικές που οι ερευνητές δεν περίμεναν. Οι πράκτορες του AI που έψαχναν έμαθαν ότι αν πηδούσαν πάνω σε ένα κουτί και το λάνσαρε προς ένα κοντινό οχυρό, θα μπορούσαν να μπαίνουν στο οχυρό και να βρουν τον κρυφτό. Οι ερευνητές δεν είχαν συνειδητοποιήσει ότι αυτό ήταν δυνατό μέσα στη φυσική του εικονικού περιβάλλοντος. Οι κρυφτοί έμαθαν να αντιμετωπίζουν αυτό το ζήτημα σύροντας τα κουτιά μέσα στα οχυρά τους.

Ενώ η απρόσμενη συμπεριφορά των πρακτόρων του AI που εκπαιδεύονται με αλγόριθμους ενισχυτικής μάθησης είναι αβλαβής σε αυτή την περίπτωση, αυτό ανεβάζει κάποιες πιθανές ανησυχίες σχετικά με το πώς η ενισχυτική μάθηση εφαρμόζεται σε άλλες καταστάσεις. Ένας μέλος της ομάδας ερευνών της OpenAI, ο Bowen Baker, εξήγησε στο IEEE Spectrum ότι αυτές οι απρόσμενες συμπεριφορές θα μπορούσαν να είναι потенτικά επικίνδυνες. Τι θα συνέβαινε αν τα ρομπότ άρχιζαν να συμπεριφέρονται με απρόσμενους τρόπους;

“Η κατασκευή αυτών των περιβαλλόντων είναι δύσκολο”, εξήγησε ο Baker. “Οι πράκτορες θα βρουν αυτές τις απρόσμενες συμπεριφορές, οι οποίες θα είναι ένα πρόβλημα ασφάλειας στο μέλλον όταν τους τοποθετήσετε σε πιο σύνθετα περιβάλλοντα”.

Ωστόσο, ο Baker εξήγησε επίσης ότι οι στρατηγικές της ενισχυτικής μάθησης θα μπορούσαν να οδηγήσουν σε καινοτόμες λύσεις σε τρέχοντα προβλήματα. Συστήματα που εκπαιδεύονται με ενισχυτική μάθηση θα μπορούσαν να λύσουν ένα ευρύ φάσμα προβλημάτων με λύσεις που ίσως δεν μπορούμε ούτε να φανταστούμε.

Blogger και προγραμματιστής με ειδικότητες στα Machine Learning και Deep Learning θέματα. Ο Daniel ελπίζει να βοηθήσει τους άλλους να χρησιμοποιήσουν τη δύναμη του AI για κοινωνικό καλό.