Μοντέλα και πλατφόρμες AI

POKELLMON: Ένας Πράκτορας Ισότητας Ανθρώπου με LLM για Μάχες Pokémon

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι Μεγάλες Γλωσσικές Μοντέλα και η Γεννητική Νοημοσύνη έχουν επιδείξει ασύγκριτη επιτυχία σε eine ευρεία γκάμα εργασιών Επεξεργασίας Φυσικής Γλώσσας. Μετά την κατάκτηση του πεδίου της Επεξεργασίας Φυσικής Γλώσσας, η επόμενη πρόκληση για τους ερευνητές GenAI και LLM είναι να εξερευνήσουν πώς τα μεγάλα γλωσσικά μοντέλα μπορούν να ενεργούν αυτονομamente στον πραγματικό κόσμο με μια επέκταση του χάσματος γενιάς από κείμενο σε δράση, αντιπροσωπεύοντας μια σημαντική παραλλαγή στην αναζήτηση της Γενικής Νοημοσύνης. Τα online παιχνίδια θεωρούνται κατάλληλο θεμέλιο για την ανάπτυξη ενσωματωμένων πρακτόρων LLM που αλληλεπιδρούν με το οπτικό περιβάλλον με τον ίδιο τρόπο που θα έκανε ένας άνθρωπος.

Για παράδειγμα, σε ένα δημοφιλές online παιχνίδι模擬, όπως το Minecraft, οι πράκτορες λήψης αποφάσεων μπορούν να χρησιμοποιηθούν για να βοηθήσουν τους παίκτες στην εξερεύνηση του κόσμου και την ανάπτυξη δεξιοτήτων για την κατασκευή εργαλείων και την επίλυση εργασιών. Ένα άλλο παράδειγμα αλληλεπίδρασης πρακτόρων LLM με το οπτικό περιβάλλον είναι το παιχνίδι The Sims, όπου οι πράκτορες έχουν επιδείξει αξιοσημείωτη επιτυχία στις κοινωνικές αλληλεπιδράσεις και παρουσιάζουν συμπεριφορά που μοιάζει με αυτή των ανθρώπων. Ωστόσο, σε σύγκριση με τα υπάρχοντα παιχνίδια, τα τακτικά παιχνίδια μάχης μπορεί να αποδειχθούν καλύτερη επιλογή για την αξιολόγηση της ικανότητας των μεγάλων γλωσσικών μοντέλων να παίζουν εικονικά παιχνίδια. Ο κύριος λόγος για τον οποίο τα τακτικά παιχνίδια αποτελούν καλύτερη βάση είναι ότι ο ρυθμός νίκης μπορεί να μετρηθεί απευθείας, και συνεπείς αντίπαλοι, συμπεριλαμβανομένων ανθρώπινων παικτών και AI, είναι πάντα διαθέσιμοι.

Βασισμένοι στο ίδιο, ο POKELLMON έχει ως στόχο να είναι ο πρώτος ενσωματωμένος πράκτορας που επιτυγχάνει επίδοση ανθρώπινου επιπέδου σε τακτικά παιχνίδια, παρόμοια με εκείνα που παρατηρούνται στις μάχες Pokémon. Η αρχιτεκτονική του POKELLMON περιλαμβάνει τρεις κύριες στρατηγικές.

  1. Εν-Περιβάλλον Ενίσχυση Μάθησης που καταναλώνει κειμενική ανάδραση από τις μάχες για να βελτιώσει την πολιτική επανειλημμένα.
  2. Γνωσιακή-Επικουρική Γεννήση που ανακτά εξωτερική γνώση για να καταπολεμήσει τις ψευδαισθήσεις, επιτρέποντας στον πράκτορα να ενεργεί εγκαίρως και σωστά.
  3. Συνεπής Γεννήση Δράσης για να ελαττώσει το πρόβλημα της πανδημίας αλλαγής όταν ο πράκτορας συναντά ισχυρούς αντιπάλους.

Αυτό το άρθρο έχει ως στόχο να καλύψει την αρχιτεκτονική του POKELLMON σε βάθος, και εξετάζουμε το μηχανισμό, τη μεθοδολογία, την αρχιτεκτονική του πλαισίου, καθώς και τη σύγκρισή του με τα πλέον προηγμένα πλαισια. Θα μιλήσουμε επίσης για το πώς το POKELLMON παρουσιάζει αξιοσημείωτες στρατηγικές μάχης και ικανότητες λήψης αποφάσεων, επιτυγχάνοντας σεβαστό ρυθμό νίκης περίπου 50%. Έτσι, ας ξεκινήσουμε.

POKELLMON: Ένας Πράκτορας Ισότητας Ανθρώπου με LLM για Μάχες Pokémon

Η αύξηση των ικανοτήτων και της αποτελεσματικότητας των Μεγάλων Γλωσσικών Μοντέλων και των Πλαίσίων Γεννητικής Νοημοσύνης τα τελευταία χρόνια ήταν πραγματικά θαυμάσια, ιδιαίτερα στις εργασίες Επεξεργασίας Φυσικής Γλώσσας. Πρόσφατα, οι dévelopπεurs και οι ερευνητές της Νοημοσύνης έχουν εργαστεί για να κάνουν τη Γεννητική Νοημοσύνη και τα LLM πιο προεξέχοντα σε πραγματικές καταστάσεις με την ικανότητα να ενεργούν αυτονομamente στον φυσικό κόσμο. Για να επιτύχουν αυτή την αυτονομία σε φυσικές και πραγματικές καταστάσεις, οι ερευνητές και dévelopπεurs θεωρούν τα παιχνίδια ως κατάλληλο πεδίο δοκιμών για την ανάπτυξη ενσωματωμένων πρακτόρων LLM με την ικανότητα να αλληλεπιδρούν με το εικονικό περιβάλλον με τον ίδιο τρόπο που θα έκανε ένας άνθρωπος.

Προηγουμένως, οι dévelopπεurs έχουν προσπαθήσει να αναπτύξουν ενσωματωμένους πράκτορες LLM σε εικονικά παιχνίδια όπως το Minecraft και το The Sims, αν και πιστεύεται ότι τα τακτικά παιχνίδια όπως το Pokémon μπορεί να είναι μια καλύτερη επιλογή για την ανάπτυξη αυτών των πρακτόρων. Οι μάχες Pokémon επιτρέπουν στους développeurs να αξιολογήσουν την ικανότητα ενός εκπαιδευτή να μάχεται σε γνωστά παιχνίδια Pokémon και προσφέρει πολλά πλεονεκτήματα σε σχέση με άλλα τακτικά παιχνίδια. Καθώς οι χώροι δράσης και καταστάσεων είναι διακριτοί, μπορούν να μεταφραστούν σε κείμενο χωρίς καμία απώλεια. Η ακόλουθη εικόνα απεικονίζει μια τυπική μάχη Pokémon όπου ο παίκτης καλείται να γεννήσει μια δράση για κάθε γύρο με βάση την τρέχουσα κατάσταση των Pokémon και από τις δύο πλευρές. Οι χρήστες έχουν την επιλογή να επιλέξουν από πέντε διαφορετικά Pokémon και υπάρχουν συνολικά τέσσερις κινήσεις στο χώρο δράσης. Επιπλέον, το παιχνίδι βοηθά στην ανακούφιση της πίεσης στο χρόνο και το κόστος επιίλυσης για τα LLM, καθώς η μορφή γύρου εξαλείφει την απαίτηση για εντατική gameplay. Ως αποτέλεσμα, η απόδοση εξαρτάται κυρίως από την ικανότητα συλλογισμού του μεγάλου γλωσσικού μοντέλου. Τέλος, αν και οι μάχες Pokémon φαίνονται απλές, τα πράγματα είναι λίγο πιο σύνθετα στην πραγματικότητα και πολύ στρατηγικά. Ένας έμπειρος παίκτης δεν επιλέγει τυχαία ένα Pokémon για τη μάχη, αλλά λαμβάνει υπόψη διάφορους παράγοντες, συμπεριλαμβανομένου του τύπου, των στατιστικών, των ικανοτήτων, του είδους, των αντικειμένων, των κινήσεων των Pokémon, και cả των Battlefield.

POKELLMON: Μεθοδολογία και Αρχιτεκτονική

Η γενική αρχιτεκτονική του πλαισίου POKELLMON απεικονίζεται στην ακόλουθη εικόνα.

Κατά τη διάρκεια κάθε γύρου, το πλάισιο POKELLMON χρησιμοποιεί τις προηγούμενες δράσεις και την αντίστοιχη κειμενική ανάδραση για να βελτιώσει την πολιτική επανειλημμένα, καθώς και να εμπλουτίσει τις τρέχουσες πληροφορίες καταστάσεων με εξωτερική γνώση, όπως η σχέση μεταξύ ικανοτήτων/κινήσεων ή η σχέση προσφώνησης/αδυναμίας. Για τις πληροφορίες που δίνονται ως είσοδος, το πλάισιο POKELLMON γεννάει πολλές δράσεις ανεξάρτητα και στη συνέχεια επιλέγει τις πιο συνεπείς ως τελική έξοδο.

Εν-Περιβάλλον Ενίσχυση Μάθησης

Οι άνθρωποι και οι αθλητές συχνά λαμβάνουν αποφάσεις όχι μόνο με βάση την τρέχουσα κατάσταση, αλλά επίσης αντανακλούν την ανάδραση από τις προηγούμενες δράσεις, καθώς και τις εμπειρίες άλλων παικτών. Θα ήταν ασφαλές να πούμε ότι η θετική ανάδραση είναι αυτό που βοηθά έναν παίκτη να μάθει από τα λάθη του και να αποφεύγει να κάνει το ίδιο λάθος ξανά και ξανά. Χωρίς την κατάλληλη ανάδραση, οι πράκτορες POKELLMON μπορεί να παραμείνουν στην ίδια λανθασμένη δράση, όπως φαίνεται στην ακόλουθη εικόνα.

Όπως μπορεί να παρατηρηθεί, ο πράκτορας στο παιχνίδι χρησιμοποιεί μια κίνηση με βάση το νερό εναντίον ενός Pokémon που έχει την ικανότητα “Dry Skin”, η οποία επιτρέπει να μηδενίσει την ζημιά από τις κινήσεις με βάση το νερό. Το παιχνίδι προσπαθεί να προειδοποιήσει τον χρήστη με την αναπαράσταση του μηνύματος “Ασθενής” στην οθόνη, το οποίο μπορεί να προκαλέσει έναν άνθρωπο να ξανασκέφτει τις δράσεις του και να τις αλλάξει, ακόμη και χωρίς να γνωρίζει για την “Dry Skin”. Ωστόσο, δεν περιλαμβάνεται στην περιγραφή της κατάστασης για τον πράκτορα, με αποτέλεσμα ο πράκτορας να κάνει το ίδιο λάθος ξανά.

Για να εξασφαλιστεί ότι ο πράκτορας POKELLMON μαθαίνει από τα προηγούμενα λάθη του, το πλάισιο εφαρμόζει την προσέγγιση της Εν-Περιβάλλον Ενίσχυσης Μάθησης. Η ενίσχυση μάθησης είναι μια δημοφιλής προσέγγιση στη μηχανική μάθηση, και βοηθά τους développeurs να βελτιώσουν την πολιτική, καθώς απαιτεί αριθμητικές ανταμοιβές για την αξιολόγηση των δράσεων. Καθώς τα μεγάλα γλωσσικά μοντέλα έχουν την ικανότητα να ερμηνεύουν και να κατανοούν τη γλώσσα, οι κειμενικές περιγραφές έχουν αναδυθεί ως μια νέα μορφή ανταμοιβής για τα LLM. Με την ενσωμάτωση της κειμενικής ανάδρασης από τις προηγούμενες δράσεις, ο πράκτορας POKELLMON είναι σε θέση να βελτιώσει επανειλημμένα και άμεσα την πολιτική του, δηλαδή την Εν-Περιβάλλον Ενίσχυση Μάθησης. Το πλάισιο POKELLMON αναπτύσσει τέσσερις τύπους ανάδρασης,

  1. Η πραγματική ζημιά που προκαλείται από μια κίνηση επίθεση με βάση τη διαφορά στην Υγεία μεταξύ δύο συνεχόμενων γύρων.
  2. Η αποτελεσματικότητα των κινήσεων επίθεσης. Η ανάδραση υποδεικνύει την αποτελεσματικότητα της κίνησης σε σχέση με την απαθής, ανίκανη ή υπερ-αποτελεσματική λόγω ικανοτήτων/κινήσεων ή τύπου προσφώνησης.
  3. Η σειρά προτεραιότητας για την εκτέλεση μιας κίνησης. Καθώς οι ακριβείς στατιστικές για το αντίπαλο Pokémon δεν είναι διαθέσιμες, η ανάδραση προτεραιότητας παρέχει μια περίπου εκτίμηση της ταχύτητας.
  4. Η πραγματική επίδραση των κινήσεων που εκτελούνται στον αντίπαλο. Οι κινήσεις επίθεσης και κατάστασης μπορεί να οδηγήσουν σε αποτελέσματα όπως η ανάκτηση Υγείας, η βελτίωση στατιστικών ή η επιβολή καταστάσεων όπως παγίδευση, καύση ή δηλητηρίαση.

Επιπλέον, η χρήση της προσέγγισης της Εν-Περιβάλλον Ενίσχυσης Μάθησης οδηγεί σε σημαντική βελτίωση της απόδοσης, όπως φαίνεται στην ακόλουθη εικόνα.

Όταν συγκρίνεται με την αρχική απόδοση στο GPT-4, ο ρυθμός νίκης αυξάνεται περίπου 10% μαζί με μια αύξηση 13% στη βαθμολογία μάχης. Επιπλέον, όπως φαίνεται στην ακόλουθη εικόνα, ο πράκτορας αρχίζει να αναλύει και να αλλάζει την δράση του εάν οι κινήσεις που εκτελέστηκαν στις προηγούμενες κινήσεις δεν ήταν σε θέση να ανταποκριθούν στις προσδοκίες.

Γνωσιακή-Επικουρική Γεννήση ή KAG

Αν και η εφαρμογή της Εν-Περιβάλλον Ενίσχυσης Μάθησης βοηθά με τις ψευδαισθήσεις μέχρι ένα σημείο, μπορεί ακόμη να οδηγήσει σε θανατηφόρες συνέπειες πριν ο πράκτορας λάβει την ανάδραση. Για παράδειγμα, αν ο πράκτορας αποφασίσει να μάχεται εναντίον ενός Pokémon τύπου πυρός με ένα Pokémon τύπου χόρτου, το πρώτο είναι πιθανό να κερδίσει σε ένα γύρο. Για να μειώσει τις ψευδαισθήσεις περαιτέρω και να βελτιώσει την ικανότητα λήψης αποφάσεων του πράκτορα, το πλάισιο POKELLMON εφαρμόζει την προσέγγιση της Γνωσιακής-Επικουρικής Γεννήσης, μια τεχνική που χρησιμοποιεί εξωτερική γνώση για να εμπλουτίσει τη γεννήση.

Τώρα, όταν το μοντέλο γεννάει τους τέσσερις τύπους ανάδρασης που αναφέρθηκαν παραπάνω, σημειώνει τις κινήσεις και τις πληροφορίες των Pokémon, επιτρέποντας στον πράκτορα να συναγάγει την σχέση τύπου-πρόsfωνησης μόνος του. Σε μια προσπάθεια να μειώσει περαιτέρω τις ψευδαισθήσεις που περιέχονται στη λήψη αποφάσεων, το πλάισιο POKELLMON σημειώνει ρητά την σχέση τύπου-πρόsfωνησης και την αδυναμία του αντίπαλου Pokémon και του πράκτορα με επαρκείς περιγραφές. Επιπλέον, είναι δύσκολο να θυμάσαι τις κινήσεις και τις ικανότητες με διακριτές επιδράσεις των Pokémon, ιδιαίτερα επειδή υπάρχουν πολλά. Η ακόλουθη πίνακας δείχνει τα αποτελέσματα της Γνωσιακής-Επικουρικής Γεννήσης. Αξίζει να σημειωθεί ότι με την εφαρμογή της Γνωσιακής-Επικουρικής Γεννήσης, το πλάισιο POKELLMON είναι σε θέση να αυξήσει τον ρυθμό νίκης περίπου 20% από το υπάρχον 36% στο 55%.

Επιπλέον, οι développeurs παρατήρησαν ότι όταν ο πράκτορας έλαβε εξωτερική γνώση για τα Pokémon, άρχισε να χρησιμοποιεί ειδικές κινήσεις στην κατάλληλη στιγμή, όπως φαίνεται στην ακόλουθη εικόνα.

Συνεπής Γεννήση Δράσης

Οι υφιστάμενες μοντέλα δείχνουν ότι η εφαρμογή προωθήσεων και προσεγγίσεων συλλογισμού μπορεί να βελτιώσει την ικανότητα των LLM να λύνουν σύνθετα προβλήματα. Αντί να γεννάει μια κίνηση μια φορά, το πλάισιο POKELLMON αξιολογεί τις υφιστάμενες στρατηγικές προωθήσεων, συμπεριλαμβανομένων CoT ή Chain of Thought, ToT ή Tree of Thought, και Self Consistency. Για την Chain of Thought, ο πράκτορας αρχικά γεννάει μια σκέψη που αναλύει την τρέχουσα κατάσταση μάχης και εξοδεύει μια δράση που προϋποθέτει τη σκέψη. Για την Self Consistency, ο πράκτορας γεννάει τρεις φορές τις δράσεις και επιλέγει την έξοδο που έχει λάβει τον μεγαλύτερο αριθμό ψήφων. Τέλος, για την Tree of Thought, το πλάισιο γεννάει τρεις δράσεις, όπως και στην Self Consistency, αλλά επιλέγει αυτή που θεωρεί την καλύτερη μετά από αξιολόγηση όλων. Η ακόλουθη πίνακας συνοψίζει την απόδοση των προσεγγίσεων προωθήσεων.

Υπάρχει μόνο μια δράση για κάθε γύρο, που σημαίνει ότι ακόμη και αν ο πράκτορας αποφασίσει να αλλάξει και ο αντίπαλος να επιτεθεί, το Pokémon που θα αντικατασταθεί θα λάβει την ζημιά. Συνήθως ο πράκτορας αποφασίζει να αλλάξει γιατί θέλει να κάνει μια αλλαγή τύπου-πρόsfωνησης για ένα Pokémon εκτός μάχης, και έτσι το Pokémon που θα αντικατασταθεί μπορεί να αντέξει την ζημιά,既然 είναι ανθεκτικό στον τύπο των κινήσεων του αντίπαλου Pokémon. Ωστόσο, όπως παραπάνω, για τον πράκτορα με CoT συλλογισμού, ακόμη και αν ο ισχυρός αντίπαλος αναγκάζει πολλές αλλαγές, ενεργεί ασυνεπώς με την αποστολή, επειδή μπορεί να μην θέλει να αντικαταστήσει το Pokémon αλλά πολλά Pokémon και πίσω, που ονομάζουμε πανδημική αλλαγή. Η πανδημική αλλαγή εξαλείφει τις ευκαιρίες για κινήσεις και οδηγεί σε ήττες.

POKELLMON: Αποτελέσματα και Πειράματα

Πριν συζητήσουμε τα αποτελέσματα, είναι απαραίτητο να κατανοήσουμε το περιβάλλον μάχης. Στο ξεκίνημα ενός γύρου, το περιβάλλον λαμβάνει ένα μήνυμα αιτήματος δράσης από τον сервер και θα απαντήσει σε αυτό το μήνυμα στο τέλος, το οποίο περιέχει επίσης το αποτέλεσμα εκτέλεσης από την προηγούμενη κίνηση.

  1. Πρώτα, αναλύει το μήνυμα και ενημερώνει τις τοπικές μεταβλητές καταστάσεων, 2. στη συνέχεια, μετατρέπει τις μεταβλητές καταστάσεων σε κείμενο. Η περιγραφή του κειμένου έχει κυρίως τέσσερα μέρη: 1. Πληροφορίες ομάδας, που περιέχει τα χαρακτηριστικά των Pokémon στο πεδίο και εκτός πεδίου (αχρησιμοποίητα).
  2. Πληροφορίες ομάδας αντιπάλου, που περιέχει τα χαρακτηριστικά των Pokémon αντιπάλου στο πεδίο και εκτός πεδίου (μερικές πληροφορίες είναι άγνωστες).
  3. Πληροφορίες πεδίου μάχης, που περιλαμβάνει το καιρό, τις εισβολές και το έδαφος.
  4. Ιστορικό αρχείο γύρων, που περιέχει τις προηγούμενες κινήσεις και των δύο Pokémon και αποθηκεύεται σε μια ουρά αρχείου. Τα LLM λαμβάνουν το μεταφρασμένο κείμενο ως είσοδο και εξοδεύουν δράσεις για το επόμενο βήμα. Η δράση στέλνεται στον сервер και εκτελείται την ίδια στιγμή με την κίνηση που κάνει ο άνθρωπος.

Μάχη Εναντίον Ανθρώπινων Παικτών

Η ακόλουθη πίνακας εικονογραφεί την απόδοση του πράκτορα POKELLMON εναντίον ανθρώπινων παικτών.

Όπως μπορεί να παρατηρηθεί, ο πράκτορας POKELLMON παρουσιάζει απόδοση συγκρίσιμη με τους παίκτες της σκάλας που έχουν υψηλότερο ρυθμό νίκης σε σύγκριση με έναν邀請 παίκτη μαζί με εκτεταμένη εμπειρία μάχης.

Ανάλυση Ικανοτήτων Μάχης

Ο πράκτορας POKELLMON σπάνια κάνει λάθος στην επιλογή της αποτελεσματικής κίνησης και αλλάζει σε ένα άλλο κατάλληλο Pokémon χάρη στην στρατηγική Γνωσιακής-Επικουρικής Γεννήσης.

Όπως φαίνεται στο παραπάνω παράδειγμα, ο πράκτορας χρησιμοποιεί μόνο ένα Pokémon για να νικήσει ολόκληρη την ομάδα αντιπάλου,既然 είναι σε θέση να επιλέξει διαφορετικές κινήσεις επίθεσης, αυτές που είναι πιο αποτελεσματικές για τον αντίπαλο σε αυτή τη κατάσταση. Επιπλέον, το πλάισιο POKELLMON παρουσιάζει ανθρώπινη στρατηγική εξάντλησης. Κάποια Pokémon έχουν μια κίνηση “Toxic” που μπορεί να προκαλέσει πρόσθετη ζημιά σε κάθε γύρο, ενώ η κίνηση “Recover” επιτρέπει να ανακτά την Υγεία. Λαμβάνοντας υπόψη το ίδιο, ο πράκτορας πρώτα δηλητηριάζει τον αντίπαλο Pokémon και στη συνέχεια χρησιμοποιεί την κίνηση Recover για να αποφύγει την λιποθυμία.

Τελικές Σκέψεις

Σε αυτό το άρθρο, μιλήσαμε για τον POKELLMON, μια προσέγγιση που επιτρέπει στα μεγάλα γλωσσικά μοντέλα να παίζουν μάχες Pokémon εναντίον ανθρώπων αυτονομamente. Ο POKELLMON έχει ως στόχο να είναι ο πρώτος ενσωματωμένος πράκτορας που επιτυγχάνει επίδοση ανθρώπινου επιπέδου σε τακτικά παιχνίδια, παρόμοια με εκείνα που παρατηρούνται στις μάχες Pokémon. Το πλάισιο POKELLMON εισάγει τρεις βασικές στρατηγικές: την Εν-Περιβάλλον Ενίσχυση Μάθησης, η οποία καταναλώνει την κειμενική ανάδραση ως “ανταμοιβή” για να βελτιώσει την πολιτική δράσης επανειλημμένα χωρίς εκπαίδευση, τη Γνωσιακή-Επικουρική Γεννήση που ανακτά εξωτερική γνώση για να καταπολεμήσει τις ψευδαισθήσεις και να εξασφαλίσει ότι ο πράκτορας ενεργεί εγκαίρως και σωστά, και τη Συνεπή Γεννήση Δράσης που αποτρέπει το πρόβλημα της πανδημικής αλλαγής όταν ο πράκτορας συναντά ισχυρούς αντιπάλους.

Ο Kunal Kejriwal είναι μηχανικός back‑end που ειδικεύεται στην Python, PostgreSQL, Redis και στην υποδομή cloud στο GCP και το AWS. Με τρία χρόνια εμπειρίας στην κατασκευή και κλιμάκωση συστημάτων παραγωγής, γράφει για την υποδομή AI, τα κατανεμημένα συστήματα και την αρχιτεκτονική πίσω από την ανάπτυξη φορτίων εργασίας μηχανικής μάθησης.