Μοντέλα και πλατφόρμες AI
Τεχνική Επιτρέπει στους Αλγόριθμους Νοήσης να Σκέφτονται Μακρύτερα στο Μέλλον
Μια ομάδα ερευνητών από το MIT, το MIT-IBM Watson AI Lab και άλλα ιδρύματα έχει αναπτύξει μια νέα προσέγγιση που επιτρέπει στους αλγόριθμους νοήσης (AI) να επιτύχουν μια μακροπρόθεσμη προοπτική. Με άλλα λόγια, ο αλγόριθμος νοήσης μπορεί να σκέφτεται μακρύτερα στο μέλλον όταν λαμβάνει υπόψη τις συμπεριφορές άλλων αλγόριθμων νοήσης κατά την εκτέλεση μιας εργασίας.
Η ερεύνηση θα παρουσιαστεί στη Διάσκεψη για την Επεξεργασία Νευρικών Πληροφοριών.
Αλγόριθμοι Νοήσης που Λαμβάνουν υπόψη τις Μελλοντικές Ενέργειες Άλλων Αλγόριθμων
Το πλαίσιο μηχανικής μάθησης που δημιούργησε η ομάδα επιτρέπει στους συνεργατικούς ή ανταγωνιστικούς αλγόριθμους νοήσης να λαμβάνουν υπόψη τι θα κάνουν άλλοι αλγόριθμοι. Αυτό δεν ισχύει μόνο για τα επόμενα βήματα, αλλά και καθώς ο χρόνος προσεγγίζει το άπειρο. Οι αλγόριθμοι προσαρμόζουν τις συμπεριφορές τους ανάλογα για να επηρεάσουν τις μελλοντικές συμπεριφορές άλλων αλγόριθμων, βοηθώντας τους να φτάσουν σε βέλτιστες, μακροπρόθεσμες λύσεις.
Σύμφωνα με την ομάδα, το πλαίσιο θα μπορούσε να χρησιμοποιηθεί, για παράδειγμα, από μια ομάδα αυτονομών drone που εργάζονται μαζί για να βρουν einen χαμένο ορειβάτη. Θα μπορούσε επίσης να χρησιμοποιηθεί από αυτονομούς οδηγούς για να προβλέψουν τις μελλοντικές κινήσεις άλλων οχημάτων και να βελτιώσουν την ασφάλεια των επιβατών.
Ο Dong-Ki Kim είναι μεταπτυχιακός φοιτητής στο Εργαστήριο Πληροφοριών και Αποφάσεων του MIT (LIDS) και πρώτος συγγραφέας της έρευνας.
«Όταν οι αλγόριθμοι νοήσης συνεργάζονται ή ανταγωνίζονται, το που περισσότερο μετρά είναι όταν οι συμπεριφορές τους συναντώνται σε κάποιο σημείο στο μέλλον», λέει ο Kim. «Υπάρχουν πολλές μεταβατικές συμπεριφορές κατά μήκος του δρόμου που δεν μετράνε πολύ σε μακροπρόθεσμο χρονικό διάστημα. Η επίτευξη αυτής της συναγερμένης συμπεριφοράς είναι αυτό που πραγματικά μας ενδιαφέρει, και τώρα έχουμε einen μαθηματικό τρόπο να το επιτύχουμε».
Το πρόβλημα που αντιμετωπίζει η ομάδα είναι γνωστό ως multi-αλγόριθμος νοήσης ενίσχυσης, με την ενίσχυση μάθησης να είναι ένας τύπος μηχανικής μάθησης όπου οι αλγόριθμοι νοήσης μαθαίνουν με δοκιμή και λάθος.
Όταν υπάρχουν πολλαπλοί συνεργατικοί ή ανταγωνιστικοί αλγόριθμοι που μαθαίνουν ταυτόχρονα, η διαδικασία μπορεί να γίνει πολύ πιο σύνθετη. Όταν οι αλγόριθμοι λαμβάνουν υπόψη περισσότερα μελλοντικά βήματα άλλων αλγόριθμων, καθώς και τη δική τους συμπεριφορά και τον τρόπο με τον οποίο επηρεάζουν άλλους, το πρόβλημα απαιτεί πολύ υπολογιστική ισχύ.
Αλγόριθμοι Νοήσης που Σκέφτονται το Άπειρο
«Οι αλγόριθμοι νοήσης πραγματικά θέλουν να σκέφτονται το τέλος του παιχνιδιού, αλλά δεν ξέρουν πότε θα τελειώσει το παιχνίδι», λέει ο Kim. «Θέλουν να σκέφτονται πώς να συνεχίσουν να προσαρμόζουν τη συμπεριφορά τους στο άπειρο, ώστε να κερδίσουν σε κάποιο μακρινό μέλλον. Η εργασία μας προτείνει βασικά einen νέο στόχο που επιτρέπει στον αλγόριθμο νοήσης να σκέφτεται το άπειρο».
Είναι αδύνατο να ενσωματωθεί το άπειρο σε einen αλγόριθμο, οπότε η ομάδα σχεδίασε το σύστημα με τρόπο που οι αλγόριθμοι να εστιάζουν σε einen μελλοντικό σημείο όπου η συμπεριφορά τους θα συναντώνται με άλλους αλγόριθμους. Αυτό ονομάζεται ισορροπία, και ένας σημείο ισορροπίας καθορίζει την μακροπρόθεσμη απόδοση των αλγόριθμων.
Είναι δυνατό να υπάρχουν πολλαπλά ισορροπία σε einen σценάριο πολλαπλών αλγόριθμων, και όταν ένας αποτελεσματικός αλγόριθμος επηρεάζει ενεργά τις μελλοντικές συμπεριφορές άλλων αλγόριθμων, μπορούν να φτάσουν σε eine επιθυμητή ισορροπία από την πλευρά του αλγόριθμου. Όταν όλοι οι αλγόριθμοι επηρεάζουν ο ένας τον άλλον, συναντώνται σε einen γενικό概念 που ονομάζεται «ενεργός ισορροπία».
Πλαίσιο FURTHER
Το πλαίσιο μηχανικής μάθησης της ομάδας ονομάζεται FURTHER, και επιτρέπει στους αλγόριθμους να μαθαίνουν πώς να προσαρμόζουν τις συμπεριφορές τους με βάση τις αλληλεπιδράσεις τους με άλλους αλγόριθμους για να επιτύχουν ενεργό ισορροπία.
Το πλαίσιο βασίζεται σε δύο μονάδες μηχανικής μάθησης. Η πρώτη είναι eine μονάδα εύρεσης που επιτρέπει στον αλγόριθμο να μαντέψει τις μελλοντικές συμπεριφορές άλλων αλγόριθμων και τους αλγόριθμους μάθησης που χρησιμοποιούν με βάση προηγούμενες ενέργειες. Οι πληροφορίες τροφοδοτούνται στη μονάδα ενίσχυσης μάθησης, την οποία ο αλγόριθμος χρησιμοποιεί για να προσαρμόσει τη συμπεριφορά του και να επηρεάσει άλλους αλγόριθμους.
«Η πρόκληση ήταν να σκεφτούμε το άπειρο. Χρειαζόμασταν να χρησιμοποιήσουμε πολλά διαφορετικά μαθηματικά εργαλεία για να το επιτύχουμε, και να κάνουμε κάποιες υποθέσεις για να το κάνουμε να λειτουργήσει στην πράξη», λέει ο Kim.
Η ομάδα ελέγχει την μέθοδό τους ενάντια σε άλλα πλαίσια πολλαπλών αλγόριθμων ενίσχυσης σε διαφορετικά σενάρια, όπου οι αλγόριθμοι που χρησιμοποιούν το FURTHER βγήκαν μπροστά.
Η προσέγγιση είναι αποκεντρωμένη, οπότε οι αλγόριθμοι μαθαίνουν να κερδίζουν ανεξάρτητα. Επιπλέον, είναι καλύτερα σχεδιασμένη για να κλιμακωθεί σε σύγκριση με άλλες μεθόδους που απαιτούν einen κεντρικό υπολογιστή για τον έλεγχο των αλγόριθμων.
Σύμφωνα με την ομάδα, το FURTHER θα μπορούσε να χρησιμοποιηθεί σε einen ευρύ φάσμα προβλημάτων πολλαπλών αλγόριθμων. Ο Kim είναι ιδιαίτερα ελπιδοφόρος για τις εφαρμογές του στην οικονομία, όπου θα μπορούσε να εφαρμοστεί για την ανάπτυξη μιας σωστής πολιτικής σε καταστάσεις που εμπλέκουν πολλά αλληλεπιδρώντα οντότητες με συμπεριφορές και ενδιαφέροντα που αλλάζουν με τον χρόνο.












