Μοντέλα και πλατφόρμες AI
Η DeepMind Ανακαλύπτει Τεχνική Εκπαίδευσης AI που Μπορεί να Λειτουργήσει και στο Εγκέφαλο
Η DeepMind δημοσίευσε πρόσφατα ένα έγγραφο που περιγράφει πώς ένας νέος τύπος ενισχυτικής μάθησης μπορεί να εξηγήσει πώς λειτουργούν οι μονοπάτι της ανταμοιβής στον ανθρώπινο εγκέφαλο. Σύμφωνα με την NewScientist, η μέθοδος εκπαίδευσης του μηχανικού μαθήματος ονομάζεται κατανομική ενισχυτική μάθηση και οι μηχανισμοί πίσω της φαίνεται να εξηγούν πώς απελευθερώνεται η ντοπαμίνη από τους νευρώνες στον εγκέφαλο.
Η νευροεπιστήμη και η επιστήμη των υπολογιστών έχουν μια μακρά ιστορία μαζί. Από το 1951, ο Marvin Minsky χρησιμοποίησε ένα σύστημα ανταμοιβών και τιμωριών για να δημιουργήσει ένα πρόγραμμα υπολογιστή που μπορούσε να λύσει ένα λαβύρινθο. Ο Minsky εμπνεύστηκε από το έργο του Ivan Pavlov, ενός φυσιολόγου που απέδειξε ότι τα σκυλιά μπορούσαν να μάθουν μέσω μιας σειράς ανταμοιβών και τιμωριών. Το νέο έγγραφο της DeepMind προσθέτει στην ιστορία της νευροεπιστήμης και της επιστήμης των υπολογιστών, εφαρμόζοντας einen τύπο ενισχυτικής μάθησης για να αποκτήσει έμπνευση για το πώς οι νευρώνες της ντοπαμίνης μπορεί να λειτουργήσουν.
Όταν ένα άτομο ή ένα ζώο είναι έτοιμο να εκτελέσει μια ενέργεια, οι συλλογές νευρώνων στον εγκέφαλο που είναι υπεύθυνα για την απελευθέρωση της ντοπαμίνης κάνουν μια πρόβλεψη για το πόσο ανταμοιβητική θα είναι η ενέργεια. Μόλις η ενέργεια έχει εκτελεστεί και οι συνέπειες (ανταμοιβές) της ενέργειας έχουν γίνει φανερές, ο εγκέφαλος απελευθερώνει ντοπαμίνη. Ωστόσο, η απελευθέρωση της ντοπαμίνης είναι κλιμακωτή σύμφωνα με το μέγεθος του σφάλματος της πρόβλεψης. Αν η ανταμοιβή είναι μεγαλύτερη/καλύτερη από την αναμενόμενη, μια ισχυρότερη έκρηξη ντοπαμίνης προκαλείται. Αντίθετα, μια χειρότερη ανταμοιβή οδηγεί σε λιγότερη ντοπαμίνη που απελευθερώνεται. Η ντοπαμίνη λειτουργεί ως μια διορθωτική λειτουργία που κάνει τους νευρώνες να调节 τις προβλέψεις τους μέχρι να συναντηθούν με τις πραγματικές ανταμοιβές που κερδίζονται. Αυτό είναι πολύ παρόμοιο με το πώς λειτουργούν οι αλγόριθμοι ενισχυτικής μάθησης.
Το 2017, ερευνητές της DeepMind δημοσίευσαν μια βελτιωμένη έκδοση ενός συνηθισμένου αλγορίθμου ενισχυτικής μάθησης, και αυτή η ανώτερη μέθοδος μάθησης ήταν σε θέση να αυξήσει την απόδοση σε πολλές εργασίες ενισχυτικής μάθησης. Η ομάδα της DeepMind σκέφτηκε ότι οι μηχανισμοί πίσω από τον νέο αλγόριθμο θα μπορούσαν να χρησιμοποιηθούν για να εξηγήσουν καλύτερα πώς λειτουργούν οι νευρώνες της ντοπαμίνης στον ανθρώπινο εγκέφαλο.
Σε αντίθεση με τους παλαιότερους αλγορίθμους ενισχυτικής μάθησης, ο νέος αλγόριθμος της DeepMind αντιπροσωπεύει τις ανταμοιβές ως μια κατανομή. Οι παλαιότερες προσεγγίσεις ενισχυτικής μάθησης αντιπροσωπεύουν τις εκτιμώμενες ανταμοιβές ως ένα単ο αριθμό που αντιπροσωπεύει τον μέσο αναμενόμενο αποτέλεσμα. Αυτή η αλλαγή επέτρεψε στο μοντέλο να αντιπροσωπεύει πιο ακριβώς τις πιθανές ανταμοιβές και να εκτελέσει καλύτερα ως αποτέλεσμα. Η ανώτερη απόδοση της νέας μεθόδου εκπαίδευσης προκάλεσε τους ερευνητές της DeepMind να ερευνήσουν αν οι νευρώνες της ντοπαμίνης στον ανθρώπινο εγκέφαλο λειτουργούν με παρόμοιο τρόπο.
Για να ερευνήσουν την λειτουργία των νευρώνων της ντοπαμίνης, η DeepMind συνεργάστηκε με το Χάρβαρντ για να ερευνήσει τη δραστηριότητα των νευρώνων της ντοπαμίνης σε ποντίκια. Οι ερευνητές είχαν τα ποντίκια να εκτελέσουν διάφορες εργασίες και τους έδωσαν ανταμοιβές με βάση το ρίξιμο ενός ζαριού, καταγράφοντας πώς οι νευρώνες της ντοπαμίνης τους έπαιρναν. Διαφορετικοί νευρώνες φαίνεται να προβλέπουν διαφορετικά πιθανά αποτελέσματα, απελευθερώνοντας διαφορετικές ποσότητες ντοπαμίνης. Ορισμένοι νευρώνες προέβλεπαν χαμηλότερα από την πραγματική ανταμοιβή, ενώ άλλοι προέβλεπαν ανταμοιβές υψηλότερες από την πραγματική ανταμοιβή. Μετά από τη γραφική απεικόνιση της κατανομής των προβλέψεων της ανταμοιβής, οι ερευνητές βρήκαν ότι η κατανομή των προβλέψεων ήταν αρκετά κοντά στη πραγματική κατανομή της ανταμοιβής. Αυτό υποδηλώνει ότι ο εγκέφαλος χρησιμοποιεί ένα κατανομικό σύστημα όταν κάνει προβλέψεις και調節 τις προβλέψεις για να ταιριάξουν καλύτερα με την πραγματικότητα.
Η μελέτη μπορεί να ενημερώσει και τη νευροεπιστήμη και την επιστήμη των υπολογιστών. Η μελέτη υποστηρίζει τη χρήση της κατανομικής ενισχυτικής μάθησης ως μέθοδο για τη δημιουργία πιο προηγμένων μοντέλων AI. Πέρα από αυτό, μπορεί να έχει επιπτώσεις στις θεωρίες μας για το πώς λειτουργεί ο εγκέφαλος σχετικά με τα συστήματα ανταμοιβής. Αν οι νευρώνες της ντοπαμίνης είναι κατανομικοί και ορισμένοι είναι πιο απαισιόδοξοι ή αισιόδοξοι από άλλους, η κατανόηση αυτών των κατανομών θα μπορούσε να αλλάξει τον τρόπο με τον οποίο αντιμετωπίζουμε аспектς της ψυχολογίας όπως η ψυχική υγεία και η мотивασία.
Σύμφωνα με την MIT Technology Review, ο Matt Botvinik, ο διευθυντής της νευροεπιστημονικής έρευνας στη DeepMind, εξήγησε τη σημασία των ευρημάτων σε μια συνέντευξη τύπου. Ο Botvinik είπε:
“Αν ο εγκέφαλος το χρησιμοποιεί, είναι πιθανό να είναι μια καλή ιδέα. Μας λέει ότι αυτή είναι μια υπολογιστική τεχνική που μπορεί να κλιμακωθεί σε πραγματικές καταστάσεις. Θα ταιριάξει καλά με άλλες υπολογιστικές διαδικασίες. Μας δίνει μια νέα προοπτική για το τι συμβαίνει στον εγκέφαλο μας κατά την καθημερινή ζωή”












