Ρομποτική και φυσική AI

Επιστημονικοί Υπολογιστών Χρησιμοποιούν Θετική Ενίσχυση για να Διδάσουν Ρομπότ

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Οι επιστήμονες υπολογιστών στο Πανεπιστήμιο Johns Hopkins έχουν αναπτύξει την τεχνική εκπαίδευσης της θετικής ενίσχυσης, η οποία χρησιμοποιείται συχνά για την εκπαίδευση ζώων όπως τα σκυλιά, σε ένα ρομπότ ώστε να μπορεί να διδάξει τον εαυτό του новые δεξιότητες. Μεταξύ αυτών των νέων δεξιοτήτων ήταν η ικανότητα να στοιβάζει μπλοκ.

Το ρομπότ ονομάζεται Spot και σύμφωνα με τους ερευνητές, μπορεί να μάθει δεξιότητες μέσα σε ημέρες που παραδοσιακά χρειάζονταν περίπου einen μήνα.

Θετική Ενίσχυση

Η θετική ενίσχυση χρησιμοποιήθηκε από την ομάδα για να αυξήσει το σύνολο των δεξιοτήτων του ρομπότ. Η ταχύτητα με την οποία η ομάδα μπόρεσε να το κάνει αυτό καθιστά ευκολότερη την ανάπτυξη τέτοιων ρομπότ στον πραγματικό κόσμο.

Το έργο δημοσιεύθηκε στο IEEE Robotics and Automation Letters, με τίτλο “Καλό Ρομπότ! Αποτελεσματική Ενίσχυση Μάθησης για Πολυ-Βήμα Οπτικές Δραστηριότητες με Μεταφορά από το Συμούλαιο στο Πραγματικό.

Ο Andrew Hundt είναι φοιτητής διδακτορικού στο Πανεπιστήμιο Johns Hopkins και ο κύριος συγγραφέας της έρευνας.

“Η ερώτηση εδώ ήταν πώς να κάνουμε το ρομπότ να μάθει μια δεξιότητα;” είπε. “Έχω είχε σκυλιά,所以 γνωρίζω ότι οι ανταμοιβές λειτουργούν και αυτό ήταν η έμπνευση για το πώς σχεδίασα τον αλγόριθμο μάθησης.”

Ένας από τους λόγους που η θετική ενίσχυση λειτουργεί στους υπολογιστές είναι ότι δεν έχουν直觉istic μυαλά, που σημαίνει ότι είναι βασικά ένα κενό καμβάς στο οποίο μπορεί να προβληθεί οτιδήποτε. Με άλλα λόγια, πρέπει να μάθουν τα πάντα από το μηδέν. Μια από τις πιο αποτελεσματικές μεθόδους μάθησης για τους υπολογιστές είναι η δοκιμή και λάθος, η οποία είναι κάτι που οι ρομποτικοί εξακολουθούν να εργάζονται σήμερα.

Αυτό είναι ακριβώς αυτό που έκαναν οι ερευνητές όταν δημιούργησαν ένα σύστημα ανταμοιβής για το ρομπότ, παρόμοιο με τη διαδικασία εκπαίδευσης ενός σκύλου δίνοντάς του λιχουδιές. Η διαφορά είναι ότι το ρομπότ θα λαμβάνει αριθμητικές μονάδες όταν ολοκληρώσει μια δραστηριότητα σωστά.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Δεξιότητες που Μαθαίνονται

Όταν ήρθε η ώρα να μάθει πώς να στοιβάζει μπλοκ, το ρομπότ έπρεπε να μάθει να επικεντρώνεται στις κατασκευαστικές ενέργειες. Στη μέθοδο, το ρομπότ Spot έλαβε υψηλότερες μονάδες όταν ολοκλήρωσε σωστές συμπεριφορές κατά τη στοίβαξη των μπλοκ. Στο αντίθετο άκρο, δεν έλαβε τίποτα για λανθασμένες συμπεριφορές. Έλαβε τις υψηλότερες μονάδες ολοκληρώνοντας μια στοίβα τεσσάρων μπλοκ με το τελευταίο μπλοκ στην κορυφή.

Οι ερευνητές είδαν μεγάλη επιτυχία σε αυτή τη μέθοδο, με το ρομπότ να μαθαίνει σε ημέρες αυτό που θα πήγαινε εβδομάδες στο παρελθόν. Εκπαιδεύοντας ένα προσομοιωμένο ρομπότ, η ομάδα μείωσε τον χρόνο πρακτικής πριν μεταβεί στο ρομπότ Spot.

“Το ρομπότ θέλει το υψηλότερο σκορ,” είπε ο Hundt. “Γρήγορα μαθαίνει τη σωστή συμπεριφορά για να πάρει την καλύτερη ανταμοιβή. Πράγματι, πήρε einen μήνα πρακτικής για το ρομπότ να επιτύχει 100% ακρίβεια. Μπορέσαμε να το κάνουμε σε δύο ημέρες.”

Εκτός από το να μάθει πώς να στοιβάζει μπλοκ, το ρομπότ χρησιμοποίησε επίσης τη θετική ενίσχυση για να μάθει άλλες δραστηριότητες, όπως πώς να παίξει ένα προσομοιωμένο παιχνίδι πλοήγησης.

“Στην αρχή το ρομπότ δεν έχει ιδέα τι κάνει, αλλά θα γίνει καλύτερο και καλύτερο με κάθε πρακτική. Δεν σταματά ποτέ και συνεχίζει να προσπαθεί να στοιβάσει και μπορεί να ολοκληρώσει την εργασία 100% του χρόνου,” είπε ο Hundt.

Ορισμένες από τις πιθανές εφαρμογές αυτής της μεθόδου περιλαμβάνουν την εκπαίδευση οικιακών ρομπότ για την ολοκλήρωση ορισμένων δραστηριοτήτων, καθώς και την βελτίωση των αυτόνομων οχημάτων.

“Ο στόχος μας είναι τελικά να αναπτύξουμε ρομπότ που μπορούν να κάνουν σύνθετες δραστηριότητες στον πραγματικό κόσμο — όπως η συναρμολόγηση προϊόντων, η φροντίδα των ηλικιωμένων και η χειρουργική,” είπε ο Hager. “Δεν γνωρίζουμε ακόμη πώς να προγραμματίσουμε δραστηριότητες όπως αυτές — ο κόσμος είναι πολύ σύνθετος. Αλλά η εργασία όπως αυτή δείχνει ότι υπάρχει υπόσχεση στην ιδέα ότι τα ρομπότ μπορούν να μάθουν να ολοκληρώνουν τέτοιες πραγματικές δραστηριότητες με ασφάλεια και αποτελεσματικότητα.”

Ο Alex ηγείται των λειτουργιών ειδήσεων με τεχνητή νοημοσύνη της Unite.AI, συνδυάζοντας δημοσιογραφία, έρευνα και αυτοματοποίηση για να υποστηρίξει έγκαιρη και κλιμακώσιμη κάλυψη της τεχνητής νοημοσύνης. Η δουλειά του βοηθά να διασφαλιστεί ότι οι αναδυόμενες εξελίξεις στην AI προβάλλονται αποτελεσματικά, διατηρώντας τα δημοσιογραφικά πρότυπα της έκδοσης.