Μοντέλα και πλατφόρμες AI
Το AI της Google διδάσκει τους ρομπότ να κινούνται παρακολουθώντας σκύλους
Ακόμη και κάποιοι από τους πιο προηγμένους ρομπότ σήμερα κινούνται με κάποιο τρόπο ακατάλληλο, σπαστικό. Για να κάνουν τα ρομπότ να κινούνται με πιο φυσικό, ομαλό τρόπο, ερευνητές της Google (GOOGL ) έχουν αναπτύξει ένα σύστημα AI που είναι ικανό να μαθαίνει από τις κινήσεις των πραγματικών ζώων. Η ερευνητική ομάδα της Google δημοσίευσε ένα προδημοσίευμα που περιέγραφε την προσέγγισή τους την περασμένη εβδομάδα. Στο έγγραφο και σε μια συνοδευτική ανάρτηση στο blog, η ερευνητική ομάδα περιγράφει τον λόγο πίσω από το σύστημα. Οι συγγραφείς του εγγράφου πιστεύουν ότι η ενδυνάμωση των ρομπότ με πιο φυσικές κινήσεις θα μπορούσε να βοηθήσει στην εκτέλεση πραγματικών εργασιών που απαιτούν ακριβή κίνηση, όπως η παράδοση αντικειμένων μεταξύ διαφορετικών επιπέδων ενός κτιρίου.
Όπως ανέφερε το VentureBeat, η ερευνητική ομάδα χρησιμοποίησε ενισχυμένη μάθηση για να εκπαιδεύσει τα ρομπότ. Οι ερευνητές ξεκίνησαν συλλέγοντας κλιπ πραγματικών ζώων που κινούνταν και χρησιμοποιώντας τεχνικές ενισχυμένης μάθησης (RL) για να ωθήσουν τα ρομπότ να μιμούνται τις κινήσεις των ζώων στα βίντεο. Σε αυτή την περίπτωση, οι ερευνητές εκπαίδευσαν τα ρομπότ σε κλιπ ενός σκύλου, σχεδιασμένο σε einen φυσικό симулятор, με εντολή σε ένα τετράποδο ρομπότ Unitree Laikago να μιμείται τις κινήσεις του σκύλου. Μετά την εκπαίδευση του ρομπότ, ήταν ικανό να εκτελέσει σύνθετες κινήσεις όπως το πήδημα, η στροφή και το γρήγορο περπάτημα, με ταχύτητα περίπου 2,6 μιλίων την ώρα.
Τα δεδομένα εκπαίδευσης αποτελούνταν από περίπου 200 εκατομμύρια δείγματα σκύλων σε κίνηση, που παρακολουθούνταν σε einen φυσικό симулятор. Οι διαφορετικές κινήσεις τότε περνούσαν από συνάρτηση ανταμοιβής και πολιτικές που οι πράκτορες έμαθαν. Μετά τη δημιουργία των πολιτικών στη симуляση, μεταφέρθηκαν στον πραγματικό κόσμο χρησιμοποιώντας μια τεχνική που ονομάζεται.latent space adaptation. Επειδή οι φυσικοί симυλατωτές που χρησιμοποιήθηκαν για την εκπαίδευση των ρομπότ μπορούσαν μόνο να προσεγγίσουν certains аспектς της πραγματικής κίνησης, οι ερευνητές εφαρμόζαν τυχαία διάφορες perturbations στη симуляση, με σκοπό να симυλατουν την λειτουργία υπό διαφορετικές συνθήκες.
Σύμφωνα με την ερευνητική ομάδα, ήταν ικανή να προσαρμόσει τις πολιτικές της симуляσης στα πραγματικά ρομπότ χρησιμοποιώντας μόνο 8 λεπτά δεδομένων που συλλέχθηκαν από 50 διαφορετικά πειράματα. Οι ερευνητές κατάφεραν να δείξουν ότι τα πραγματικά ρομπότ ήταν ικανά να μιμούνται eine ποικιλία από διαφορετικές, συγκεκριμένες κινήσεις όπως το τρέξιμο, η στροφή, το πήδημα και το περπάτημα. Μπορούσαν ακόμη να μιμούνται animations που δημιουργήθηκαν από animation artists, όπως μια συνδυασμένη κίνηση πήδησης και στροφής.
Οι ερευνητές συνοψίζουν τα ευρήματά τους στο έγγραφο:
«Δείχνουμε ότι με την αξιοποίηση δεδομένων κίνησης αναφοράς, μια seule μάθηση-βασισμένη προσέγγιση είναι ικανή να συνθέσει αυτόματα ελεγκτές για eine ποικιλία από συμπεριφορές για ρομπότ με πόδια. Με την ενσωμάτωση τεχνικών προσαρμογής τομέα σε αποτελεσματική δειγματοληψία στη διαδικασία εκπαίδευσης, το σύστημά μας είναι ικανό να μάθει προσαρμοστικές πολιτικές στη симуляση που μπορούν να προσαρμοστούν γρήγορα για ανάπτυξη στον πραγματικό κόσμο».
Οι πολιτικές ελέγχου που χρησιμοποιήθηκαν κατά τη διαδικασία ενισχυμένης μάθησης είχαν τους περιορισμούς τους. Λόγω των περιορισμών που επιβλήθηκαν από το υλικό και τους αλγορίθμους, υπήρχαν κάποια πράγματα που τα ρομπότ απλά δεν μπορούσαν να κάνουν. Δεν ήταν ικανά να τρέξουν ή να κάνουν μεγάλες πηδήξεις, για παράδειγμα. Οι μάθειες πολιτικές δεν έδειξαν επίσης τόσο σταθερότητα όταν συγκρίθηκαν με κινήσεις που σχεδιάστηκαν χειροκίνητα. Η ερευνητική ομάδα θέλει να πάρει το έργο πιο遠 by κάνωντας τους ελεγκτές πιο robust και ικανούς να μάθουν από διαφορετικά είδη δεδομένων. Ιδανικά, μελλοντικές εκδόσεις του πλαισίου θα είναι ικανές να μάθουν από δεδομένα βίντεο.










