Ρομποτική και φυσική AI
Μοντέλο Μηχανικής Μάθησης Κατανοεί τις Σχέσεις Αντικειμένων
Ερευνητές στο Ινστιτούτο Τεχνολογίας της Μασαχουσέτης (MIT) έχουν αναπτύξει ένα νέο μοντέλο μηχανικής μάθησης (ML) που κατανοεί τις υποκείμενες σχέσεις μεταξύ αντικειμένων σε μια σκηνή. Το μοντέλο αντιπροσωπεύει τις ατομικές σχέσεις μια-μια πριν από τη συνδυαστική τους για να περιγράψει την συνολική σκηνή.
Μέσω αυτής της νέας προσέγγισης, το μοντέλο ML μπορεί να γεννήσει πιο ακριβείς εικόνες από περιγραφές κειμένου, και μπορεί να το κάνει αυτό ακόμη και όταν η σκηνή έχει πολλά έργα διατεταγμένα σε διαφορετικές σχέσεις μεταξύ τους.
Αυτή η νέα ανάπτυξη είναι σημαντική δεδομένου ότι πολλά μοντέλα βαθιάς μάθησης δεν μπορούν να κατανοήσουν τις μπλεγμένες σχέσεις μεταξύ ατομικών αντικειμένων.
Το μοντέλο της ομάδας θα μπορούσε να χρησιμοποιηθεί σε περιπτώσεις όπου βιομηχανικοί ρομπότ πρέπει να εκτελέσουν πολύπλοκες εργασίες χειρισμού, όπως το στοίβαγμα αντικειμένων ή η συναρμολόγηση συσκευών. Βοηθά επίσης στην οδηγία των μηχανών να μάθουν από και να αλληλεπιδράσουν με το περιβάλλον τους, όπως οι άνθρωποι.
Ο Yilun Du είναι φοιτητής διδακτορικού στο Εργαστήριο Επιστήμης και Τεχνολογίας Υπολογιστών (CSAIL) και συν-πρωταγωνιστής της έρευνας. Ο Du συν-ηγήθηκε την έρευνα με τον Shuang Li, φοιτητή διδακτορικού στο CSAIL, και τον Nan Liu, μεταπτυχιακό φοιτητή στο Πανεπιστήμιο του Ιλινόις στο Urbana-Champaign. Περιελάμβανε επίσης τον Joshua B. Tenenbaum, Καθηγητή Κognitικής Επιστήμης και Υπολογιστών στο Τμήμα Εγκεφαλικών και Κognitικών Επιστημών, και τον senior συγγραφέα Antonio Torralba, Καθηγητή Ηλεκτρολογικής και Υπολογιστικής Μηχανικής. Και οι Tenenbaum και Torralba είναι μέλη του CSAIL.
Το Νέο Πλαίσιο
“Όταν κοιτάω ένα τραπέζι, δεν μπορώ να πω ότι υπάρχει ένα αντικείμενο στη θέση XYZ. Ο νους μας δεν λειτουργεί έτσι. Όταν κατανοούμε μια σκηνή, την κατανοούμε πραγματικά με βάση τις σχέσεις μεταξύ των αντικειμένων. Νομίζουμε ότι με την κατασκευή ενός συστήματος που μπορεί να κατανοήσει τις σχέσεις μεταξύ αντικειμένων, θα μπορούσαμε να χρησιμοποιήσουμε αυτό το σύστημα για να χειριστούμε και να αλλάξουμε το περιβάλλον μας με πιο αποτελεσματικό τρόπο,” λέει ο Du.
Το νέο πλαίσιο μπορεί να γεννήσει μια εικόνα μιας σκηνής με βάση μια περιγραφή κειμένου αντικειμένων και των σχέσεών τους.
Το σύστημα μπορεί να σπάσει αυτές τις προτάσεις σε μικρότερα κομμάτια που περιγράφουν κάθε ατομική σχέση. Κάθε μέρος μοντελοποιείται ξεχωριστά, και τα κομμάτια συνδυάζονται μέσω μιας διαδικασίας βελτιστοποίησης που γεννάει μια εικόνα της σκηνής.
Με τις προτάσεις σπασμένες σε μικρότερα κομμάτια, το σύστημα μπορεί να τις ξανασυνδυάσει με διαφορετικούς τρόπους, επιτρέποντάς του να προσαρμοστεί σε περιγραφές σκηνών που δεν έχει συναντήσει ποτέ.
“Άλλα συστήματα θα έπαιρναν όλες τις σχέσεις ολιστικά και θα γεννούσαν την εικόνα σε μια seule βολή από την περιγραφή. Ωστόσο, τέτοιες προσεγγίσεις αποτυγχάνουν όταν έχουμε περιγραφές εκτός της κατανομής, όπως περιγραφές με περισσότερες σχέσεις, поскольку αυτά τα μοντέλα δεν μπορούν πραγματικά να προσαρμοστούν σε μια seule βολή για να γεννήσουν εικόνες που περιέχουν περισσότερες σχέσεις. Ωστόσο, καθώς συνθέτουμε αυτά τα ξεχωριστά, μικρότερα μοντέλα μαζί, μπορούμε να μοντελοποιήσουμε ένα μεγαλύτερο αριθμό σχέσεων και να προσαρμοστούμε σε νέες συνδυασίες,” λέει ο Du.
Το σύστημα μπορεί επίσης να εκτελέσει αυτή τη διαδικασία ανάποδα. Αν του δοθεί μια εικόνα, μπορεί να βρει περιγραφές κειμένου που ταιριάζουν στις σχέσεις μεταξύ αντικειμένων στη σκηνή.
Αξιολόγηση του Μοντέλου
Οι ερευνητές ζήτησαν από ανθρώπους να αξιολογήσουν αν οι γεννημένες εικόνες ταιριάζουν με την αρχική περιγραφή της σκηνής. Όταν οι περιγραφές περιείχαν τρεις σχέσεις, που ήταν ο πιο σύνθετος τύπος, το 91% των συμμετεχόντων είπε ότι το νέο μοντέλο εκτελούσε καλύτερα από άλλα μοντέλα βαθιάς μάθησης.
“Ένα ενδιαφέρον πράγμα που βρήκαμε είναι ότι για το μοντέλο μας, μπορούμε να αυξήσουμε την πρόταση μας από μια σχέση περιγραφής σε δύο, ή τρεις, ή ακόμη και τέσσερις περιγραφές, και η προσέγγισή μας συνεχίζει να είναι σε θέση να γεννήσει εικόνες που περιγράφονται σωστά από αυτές τις περιγραφές, ενώ άλλα μοντέλα αποτυγχάνουν,” λέει ο Du.
Το μοντέλο απέδειξε επίσης μια εντυπωσιακή ικανότητα να εργαστεί με περιγραφές που δεν είχε συναντήσει προηγουμένως.
“Αυτό είναι πολύ υποσχόμενο επειδή αυτό είναι πιο κοντά στο πώς δουλεύουν οι άνθρωποι. Οι άνθρωποι μπορεί να δουν μόνο vài παραδείγματα, αλλά μπορούμε να εξαγάγουμε χρήσιμη πληροφορία από αυτά τα λίγα παραδείγματα και να τα συνδυάσουμε μαζί για να δημιουργήσουμε άπειρες συνδυασίες. Και το μοντέλο μας έχει αυτή την ιδιότητα που του επιτρέπει να μάθει από λιγότερα δεδομένα αλλά να γενικεύσει σε πιο σύνθετες σκηνές ή γεννήσεις εικόνων,” λέει ο Li.
Η ομάδα θα εξετάσει τώρα το μοντέλο σε πραγματικές εικόνες που είναι πιο σύνθετες και θα εξερευνήσει πώς να ενσωματώσει τελικά το μοντέλο σε συστήματα ρομποτικής.












