Μοντέλα και πλατφόρμες AI
Ερευνητές Αναπτύσσουν το Μοντέλο Υπολογιστή JL2P για τη Μεταφράση Σεναρίων Ταινιών σε Animations

Ερευνητές στο Πανεπιστήμιο Carnegie Mellon έχουν αναπτύξει ένα μοντέλο υπολογιστή που είναι ικανό να μεταφράζει κείμενο που περιγράφει σωματικές κινήσεις σε απλές υπολογιστικές animations. Αυτές οι νέες εξελίξεις θα μπορούσαν να κάνουν δυνατή την δημιουργία ταινιών και άλλων animations απευθείας από ένα μοντέλο υπολογιστή που διαβάζει τα σενάρια.
Οι επιστήμονες έχουν κάνει πρόοδο στην κατανόηση της φυσικής γλώσσας και την παραγωγή σωματικών στάσεων από σενάριο. Αυτό το νέο μοντέλο υπολογιστή μπορεί να είναι ο σύνδεσμος μεταξύ τους.
Ο Louis-Philippe Morency, αναπληρωτής καθηγητής στο Ινστιτούτο Γλωσσικών Τεχνολογιών (LTI), και ο Chaitanya Ahuja, φοιτητής διδακτορικού στο LTI, έχουν χρησιμοποιήσει μια νευρωνική αρχιτεκτονική που ονομάζεται Joint Language-to-Pose (JL2P). Το μοντέλο JL2P είναι ικανό να ενσωματώνει προτάσεις και σωματικές κινήσεις. Αυτό του επιτρέπει να μάθει πώς η γλώσσα συνδέεται με δράση, χειρονομίες και κινήσεις.
“Νομίζω ότι βρισκόμαστε σε ένα πρώιμο στάδιο αυτής της έρευνας, αλλά από την πλευρά του μοντέλου, της τεχνητής νοημοσύνης και της θεωρίας, είναι ένα πολύ ενδιαφέρον момент”, είπε ο Morency. “Τώρα, μιλάμε για την animation εικονικών χαρακτήρων. Τελικά, αυτός ο σύνδεσμος μεταξύ γλώσσας και χειρονομιών θα μπορούσε να εφαρμοστεί σε ρομπότ· θα μπορούσαμε να τους πούμε απλά τι θέλουμε να κάνουν.
“Θα μπορούσαμε επίσης να πάρουμε την αντίστροφη οδό — χρησιμοποιώντας αυτόν τον σύνδεσμο μεταξύ γλώσσας και animation, ώστε ένας υπολογιστής να μπορεί να περιγράψει τι συμβαίνει σε ένα βίντεο”, πρόσθεσε.
Το μοντέλο Joint Language-to-Pose θα παρουσιαστεί από τον Ahuja στις 19 Σεπτεμβρίου στη Διεθνή Διάσκεψη για την Οπτική των 3D. Η διάσκεψη θα διεξαχθεί στην Πόλη του Κεμπέκ, Καναδάς.
Το μοντέλο JL2P δημιουργήθηκε με μια προσέγγιση μάθησης καθηκόντων. Το πρώτο σημαντικό βήμα ήταν για το μοντέλο να μάθει σύντομες, εύκολες ακολουθίες. Αυτό θα ήταν κάτι όπως “Ένας άνθρωπος περπατάει μπροστά”. Στη συνέχεια, προχώρησε σε μεγαλύτερες και πιο δύσκολες ακολουθίες, όπως “Ένας άνθρωπος περπατάει μπροστά,然后 γυρίζει και περπατάει πάλι μπροστά” ή “Ένας άνθρωπος πηδάει πάνω από ένα εμπόδιο ενώ τρέχει”.
Όταν το μοντέλο χρησιμοποιεί τις ακολουθίες, εξετάζει τα ρήματα και τα επιρρήματα. Αυτά περιγράφουν την δράση και την ταχύτητα/επίταξη της δράσης. Στη συνέχεια, εξετάζει τα ουσιαστικά και τα επιθέματα, τα οποία περιγράφουν τις τοποθεσίες και τις διευθύνσεις. Σύμφωνα με τον Ahuja, ο τελικός στόχος του μοντέλου είναι να animate σύνθετες ακολουθίες με πολλές δράσεις που συμβαίνουν ταυτόχρονα ή σε ακολουθία.
Για τώρα, οι animations περιορίζονται σε σχήματα σκιών, αλλά οι επιστήμονες θα συνεχίσουν να αναπτύσσουν το μοντέλο. Μια από τις δυσκολίες που προκύπτουν είναι ότι, σύμφωνα με τον Morency, πολλά πράγματα συμβαίνουν ταυτόχρονα. Κάποια από αυτά συμβαίνουν ακόμη και σε απλές ακολουθίες.
“Η συγχρονία μεταξύ των μερών του σώματος είναι πολύ σημαντική”, είπε ο Morency. “Κάθε φορά που κινείς τα πόδια σου, επίσης κινείς τα χέρια σου, το σώμα σου και πιθανώς το κεφάλι σου. Οι animations του σώματος πρέπει να συντονίσουν αυτά τα διαφορετικά μέρη, ενώ ταυτόχρονα επιτυγχάνουν σύνθετες δράσεις. Η εισαγωγή αφηγηματικής γλώσσας σε αυτό το σύνθετο περιβάλλον animation είναι και προκλητική και ενδιαφέρουσα. Αυτός είναι ο δρόμος προς μια καλύτερη κατανόηση της ομιλίας και των χειρονομιών.”
Εάν το μοντέλο Joint Language-to-Pose είναι ικανό να αναπτυχθεί στο σημείο όπου μπορεί να δημιουργήσει σύνθετες animations και δράσεις με βάση τη γλώσσα, οι δυνατότητες είναι τεράστιες. Όχι μόνο μπορεί να χρησιμοποιηθεί σε περιοχές όπως η κινηματογράφηση και η animation, αλλά θα οδηγήσει επίσης σε εξελίξεις στην κατανόηση της ομιλίας και των χειρονομιών.
Στρέφοντας την προσοχή στην τεχνητή νοημοσύνη, αυτό το μοντέλο JL2P θα μπορούσε να χρησιμοποιηθεί σε ρομπότ. Για παράδειγμα, τα ρομπότ θα μπορούσαν να ελεγχθούν και να τους πούμε τι θέλουμε να κάνουν, και θα ήταν ικανά να κατανοήσουν τη γλώσσα και να ανταποκριθούν ανάλογα.
Αυτές οι νέες εξελίξεις θα επηρεάσουν πολλά διαφορετικά πεδία, και το μοντέλο θα συνεχίσει να γίνεται πιο ικανό να κατανοήσει σύνθετη γλώσσα.












