Ρομποτική και φυσική AI

Ερευνητές του CMU Δημιουργούν Ρομποτικό Βραχίονα που Ζωγραφίζει με τη Βοήθεια του AI

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Ερευνητές στο Ινστιτούτο Ρομποτικής του Πανεπιστημίου Carnegie Mellon έχουν αναπτύξει ένα εργαλείο που ονομάζεται FRIDA, το οποίο είναι ένας ρομποτικός βραχίονας με einen πινέλο ζωγραφικής. Το εργαλείο αξιοποιεί τη τεχνητή νοημοσύνη (AI) για να συνεργαστεί με τους ανθρώπους σε έργα τέχνης.

Η ομάδα είναι πρόκειται να παρουσιάσει την έρευνά τους με τον τίτλο «FRIDA: Ένας Συνεργατικός Ρομποτικός Ζωγράφος με ένα Διαφορίσιμο, Πραγματικό-Συμβολικό-Πραγματικό Περιβάλλον Σχεδιασμού» στη Διεθνή Διάσκεψη Ρομποτικής και Αυτομάτου Ελέγχου του IEEE τον Μάιο.

Ο Peter Schaldenbrand είναι φοιτητής διδακτορικού στο Ινστιτούτο Ρομποτικής της Σχολής Επιστημών Υπολογιστών. Εργάζεται με τη FRIDA και εξερευνά τη σχέση μεταξύ AI και δημιουργικότητας.

«Υπάρχει ένα πίνακας με μια βαλλερίνα-βάτραχο που νομίζω ότι βγήκε πολύ καλά», είπε. «Είναι πραγματικά αστείο και διασκεδαστικό, και νομίζω ότι η έκπληξη από το τι παράγει η FRIDA με βάση την είσοδό μου ήταν πραγματικά διασκεδαστικό να δω».

Η FRIDA είναι ένα ακρωνύμιο για το Framework και Ρομποτική Πρωτοβουλία για την Ανάπτυξη Τέχνης. Ονομάζεται così από τη Frida Kahlo.

Η έρευνα διεξήχθη από τον Schalderbrand, μαζί με μέλη του διδακτικού προσωπικού του RI, Jean Oh και Jim McCaam, και έχει προσελκύσει φοιτητές και ερευνητές από όλο το CMU.

Συνεργατικό Εργαλείο, Όχι Καλλιτέχνης

Οι χρήστες μπορούν να οδηγούν τη FRIDA εισάγοντας μια περιγραφή κειμένου, υποβάλλοντας άλλα έργα τέχνης για να εμπνεύσουν το στυλ της, ή ανεβάζοντας μια φωτογραφία και ζητώντας της να ζωγραφίσει μια αναπαράσταση. Η ομάδα δοκιμάζει επίσης άλλες εισόδους, όπως ήχο.

«Η FRIDA είναι ένα ρομποτικό σύστημα ζωγραφικής, αλλά η FRIDA δεν είναι καλλιτέχνης», συνέχισε ο Schalderbrand. «Η FRIDA δεν παράγει τις ιδέες για να επικοινωνήσει. Η FRIDA είναι ένα σύστημα που μπορεί να συνεργαστεί με έναν καλλιτέχνη. Ο καλλιτέχνης μπορεί να ορίσει υψηλού επιπέδου στόχους για τη FRIDA και στη συνέχεια η FRIDA μπορεί να τους εκτελέσει».

Για να ζωγραφίσει μια εικόνα, ο ρομποτικός βραχίονας χρησιμοποιεί μοντέλα AI που είναι συγκρίσιμα με αυτά που τροφοδοτούν το ChatGPT και το DALL-E 2 της OpenAI, τα οποία παράγουν κείμενο ή μια εικόνα ως απάντηση σε μια πρόκληση. Η FRIDA προσομοιώνει πώς θα ζωγράφιζε μια εικόνα με πινέλα και χρησιμοποιεί μηχανική μάθηση για να αξιολογήσει την πρόοδό της καθώς εργάζεται.

Τα τελικά προϊόντα της FRIDA είναι φανταστικά και εντυπωσιακά. Οι πινελιές είναι τολμηρές και λείπουν της ακρίβειας που αναζητείται συχνά στις ρομποτικές προσπάθειες.

«Η FRIDA είναι ένα έργο που εξερευνά το交差 μεταξύ ανθρώπινης και ρομποτικής δημιουργικότητας», πρόσθεσε ο McCann. «Η FRIDA χρησιμοποιεί τα είδη μοντέλων AI που έχουν αναπτυχθεί για να κάνουν πράγματα όπως να προσθέτουν λεζάντες σε εικόνες και να κατανοούν το περιεχόμενο της σκηνής και εφαρμόζονται σε αυτό το καλλιτεχνικό γεννητικό πρόβλημα».

Η FRIDA χρησιμοποιεί AI και μηχανική μάθηση πολλές φορές κατά τη διαδικασία δημιουργίας τέχνης. Πρώτα, περνάει μια ώρα ή περισσότερο μαθαίνοντας πώς να χρησιμοποιήσει το πινέλο της. Στη συνέχεια, χρησιμοποιεί μοντέλα οπτικής-γλώσσας που έχουν εκπαιδευτεί σε τεράστιες βάσεις δεδομένων που ζευγνύουν κείμενο και εικόνες από το διαδίκτυο, όπως το Contrastive Language-Image Pre-Training (CLIP) της OpenAI, για να κατανοήσει την είσοδο.

Μια από τις πιο σημαντικές τεχνικές προκλήσεις στην παραγωγή μιας φυσικής εικόνας είναι η μείωση του χάσματος προσομοίωσης-πραγματικότητας, το οποίο είναι η διαφορά μεταξύ того που δημιουργεί η FRIDA στη προσομοίωση και αυτό που ζωγραφίζει στο καμβά. Η FRIDA χρησιμοποιεί μια ιδέα που ονομάζεται πραγματικό-συμβολικό-πραγματικό, όπου οι πραγματικές πινελιές του ρομποτικού βραχίονα χρησιμοποιούνται για να εκπαιδεύσουν τον προσομοιωτή να αντανακλούν και να μιμούνται τις φυσικές ικανότητες του ρομποτικού και των υλικών ζωγραφικής.

Η ομάδα της FRIDA τώρα στοχεύει να αντιμετωπίσει κάποιες από τις περιορισμούς των τρεχουσών μεγάλων μοντέλων οπτικής-γλώσσας, συνεχίζοντας να βελτιώνει αυτά που χρησιμοποιούν. Τάισαν τα μοντέλα με τίτλους από άρθρα ειδήσεων για να τους δώσουν μια αίσθηση του τι συμβαίνει στον κόσμο και εκπαίδευσαν περαιτέρω τα μοντέλα σε εικόνες και κείμενο που είναι πιο αντιπροσωπευτικά διαφορετικών πολιτισμών για να αποφευχθεί μια αμερικανική ή δυτική προκατάληψη.

Ο Alex McFarland είναι δημοσιογράφος και συγγραφέας του AI που εξερευνά τις τελευταίες εξελίξεις στην τεχνητή νοημοσύνη. Έχει συνεργαστεί με πολλές startups και εκδόσεις του AI σε όλο τον κόσμο.