Μοντέλα και πλατφόρμες AI
Η OpenAI Δημιουργεί Νέο Πρόγραμμα AI για τη Δημιουργία Μουσικής Βασισμένης σε Είδη
Το ανεξάρτητο ερευνητικό ίδρυμα OpenAI έχει κυκλοφορήσει πρόσφατα μια νέα μορφή γεννητικής τεχνητής νοημοσύνης με το όνομα Jukebox, ονομάζεται così λόγω της ικανότητάς του να γεννά μουσική. Το Jukebox AI είναι σε θέση να γεννά ήχους βασισμένους σε χαρακτηριστικά όπως η οργανολογία και ακόμη οι στίχοι, και η ομάδα ερευνών της OpenAI δημιούργησε το AI εκπαιδεύοντας το με συμπιεσμένα κλιπ ήχου και διάφορα αποσπάσματα στίχων.
Όπως ανέφερε το TechCrunch ανέφερε, οι ερευνητές της OpenAI εκπαίδευσαν το μοντέλο χρησιμοποιώντας ακατέργαστα κλιπ ήχου, δίνοντας στο μοντέλο την ικανότητα να παράγει ήχο. Αυτό είναι σε αντίθεση με τις προσεγγίσεις που χρησιμοποιούνται για τη δημιουργία άλλων εφαρμογών γεννήτριας μουσικής, οι οποίες συχνά βασίζονται σε “συμβολική μουσική” (όπως η μουσική MIDI) η οποία είναι πληροφορίες για νότες και πίτσες αλλά όχι πραγματικός ήχος. Η ομάδα ερευνών χρησιμοποίησε συνβολικά νευρωνικά δίκτυα για να εκπαιδεύσει το μοντέλο, συμπιέζοντας τον ήχο και κωδικοποιώντας τον σε μορφή που το νευρωνικό δίκτυο μπορούσε να ερμηνεύσει. Μετά, χρησιμοποιήθηκε ένας μετασχηματιστής για να γεννήσει συμπιεσμένο ήχο, ο οποίος ήταν αναπαραγόμενος για να μετατρέψει τα δεδομένα σε μορφή ήχου.
Όταν δημιούργησαν το Jukebox, η OpenAI έπρεπε να δημιουργήσει μια μέθοδο για την αντιμετώπιση της σύνθετης, πυκνής φύσης του ήχου. Οι ερευνητές αντιμετώπισαν τη συνεχή φύση του ήχου分割οντας τον σε πιο διακριτά, εύκολη στην κατανόηση τμήματα, διαιρώντας τα τραγούδια σε κομμάτια που είναι 1/128 του δευτερολέπτου. Ο στόχος ήταν να δημιουργηθεί ένα μοντέλο AI ικανό να διασπάσει τα τραγούδια σε κομμάτια αρκετά μεγάλα ώστε το πρόβλημα να μην γίνει ακατόρθωτο, αλλά αρκετά μικρά και ακριβή ώστε τα μοντέλα να μπορέσουν να μάθουν το μοτίβο ενός τραγουδιού και να το αναπαράγουν.
Η τεχνική που χρησιμοποιήθηκε από την OpenAI μοιράζεται ορισμένες ομοιότητες με một παλαιότερο AI γεννήτρια μουσικής που παρήγαγε η εταιρεία, το MuseNet. Το MuseNet είχε εκπαιδευτεί σε αρχεία MIDI και ήταν ικανό να γεννά μουσική σε ποικιλία στυλ, αν και επικεντρωνόταν στην γενική μελωδία ενός τραγουδιού και δεν μπορούσε να παράγει στίχους. Σε αντίθεση, το Jukebox είναι ικανό να γράψει τους δικούς του στίχους για να συνοδεύσει τη μουσική. Οι στίχοι είναι “συγγραφείς” από τους ερευνητές της OpenAI, οδηγώντας το μοντέλο προς τη δημιουργία στίχων σε συγκεκριμένα στυλ. Το σύστημα Jukebox είχε εκπαιδευτεί σε στίχους από το LyricWiki, με τα δεδομένα εκπαίδευσης να αποτελούνται από κείμενο και μεταδεδομένα για 1,2 εκατομμύρια τραγούδια.
Όταν πρόκειται για τους στίχους του μοντέλου, οι ερευνητές πρώτα προσπάθησαν να χρησιμοποιήσουν μια απλή εύρεση που έτρεχε τους στίχους σε περίπου τη διάρκεια ενός τραγουδιού, αναλύοντας το κείμενο που αντιστοιχούσε σε ένα συγκεκριμένο τμήμα/κομμάτι του τραγουδιού. Αυτή η απλή προσέγγιση λειτουργούσε καλά γενικά, αν και οι ερευνητές βρήκαν ότι όταν οι στίχοι ήταν ιδιαίτερα γρήγοροι, κατέρρεε. Για να αντιμετωπίσουν αυτό το πρόβλημα, εξαγόρασαν φωνητικά από το τραγούδι και τα συσχετίζουν με το κείμενο των στίχων για να λάβουν συσχετίσεις σε επίπεδο λέξης για τους στίχους. Μετά, χρησιμοποιήθηκε ένα επίπεδο κωδικοποίησης για τους στίχους μαζί με ένα επίπεδο προσοχής που χαρτογράφησε τμήματα της μουσικής σε στίχους χρησιμοποιώντας ζευγάρια κλειδιού-τιμής. Το αποτέλεσμα ήταν ότι οι στίχοι και τα φωνητικά είχαν μια αρκετά ακριβή αντιστοίχηση.
Οι συγγραφείς του εγγράφου σημειώνουν επίσης ότι υπάρχουν ορισμένες περιορισμοί που έχει το Jukebox, και ότι μελλοντική εργασία θα στοχεύσει να βελτιώσει την ικανότητα του AI. Όπως γράφουν οι συγγραφείς σε μια ανάρτηση στο blog:
“Ενώ το Jukebox αντιπροσωπεύει ένα βήμα προς τα εμπρός στη μουσική ποιότητα, συνεκτικότητα, μήκος του δείγματος ήχου και ικανότητα να συνδεθεί με καλλιτέχνη, είδος και στίχους, υπάρχει ένα σημαντικό χάσμα μεταξύ αυτών των γεννήσεων και της μουσικής που δημιουργείται από ανθρώπους. Για παράδειγμα, ενώ τα γεννημένα τραγούδια δείχνουν τοπική μουσική συνεκτικότητα, ακολουθούν παραδοσιακές ακολουθίες χορδών και μπορούν ακόμη και να έχουν εντυπωσιακά σόλο, δεν ακούμε οικείες μεγαλύτερες μουσικές δομές όπως οι χοροί που επαναλαμβάνονται.”
Τώρα, το μοντέλο είναι ικανό να παράγει ένα τραγούδι που είναι αναγνωρίσιμο στο στυλ ενός συγκεκριμένου είδους ή ακόμη και ενός συγκεκριμένου καλλιτέχνη. Για παράδειγμα, μπορεί να παράγει τραγούδια στο στυλ του Elvis Presley, της Katy Perry ή των Rage Against the Machine. Αν και τα τραγούδια είναι αναγνωρίσιμα μέσα σε ένα είδος ή θεματολογούνται γύρω από το στυλ ενός τραγουδιστή, είναι επίσης αρκετά άσχημα, συχνά ακούγοντας σαν παρωδία ή μια κακή εκτέλεση ενός τραγουδιού. Παρόλα αυτά, η τεχνική επίτευξη είναι εντυπωσιακή. Οι ερευνητές που είναι υπεύθυνοι για τη δημιουργία του συστήματος γεννήτριας AI επέλεξαν να δουλέψουν σε ένα πρόγραμμα ικανό να γεννά μουσική συγκεκριμένα λόγω του ότι η εργασία ήταν δύσκολη, και οι ερευνητές σχεδιάζουν να συνεχίσουν να βελτιώνουν τις τεχνικές τους. Μπορείτε να ακούσετε κάποια από τα τραγούδια εδώ.












