Μοντέλα και πλατφόρμες AI

Κβαντο-Μουσική Γεννητική Νοημοσύνη: Σταθερή Ήχος, Google’s MusicLM και Περισσότερα

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Η μουσική, μια μορφή τέχνης που αντηχεί με την ανθρώπινη ψυχή, ήταν μια σταθερή συνοδός όλων μας. Η δημιουργία μουσικής με τη χρήση τεχνητής νοημοσύνης ξεκίνησε αρκετές δεκαετίες πριν. Αρχικά, οι προσπάθειες ήταν απλές και εντιμής, με βασικούς αλγόριθμους που δημιουργούσαν μονότονα μελωδίες. Ωστόσο, καθώς η τεχνολογία προχώρησε, τόσο και η πολυπλοκότητα και οι ικανότητες των γεννητριών μουσικής AI, ανοίγοντας το δρόμο για το deep learning και την επεξεργασία φυσικής γλώσσας (NLP) να παίξουν καθοριστικό ρόλο σε αυτήν την τεχνολογία.

Σήμερα, πλατφόρμες όπως το Spotify χρησιμοποιούν την τεχνητή νοημοσύνη για να βελτιώσουν τις εμπειρίες ακρόασης των χρηστών. Οι αλγόριθμοι deep learning αναλύουν τις ατομικές προτιμήσεις με βάση διάφορα μουσικά στοιχεία, όπως το τέμπο και τη διάθεση, για να δημιουργήσουν προσωπικές προτάσεις τραγουδιών. Αναλύουν επίσης ευρύτερες τάσεις ακρόασης και αναζητούν στο διαδίκτυο συζητήσεις σχετικές με τα τραγούδια για να δημιουργήσουν λεπτομερείς προφίλ τραγουδιών.

Η Προέλευση της Τεχνητής Νοημοσύνης στη Μουσική: Ένα Ταξίδι από την Αλγοριθμική Σύνθεση στη Γεννητική Μοντελοποίηση

Στις πρώτες φάσεις της τεχνητής νοημοσύνης στη μουσική, που εκτείνονταν από τη δεκαετία του 1950 έως τη δεκαετία του 1970, ο焦点 ήταν κυρίως στην αλγοριθμική σύνθεση. Αυτή ήταν μια μέθοδος όπου οι υπολογιστές χρησιμοποιούσαν ένα καθορισμένο σύνολο κανόνων για να δημιουργήσουν μουσική. Η πρώτη αξιοσημείωτη δημιουργία κατά τη διάρκεια αυτής της περιόδου ήταν το Illiac Suite για Κουαρτέτο Εγχόρδων το 1957. Χρησιμοποίησε τον αλγόριθμο Monte Carlo, μια διαδικασία που εμπλέκει τυχαίους αριθμούς για να καθορίσει το πίτσο και τον ρυθμό μέσα στα όρια της παραδοσιακής μουσικής θεωρίας και στατιστικών πιθανοτήτων.

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

Κατά τη διάρκεια αυτής της περιόδου, ένας άλλος πρωτοπόρος, Iannis Xenakis, χρησιμοποίησε στοχαστικές διαδικασίες, μια έννοια που εμπλέκει τυχαίες πιθανοτικές κατανομές, για να δημιουργήσει μουσική. Χρησιμοποίησε υπολογιστές και τη γλώσσα FORTRAN για να συνδέσει πολλές πιθανοτικές συναρτήσεις, δημιουργώντας ένα μοτίβο όπου διαφορετικές γραφικές αναπαραστάσεις αντιστοιχούν σε διαφορετικούς ήχους χώρους.

Η Συμπλοκότητα της Μεταφράσεως Κειμένου σε Μουσική

Η μουσική αποθηκεύεται σε μια πλούσια και πολυδιάστατη μορφή δεδομένων που περιλαμβάνει στοιχεία όπως μελωδία, αρμονία, ρυθμός και τέμπο, καθιστώντας την εργασία της μεταφράσεως κειμένου σε μουσική εξαιρετικά σύνθετη. Ένα τυπικό τραγούδι αντιπροσωπεύεται από σχεδόν ένα εκατομμύριο αριθμούς σε einen υπολογιστή, ένας αριθμός σημαντικά υψηλότερος από άλλες μορφές δεδομένων όπως εικόνα, κείμενο κ.λπ.

Το πεδίο της γεννήσεως ήχου μαρτυρεί καινοτόμες προσεγγίσεις για την υπέρβαση των προκλήσεων της δημιουργίας ρεαλιστικού ήχου. Μια μέθοδος εμπλέκει τη δημιουργία ενός σπεκτρογράμματος και στη συνέχεια τη μετατροπή του πίσω σε ήχο.

Μια άλλη στρατηγική αξιοποιεί την συμβολική αναπαράσταση της μουσικής, όπως η партίτουρα, η οποία μπορεί να ερμηνευτεί και να παιχθεί από μουσικούς. Αυτή η μέθοδος έχει ψηφιοποιηθεί επιτυχώς, με εργαλεία όπως το Chamber Ensemble Generator της Magenta, το οποίο δημιουργεί μουσική στη μορφή MIDI, einem πρωτόκολλο που διευκολύνει την επικοινωνία μεταξύ υπολογιστών και μουσικών οργάνων.

Ενώ αυτές οι προσεγγίσεις έχουν προχωρήσει το πεδίο, έρχονται με το δικό τους σύνολο περιορισμών, υπογραμμίζοντας την σύνθετη φύση της γεννήσεως ήχου.

Transformer-based αυτο-αναδρομικά μοντέλα και U-Net-based diffusion μοντέλα, βρίσκονται στην αιχμή της τεχνολογίας, παράγοντας αποτελέσματα κατάστασης-of-the-τέχνης (SOTA) στη γεννήσεως ήχου, κειμένου, μουσικής και πολλά άλλα. Το OpenAI’s GPT σειρά και σχεδόν όλα τα άλλα LLMs σήμερα είναι τροφοδοτούμενα από transformers που χρησιμοποιούν είτε encoder, decoder, είτε και τα δύο αρχιτεκτονικά. Στην πλευρά της τέχνης/εικόνας, MidJourney, Stability AI και DALL-E 2 όλα αξιοποιούν diffusion πλαίσια. Αυτές οι δύο βασικές τεχνολογίες έχουν sido κλειδιά στην επίτευξη SOTA αποτελέσματα στο ηχητικό τομέα επίσης. Σε αυτό το άρθρο, θα εμβαθύνουμε στη Google’s MusicLM και Stable Audio, τα οποία αποτελούν μαρτυρία για τις αξιοσημείωτες ικανότητες αυτών των τεχνολογιών.

Google’s MusicLM

Το Google’s MusicLM κυκλοφόρησε τον Μάιο αυτό. Το MusicLM μπορεί να δημιουργήσει υψηλής πιστότητας μουσικά κομμάτια, που αντηχούν με το ακριβές συναισθηματικό περιεχόμενο που περιγράφεται στο κείμενο. Χρησιμοποιώντας ιεραρχική ακολουθιακή μοντελοποίηση, το MusicLM έχει τη δυνατότητα να μετατρέψει περιγραφές κειμένου σε μουσική που αντηχεί στα 24 kHz για εκτενείς χρονικές περιόδους.

Το μοντέλο λειτουργεί σε πολλαπλά επίπεδα, όχι μόνο ακολουθώντας τις εισαγωγές κειμένου αλλά και αποδεικνύοντας την ικανότητα να είναι συνθηματισμένο με μελωδίες. Αυτό σημαίνει ότι μπορεί να πάρει ένα χαμηλό ή σφυρίχτρα μελωδία και να τη μετατρέψει σύμφωνα με το στυλ που περιγράφεται σε μια λεζάντα κειμένου.

Τεχνικές Εισichten

Το MusicLM αξιοποιεί τις αρχές του AudioLM, ενός πλαισίου που εισήχθη το 2022 για τη γεννήσεως ήχου. Το AudioLM συνθέτει ήχο ως μια εργασία μοντελοποίησης γλώσσας σε ένα διακριτό χώρο αναπαράστασης, χρησιμοποιώντας μια ιεραρχία από χονδρές σε λεπτές μονάδες ήχου, επίσης γνωστές ως tokens. Αυτή η προσέγγιση εξασφαλίζει υψηλής πιστότητας και μακροχρόνια συνάφεια για σημαντικές χρονικές περιόδους.

Για να διευκολύνει τη διαδικασία γεννήσεως, το MusicLM επεκτείνει τις ικανότητες του AudioLM για να ενσωματώσει συνθήματα κειμένου, μια τεχνική που ευθυγραμμίζει τον γεννηθέντα ήχο με τις νюανς της εισαγωγής κειμένου. Αυτό επιτυγχάνεται μέσω ενός κοινού χώρου ενσωμάτωσης που δημιουργείται χρησιμοποιώντας MuLan, ένα κοινό μοντέλο μουσικής-κειμένου που εκπαιδεύτηκε για να προβάλει μουσική και τις αντίστοιχες περιγραφές κειμένου κοντά στον ίδιο χώρο ενσωμάτωσης. Αυτή η στρατηγική εξαλείφει αποτελεσματικά την ανάγκη για λεζάντες κατά τη διάρκεια της εκπαίδευσης, επιτρέποντας στο μοντέλο να εκπαιδευτεί σε τεράστιους корпус ήχου μόνο.

Το μοντέλο MusicLM χρησιμοποιεί επίσης SoundStream ως τον αποκωδικοποιητή ήχου, ο οποίος μπορεί να ανακατασκευάσει ήχο 24 kHz με 6 kbps και εντυπωσιακή πιστότητα, αξιοποιώντας residual vector quantization (RVQ) για αποτελεσματική και υψηλής ποιότητας συμπίεση ήχου.

Εικονογράφηση της ανεξάρτητης διαδικασίας προ-εκπαίδευσης για τα θεμελιώδη μοντέλα του MusicLM: SoundStream, w2v-BERT και MuLan,

Εικονογράφηση της διαδικασίας προ-εκπαίδευσης του MusicLM: SoundStream, w2v-BERT και MuLan | Πηγή εικόνας: εδώ

Επιπλέον, το MusicLM επεκτείνει τις ικανότητές του επιτρέποντας τη συνθήκη μελωδίας. Αυτή η προσέγγιση εξασφαλίζει ότι ακόμη και μια απλή σφυρίχτρα μελωδία μπορεί να αποτελέσει την βάση για μια μεγαλοπρεπή ακουστική εμπειρία, που τελειοποιείται σύμφωνα με τις ακριβείς περιγραφές στυλ κειμένου.

Οι dévelopπεurs του MusicLM έχουν επίσης ανοίξει το MusicCaps, ένα σύνολο δεδομένων που περιλαμβάνει 5.5k ζεύγη μουσικής-κειμένου, κάθε ένα από τα οποία συνοδεύεται από πλούσιες περιγραφές κειμένου που έχουν δημιουργηθεί από ανθρώπινους εμπειρογνώμονες. Μπορείτε να το δείτε εδώ: MusicCaps στο Hugging Face.

Είστε έτοιμοι να δημιουργήσετε ηχητικά κομμάτια AI με το Google’s MusicLM; Εδώ είναι πώς να ξεκινήσετε:

  1. Επισκεφθείτε την επίσημη ιστοσελίδα του MusicLM και κάντε κλικ στο “Ξεκινήστε τώρα”.
  2. Εγγραφείτε στη λίστα αναμονής επιλέγοντας “Εγγραφή ενδιαφέροντος”.
  3. Συνδεθείτε με το λογαριασμό σας Google.
  4. Όταν σας δοθεί πρόσβαση, κάντε κλικ στο “Δοκιμάστε τώρα” για να ξεκινήσετε.

Παρακάτω είναι μερικά παραδείγματα προτύπων που πειραματίστηκα:

“Μελωδικό τραγούδι, γαλήνιο και ηρεμιστικό, με φλάουτο και κιθάρα. Η μουσική είναι αργή, με έμφαση στη δημιουργία μιας αίσθησης ειρήνης και ηρεμίας.”

 

Οι εφαρμογές τέτοιων καλοσχεδιασμένων ηχητικών κομματιών είναι απεριόριστες. Οι κινηματογραφιστές μπορούν να αξιοποιήσουν αυτήν την τεχνολογία για να δημιουργήσουν πλούσιες και εύστοχες ηχητικές τοπιογραφίες. Στο εμπορικό τομέα, οι διαφημιστές μπορούν να χρησιμοποιήσουν αυτές τις.tailored ηχητικές pistes. Επιπλέον, αυτό το εργαλείο ανοίγει δρόμους για ατομικούς δημιουργούς και καλλιτέχνες να πειραματιστούν και να καινοτομήσουν, προσφέροντας ένα καμβά απεριόριστου δυναμικού για να δημιουργήσουν ηχητικά κομμάτια που αφηγούνται ιστορίες, προκαλούν συναισθήματα και δημιουργούν atmospheres με βάθος που ήταν προηγουμένως δύσκολο να επιτευχθεί χωρίς σημαντικό προϋπολογισμό ή τεχνική εμπειρία.

Σταθερή Ήχος

Η Stability AI παρουσίασε πρόσφατα τη “Σταθερή Ήχος”, μια αρχιτεκτονική μοντέλου Latent Diffusion που συνθήματισε με μετα-δεδομένα κειμένου μαζί με τη διάρκεια και τον χρόνο έναρξης του αρχείου ήχου. Αυτή η προσέγγιση, όπως και το Google’s MusicLM, έχει έλεγχο του περιεχομένου και του μήκους του γεννηθέντα ήχου, επιτρέποντας τη δημιουργία ηχητικών κομματιών με καθορισμένα μήκη μέχρι το μέγεθος του παραθύρου εκπαίδευσης.

Τεχνικές Εισichten

Η Σταθερή Ήχος αποτελείται από πολλά συστατικά, συμπεριλαμβανομένων ενός Variational Autoencoder (VAE) και ενός U-Net-based συνθηματισμένου μοντέλου diffusion, που εργάζονται μαζί με έναν κωδικοποιητή κειμένου.

Εικονογράφηση που δείχνει την ενσωμάτωση ενός Variational Autoencoder (VAE), ενός κωδικοποιητή κειμένου και ενός U-Net-based συνθηματισμένου μοντέλου diffusion

Αρχιτεκτονική της Σταθερής Ήχου, Πηγή εικόνας: εδώ

Ο VAE διευκολύνει τη γρήγορη γεννήσεως και εκπαίδευσης, συμπιέζοντας στερεοφωνικό ήχο σε μια συμπιεσμένη, ανθεκτική στο θόρυβο και αναστρέψιμη απώλεια κωδικοποίησης, παρακάμπτοντας την ανάγκη να εργαστεί με ακατέργαστες δείγματα ήχου.

Ο κωδικοποιητής κειμένου, που προέρχεται από ένα CLAP μοντέλο, играє κρίσιμο ρόλο στην κατανόηση των σύνθετων σχέσεων μεταξύ λέξεων και ήχων, προσφέροντας μια ενημερωμένη αναπαράσταση του κειμένου εισαγωγής. Αυτό επιτυγχάνεται μέσω της αξιοποίησης των χαρακτηριστικών κειμένου από το penultimate στρώμα του CLAP κωδικοποιητή κειμένου, τα οποία στη συνέχεια ενσωματώνονται στο diffusion U-Net μέσω στρωμάτων cross-attention.

Μια σημαντική πτυχή είναι η ενσωμάτωση των chronόμενων εμβολίων, τα οποία υπολογίζονται με βάση δύο ιδιοτήτων: τον χρόνο έναρξης του κομματιού ήχου και τη συνολική διάρκεια του αρχικού αρχείου ήχου. Αυτές οι τιμές, μεταφρασμένες σε διακριτές εμβολιασμούς ανά δευτερόλεπτο, συνδυάζονται με τα προτύπων κειμένου και εισάγονται στα στρώματα cross-attention του U-Net, δίνοντας τη δυνατότητα στους χρήστες να καθορίσουν το συνολικό μήκος του εξαγόμενα ήχου.

Το μοντέλο της Σταθερής Ήχου εκπαιδεύτηκε χρησιμοποιώντας ένα εκτενές σύνολο δεδομένων που περιλαμβάνει πάνω από 800.000 αρχεία ήχου, μέσω συνεργασίας με τον πάροχο μουσικής AudioSparx.

Διαφημίσεις Σταθερής Ήχου

Διαφημίσεις Σταθερής Ήχου

Η Σταθερή Ήχος προσφέρει μια δωρεάν έκδοση, που επιτρέπει 20 γεννήσεις ηχητικών κομματιών μέχρι 20 δευτερόλεπτα το μήνα, και ένα σχέδιο Pro που κοστίζει 12 δολάρια το μήνα, επιτρέποντας 500 γεννήσεις ηχητικών κομματιών μέχρι 90 δευτερόλεπτα.

Παρακάτω είναι ένα ηχητικό κομμάτι που δημιούργησα χρησιμοποιώντας τη Σταθερή Ήχος.

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

“Κινηματογραφική, Soundtrack Γαλήνιος Βροχός, Ambient, Ηρεμιστικό, Μακρινά Σκύλοι Λαλούν, Γαλήνιος Ψίθυρος Φύλλων, Υποβλητικός Άνεμος, 40 BPM”

 

Συμβουλές για Προτύπωση

Δημιουργήστε το ιδανικό ηχητικό κομμάτι χρησιμοποιώντας προτύπους κειμένου. Εδώ είναι μια γρήγορη οδηγία για να ξεκινήσετε:

  1. Είστε Λεπτομερείς: Καθορίστε είδη, διάθεση και όργανα. Για παράδειγμα: Κινηματογραφική, Άγρια Δύση, Κρουστά, Τεντωμένο, Atmospheric
  2. Ρύθμιση Διάθεσης: Συνδυάστε μουσικά και συναισθηματικά όρους για να μεταφέρετε τη επιθυμητή διάθεση.
  3. Επιλογή Οργάνων: Βελτιώστε τα ονόματα οργάνων με επιθέτους, όπως “Ηχογραφημένο Κιθάρα” ή “Δυνατό Χορωδία”.
  4. BPM: Συγχρονίστε το τέμπο με το είδος για μια αρμονική έξοδο, όπως “170 BPM” για ένα Drum and Bass κομμάτι.

Κλείσιμο

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

Εικόνα που δημιουργήθηκε από τον συγγραφέα χρησιμοποιώντας Midjourney

Σε αυτό το άρθρο, abbiamo αναλύσει τη γεννήσεως μουσικής/ήχου AI, από τις αλγοριθμικές συνθέσεις μέχρι τις σύγχρονες γεννητικές αρχιτεκτονικές όπως το Google’s MusicLM και η Σταθερή Ήχος. Αυτές οι τεχνολογίες, αξιοποιώντας το deep learning και τα SOTA μοντέλα συμπίεσης, δεν μόνο βελτιώνουν τη γεννήσεως μουσικής αλλά και τελειοποιούν τις εμπειρίες ακρόασης.

Ωστόσο, είναι ένας τομέας σε συνεχή εξέλιξη, με εμπόδια όπως η διατήρηση της μακροχρόνιας συνάφειας και η συνεχής συζήτηση για την αυθεντικότητα της AI-δημιουργημένης μουσικής να προκαλούν τους πρωτοπόρους σε αυτόν τον τομέα. Μόλις την περασμένη εβδομάδα, η συζήτηση ήταν όλα για ένα AI-δημιουργημένο τραγούδι που καναλιζόταν στο στυλ του Drake και του The Weeknd, το οποίο είχε αρχικά κάνει θόρυβο στο διαδίκτυο νωρίτερα αυτό το χρόνο. Ωστόσο, απομακρύνθηκε από τη λίστα υποψηφίων για Grammy, δείχνοντας τη συνεχής συζήτηση σχετικά με την νομιμότητα της AI-δημιουργημένης μουσικής στη βιομηχανία (πηγή). Όσο η AI συνεχίζει να γεφυρώνει τα κενά μεταξύ μουσικής και ακροατών, προάγει ένα οικοσύστημα όπου η τεχνολογία συνυπάρχει με την τέχνη, προάγοντας την καινοτομία ενώ σεβόμενο την παράδοση.

Έχω περάσει τα τελευταία πέντε χρόνια βυθισμένος στον συναρπαστικό κόσμο της Μηχανικής Μάθησης και του Βαθιάς Μάθησης. Η δέσμευσή μου και η εξειδίκευσή μου με οδήγησαν να συμβάλλω σε πάνω από 50 διαφορετικά projects μηχανικής λογισμικού, με ιδιαίτερη έμφαση στο AI/ML. Η συνεχής περιέργειά μου με έχει οδηγήσει επίσης προς την Επεξεργασία Φυσικής Γλώσσας, ένα πεδίο που είμαι πρόθυμος να εξερευνήσω περαιτέρω.