Μοντέλα και πλατφόρμες AI
Ερευνητές Δημιουργούν Μοντέλο AI Ικανό Να Τραγουδά Σε Κινέζικα και Αγγλικά
Μια ομάδα ερευνητών από τη Microsoft και το Πανεπιστήμιο Zhajiang έχουν πρόσφατα δημιουργήσει ένα μοντέλο AI ικανό να τραγουδά σε πολλές γλώσσες. Όπως αναφέρθηκε στο VentureBeat, το DeepSinger AI που αναπτύχθηκε από την ομάδα εκπαιδεύτηκε σε δεδομένα από διάφορους ιστότοπους μουσικής, χρησιμοποιώντας αλγόριθμους που κατέγραψαν το χρώμα της φωνής του τραγουδιστή.
Η δημιουργία της “φωνής” ενός AI τραγουδιστή απαιτεί αλγόριθμους που είναι ικανοί να προβλέπουν και να ελέγχουν τόσο την πίεση όσο και τη διάρκεια του ήχου. Όταν οι άνθρωποι τραγουδούν, οι θόρυβοι που παράγουν έχουν πολύ πιο σύνθετους ρυθμούς και μοτίβα σε σύγκριση με την απλή ομιλία. Ένα άλλο πρόβλημα που η ομάδα έπρεπε να ξεπεράσει ήταν ότι ενώ υπάρχει μια αξιοσημείωτη ποσότητα δεδομένων ομιλίας, τα δεδομένα εκπαίδευσης τραγουδιού είναι σχετικά σπάνια. Συνδυάζοντας αυτές τις προκλήσεις με το γεγονός ότι τα τραγούδια χρειάζονται και ήχο και στίχους να αναλυθούν, το πρόβλημα της δημιουργίας τραγουδιού είναι εξαιρετικά σύνθετο.
Το σύστημα DeepSinger που δημιούργησαν οι ερευνητές ξεπέρασε αυτές τις προκλήσεις αναπτύσσοντας einen αγωγό δεδομένων που εξόρυξε και μετέτρεψε δεδομένα ήχου. Τα αποσπάσματα τραγουδιού εξήχθησαν από διάφορους ιστότοπους μουσικής και στη συνέχεια το τραγούδι απομονώθηκε από τον υπόλοιπο ήχο και χωρίστηκε σε προτάσεις. Το επόμενο βήμα ήταν να καθορίσει τη διάρκεια κάθε φωνήματος μέσα στους στίχους, με αποτέλεσμα μια σειρά δειγμάτων, τα οποία αντιπροσώπευαν ένα μοναδικό φωνήμα στους στίχους. Η καθαρισμός των δεδομένων γίνεται για να αντιμετωπιστούν τυχόν παραμορφωμένα δείγματα εκπαίδευσης μετά τη διάταξη των στίχων και των συνοδευτικών δειγμάτων ήχου σύμφωνα με το βαθμό εμπιστοσύνης.
Οι ίδιες μέθοδοι φαίνεται να λειτουργούν για eine ποικιλία γλωσσών. Το DeepSinger εκπαιδεύτηκε σε κινέζικα, καντονέζικα και αγγλικά φωνητικά δείγματα που αποτελούνταν από 89 διαφορετικούς τραγουδιστές που τραγουδούσαν για πάνω από 92 ώρες. Τα αποτελέσματα της μελέτης βρήκαν ότι το σύστημα DeepSinger ήταν σε θέση να παράγει αξιόπιστα υψηλής ποιότητας “τραγούδια” σύμφωνα με μετρικά όπως η ακρίβεια της πίεσης και πόσο φυσικό ήχησε το τραγούδι. Οι ερευνητές είχαν 20 άτομα να αξιολογήσουν και τα τραγούδια που παράχθηκαν από το DeepSinger και τα τραγούδια εκπαίδευσης σύμφωνα με αυτά τα μετρικά και το χάσμα μεταξύ των βαθμολογιών για τα παραγόμενα δείγματα και τα γνήσια ήχη ήταν khá μικρό. Οι συμμετέχοντες έδωσαν στο DeepSinger einen μέσο βαθμό απόψεως που διέφερε μεταξύ 0,34 και 0,76.
Προσβλέποντας στο μέλλον, οι ερευνητές θέλουν να προσπαθήσουν να βελτιώσουν την ποιότητα των παραγόμενων φωνών με την κοινή εκπαίδευση των υπομοντέλων που αποτελούν το DeepSinger, με τη βοήθεια ειδικών τεχνολογιών όπως το WaveNet που σχεδιάζονται ειδικά για την εργασία της δημιουργίας φυσικών ήχων ομιλίας μέσω των ηχητικών κυμάτων.
Το σύστημα DeepSinger θα μπορούσε να χρησιμοποιηθεί για να βοηθήσει τους τραγουδιστές και άλλους μουσικούς καλλιτέχνες να κάνουν διορθώσεις στο έργο τους χωρίς να χρειάζεται να επιστρέψουν στο στούντιο για μια άλλη ηχογράφηση. Θα μπορούσε επίσης να χρησιμοποιηθεί για τη δημιουργία ήχου deepfakes, κάνοντας να φαίνεται σαν να τραγούδησε ένας καλλιτέχνης ένα τραγούδι που δεν τραγούδησε ποτέ. Ενώ θα μπορούσε να χρησιμοποιηθεί για παρωδία ή σάτιρα, είναι επίσης αμφίβολης νομιμότητας.
Το DeepSinger είναι μόνο μια από μια σειρά νέων συστημάτων μουσικής και ήχου που βασίζονται σε AI που θα μπορούσαν να μεταμορφώσουν τον τρόπο με τον οποίο η μουσική και το λογισμικό αλληλεπιδρούν. Η OpenAI δημοσίευσε πρόσφατα το δικό της σύστημα AI, dubbed JukeBox, το οποίο είναι ικανό να παράγει πρωτότυπα μουσικά κομμάτια στο στυλ ενός συγκεκριμένου είδους ή ακόμη και ενός συγκεκριμένου καλλιτέχνη. Άλλα μουσικά εργαλεία AI περιλαμβάνουν το Magenta της Google (GOOGL ) και το DeepComposer της Amazon (AMZN ). Το Magenta είναι μια ανοιχτή πηγή βιβλιοθήκη χειρισμού ήχου (και εικόνας) που μπορεί να χρησιμοποιηθεί για την παραγωγή mọiTHING από αυτόματα ντραμς μέχρι απλά μουσικά βίντεο παιχνίδια. Εν τω μεταξύ, το DeepComposer της Amazon στοχεύει σε εκείνους που θέλουν να εκπαιδεύσουν και να προσαρμόσουν τα δικά τους μοντέλα βαθιάς μάθησης βασισμένα στη μουσική, επιτρέποντας στον χρήστη να λάβει προ-εκπαιδευμένα δείγματα μοντέλων και να τα điều chỉnh σύμφωνα με τις ανάγκες τους.
Μπορείτε να ακούσετε κάποια από τα δείγματα ήχου που παράχθηκαν από το DeepSinger σε αυτό το σύνδεσμο.












