Η γωνία του Anderson

Έρευνα για την τεχνητή νοημοσύνη προβλέπει ξεχωριστά έλεγχοι όγκου για διαλόγους, μουσική και ήχους

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Μια νέα έρευνα υπό την ηγεσία της Mitsubishi ερευνά την πιθανότητα εξαγωγής τριών ξεχωριστών soundtracks από μια αρχική πηγή ήχου, διαχωρίζοντας το ήχο σε ομιλία, μουσική και ήχους (π.χ. περιβαλλοντικά θορύβη).

Καθώς αυτό είναι ένα πλαίσιο επεξεργασίας μετά την πραγματοποίηση, προσφέρει δυνατότητες για μελλοντικές γενιές πλατφορμών πολυμέσων, συμπεριλαμβανομένων καταναλωτικών συσκευών, για να προσφέρουν τριπλούς έλεγχους όγκου, επιτρέποντας στον χρήστη να αυξήσει τον όγκο της ομιλίας ή να μειώσει τον όγκο της μουσικής.

Στο σύντομο βίντεο παρακάτω από το βίντεο που συνοδεύει την έρευνα (δείτε το τέλος του άρθρου για το πλήρες βίντεο), βλέπουμε διαφορετικά μέρη του soundtrack να τονίζονται καθώς ο χρήστης σύρεται ένα έλεγχο σε ένα τρίγωνο με κάθε einen από τους τρεις ήχους σε μια γωνία:

[βίντεο πλάτος=”1036″ ύψος=”378″ mp4=”https://www.unite.ai/wp-content/uploads/2021/10/Cooking_program-extracted.mp4″][/βίντεο]

Ένα σύντομο βίντεο από το βίντεο που συνοδεύει το έγγραφο (δείτε το embed στο τέλος του άρθρου). Όταν ο χρήστης σύρεται το ποντίκι προς μια από τις τρεις εξαγμένες πτυχές στο τρίγωνο UI (δεξιά), ο ήχος τονίζει这一 μέρος του τριμερούς soundtrack. Αν και το μεγαλύτερο βίντεο αναφέρει μια σειρά από επιπλέον παραδείγματα στο YouTube, αυτά φαίνεται να είναι目前 μη διαθέσιμα. Πηγή: https://vimeo.com/634073402

Το έγγραφο έχει τον τίτλο Το πρόβλημα του Cocktail Fork: Τριπλή διάσπαση ήχου για πραγματικά soundtracks και προέρχεται από ερευνητές στα εργαστήρια έρευνας της Mitsubishi Electric (MERL) στο Κέιμπριτζ, MA, και το τμήμα έξυπνων συστημάτων μηχανικής στο Πανεπιστήμιο του Ιλινόις.

Διαχωρισμός πτυχών ενός soundtrack

Οι ερευνητές έχουν ονομάσει την πρόκληση ‘Το πρόβλημα του Cocktail Party’ επειδή αφορά τον διαχωρισμό σοβαρά μπλεγμένων στοιχείων ενός soundtrack, το οποίο δημιουργεί einen χάρτη που μοιάζει με ένα πιρούνι (δείτε την εικόνα παρακάτω). Στην πράξη, πολυκαναλικοί (π.χ. στερεοφωνικοί και περισσότεροι) soundtrack μπορεί να έχουν διαφορετικές ποσότητες τύπων περιεχομένου, όπως ομιλία, μουσική και περιβάλλον, ιδιαίτερα επειδή η ομιλία έχει την τάση να доминирует τον κεντρικό канάλι σε μίξεις Dolby 5.1. Hiện tại, ωστόσο, το πολύ ενεργό πεδίο έρευνας της διάσπασης ήχου εστιάζει στην κατανάλωση αυτών των νημάτων από ένα単一ό, ψημένο soundtrack, όπως και η τρέχουσα έρευνα.

[λεπτομέρεια id=”attachment_178388″ align=”alignnone” πλάτος=”701″]Το πιρούνι του Cocktail – εξαγωγή τριών ξεχωριστών soundtracks από ένα συγχωνευμένο και單一ό soundtrack. Το πιρούνι του Cocktail – εξαγωγή τριών ξεχωριστών soundtracks από ένα συγχωνευμένο και單一ό soundtrack. Πηγή: https://arxiv.org/pdf/2110.09958.pdf[/λεπτομέρεια]

Πρόσφατη έρευνα έχει εστιάσει στην εξαγωγή ομιλίας σε διάφορες περιβάλλοντες, συχνά για σκοπούς απομακρύνσεων θορύβου ομιλίας για μετέπειτα αλληλεπίδραση με συστήματα NLP, αλλά και στην διάσπαση αρχειοθετημένων τραγουδιών, είτε για να δημιουργήσουν συνθετικά αντίγραφα πραγματικών (ακόμη και νεκρών) τραγουδιστών, είτε για να διευκολύνουν Karaoke-στυλ διάσπαση μουσικής.

Ένα σύνολο δεδομένων για κάθε πτυχή

Μέχρι τώρα, λίγη προσοχή έχει δοθεί στη χρήση αυτού του είδους τεχνολογίας AI για να δώσει στους χρήστες περισσότερο έλεγχο στο μείγμα ενός soundtrack.,因此, οι ερευνητές έχουν формαλίσει το πρόβλημα και έχουν δημιουργήσει ένα νέο σύνολο δεδομένων ως βοήθημα για την συνεχιζόμενη έρευνα στη διάσπαση soundtrack πολλαπλών τύπων, καθώς και για δοκιμή σε διάφορους υφιστάμενους πλαισίων διάσπασης ήχου.

Το νέο σύνολο δεδομένων που έχουν αναπτύξει οι συγγραφείς ονομάζεται Διάσπαση και επαναδημιουργία (DnR), και προέρχεται από προηγούμενα σύνολα δεδομένων LibriSpeech, Δωρεάν Μουσική Αρχείο και το Σύνολο Δεδομένων Freesound 50k (FSD50K). Για όσους επιθυμούν να εργαστούν με DnR από την αρχή, το σύνολο δεδομένων πρέπει να ανακατασκευαστεί από τις τρεις πηγές· αλλιώς θα είναι σύντομα διαθέσιμο στο Zenodo, ισχυρίζονται οι συγγραφείς. Ωστόσο, κατά την время της γραφής, ο παρεχόμενος σύνδεσμος GitHub για εργαλεία εξαγωγής πηγαίου κώδικα δεν είναι目前 ενεργός, οπότε όσοι ενδιαφέρονται μπορεί να πρέπει να περιμένουν για λίγο.

Οι ερευνητές έχουν βρει ότι η αρχιτεκτονική CrossNet un-mix (XUMX) που προτάθηκε από τη Sony τον Μάιο λειτουργεί ιδιαίτερα καλά με DnR.

[λεπτομέρεια id=”attachment_178389″ align=”alignnone” πλάτος=”700″]Η αρχιτεκτονική CrossNet της Sony. Η αρχιτεκτονική CrossNet της Sony.[/λεπτομέρεια]

Οι συγγραφείς ισχυρίζονται ότι τα μοντέλα εξαγωγής τους με τη βοήθεια της μηχανικής μάθησης λειτουργούν καλά σε soundtracks από το YouTube, αν και οι αξιολογήσεις που παρουσιάζονται στο έγγραφο βασίζονται σε συνθετικά δεδομένα, και το παρεχόμενο κύριο υποστηρικτικό βίντεο (εμφανίζεται παρακάτω) είναι目前 το μόνο που φαίνεται να είναι διαθέσιμο.

Τα τρία σύνολα δεδομένων που χρησιμοποιούνται κάθε ένα αποτελείται από μια συλλογή του είδους του εξόδου που πρέπει να διαχωριστεί από ένα soundtrack: το FSD50K είναι κατειλημμένο με ήχους, και διαθέτει 50.000 mono ηχητικά κλιπ 44,1 kHz με 200 ετικέτες κλάσεων από την οντολογία AudioSet του Google · το Δωρεάν Μουσική Αρχείο διαθέτει 100.000 στερεοφωνικά τραγούδια που καλύπτουν 161 μουσικά είδη, αν και οι συγγραφείς έχουν χρησιμοποιήσει ένα υποσύνολο που περιέχει 25.000 τραγούδια, για ισότητα με το FSD50K· και το LibriSpeech παρέχει στο DnR 100 ώρες δειγμάτων ήχου βιβλίων ως αρχεία mp3 44,1 kHz.

Μελλοντική εργασία

Οι συγγραφείς προβλέπουν περαιτέρω εργασία στο σύνολο δεδομένων και μια συνδυασμένη των ξεχωριστών μοντέλων που αναπτύχθηκαν για επιπλέον έρευνα σε πλαισιά διάσπασης ομιλίας και ταξινόμησης ήχου, με χαρακτηριστικά όπως αυτόματη δημιουργία legend για ομιλία και μη ομιλία ήχους. Επίσης, σκοπεύουν να αξιολογήσουν τις δυνατότητες για προσεγγίσεις remix που μπορούν να μειώσουν τις αισθητικές ανωμαλίες, οι οποίες παραμένουν το κεντρικό πρόβλημα όταν διαιρούνται ένα συγχωνευμένο soundtrack σε τα συνιστώμενα του.

Αυτό το είδος διάσπασης θα μπορούσε στο μέλλον να είναι διαθέσιμο ως καταναλωτική εμπορευματοποίηση σε έξυπνες τηλεοράσεις που ενσωματώνουν高度 βελτιωμένα δίκτυα inference, αν και φαίνεται πιθανό ότι οι πρώτες εφαρμογές θα χρειαστούν κάποιο βαθμό προεπεξεργασίας χρόνου και χώρου αποθήκευσης. Η Samsung ήδη χρησιμοποιεί τοπικά δίκτυα νευρώνων για αναβάθμιση, ενώ ο Επεξεργαστής Cognitive XR της Sony, που χρησιμοποιείται στη σειρά Bravia, αναλύει και επαναερμηνεύει soundtracks σε ζωντανούς όρους μέσω ελαφριών ενσωματωμένων AI.

Κλήσεις για μεγαλύτερο έλεγχο στο μείγμα ενός soundtrack επαναλαμβάνονται περιοδικά, και οι περισσότερες από τις λύσεις που προσφέρονται πρέπει να αντιμετωπίσουν το γεγονός ότι το soundtrack έχει ήδη αναμιχθεί σύμφωνα με τις τρέχουσες προδιαγραφές (και υποθέσεις σχετικά με αυτό που θέλουν οι θεατές) στις βιομηχανίες κινηματογράφου και τηλεόρασης.

Ένας θεατής, που ενοχλήθηκε από την εκπληκτική ανισότητα των επιπέδων όγκου μεταξύ διαφόρων στοιχείων του soundtrack μιας ταινίας, έγινε αρκετά απελπισμένος για να αναπτύξει einen hardware-αυτόματο ρυθμιστή όγκου που μπορεί να ισορροπήσει τον όγκο για ταινίες και τηλεόραση.

Αν και οι έξυπνες τηλεοράσεις προσφέρουν eine ποικιλία μεθόδων για να προσπαθήσουν να αυξήσουν τον όγκο της ομιλίας έναντι των μεγάλων επιπέδων όγκου για τη μουσική, παλεύουν όλες ενάντια στις αποφάσεις που λαμβάνονται κατά την время του μιξingu, και, επιχείρημα, τις όρασεις των παραγωγών περιεχομένου που επιθυμούν το κοινό να παρατηρήσει τα soundtracks τους ακριβώς όπως είχαν ρυθμιστεί.

Οι παραγωγοί περιεχομένου φαίνεται πιθανό να αντιδράσουν ενάντια σε αυτήν την πιθανή προσθήκη στο ‘remix culture’,既然 αρκετοί επιφανείς της βιομηχανίας έχουν ήδη εκφράσει δυσαρέσκεια ενάντια στις προεπιλεγμένες αλγόριθμους τηλεόρασης που βασίζονται σε επεξεργασία μετά την πραγματοποίηση, όπως η λείανση κίνησης.

https://vimeo.com/634073402

Συγγραφέας σε μηχανική μάθηση, ειδικός σε σύνθεση εικόνων ανθρώπων. Πρώην επικεφαλής ερευνητικού περιεχομένου στη Metaphysic.ai, μέχρι τη διάλυση της στην DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai