Μοντέλα και πλατφόρμες AI

AudioSep: Διαχωρισμός Οποιασδήποτε Περιγραφής

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Το LASS ή η Γλώσσα-ερωτημένη Ηχογραφική Πηγή Διαχωρισμού είναι το νέο παράδειγμα για το CASA ή την Υπολογιστική Ακουστική Ανάλυση Σκηνής που στοχεύει στον διαχωρισμό ενός στόχου ήχου από ένα δεδομένο μείγμα ήχου χρησιμοποιώντας μια φυσική γλώσσα ερώτημα που παρέχει μια φυσική αλλά κλιμακωτή διεπαφή για ψηφιακές ηχογραφικές εργασίες και εφαρμογές. Αν και τα πλαίσια LASS έχουν προοδεύσει σημαντικά τα τελευταία χρόνια σε όρους επίτευξης επιθυμητής απόδοσης σε συγκεκριμένες ηχογραφικές πηγές όπως μουσικά όργανα, δεν είναι σε θέση να διαχωρίσουν τον στόχο ήχου στην ανοιχτή περιοχή.

AudioSep, είναι ένα θεμελιώδες μοντέλο που στοχεύει να επιλύσει τις τρέχουσες περιορισμοί των πλαισίων LASS ενεργοποιώντας τον διαχωρισμό του στόχου ήχου χρησιμοποιώντας φυσική γλώσσα ερωτήματα. Οι dévelopπεurs του πλαισίου AudioSep έχουν εκπαιδεύσει το μοντέλο εκτενώς σε ένα ευρύ φάσμα μεγάλης κλίμακας πολυμεσικών συνόλων δεδομένων και έχουν αξιολογήσει την απόδοση του πλαισίου σε ένα ευρύ φάσμα ηχογραφικών εργασιών συμπεριλαμβανομένων του διαχωρισμού μουσικών οργάνων, του διαχωρισμού ηχογραφικών συμβάντων και της βελτίωσης της ομιλίας μεταξύ πολλών άλλων. Η αρχική απόδοση του AudioSep ικανοποιεί τα βENCHMARKS καθώς παρουσιάζει εντυπωσιακές ικανότητες μηδενικής εκπαίδευσης και παρέχει ισχυρή απόδοση διαχωρισμού ήχου.

Σε αυτό το άρθρο, θα κάνουμε μια πιο sâuστόχαστη εμβάθυνση στη λειτουργία του πλαισίου AudioSep καθώς θα αξιολογήσουμε την αρχιτεκτονική του μοντέλου, τα συνόλα δεδομένων που χρησιμοποιούνται για την εκπαίδευση και την αξιολόγηση, και τις βασικές έννοιες που εμπλέκονται στη λειτουργία του μοντέλου AudioSep. Έτσι, ας ξεκινήσουμε με μια βασική εισαγωγή στο πλαίσιο CASA.

CASA, USS, QSS, LASS Πλαίσια: Η Βάση για το AudioSep

Το CASA ή το Υπολογιστικό Ακουστικό Σκηνικό Ανάλυσης είναι ένα πλαίσιο που χρησιμοποιείται από dévelopπεurs για να σχεδιάσουν συστήματα ακουστικής που έχουν την ικανότητα να αντιλαμβάνονται σύνθετα ηχογραφικά περιβάλλοντα με τρόπο παρόμοιο με τον τρόπο που οι άνθρωποι αντιλαμβάνονται τον ήχο χρησιμοποιώντας τα ακουστικά συστήματα. Ο διαχωρισμός ήχου, με ειδική έμφαση στον διαχωρισμό στόχου ήχου, είναι một θεμελιώδους σημασίας περιοχή έρευνας εντός του πλαισίου CASA, και στοχεύει να λύσει το «πρόβλημα του κοκτέιλ» ή τον διαχωρισμό πραγματικών ηχογραφικών εγγραφών από ατομικές ηχογραφικές εγγραφές ή αρχεία. Η σημασία του διαχωρισμού ήχου μπορεί να αποδοθεί κυρίως στις ευρείες εφαρμογές του, συμπεριλαμβανομένων του διαχωρισμού μουσικών πηγών, του διαχωρισμού ηχογραφικών πηγών, της βελτίωσης της ομιλίας, της ταυτοποίησης στόχου ήχου, και πολλά άλλα.

Η większość των εργασιών για τον διαχωρισμό ήχου που έχουν γίνει στο παρελθόν περιστρέφεται κυρίως γύρω από τον διαχωρισμό ενός ή περισσοτέρων ηχογραφικών πηγών όπως ο διαχωρισμός μουσικής ή ο διαχωρισμός ομιλίας. Ένα νέο μοντέλο με το όνομα USS ή Οниверσαλικός Ήχος Διαχωρισμού στοχεύει στον διαχωρισμό αυθαίρετων ήχων σε πραγματικά ηχογραφικά αρχεία. Ωστόσο, είναι μια προκλητική και περιοριστική εργασία να διαχωρίσετε κάθε ηχογραφική πηγή από ένα μείγμα ήχου κυρίως λόγω του ευρέος φάσματος διαφορετικών ηχογραφικών πηγών που υπάρχουν στον κόσμο, το οποίο είναι ο κύριος λόγος για τον οποίο η μέθοδος USS δεν είναι εφικτή για πραγματικές εφαρμογές που λειτουργούν σε πραγματικό χρόνο.

Μια εφικτή εναλλακτική λύση για τη μέθοδο USS είναι η QSS ή η Ερωτηματική Ήχος Διαχωρισμού μέθοδος που στοχεύει στον διαχωρισμό ενός ατομικού ή στόχου ηχογραφικής πηγής από το μείγμα ήχου με βάση ένα συγκεκριμένο σύνολο ερωτημάτων. Χάρη σε αυτό, το πλαίσιο QSS επιτρέπει στους dévelopπεurs και τους χρήστες να εξάγουν τις επιθυμητές πηγές ήχου από το μείγμα με βάση τις απαιτήσεις τους, καθιστώντας τη μέθοδο QSS μια πιο πρακτική λύση για ψηφιακές εφαρμογές του πραγματικού κόσμου όπως η επεξεργασία πολυμέσων ή η επεξεργασία ήχου.

Επιπλέον, οι dévelopπεurs έχουν πρόσφατα προτείνει μια επέκταση του πλαισίου QSS, το LASS ή το Γλώσσα-ερωτημένη Ηχογραφική Πηγή Διαχωρισμού πλαίσιο που στοχεύει στον διαχωρισμό αυθαίρετων πηγών ήχου από ένα μείγμα ήχου χρησιμοποιώντας φυσικές περιγραφές του στόχου ήχου. Καθώς το πλαίσιο LASS επιτρέπει στους χρήστες να εξάγουν τις πηγές ήχου χρησιμοποιώντας ένα σύνολο φυσικών γλώσσας οδηγιών, μπορεί να γίνει ένα ισχυρό εργαλείο με ευρείες εφαρμογές σε ψηφιακές ηχογραφικές εφαρμογές. Σε σύγκριση με παραδοσιακές ηχογραφικές ή οπτικές ερωτήσεις μεθόδους, η χρήση φυσικών γλώσσας οδηγιών για τον διαχωρισμό ήχου προσφέρει einen μεγαλύτερο βαθμό ευελιξίας και καθιστά την απόκτηση ερωτηματικών πληροφοριών πολύ πιο εύκολη και βολική. Επιπλέον, σε σύγκριση με μεθόδους διαχωρισμού ήχου που βασίζονται σε προκαθορισμένα σύνολα οδηγιών ή ερωτημάτων, το πλαίσιο LASS δεν περιορίζει τον αριθμό των εισαγώμενων ερωτημάτων και έχει την ευελιξία να γενικευθεί σε ανοιχτό τομέα χωρίς προβλήματα.

Αρχικά, το πλαίσιο LASS βασίζεται σε επιβλεπόμενη εκπαίδευση, στην οποία το μοντέλο εκπαιδεύεται σε ένα σύνολο ετικετών ηχογραφικών-κειμένου ζευγαριών δεδομένων. Ωστόσο, το κύριο πρόβλημα με αυτήν την προσέγγιση είναι η περιορισμένη διαθεσιμότητα αναγνωρισμένων και ετικετών ηχογραφικών-κειμένου δεδομένων. Για να μειώσει την εξάρτηση του πλαισίου LASS από αναγνωρισμένα ετικετών ηχογραφικών-κειμένου δεδομένα, τα μοντέλα εκπαιδεύονται χρησιμοποιώντας την πολυμεσική επιβλεπόμενη εκπαίδευση προσέγγιση. Ο κύριος στόχος πίσω από τη χρήση μιας πολυμεσικής επιβλεπόμενης εκπαίδευσης είναι να χρησιμοποιηθούν μοντέλα αντίθετης εκπαίδευσης όπως το CLIP ή το Contrastive Language Image Pre Training μοντέλο ως ο κωδικοποιητής ερωτήματος για το πλαίσιο. Καθώς το μοντέλο CLIP έχει την ικανότητα να ευθυγραμμίσει κειμενικές εμβυθύνσεις με άλλες modalities όπως ήχος ή όραση, επιτρέπει στους dévelopπεurs να εκπαιδεύσουν τα μοντέλα LASS χρησιμοποιώντας δεδομένα-πλούσια modalities και να επηρεάσουν τα κειμενικά δεδομένα σε μια μηδενική ρύθμιση. Τα τρέχοντα πλαίσια LASS ωστόσο χρησιμοποιούν μικρές κλίμακας συνόλα δεδομένων για την εκπαίδευση, και οι εφαρμογές του πλαισίου LASS σε εκατοντάδες πιθανές περιοχές είναι ακόμη να εξερευνηθούν.

Για να επιλύσει τις τρέχουσες περιορισμοί που αντιμετωπίζουν τα πλαίσια LASS, οι dévelopπεurs έχουν εισαγάγει το AudioSep, ένα θεμελιώδες μοντέλο που στοχεύει στον διαχωρισμό ήχου από ένα μείγμα ήχου χρησιμοποιώντας φυσικές περιγραφές. Ο τρέχων στόχος για το AudioSep είναι να αναπτύξει ένα προ-εκπαιδευμένο μοντέλο διαχωρισμού ήχου που να εκμεταλλεύεται τα υπάρχοντα μεγάλα πολυμεσικά συνόλα δεδομένων για να ενεργοποιήσει την γενίκευση των μοντέλων LASS σε ανοιχτό τομέα. Για να συνοψίσουμε, το μοντέλο AudioSep είναι: «Ένα θεμελιώδες μοντέλο για τον καθολικό διαχωρισμό ήχου σε ανοιχτό τομέα χρησιμοποιώντας φυσικές γλώσσες ερωτήματα ή περιγραφές εκπαιδευμένο σε μεγάλα πολυμεσικά συνόλα δεδομένων».

AudioSep: Κύρια Στοιχεία & Αρχιτεκτονική

Η αρχιτεκτονική του πλαισίου AudioSep αποτελείται από δύο κύρια στοιχεία: einen κωδικοποιητή κειμένου και ένα μοντέλο διαχωρισμού.

Ο Κωδικοποιητής Κειμένου

Το πλαίσιο AudioSep χρησιμοποιεί einen κωδικοποιητή κειμένου του μοντέλου CLIP ή του Contrastive Language Image Pre Training μοντέλου ή του CLAP ή του Contrastive Language Audio Pre Training μοντέλου για να εξάγει κειμενικές εμβυθύνσεις μέσα σε μια φυσική γλώσσα ερώτημα. Η είσοδος κειμένου ερώτημα αποτελείται από μια σειρά «N» token που στη συνέχεια επεξεργάζεται από τον κωδικοποιητή κειμένου για να εξαγάγει τις κειμενικές εμβυθύνσεις για την δεδομένη είσοδο γλώσσας ερώτημα. Ο κωδικοποιητής κειμένου χρησιμοποιεί einen σωρό μετασχηματιστών μπλοκ για να κωδικοποιήσει τα εισαγόμενα κειμενικά token, και οι εξοδοτικές αναπαραστάσεις συλλέγονται μετά την διέλευση από τα στρώματα μετασχηματιστών που οδηγεί στην ανάπτυξη μιας D-διαστάσεων διανυσματικής αναπαράστασης με σταθερό μήκος όπου D αντιστοιχεί στις διαστάσεις του μοντέλου CLAP ή CLIP, ενώ ο κωδικοποιητής κειμένου είναι παγωμένος κατά την περίοδο εκπαίδευσης.

Το μοντέλο CLIP είναι προ-εκπαιδευμένο σε ένα μεγάλο σύνολο δεδομένων εικόνας-κειμένου ζευγαριών χρησιμοποιώντας αντίθετη εκπαίδευση, η οποία είναι ο κύριος λόγος για τον οποίο ο κωδικοποιητής κειμένου του μοντέλου CLIP μαθαίνει να χαρτογραφεί κειμενικές περιγραφές στο σημάντικό χώρο που είναι επίσης κοινός με τις οπτικές αναπαραστάσεις. Το πλεονέκτημα που το AudioSep αποκτά με τη χρήση του κωδικοποιητή κειμένου του CLIP είναι ότι μπορεί τώρα να κλιμακωθεί ή να εκπαιδεύσει το μοντέλο LASS από μη ετικετώνημένα ηχογραφικά-οπτικά δεδομένα χρησιμοποιώντας τις οπτικές εμβυθύνσεις ως εναλλακτική, επιτρέποντας την εκπαίδευση των μοντέλων LASS χωρίς την ανάγκη ετικετών ηχογραφικών-κειμένου δεδομένων.

Το μοντέλο CLAP λειτουργεί παρόμοια με το μοντέλο CLIP και χρησιμοποιεί αντίθετη εκπαίδευση στόχο χρησιμοποιώντας einen κωδικοποιητή κειμένου και einen κωδικοποιητή ήχου για να συνδέσει ήχο και γλώσσα, φέρνοντας κειμενικές και ηχογραφικές περιγραφές σε einen ηχογραφικό-κειμενικό 潛在 χώρο μαζί.

Μοντέλο Διαχωρισμού

Το πλαίσιο AudioSep χρησιμοποιεί einen μοντέλο ResUNet που τροφοδοτείται με ένα μείγμα ηχογραφικών κλιπ ως τον πυρήνα διαχωρισμού για το πλαίσιο. Το πλαίσιο λειτουργεί εφαρμόζοντας einen STFT ή einen Short-Time Fourier Transform στην κυματική μορφή για να εξαγάγει einen σύνθετο φασματόγραμμα, το φασματόγραμμα μεγέθους, και την Φάση του X. Το μοντέλο στη συνέχεια ακολουθεί την ίδια ρύθμιση και κατασκευάζει einen κωδικοποιητή-αποκωδικοποιητή δίκτυο για να επεξεργαστεί το φασματόγραμμα μεγέθους.

Το δίκτυο ResUNet κωδικοποιητή-αποκωδικοποιητή αποτελείται από 6残 blocks, 6 αποκωδικοποιητές blocks, και 4 μπουκώματα blocks. Το φασματόγραμμα σε κάθε block κωδικοποιητή χρησιμοποιεί 4残 convention blocks για να δειγματοληψίασει τον εαυτό του σε einen μπουκώματος χαρακτηριστικό ενώ οι αποκωδικοποιητές blocks χρησιμοποιούν 4残 deconvolutional blocks για να λάβουν τα στοιχεία διαχωρισμού απο-δειγματοληψίασει τα χαρακτηριστικά. Μετά από αυτό, κάθε block κωδικοποιητή και block αποκωδικοποιητή καθιερώνει eine skip σύνδεση που λειτουργεί στην ίδια απο-δειγματοληψίασει率. Το残 block του πλαισίου αποτελείται από 2 Leaky-ReLU ενεργοποίηση στρώματα, 2 batch κανονικοποίηση στρώματα, και 2 CNN στρώματα, και επιπλέον, το πλαίσιο εισάγει μια 额外残 σύνδεση που συνδέει την είσοδο και την έξοδο κάθε ατομικού残 block. Το μοντέλο ResUNet λαμβάνει το σύνθετο φασματόγραμμα X ως είσοδο, και παράγει το φασματόγραμμα μεγέθους Μ ως έξοδο με το φαζικό υπόλοιπο να υπόκειται σε κειμενικές εμβυθύνσεις που ελέγχουν το μέγεθος της κλίμακας, και την περιστροφή του γωνίας του φασματόγραμματος. Το διαχωρισμένο σύνθετο φασματόγραμμα μπορεί στη συνέχεια να εξαχθεί πολλαπλασιάζοντας το προβλεπόμενο φασματόγραμμα μεγέθους και το φαζικό υπόλοιπο με το STFT (Short-Time Fourier Transform) του μείγματος.

Στο πλαίσιο του, το AudioSep χρησιμοποιεί einen FiLm ή einen Feature-wise Linearly modulated στρώμα για να συνδέσει το μοντέλο διαχωρισμού και τον κωδικοποιητή κειμένου μετά την ανάπτυξη των convolutional blocks στο ResUNet.

Εκπαίδευση και Απώλεια

Κατά την εκπαίδευση του μοντέλου AudioSep, οι dévelopπεurs χρησιμοποιούν την μέθοδο loudness augmentation, και εκπαιδεύουν το πλαίσιο AudioSep από την αρχή χρησιμοποιώντας eine L1 απώλεια συνάρτηση μεταξύ της πραγματικής και της προβλεπόμενης κυματικής μορφής.

Συνόλα Δεδομένων και ΒENCHMARKS

Όπως αναφέρθηκε σε προηγούμενες ενότητες, το AudioSep είναι ένα θεμελιώδες μοντέλο που στοχεύει να επιλύσει την τρέχουσα εξάρτηση των μοντέλων LASS από ετικετών ηχογραφικών-κειμένου δεδομένων. Το μοντέλο AudioSep εκπαιδεύεται σε ένα ευρύ φάσμα συνόλων δεδομένων για να του παρέχει πολυμεσικές εκπαιδευτικές ικανότητες, και εδώ είναι μια λεπτομερής περιγραφή του συνόλου δεδομένων και των βENCHMARKS που χρησιμοποιούνται από τους développeurs για να εκπαιδεύσουν το πλαίσιο AudioSep.

AudioSet

Το AudioSet είναι ένα слабά-ετικετώνητο μεγάλο σύνολο δεδομένων ήχου που αποτελείται από πάνω από 2 εκατομμύρια 10-δευτερόλεπτων ηχογραφικών κλιπ που εξάγονται trực tiếp από το YouTube. Κάθε ηχογραφικό κλιπ στο σύνολο δεδομένων AudioSet κατηγοριοποιείται από την απουσία ή την παρουσία ηχογραφικών κλάσεων χωρίς τις συγκεκριμένες λεπτομέρειες του χρόνου των ηχογραφικών συμβάντων. Το σύνολο δεδομένων AudioSet έχει πάνω από 500 διαφορετικές ηχογραφικές κλάσεις, συμπεριλαμβανομένων φυσικών ήχων, ανθρώπινων ήχων, οχημάτων ήχων, και πολλά άλλα.

VGGSound

Το σύνολο δεδομένων VGGSound είναι ένα μεγάλο σύνολο δεδομένων οπτικών-ήχου που, όπως και το AudioSet, έχει εξαχθεί trực tiếp από το YouTube, και περιέχει πάνω από 200.000 βίντεο κλιπ, κάθε ένα από τα οποία έχει διάρκεια 10 δευτερολέπτων. Το σύνολο δεδομένων VGGSound κατηγοριοποιείται σε πάνω από 300 ηχογραφικές κλάσεις, συμπεριλαμβανομένων ανθρώπινων ήχων, φυσικών ήχων, πουλιών ήχων, και πολλά άλλα. Η χρήση του συνόλου δεδομένων VGGSound εξασφαλίζει ότι το αντικείμενο που παράγει τον στόχο ήχο είναι επίσης περιγραφικό στην αντίστοιχη οπτική κλιπ.

AudioCaps

Το AudioCaps είναι το μεγαλύτερο δημόσιο σύνολο δεδομένων ηχογραφικών περιγραφών και αποτελείται από πάνω από 50.000 10-δευτερόλεπτων ηχογραφικών κλιπ που εξάγονται από το σύνολο δεδομένων AudioSet. Τα δεδομένα στο AudioCaps διαιρούνται σε τρεις κατηγορίες: δεδομένα εκπαίδευσης, δεδομένα δοκιμής, και δεδομένα επαλήθευσης, και τα ηχογραφικά κλιπ είναι ανθρωπογενώς-ετικετώνητα με φυσικές γλώσσες περιγραφές χρησιμοποιώντας την πλατφόρμα Amazon (AMZN ) Mechanical Turk. Είναι αξιοσημείωτο ότι κάθε ηχογραφικό κλιπ στο σύνολο δεδομένων εκπαίδευσης έχει eine seule ετικέτα, ενώ τα δεδομένα δοκιμής και επαλήθευσης έχουν από 5 πραγματικές ετικέτες.

ClothoV2

Το ClothoV2 είναι ένα σύνολο δεδομένων ηχογραφικών περιγραφών που αποτελείται από κλιπ που εξάγονται από την πλατφόρμα FreeSound, και όπως και το AudioCaps, κάθε ηχογραφικό κλιπ είναι ανθρωπογενώς-ετικετώνητο με φυσικές γλώσσες περιγραφές χρησιμοποιώντας την πλατφόρμα Amazon Mechanical Turk.

WavCaps

Όπως και το AudioSet, το WavCaps είναι ένα слабά-ετικετώνητο μεγάλο σύνολο δεδομένων ήχου που αποτελείται από πάνω από 400.000 ηχογραφικά κλιπ με περιγραφές, και συνολικό χρόνο εκτέλεσης που προσεγγίζει τα 7568 ώρες εκπαίδευσης. Τα ηχογραφικά κλιπ στο σύνολο δεδομένων WavCaps εξάγονται από ένα ευρύ φάσμα ηχογραφικών πηγών, συμπεριλαμβανομένων των BBC Sound Effects, AudioSet, FreeSound, SoundBible, και πολλά άλλα.

Λεπτομέρειες Εκπαίδευσης

Κατά την περίοδο εκπαίδευσης, το μοντέλο AudioSep τυχαία δειγματοληψίαζει δύο ηχογραφικά τμήματα από δύο διαφορετικά ηχογραφικά κλιπ από το σύνολο δεδομένων εκπαίδευσης, και στη συνέχεια τα αναμιγνύει για να δημιουργήσει ένα μείγμα εκπαίδευσης όπου το μήκος κάθε ηχογραφικού τμήματος είναι περίπου 5 δευτερόλεπτα. Το μοντέλο στη συνέχεια εξάγει το σύνθετο φασματόγραμμα από το σήμα κυματικής μορφής χρησιμοποιώντας einen Hann παράθυρο μεγέθους 1024 με einen hop μεγέθους 320.

Το μοντέλο στη συνέχεια χρησιμοποιεί τον κωδικοποιητή κειμένου του μοντέλου CLIP/CLAP για να εξαγάγει τις κειμενικές εμβυθύνσεις με κειμενική επιτήρηση ως την προεπιλεγμένη ρύθμιση για το AudioSep. Για το μοντέλο διαχωρισμού, το πλαίσιο AudioSep χρησιμοποιεί einen ResUNet στρώμα που αποτελείται από 30 στρώματα, 6 κωδικοποιητές blocks, και 6 αποκωδικοποιητές blocks που μοιάζουν με την αρχιτεκτονική που ακολουθείται στο καθολικό μοντέλο διαχωρισμού ήχου. Επιπλέον, κάθε κωδικοποιητής block έχει δύο convolutional στρώματα με einen 3×3 πυρήνα μεγέθους με τον αριθμό των εξοδοτικών χαρακτηριστικών των κωδικοποιητών blocks να είναι 32, 64, 128, 256, 512, και 1024 αντίστοιχα. Οι αποκωδικοποιητές blocks μοιράζονται συμμετρία με τους κωδικοποιητές blocks, και οι développeurs εφαρμόζουν τον Adam βελτιωτή για να εκπαιδεύσουν το μοντέλο AudioSep με einen batch μεγέθους 96.

Αποτελέσματα Αξιολόγησης

Σε Δεδομένα Εκπαίδευσης

Το ακόλουθο σχήμα συγκρίνει την απόδοση του πλαισίου AudioSep σε δεδομένα εκπαίδευσης κατά την περίοδο εκπαίδευσης, συμπεριλαμβανομένων των δεδομένων εκπαίδευσης. Το παρακάτω σχήμα αντιπροσωπεύει τα αποτελέσματα αξιολόγησης του πλαισίου AudioSep όταν συγκρίνεται με τα βασικά συστήματα, συμπεριλαμβανομένων των μοντέλων Βελτίωσης Ομιλίας, LASS, και CLIP. Το μοντέλο AudioSep με τον κωδικοποιητή κειμένου CLIP αντιπροσωπεύεται ως AudioSep-CLIP, ενώ το μοντέλο AudioSep με τον κωδικοποιητή κειμένου CLAP αντιπροσωπεύεται ως AudioSep-CLAP.

Όπως φαίνεται στο σχήμα, το πλαίσιο AudioSep παρουσιάζει καλή απόδοση όταν χρησιμοποιεί ηχογραφικές περιγραφές ή κειμενικές ετικέτες ως εισαγόμενα ερωτήματα, και τα αποτελέσματα δείχνουν την υπεροχή της απόδοσης του πλαισίου AudioSep όταν συγκρίνεται με τα προηγούμενα μοντέλα LASS και ηχογραφικά-ερωτημένα μοντέλα διαχωρισμού ήχου.

Σε Άγνωστα Δεδομένα

Για να αξιολογήσει την απόδοση του AudioSep σε μια μηδενική ρύθμιση, οι développeurs συνέχισαν να αξιολογούν την απόδοση σε άγνωστα δεδομένα, και το πλαίσιο AudioSep παρουσιάζει εντυπωσιακή απόδοση διαχωρισμού σε μια μηδενική ρύθμιση, και τα αποτελέσματα εμφανίζονται στο σχήμα παρακάτω.

Επιπλέον, η εικόνα παρακάτω δείχνει τα αποτελέσματα της αξιολόγησης του μοντέλου AudioSep σε σχέση με το Voicebank-Demand speech enhancement.

Η αξιολόγηση του πλαισίου AudioSep δείχνει μια ισχυρή και επιθυμητή απόδοση σε άγνωστα δεδομένα σε μια μηδενική ρύθμιση, και έτσι ανοίγει τον δρόμο για την εκτέλεση εργασιών ήχου σε νέες κατανομές δεδομένων.

Οπτικοποίηση Αποτελεσμάτων Διαχωρισμού

Το παρακάτω σχήμα δείχνει τα αποτελέσματα που λαμβάνονται όταν οι développeurs χρησιμοποίησαν το πλαίσιο AudioSep-CLAP για να οπτικοποιήσουν τα φασματόγραμμα για τις πραγματικές πηγές ήχου, και τα μείγματα και διαχωρισμένα ηχογραφικά κλιπ χρησιμοποιώντας κειμενικές ερωτήσεις διαφορετικών ήχων. Τα αποτελέσματα επέτρεψαν στους développeurs να παρατηρήσουν ότι το φασματόγραμμα του διαχωρισμένου πηγής μοιάζει με την πηγή της πραγματικής αλήθειας, που υποστηρίζει περαιτέρω τα αντικειμενικά αποτελέσματα που λαμβάνονται κατά τη διάρκεια των πειραμάτων.

Σύγκριση Κειμενικών Ερωτημάτων

Οι développeurs αξιολογούν την απόδοση του AudioSep-CLAP και του AudioSep-CLIP στο AudioCaps Mini, και οι développeurs χρησιμοποιούν τις ετικέτες συμβάντων AudioSet, τις περιγραφές AudioCaps, και τις ανα-ετικετώνητες φυσικές γλώσσες περιγραφές για να εξετάσουν τις επιδράσεις των διαφορετικών ερωτημάτων, και το παρακάτω σχήμα δείχνει ένα παράδειγμα του AudioCaps Mini σε δράση.

Συμπέρασμα

AudioSep είναι ένα θεμελιώδες μοντέλο που αναπτύχθηκε με τον στόχο να είναι ένα ανοιχτό τομέα καθολικό μοντέλο διαχωρισμού ήχου που χρησιμοποιεί φυσικές γλώσσες περιγραφές για τον διαχωρισμό ήχου. Όπως παρατηρήθηκε κατά την αξιολόγηση, το πλαίσιο AudioSep είναι ικανό να εκτελεί μηδενική και ανεπίσημη εκπαίδευση ομαλά χρησιμοποιώντας ηχογραφικές περιγραφές ή κειμενικές ετικέτες ως ερωτήματα. Τα αποτελέσματα και η απόδοση αξιολόγησης του AudioSep δείχνουν μια ισχυρή απόδοση που υπερβαίνει τα τρέχοντα μοντέλα διαχωρισμού ήχου όπως το LASS, και μπορεί να είναι αρκετά ικανό για να επιλύσει τις τρέχουσες περιορισμοί των δημοφιλών μοντέλων διαχωρισμού ήχου.

Ένας μηχανικός επάγγελμα, ένας συγγραφέας με την καρδιά. Ο Kunal είναι ένας τεχνικός συγγραφέας με einen βαθύ έρωτα και κατανόηση του AI και ML, αφιερωμένος στο να απλοποιεί σύνθετες έννοιες σε αυτά τα πεδία μέσω των ελκυστικών και ενημερωτικών εγγράφων του.