Modele i platformy AI
AudioSep: Oddzielaj cokolwiek opisujesz

LASS lub Language-queried Audio Source Separation to nowy paradygmat dla CASA lub Computational Auditory Scene Analysis, który ma na celu oddzielenie dźwięku docelowego od mieszanki dźwięku przy użyciu zapytania językowego, które zapewnia naturalny, ale skalowalny interfejs dla zadań i aplikacji cyfrowego dźwięku. Chociaż ramy LASS znacznie rozwinęły się w ciągu ostatnich kilku lat pod względem osiągania pożądanej wydajności na określonych źródłach dźwięku, takich jak instrumenty muzyczne, nie są w stanie oddzielić dźwięku docelowego w otwartej domenie.
AudioSep to model podstawowy, który ma na celu rozwiązać obecne ograniczenia ram LASS, umożliwiając separację dźwięku docelowego przy użyciu zapytań językowych. Deweloperzy ram AudioSep przeszkolili model na szerokiej gamie dużych, wielomodalnych zbiorów danych i ocenili wydajność ram w szerokiej gamie zadań dźwiękowych, w tym separacji instrumentów muzycznych, separacji zdarzeń dźwiękowych i poprawy mowy. Początkowa wydajność AudioSep spełnia benchmarki, gdyż wykazuje imponujące zdolności do nauki zero-shot i dostarcza silną separację dźwięku.
W tym artykule dokonamy głębszej analizy działania ram AudioSep, oceniając architekturę modelu, zbiory danych użyte do szkolenia i oceny, oraz podstawowe pojęcia zaangażowane w działanie modelu AudioSep. Zacznijmy więc od podstawowego wprowadzenia do ram CASA.
CASA, USS, QSS, LASS Frameworks: Podstawa dla AudioSep
Ramy CASA lub Computational Auditory Scene Analysis to ramy używane przez deweloperów do projektowania systemów słuchowych, które mają zdolność postrzegania złożonych środowisk dźwiękowych w sposób podobny do tego, jak ludzie postrzegają dźwięk przy użyciu swoich systemów słuchowych. Separacja dźwięku, ze specjalnym uwzględnieniem separacji dźwięku docelowego, jest podstawowym obszarem badań w ramach CASA, a jego celem jest rozwiązanie problemu “cocktail party” lub separacji nagrania dźwiękowego z poszczególnych źródeł dźwięku.
Większość prac nad separacją dźwięku wykonanych w przeszłości dotyczyła głównie separacji jednego lub więcej źródeł dźwięku, takich jak separacja muzyki lub mowy. Nowy model o nazwie USS lub Universal Sound Separation ma na celu separację dowolnych dźwięków w nagraniach dźwiękowych z rzeczywistego świata. Jest to jednak wyzwaniem i ograniczeniem separacji każdego źródła dźwięku z mieszanki dźwięku, głównie ze względu na szeroki zakres różnych źródeł dźwięku istniejących na świecie, co jest głównym powodem, dla którego metoda USS nie jest wykonalna dla aplikacji z rzeczywistego świata działających w czasie rzeczywistym.
Opracowano alternatywę dla metody USS, czyli QSS lub Query-based Sound Separation, który ma na celu separację indywidualnego lub docelowego źródła dźwięku z mieszanki dźwięku na podstawie określonego zestawu zapytań. Dzięki temu ramy QSS pozwalają deweloperom i użytkownikom na wyodrębnienie pożądanych źródeł dźwięku z mieszanki na podstawie ich wymagań, co czyni metodę QSS bardziej praktycznym rozwiązaniem dla aplikacji cyfrowych, takich jak edycja multimediów lub edycja dźwięku.
Ponadto deweloperzy niedawno zaproponowali rozszerzenie ram QSS, ramy LASS lub Language-queried Audio Source Separation, który ma na celu separację dowolnych źródeł dźwięku z mieszanki dźwięku przy użyciu naturalnych opisów językowych źródła dźwięku docelowego. Ponieważ ramy LASS pozwalają użytkownikom na wyodrębnienie źródeł dźwięku docelowych przy użyciu zestawu naturalnych instrukcji językowych, może to być potężne narzędzie o szerokim zastosowaniu w aplikacjach cyfrowych.
Oryginalnie ramy LASS opierają się na uczeniu nadzorowanym, w którym model jest szkolony na zestawie danych audio-tekstowych. Głównym problemem z tym podejściem jest ograniczona dostępność danych audio-tekstowych z etykietami. Aby zmniejszyć uzależnienie ram LASS od danych audio-tekstowych z etykietami, modele są szkolone przy użyciu podejścia multimodalnego.
Celem głównym stosowania podejścia multimodalnego jest użycie modeli kontrastowych, takich jak CLIP lub Contrastive Language Image Pre Training, jako kodera zapytań dla ram. Ponieważ model CLIP ma możliwość łączenia opisów tekstowych z reprezentacjami wizualnymi, pozwala deweloperom na szkolenie modeli LASS przy użyciu danych zamożnych modalności, a także umożliwia interferencję z danymi tekstowymi w ustawieniu zero-shot.
AudioSep: Kluczowe komponenty i architektura
Architektura ram AudioSep składa się z dwóch kluczowych komponentów: kodera tekstu i modelu separacji.
Koder tekstu
Ramy AudioSep używają kodera tekstu modelu CLIP lub Contrastive Language Image Pre Training lub modelu CLAP lub Contrastive Language Audio Pre Training do wyodrębnienia osadzeń tekstu w zapytaniu językowym. Wejściowe zapytanie tekstu składa się z sekwencji “N” tokenów, które są następnie przetwarzane przez koder tekstu w celu wyodrębnienia osadzeń tekstu dla danego wejściowego zapytania językowego.
Model CLIP jest przeszkolony na dużym zbiorze danych obrazu i tekstu przy użyciu kontrastowego uczenia, co pozwala kodownikowi tekstu nauczyć się mapowania opisów tekstowych na przestrzeń semantyczną, którą dzielą reprezentacje wizualne. Zaletą, którą AudioSep zyskuje dzięki użyciu kodera tekstu CLIP, jest to, że może teraz skalować lub szkolić model LASS z nieoznaczonych danych audio-wizualnych, używając osadzeń wizualnych jako alternatywy, co umożliwia szkolenie modeli LASS bez wymogu danych audio-tekstowych z etykietami.
Model CLAP działa podobnie do modelu CLIP i używa obiektu kontrastowego do połączenia dźwięku i języka, łącząc opisy tekstowe i dźwiękowe w przestrzeni latentnej.
Model separacji
Ramy AudioSep używają modelu ResUNet w dziedzinie częstotliwości jako kręgosłupa separacji dla ram. Model działa, stosując transformację Fouriera krótkiego czasu do sygnału falowego w celu wyodrębnienia spektrogramu zespolonego, spektrogramu magnitudy i fazy X.
Sieć ResUNet składa się z 6 bloków kodujących, 6 bloków dekodujących i 4 bloków wąskich. Spektrogram w każdym bloku kodującym używa 4 bloków konwolucyjnych do próbkowania się w kierunku wąskiego zestawu cech, podczas gdy bloki dekodujące używają 4 bloków konwolucyjnych do uzyskania składników separacji przez przeskalowanie cech. Następnie każdy blok kodujący i dekodujący ustanawia połączenie pomostowe, które działa z tym samym współczynnikiem przeskalowania lub próbkowania.

W ramach AudioSep używa się warstwy FiLm lub Feature-wise Linearly modulated do połączenia modelu separacji i kodera tekstu po wdrożeniu bloków konwolucyjnych w ResUNet.
Szkolenie i straty
Podczas szkolenia modelu AudioSep deweloperzy używają metody augmentacji głośności i szkolą ramy AudioSep w sposób końcowy, używając funkcji straty L1 między sygnałem falowym a przewidywanym.
Zbiory danych i benchmarki
Jak wspomniano w poprzednich sekcjach, AudioSep to model podstawowy, który ma na celu rozwiązać obecne zależności modeli LASS od danych audio-tekstowych z etykietami. Model AudioSep jest szkolony na szerokiej gamie zbiorów danych, aby wyposażyć go w zdolności uczenia się wielomodalnego, a tutaj znajduje się szczegółowy opis zbioru danych i benchmarków użytych przez deweloperów do szkolenia ram AudioSep.
AudioSet
AudioSet to słabo oznaczony duży zbiór danych dźwiękowych, składający się z ponad 2 milionów fragmentów dźwiękowych o długości 10 sekund, wyodrębnionych bezpośrednio z YouTube. Każdy fragment dźwiękowy w zbiorze AudioSet jest sklasyfikowany według obecności lub braku klas dźwięku bez szczegółowych informacji o czasie zdarzeń dźwiękowych.
VGGSound
Zbiór VGGSound to duży zbiór danych wizualno-dźwiękowych, który podobnie jak AudioSet został wyodrębniony bezpośrednio z YouTube i zawiera ponad 200 000 klipów wideo, każdy o długości 10 sekund. Zbiór VGGSound jest sklasyfikowany w ponad 300 klasach dźwięku, w tym dźwiękach ludzkich, dźwiękach naturalnych, dźwiękach ptaków i innych.
AudioCaps
AudioCaps to największy publicznie dostępny zbiór danych z opisami dźwięku i składa się z ponad 50 000 fragmentów dźwiękowych o długości 10 sekund, wyodrębnionych z zbioru AudioSet. Dane w AudioCaps są podzielone na trzy kategorie: dane szkoleniowe, dane testowe i dane walidacyjne, a fragmenty dźwiękowe są opisane przez ludzi przy użyciu platformy Amazon (AMZN ) Mechanical Turk.
ClothoV2
ClothoV2 to zbiór danych z opisami dźwięku, składający się z klipów wyodrębnionych z platformy FreeSound, a każdy fragment dźwiękowy jest opisany przez ludzi przy użyciu platformy Amazon Mechanical Turk.
WavCaps
Podobnie jak AudioSet, WavCaps to słabo oznaczony duży zbiór danych dźwiękowych, składający się z ponad 400 000 fragmentów dźwiękowych z opisami, a czas odtwarzania wynosi około 7568 godzin danych szkoleniowych. Fragmenty dźwiękowe w zbiorze WavCaps są wyodrębnione z szerokiej gamy źródeł dźwięku, w tym BBC Sound Effects, AudioSet, FreeSound, SoundBible i innych.

Szczegóły szkolenia
Podczas fazy szkolenia modelu AudioSep losowo wybiera się dwa fragmenty dźwiękowe z dwóch różnych klipów dźwiękowych z zestawu szkoleniowego, a następnie łączy je, tworząc mieszaninę szkoleniową, gdzie długość każdego fragmentu dźwiękowego wynosi około 5 sekund.
Następnie model wyodrębnia spektrogram zespolony z sygnału falowego przy użyciu okna Hann o rozmiarze 1024 z przesunięciem 320. Model używa następnie kodera tekstu modeli CLIP/CLAP do wyodrębnienia osadzeń tekstowych z nadzorem tekstu jako konfiguracja domyślna dla AudioSep.
Wyniki oceny
Na widocznych zbiorach danych
Poniższy rysunek porównuje wyniki modelu AudioSep na widocznych zbiorach danych podczas fazy szkolenia, w tym zestawu danych szkoleniowych. Poniższy rysunek przedstawia wyniki oceny modelu AudioSep w porównaniu z systemami bazowymi, w tym modelami wzmocnienia mowy, LASS i CLIP.

Jak widać na rysunku, model AudioSep działa dobrze przy użyciu opisów dźwięku lub etykiet tekstu jako zapytań wejściowych, a wyniki wskazują na lepszą wydajność modelu AudioSep w porównaniu z poprzednimi modelami LASS i modelami separacji dźwięku z zapytaniami.
Na niewidocznych zbiorach danych
Aby ocenić wydajność modelu AudioSep w ustawieniu zero-shot, deweloperzy kontynuowali ocenę wydajności na niewidocznych zbiorach danych, a model AudioSep dostarcza imponującą separację dźwięku w ustawieniu zero-shot, a wyniki są wyświetlane na poniższym rysunku.

Ponadto poniższy rysunek przedstawia wyniki oceny modelu AudioSep w porównaniu z modelem Voicebank-Demand do wzmocnienia mowy.

Ocena modelu AudioSep wskazuje na silną i pożądaną wydajność na niewidocznych zbiorach danych w ustawieniu zero-shot, co umożliwia wykonywanie zadań operacji dźwięku na nowych dystrybucjach danych.
Wizualizacja wyników separacji
Poniższy rysunek przedstawia wyniki uzyskane, gdy deweloperzy użyli modelu AudioSep-CLAP do wizualizacji spektrogramów dla źródeł dźwięku docelowych, mieszanin dźwięku i źródeł dźwięku oddzielonych przy użyciu zapytań tekstu o różnych dźwiękach.

Porównanie zapytań tekstu
Deweloperzy ocenili wydajność modelu AudioSep-CLAP i AudioSep-CLIP na AudioCaps Mini, a deweloperzy użyli etykiet zdarzeń AudioSet, opisów AudioCaps i ponownie zaopiniowanych opisów językowych, aby zbadać wpływ różnych zapytań.

Podsumowanie
AudioSep to model podstawowy, który został opracowany w celu stworzenia ram universum separacji dźwięku w otwartej domenie, używając opisów językowych do separacji dźwięku. Jak zaobserwowano podczas oceny, model AudioSep jest w stanie wykonywać naukę zero-shot i nienadzorowaną bezproblemowo, używając opisów dźwięku lub etykiet tekstu jako zapytań.












