Kąt Andersona

Badania AI przewidują oddzielne kontrolki głośności dla dialogu, muzyki i efektów dźwiękowych

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badanie kierowane przez Mitsubishi bada możliwość wyodrębnienia trzech oddzielnych ścieżek dźwiękowych z oryginalnego źródła dźwięku, rozdzielając ścieżkę dźwiękową na mowę, muzykę i efekty dźwiękowe (tj. hałas ambientalny).

Ponieważ jest to ramowa struktura przetwarzania, oferuje potencjał dla późniejszych generacji platform multimedialnych, w tym urządzeń konsumenckich, aby oferować trójpunktowe kontrolki głośności, pozwalające użytkownikowi zwiększyć głośność dialogu lub obniżyć głośność ścieżki dźwiękowej.

W krótkim klipie poniżej z towarzyszącego filmu wideo do badań (zobacz koniec artykułu na pełne wideo), widzimy różne aspekty ścieżki dźwiękowej, które są podkreślane, gdy użytkownik przesuwa kontrolkę po trójkącie z każdym z trzech składników audio w jednym z rogów:

Krótki klip z filmu wideo towarzyszącego artykułowi (zobacz osadzony na końcu artykułu). Gdy użytkownik przesuwa kursor w kierunku jednego z trzech wyodrębnionych aspektów w interfejsie trójkąta (po prawej), dźwięk podkreśla tę część ścieżki dźwiękowej. Chociaż dłuższy film cytuje kilka dodatkowych przykładów na YouTube, wydają się one obecnie niedostępne. Źródło: https://vimeo.com/634073402

Artykuł artykuł nosi tytuł Problem widelec kielicha: trójścieżkowa separacja audio dla ścieżek dźwiękowych z prawdziwego świata i pochodzi od badaczy z Mitsubishi Electric Research Laboratories (MERL) w Cambridge, MA, oraz Wydziału Inżynierii Systemów Inteligentnych na Uniwersytecie w Illinois.

Separowanie aspektów ścieżki dźwiękowej

Badacze nazwali to wyzwanie “Problemem przyjęcia kielicha”, ponieważ polega ono na izolowaniu ściśle splecionych elementów ścieżki dźwiękowej, tworząc mapę przypominającą widelec (zobacz poniższy obraz). W praktyce ścieżki dźwiękowe wielokanałowe (tj. stereo i więcej) mogą mieć różne ilości typów zawartości, takich jak dialog, muzyka i ambient, szczególnie ponieważ dialog ma tendencję do dominowania kanału centralnego w miksu Dolby 5.1. Obecnie jednak bardzo aktywny obszar badań nad separacją audio koncentruje się na przechwytywaniu tych nici z pojedynczej, upieczonej ścieżki dźwiękowej, tak jak robi to bieżące badanie.

Widelce kielicha – wyodrębnianie trzech odrębnych ścieżek dźwiękowych z połączonej i pojedynczej ścieżki dźwiękowej. Źródło: https://arxiv.org/pdf/2110.09958.pdf

Widelce kielicha – wyodrębnianie trzech odrębnych ścieżek dźwiękowych z połączonej i pojedynczej ścieżki dźwiękowej. Źródło: https://arxiv.org/pdf/2110.09958.pdf

Ostatnie badania koncentrowały się na wyodrębnianiu mowy w różnych środowiskach, często w celu denoisingu audio mowy do późniejszego zaangażowania z systemami NLP, ale także na izolacji archiwalnych głosów śpiewających, albo w celu tworzenia syntetycznych wersji prawdziwych (nawet zmarłych) śpiewaków, albo w celu ułatwienia izolacji muzyki w stylu karaoke.

Zestaw danych dla każdego aspektu

Do tej pory niewiele uwagi poświęcono wykorzystaniu tego rodzaju technologii AI, aby dać użytkownikom większą kontrolę nad miksem ścieżki dźwiękowej. Dlatego badacze sformalizowali problem i wygenerowali nowy zestaw danych jako pomoc w dalszych badaniach nad separacją ścieżek dźwiękowych wielotypowych, a także przetestowali go na różnych istniejących ramach separacji audio.

Nowy zestaw danych, który autorzy opracowali, nosi nazwę Divide and Remaster (DnR), i jest pochodną poprzednich zestawów danych LibriSpeech, Free Music Archive i Freesound Dataset 50k (FSD50K). Dla tych, którzy chcą pracować z DnR od podstaw, zestaw danych musi być odtworzony z trzech źródeł; w przeciwnym razie zostanie on wkrótce udostępniony na Zenodo, twierdzą autorzy. Jednak na czas pisania, podany link GitHub do narzędzi do ekstrakcji źródeł nie jest obecnie aktywny, więc zainteresowani mogą musieć poczekać trochę.

Badacze stwierdzili, że architektura CrossNet un-mix (XUMX) zaproponowana przez Sony w maju działa szczególnie dobrze z DnR.

Architektura audio CrossNet Sony.

Architektura audio CrossNet Sony.

Autorzy twierdzą, że ich modele ekstrakcji z wykorzystaniem uczenia maszynowego działają dobrze na ścieżkach dźwiękowych z YouTube, chociaż oceny przedstawione w artykule opierają się na danych syntetycznych, a dostarczony główny film wideo (osadzony poniżej) jest obecnie jedynym, który wydaje się dostępny.

Trzy zestawy danych użyte każdy składają się z kolekcji rodzaju danych wyjściowych, które muszą być wyodrębnione z ścieżki dźwiękowej: FSD50K zajmuje się efektami dźwiękowymi i zawiera 50 000 klipów audio mono 44,1 kHz z 200 etykietami klas z ontologii AudioSet Google; Free Music Archive zawiera 100 000 utworów stereo, obejmujących 161 gatunki muzyczne, chociaż autorzy użyli podzbioru zawierającego 25 000 utworów, dla równości z FSD50K; a LibriSpeech dostarcza DnR 100 godzin próbek audio książek w formacie mp3 44,1 kHz.

Przyszła praca

Autorzy przewidują dalszą pracę nad zestawem danych i połączeniem oddzielnych modeli opracowanych do dalszych badań nad ramami rozpoznawania mowy i klasyfikacji dźwięku, zawierającymi automatyczną generację napisów dla mowy i dźwięków nie-mowy. Zamierzają również ocenić możliwości podejść do remiksu, które mogą zmniejszyć artifacts percepcyjne, które pozostają centralnym problemem przy dzieleniu połączonej ścieżki dźwiękowej na jej składowe.

Ten rodzaj separacji może w przyszłości być dostępny jako towar konsumencki w inteligentnych telewizorach, które zawierają wysoko zoptymalizowane sieci inferencyjne, chociaż wydaje się prawdopodobne, że wczesne implementacje będą wymagały pewnego poziomu czasu przetwarzania i miejsca na dysku. Samsung już używa lokalnych sieci neuronowych do skalowania, podczas gdy Procesor Cognitive XR Sony, używany w serii Bravia, analizuje i interpretuje ścieżki dźwiękowe na żywo za pomocą lekkich, zintegrowanych AI.

Wezwania do większej kontroli nad miksem ścieżki dźwiękowej powtarzają się okazjonalnie, a większość rozwiązań oferowanych musi radzić sobie z faktem, że ścieżka dźwiękowa została już obniżona zgodnie z obecnymi standardami (i założeniami o tym, co widzowie chcą) w przemyśle filmowym i telewizyjnym.

Jeden widz, zirytowany szokującą dysproporcją poziomów głośności między różnymi elementami ścieżek dźwiękowych, stał się wystarczająco desperacki, aby rozwinąć sprzętowy automatyczny regulator głośności, który może wyrównywać głośność dla filmów i telewizji.

Chociaż inteligentne telewizory oferują różnorodne metody, aby próbować zwiększyć głośność dialogu przeciwko wielkim poziomom głośności dla muzyki, wszystkie one walczą z decyzjami podjętymi w czasie miksowania, i, można powiedzieć, wizjami producentów treści, które chcą, aby widzowie doświadczali ich ścieżek dźwiękowych dokładnie tak, jak zostały one ustawione.

Producent treści wydają się prawdopodobni, aby sprzeciwić się temu potencjalnemu dodatkowi do “kultury remiksu”, ponieważ kilku luminarzy branżowych już wyraziło niezadowolenie z domyślnych algorytmów przetwarzania telewizyjnego, takich jak wyrównywanie ruchu.

https://vimeo.com/634073402

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai