Andersonův úhel
Výzkum umělé inteligence předpokládá samostatné ovládání hlasitosti pro dialog, hudbu a zvukové efekty

Nová výzkumná spolupráce vedená Mitsubishi zkoumá možnost extrahování tří samostatných zvukových stop z původního audiozdroje, rozdělení audiové stopáže na řeč, hudbu a zvukové efekty (tj. ambientní hluk).
Pokud jde o post-facto zpracování, nabízí potenciál pro pozdější generace multimediálních přehrávacích platforem, včetně spotřebitelských zařízení, aby nabízely tříbodové ovládání hlasitosti, umožňující uživateli zvýšit hlasitost dialogu nebo snížit hlasitost soundtracku.
V krátkém klipu níže z doprovodného videa pro výzkum (viz konec článku pro kompletní video), vidíme různé aspekty soundtracku, které jsou zdůrazněny, když uživatel táhne ovladač přes trojúhelník s každou ze tří audio komponent v jednom rohu:
Krátký klip z videa doprovázejícího článek (viz vložené video na konci článku). Když uživatel táhne kurzor směrem k jedné ze tří extrahovaných složek v trojúhelníkovém rozhraní (vpravo), audio zdůrazňuje tu část tripartitní soundtracku. Ačkoli delší video uvádí několik dalších příkladů na YouTube, tyto目前 nejsou k dispozici. Source: https://vimeo.com/634073402
Článek článku se jmenuje Problém koktejlové vidličky: Třístopá audio separace pro soundtracky z reálného světa a pochází z výzkumníků z Mitsubishi Electric Research Laboratories (MERL) v Cambridge, MA, a z oddělení inteligentních systémů na Univerzitě v Illinois.
Oddělování aspektů soundtracku
Výzkumníci označili tuto výzvu jako “Problém koktejlové party”, protože se jedná o izolování silně propletených prvků soundtracku, což vytváří mapu, která připomíná vidličku (viz obrázek níže). V praxi mohou multi-kanálové (tj. stereo a více) soundtracky mít různé druhy obsahu, jako je dialog, hudba a ambience, zejména proto, že dialog tenduje k dominanci středního kanálu v mixech Dolby 5.1. V současné době se však velmi aktivní výzkumné pole audio separace soustředí na zachycení těchto stop z jediné, pevné soundtracku, stejně jako aktuální výzkum.

Koktejlová vidlička – odvození tří samostatných soundtracků z jednoho spojeného a jediného soundtracku. Source: https://arxiv.org/pdf/2110.09958.pdf
Recentní výzkum se soustředil na extrahování řeči v různých prostředích, často za účelem odstranění šumu z řečového audio pro pozdější interakci s systémy zpracování přirozeného jazyka (NLP), ale také na izolaci archivních zpěvů, buď pro vytvoření syntetických verzí skutečných (i mrtvých) zpěváků, nebo pro usnadnění karaoke stylu hudby.
Datová sada pro každou složku
Dosud nebyla věnována dostatečná pozornost použití této technologie AI pro poskytnutí uživatelům větší kontroly nad mixem soundtracku. Proto výzkumníci formalizovali problém a vytvořili novou datovou sadu jako pomoc pro pokračující výzkum separace soundtracků s více typy, jakož i testování jej na různých existujících audio separačních rámcích.
Nová datová sada, kterou autoři vytvořili, se jmenuje Divide and Remaster (DnR), a je odvozena z předchozích datových sad LibriSpeech, Free Music Archive a Freesound Dataset 50k (FSD50K). Pro ty, kteří chtějí pracovat s DnR od začátku, musí být datová sada rekonstruována ze tří zdrojů; jinak bude brzy k dispozici na Zenodo, tvrdí autoři. Nicméně, v době psaní tohoto článku, poskytnutý GitHub odkaz pro zdroj extrakčních utilit není v současné době aktivní, takže ti, kteří jsou intéressovaní, mohou muset počkat.
Výzkumníci zjistili, že architektura CrossNet un-mix (XUMX) navržená Sony v květnu funguje zvláště dobře s DnR.

Sony’s CrossNet architektura.
Autoři tvrdí, že jejich modely extrakce strojového učení fungují dobře na soundtracky z YouTube, ačkoli hodnocení prezentovaná v článku jsou založena na syntetických datech a dodaný hlavní podpůrný video (vložený níže) je v současné době jediné, které se zdá být k dispozici.
Tři datové sady použité každá tvoří sbírku druhu výstupu, který je třeba oddělit od soundtracku: FSD50K je obsazený se zvukovými efekty a obsahuje 50 000 44,1 kHz mono audio klipů označených 200 třídami z Google AudioSet ontologie; Free Music Archive obsahuje 100 000 stereo písní pokrývajících 161 hudebních žánrů, ačkoli autoři použili podmnožinu obsahující 25 000 písní, pro shodu s FSD50K; a LibriSpeech poskytuje DnR 100 hodin audio knihovních vzorků jako 44,1kHz mp3 audio soubory.
Budoucí práce
Autoři předpokládají další práci na datové sadě a kombinaci samostatných modelů vyvinutých pro další výzkum do rámců rozpoznávání řeči a klasifikace zvuků, s funkcí automatické generace titulků pro řeč a ne-řeč zvuky. Zamýšlejí také vyhodnotit možnosti remixování přístupů, které mohou snížit percepční artefakty, což zůstává centrálním problémem při rozdělování spojeného audio soundtracku na jeho složky.
Tento druh separace by mohl být v budoucnu k dispozici jako spotřebitelský statek v chytrých televizích, které zahrnují vysoce optimalizované inferenční sítě, ačkoli se zdá, že rané implementace by vyžadovaly určitou úroveň předzpracování času a úložného prostoru. Samsung již používá lokální neuronové sítě pro upscale, zatímco Sony’s Cognitive Processor XR, použitý v řadě Bravia, analyzuje a reinterpretuje soundtracky v reálném čase prostřednictvím lehkých integrovaných AI.
Volání po větší kontrole nad mixem soundtracku se opakují, a většina řešení musí řešit fakt, že soundtrack byl již smíchán v souladu se současnými standardy (a předpoklady o tom, co diváci chtějí) ve filmovém a televizním průmyslu.
Jeden divák, který byl znepokojen šokujícím rozdílem úrovní hlasitosti mezi různými prvky soundtracku, se stal natolik zoufalým, že vyvinul hardwarový automatický regulátor hlasitosti, který je schopen vyrovnat hlasitost pro filmy a TV.
Chytré televizory nabízejí různé metody pro pokus o zvýšení hlasitosti dialogu proti grandiózním úrovním hlasitosti pro hudbu, ale všechny bojují proti rozhodnutím učiněným v době mixáže, a arguable, vize tvůrců obsahu, kteří chtějí, aby diváci zažili jejich soundtracky přesně tak, jak byly nastaveny.
Obsah tvůrci se pravděpodobně budou bránit proti tomuto potenciálnímu přidání do “remix kultury”, protože několik průmyslových osobností již vyjádřilo nespokojenost s výchozími post-procesními algoritmy TV, jako je motion smoothing.
https://vimeo.com/634073402












