Modely a platformy AI

AudioSep: Oddělte cokoliv, co popíšete

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

LASS nebo Language-queried Audio Source Separation je nový paradigm pro CASA nebo Computational Auditory Scene Analysis, který má za cíl oddělit cílový zvuk z dané směsi audio pomocí přirozeného jazykového dotazu, který poskytuje přirozené, ale škálovatelné rozhraní pro digitální audio úkoly a aplikace. Ačkoli LASS rámce výrazně pokročily v posledních letech co se týče dosažení požadovaného výkonu na specifických audio zdrojích, jako jsou hudební nástroje, nejsou schopny oddělit cílový audio v otevřeném doméně.

AudioSep je základním modelem, který má za cíl vyřešit současné omezení LASS rámců tím, že umožňuje oddělení cílového audio pomocí přirozeného jazykového dotazu. Vývojáři AudioSep rámce trénovali model rozsáhle na široké škále velkých multimodálních datových sad a vyhodnotili výkon rámce na široké škále audio úkolu, včetně oddělení hudebních nástrojů, audio událostí a zlepšení řeči. Počáteční výkon AudioSep splňuje benchmarky, protože prokazuje působivou zero-shot učící schopnost a dodává silný audio oddělovací výkon.

V tomto článku se budeme hlouběji zabývat fungováním AudioSep rámce, protože budeme vyhodnocovat architekturu modelu, datové sady použité pro trénink a hodnocení, a základní koncepty zapojené do fungování AudioSep modelu. Takže začněme se základním úvodem do CASA rámce.

CASA, USS, QSS, LASS Rámce: Základ pro AudioSep

CASA nebo Computational Auditory Scene Analysis rámec je rámec, který používají vývojáři k návrhu strojového poslouchání systémů, které mají schopnost vnímat složitá zvuková prostředí podobně jako lidé vnímají zvuk pomocí svých sluchových systémů. Zvukové oddělení, se zvláštním zaměřením na cílové zvukové oddělení, je základním oblastí výzkumu v rámci CASA rámce, a jeho cílem je vyřešit “cocktail party problém” nebo oddělit reálné zvukové nahrávky z jednotlivých audio zdrojů nebo souborů. Důležitost zvukového oddělení lze připsat především jeho širokým aplikacím, včetně hudebního zdrojového oddělení, audio zdrojového oddělení, zlepšení řeči, identifikace cílového zvuku a mnoha dalších.

Většina práce na zvukovém oddělení provedená v minulosti se týká především oddělení jednoho nebo více audio zdrojů, jako je hudební oddělení nebo řečové oddělení. Nový model nazvaný USS nebo Universal Sound Separation má za cíl oddělit libovolné zvuky v reálných zvukových nahrávkách. Nicméně je to náročná a omezující úloha oddělit každý zvukový zdroj ze zvukové směsi, především kvůli široké škále různých zvukových zdrojů existujících na světě, což je hlavní důvod, proč metoda USS není proveditelná pro reálné aplikace pracující v reálném čase.

Funkční alternativou k metodě USS je QSS nebo Query-based Sound Separation metoda, která má za cíl oddělit jednotlivý nebo cílový zvukový zdroj ze zvukové směsi na základě konkrétní sady dotazů. Díky tomu QSS rámec umožňuje vývojářům a uživatelům extrahovat požadované zdroje audio ze směsi na základě svých požadavků, což činí QSS metodu více praktickým řešením pro digitální reálné aplikace, jako je multimediální obsahové editace nebo audio editace.

Vývojáři nedávno navrhli rozšíření QSS rámce, LASS rámec nebo Language-queried Audio Source Separation rámec, který má za cíl oddělit libovolné zdroje zvuku ze zvukové směsi pomocí přirozeného jazykového popisu cílového audio zdroje. Ačkoli LASS rámec umožňuje uživatelům extrahovat cílové audio zdroje pomocí sady přirozeného jazykového dotazu, může se stát mocným nástrojem se širokými aplikacemi v digitálních audio aplikacích. Při srovnání s tradičními audio- nebo video-dotazovanými metodami nabízí použití přirozeného jazykového dotazu pro zvukové oddělení větší stupeň flexibility a usnadňuje získání dotazové informace.

Původně LASS rámec spoléhá na dohledované učení, ve kterém je model trénován na sadě označených audio-textových párů. Hlavním problémem tohoto přístupu je omezená dostupnost označených a označených audio-textových dat. Aby se snížila závislost LASS rámce na označených audio-textových datech, modely jsou trénovány pomocí multimodálního supervizního učení. Hlavním cílem multimodálního supervizního učení je použít multimodální kontrastní předtrénovací modely, jako je CLIP nebo Contrastive Language Image Pre Training model, jako dotazovací encoder pro rámec.

CLIP model je předtrénován na velké datové sadě obrazového a textového párového údaje pomocí kontrastního učení, což je primární důvod, proč jeho textový encoder učí mapovat textové popisy na sdílený semantický prostor. Výhoda, kterou AudioSep získá pomocí CLIPova textového encoderu, spočívá v tom, že může nyní škálovat nebo trénovat LASS model z neoznačených audio-viditelných dat pomocí vizuálních embeddingů jako alternativy, což umožňuje trénink LASS modelů bez požadavku na označené audio-textová data.

AudioSep: Klíčové komponenty a architektura

Architektura AudioSep rámce se skládá ze dvou klíčových komponent: textového encoderu a separačního modelu.

Textový encoder

AudioSep rámec používá textový encoder z CLIP nebo Contrastive Language Image Pre Training modelu nebo CLAP nebo Contrastive Language Audio Pre Training modelu k extrahování textových embeddingů z přirozeného jazykového dotazu. Vstupní textový dotaz se skládá z posloupnosti “N” tokenů, které jsou poté zpracovány textovým encoderem k extrahování textových embeddingů pro daný vstupní jazykový dotaz.

CLIP model je předtrénován na velké datové sadě obrazového a textového párového údaje pomocí kontrastního učení, což je primární důvod, proč jeho textový encoder učí mapovat textové popisy na sdílený semantický prostor. Výhoda, kterou AudioSep získá pomocí CLIPova textového encoderu, spočívá v tom, že může nyní škálovat nebo trénovat LASS model z neoznačených audio-viditelných dat pomocí vizuálních embeddingů jako alternativy, což umožňuje trénink LASS modelů bez požadavku na označené audio-textová data.

CLAP model funguje podobně jako CLIP model a používá kontrastní učení k propojení audio a jazyka, což umožňuje vývojářům trénovat LASS modely pomocí dat-bohatých modalit a interference s textovými daty v zero-shot nastavení.

Separace modelu

AudioSep rámec používá frekvenční-doménový ResUNet model, který je krmen směsí audio klipů jako separační páteř pro rámec. Rámec funguje tak, že nejprve aplikuje STFT nebo Short-Time Fourier Transform na vlnový signál k extrahování komplexního spektra, magnitudy spektra a fáze X.

ResUNet encoder-decoder síť se skládá z 6 reziduálních bloků, 6 decoder bloků a 4 bottleneck bloků. Spektrum v každém encoder bloku používá 4 reziduální konvoluční bloky ke downsamplingu do bottleneck funkce, zatímco decoder bloky používají 4 reziduální dekonvoluční bloky k získání separačních komponent upsamplingem funkcí. Každý encoder blok a jeho odpovídající decoder blok stanoví skip spojení, které funguje na stejném upsamplingu nebo downsamplingu. Reziduální blok rámce se skládá z 2 Leaky-ReLU aktivních vrstev, 2 batch normalizačních vrstev a 2 CNN vrstev, a navíc rámec také zavádí další reziduální zkrat, který spojuje vstup a výstup každého jednotlivého reziduálního bloku.

V rámci svého rámce AudioSep používá FiLm nebo Feature-wise Linearly modulovanou vrstvu k propojení separačního modelu a textového encoderu po nasazení konvolučních bloků v ResUNet.

Trénink a ztráta

Během tréninku AudioSep modelu vývojáři používají loudness augmentation metodu a trénují AudioSep rámec end-to-end pomocí L1 ztrátové funkce mezi ground truth a předpovězenými vlnovými signály.

Datové sady a benchmarky

Jak je zmíněno v předchozích částech, AudioSep je základním modelem, který má za cíl vyřešit současné závislosti LASS modelů na označených audio-textových párových datech. AudioSep model je trénován na široké škále datových sad, aby mu poskytl multimodální učící schopnosti, a zde je podrobný popis datové sady a benchmarků použitých vývojáři k tréninku AudioSep rámce.

AudioSet

AudioSet je slabě označená velká datové sada skládající se z více než 2 milionů 10-vteřinových audio klipů extrahovaných přímo z YouTube. Každý audio klip v AudioSet datové sadě je kategorizován podle absence nebo přítomnosti zvukových tříd bez konkrétních časových detailů zvukových událostí.

VGGSound

VGGSound datové sada je velká vizuálně-audio datové sada, která podobně jako AudioSet pochází přímo z YouTube, a obsahuje více než 200 000 video klipů, každý z nich má délku 10 sekund. VGGSound datové sada je kategorizována do více než 300 zvukových tříd, včetně lidských zvuků, přírodních zvuků, ptáků a dalších.

AudioCaps

AudioCaps je největší veřejně dostupná audio-popisovací datové sada, která se skládá z více než 50 000 10-vteřinových audio klipů extrahovaných z AudioSet datové sady. Data v AudioCaps jsou rozdělena do tří kategorií: trénovací data, testovací data a validační data, a audio klipy jsou lidsky označeny přirozenými jazykovými popisy pomocí Amazon (AMZN ) Mechanical Turk platformy.

ClothoV2

ClothoV2 je audio-popisovací datové sada, která se skládá z klipů z FreeSound platformy, a podobně jako AudioCaps, každý audio klip je lidsky označen přirozenými jazykovými popisy pomocí Amazon Mechanical Turk platformy.

WavCaps

WavCaps je slabě označená velká datové sada skládající se z více než 400 000 audio klipů s popisy, a celková doba přehrávání se blíží 7568 hodinám trénovacích dat. Audio klipy v WavCaps datové sadě pocházejí z široké škály audio zdrojů, včetně BBC Sound Effects, AudioSet, FreeSound, SoundBible a dalších.

Tréninkové detaily

Během tréninkové fáze AudioSep modelu vývojáři náhodně vyberou dva audio segmenty z dvou různých audio klipů z trénovací datové sady a poté je smíchají dohromady, aby vytvořili trénovací směs, kde délka každého audio segmentu je asi 5 sekund.

Model poté extrahuje komplexní spektrum z vlnového signálu pomocí Hann okna o velikosti 1024 s hop velikostí 320. Model poté používá textový encoder z CLIP/CLAP modelů k extrahování textových embeddingů s textovou supervizí jako výchozí konfigurací pro AudioSep.

Vyhodnocení výsledků

Na viditelných datech

Následující obrázek porovnává výkon AudioSep rámce na viditelných datech během tréninkové fáze, včetně trénovací datové sady. Níže uvedený obrázek reprezentuje benchmark vyhodnocení výsledků AudioSep rámce ve srovnání s bazálními systémy, včetně Speech Enhancement modelů, LASS a CLIP.

Jak je vidět na obrázku, AudioSep rámec funguje dobře, když používá audio popisy nebo textové štítky jako vstupní dotazy, a výsledky ukazují lepší výkon AudioSep rámce ve srovnání s předchozími benchmark LASS a audio-dotazovanými zvukovými separačními modely.

Na neviditelných datech

Aby vyhodnotili výkon AudioSep v zero-shot nastavení, vývojáři pokračovali ve vyhodnocování výkonu na neviditelných datech, a AudioSep rámec dodává působivý separační výkon v zero-shot nastavení, a výsledky jsou zobrazeny na následujícím obrázku.

Dále je zobrazen výsledek vyhodnocení AudioSep modelu proti Voicebank-Demand speech enhancement.

Vyhodnocení AudioSep rámce ukazuje silný a požadovaný výkon na neviditelných datech v zero-shot nastavení, a tím otevírá cestu pro provádění zvukových operací na nových datech.

Vizualizace separačních výsledků

Následující obrázek ukazuje výsledky získané, když vývojáři použili AudioSep-CLAP rámec k provedení vizualizací spektrogramů pro ground-truth cílové audio zdroje, audio směsi a separované audio zdroje pomocí textových dotazů různých audio nebo zvuků.

Srovnání textových dotazů

Vývojáři vyhodnotili výkon AudioSep-CLAP a AudioSep-CLIP na AudioCaps Mini, a vývojáři použili AudioSet událostní štítky, AudioCaps popisy a re-označené přirozené jazykové popisy k vyšetření efektů různých dotazů, a níže uvedený obrázek ukazuje příklad AudioCaps Mini v akci.

Závěr

AudioSep je základním modelem, který je vyvinut s cílem být otevřeným doménovým univerzálním zvukovým separačním rámcem, který používá přirozené jazykové popisy pro audio separaci. Jak je vidět během vyhodnocení, AudioSep rámec je schopen provádět zero-shot a nesupervizované učení bezproblémově pomocí audio popisu nebo textových štítků jako vstupních dotazů. Výsledky a vyhodnocení výkonu AudioSep ukazují silný výkon, který předčí současné stavové zvukové separační rámce, jako je LASS, a může být dostatečně schopný vyřešit současné omezení populárních zvukových separačních rámců.

Inženýr z povolání, spisovatel ze srdce. Kunal je technický spisovatel s hlubokou láskou a porozuměním pro AI a ML, který se věnuje zjednodušování složitých konceptů v těchto oblastech prostřednictvím svých přitažlivých a informačních dokumentací.