Modele și platforme AI

AudioSep: Separați orice descrieți

mm
Adaugă Unite.AI la sursele tale preferate pe Google

LASS sau Separarea Surselor Audio pe baza Limbajului Natural este noul paradigme pentru CASA sau Analiza Auditory Scene Computatională, care are ca scop separarea unui sunet țintă dintr-un amestec de audio folosind o interogare în limbaj natural care oferă o interfață naturală și scalabilă pentru sarcinile și aplicațiile audio digitale. Deși cadrele LASS au evoluat semnificativ în ultimii ani în ceea ce privește realizarea performanței dorite pe surse audio specifice, cum ar fi instrumentele muzicale, ele nu sunt capabile să separe sunetul țintă în domeniul deschis.

AudioSep este un model fundamental care are ca scop rezolvarea limitărilor actuale ale cadrelor LASS, permițând separarea sunetului țintă folosind interogări în limbaj natural. Dezvoltatorii modelului AudioSep au antrenat modelul pe o varietate largă de seturi de date multimodale de mari dimensiuni și au evaluat performanța cadrelor pe o gamă largă de sarcini audio, incluzând separarea instrumentelor muzicale, separarea evenimentelor audio și îmbunătățirea vorbirii, printre altele. Performanța inițială a AudioSep îndeplinește benchmark-urile, demonstrând capacități impresionante de învățare zero-shot și o puternică separare a sunetului.

În acest articol, vom face o analiză mai profundă a funcționării modelului AudioSep, evaluând arhitectura modelului, seturile de date utilizate pentru antrenare și evaluare, și conceptele esențiale implicate în funcționarea modelului AudioSep. Să începem cu o introducere de bază în cadrul CASA.

CASA, USS, QSS, LASS: Fundamentul pentru AudioSep

CASA sau Analiza Auditory Scene Computatională este un cadru utilizat de dezvoltatori pentru a proiecta sisteme de ascultare care pot percepe medii sonore complexe într-un mod similar cu cel în care oamenii percep sunetul folosind sistemele auditive. Separarea sunetului, cu un accent special pe separarea sunetului țintă, este o zonă fundamentală de cercetare în cadrul CASA, și are ca scop rezolvarea “problemei cocktail party” sau separarea înregistrărilor audio reale de la surse audio individuale.

Majoritatea lucrărilor de separare a sunetului efectuate în trecut se concentrează în principal pe separarea uneia sau a mai multor surse audio, cum ar fi separarea muzicii sau a vorbirii. Un nou model, denumit USS sau Universal Sound Separation, are ca scop separarea sunetelor arbitrare din înregistrări audio reale. Cu toate acestea, este o sarcină provocatoare și restrictivă să separe toate sursele de sunet dintr-un amestec de audio, în principal din cauza gamei largi de surse de sunet care există în lume, ceea ce face ca metoda USS să nu fie fezabilă pentru aplicații reale care funcționează în timp real.

O alternativă fezabilă la metoda USS este metoda QSS sau Query-based Sound Separation, care are ca scop separarea unei surse de sunet individuale sau țintă din amestecul de audio pe baza unei interogări specifice. Acest lucru permite dezvoltatorilor și utilizatorilor să extragă sursele dorite de audio din amestec pe baza nevoilor lor, făcând metoda QSS o soluție mai practică pentru aplicații digitale reale, cum ar fi editarea conținutului multimedia sau editarea audio.

În plus, dezvoltatorii au propus recent o extensie a cadrului QSS, cadrul LASS sau Language-queried Audio Source Separation, care are ca scop separarea surselor arbitrare de sunet dintr-un amestec de audio folosind descrieri în limbaj natural ale sursei de sunet țintă. Deoarece cadrul LASS permite utilizatorilor să extragă sursele de sunet țintă folosind o interogare în limbaj natural, poate deveni un instrument puternic cu aplicații largi în aplicații audio digitale.

Inițial, cadrul LASS se bazează pe învățarea supervizată, în care modelul este antrenat pe un set de date audio-text etichetate. Cu toate acestea, problema principală cu această abordare este disponibilitatea limitată a datelor audio-text etichetate. Pentru a reduce dependența cadrului LASS de date audio-text etichetate, modelele sunt antrenate folosind abordarea de învățare multimodală. Scopul principal al utilizării unei abordări de învățare multimodală este de a utiliza modele de pre-antrenare contrastivă multimodală, cum ar fi modelul CLIP sau Contrastive Language Image Pre-training, ca encoder de interogare pentru cadru.

Pentru a rezolva limitările actuale ale cadrelor LASS, dezvoltatorii au introdus AudioSep, un model fundamental care are ca scop separarea sunetului dintr-un amestec de audio folosind descrieri în limbaj natural. Focalizarea actuală pentru AudioSep este de a dezvolta un model de separare a sunetului pre-antrenat care să utilizeze seturi de date multimodale de mari dimensiuni pentru a permite generalizarea modelelor LASS în aplicații deschise.

AudioSep: Componente cheie și Arhitectură

Arhitectura cadrului AudioSep cuprinde două componente cheie: un encoder de text și un model de separare.

Encoderul de text

Cadrul AudioSep utilizează un encoder de text al modelului CLIP sau Contrastive Language Image Pre-training sau al modelului CLAP sau Contrastive Language Audio Pre-training pentru a extrage încorporări de text dintr-o interogare în limbaj natural. Interogarea de text de intrare constă dintr-o secvență de “N” tokeni care este apoi procesată de encoderul de text pentru a extrage încorporările de text pentru interogarea de limbaj natural dată.

Modelul CLIP este pre-antrenat pe un set de date de mari dimensiuni de perechi de imagini și text folosind învățarea contrastivă, ceea ce face ca encoderul de text să învețe o mapare a descrierilor textuale pe spațiul semantic care este împărtășit și de reprezentările vizuale. Avantajul pe care AudioSep îl obține prin utilizarea encoderului de text al modelului CLIP este că poate scala sau antrena modelul LASS folosind date neetichetate audio-vizuale, permițând antrenarea modelelor LASS fără necesitatea datelor audio-text etichetate.

Modelul CLAP funcționează similar cu modelul CLIP și utilizează un obiectiv de învățare contrastivă pentru a conecta encoderul de text și encoderul de audio, permițând dezvoltatorilor să antreneze modelele LASS folosind date bogate în modalități și să interfereze cu datele textuale într-un mediu zero-shot.

Modelul de separare

Cadrul AudioSep utilizează un model ResUNet în domeniul frecvenței care primește un amestec de clipuri audio ca spatele de separare pentru cadru. Modelul funcționează prin aplicarea unei transformări Fourier cu timp scurt (STFT) pe semnalul de undă pentru a extrage un spectrogram complex, un spectrogram de magnitudine și faza lui X.

Modelul ResUNet constă din 6 blocuri reziduale, 6 blocuri decodificatoare și 4 blocuri de gât. Spectrogramele din fiecare bloc de encoder utilizează 4 blocuri convoluționale reziduale pentru a coborî spectrograma într-un bloc de caracteristici, în timp ce blocurile decodificatoare utilizează 4 blocuri convoluționale reziduale pentru a obține componentele separate prin upsampling-ul caracteristicilor. Fiecare bloc de encoder și blocul decodificator corespunzător stabilesc o conexiune de salt care funcționează la aceeași rată de upsampling sau downsampling.

În cadrul său, AudioSep utilizează un strat FiLm sau Feature-wise Linearly modulated pentru a conecta modelul de separare și encoderul de text după implementarea blocurilor convoluționale în ResUNet.

Antrenare și Pierdere

În timpul antrenării modelului AudioSep, dezvoltatorii utilizează metoda de augmentare a zgomotului și antrenează cadrul AudioSep de la capăt la coadă folosind o funcție de pierdere L1 între undele de sunet reale și prezise.

Seturi de date și Benchmark-uri

Așa cum s-a menționat în secțiunile anterioare, AudioSep este un model fundamental care are ca scop rezolvarea dependenței actuale a modelelor LASS de seturi de date audio-text etichetate. Modelul AudioSep este antrenat pe o varietate de seturi de date pentru a-i oferi capacități de învățare multimodală, și iată o descriere detaliată a setului de date și a benchmark-urilor utilizate de dezvoltatori pentru a antrena cadrul AudioSep.

AudioSet

AudioSet este un set de date audio slab etichetat de mari dimensiuni care cuprinde peste 2 milioane de clipuri audio de 10 secunde extrase direct din YouTube. Fiecare clip audio din setul de date AudioSet este categorizat de prezența sau absența claselor de sunet fără detalii specifice despre timpul evenimentelor sonore.

VGGSound

Setul de date VGGSound este un set de date vizual-audio de mari dimensiuni care, la fel ca AudioSet, a fost extras direct din YouTube și conține peste 200.000 de clipuri video, fiecare cu o lungime de 10 secunde. Setul de date VGGSound este categorizat în peste 300 de clase de sunet, incluzând sunete umane, sunete naturale, sunete de păsări și multe altele.

AudioCaps

AudioCaps este cel mai mare set de date de captionare audio disponibil public și cuprinde peste 50.000 de clipuri audio de 10 secunde extrase din setul de date AudioSet. Datele din AudioCaps sunt împărțite în trei categorii: date de antrenare, date de testare și date de validare, și clipurile audio sunt etichetate cu descrieri în limbaj natural folosind platforma Amazon (AMZN ) Mechanical Turk.

ClothoV2

Setul de date ClothoV2 este un set de date de captionare audio care cuprinde clipuri extrase din platforma FreeSound, și, la fel ca AudioCaps, fiecare clip audio este etichetat cu descrieri în limbaj natural folosind platforma Amazon Mechanical Turk.

WavCaps

La fel ca AudioSet, WavCaps este un set de date audio slab etichetat de mari dimensiuni care cuprinde peste 400.000 de clipuri audio cu captionări, și un timp total de aproximativ 7568 de ore de date de antrenare.

Detalii de antrenare

În timpul fazei de antrenare, modelul AudioSep extrage aleatoriu două segmente audio din două clipuri audio diferite din setul de date de antrenare și le amestecă pentru a crea un amestec de antrenare, unde lungimea fiecărui segment audio este de aproximativ 5 secunde.

Modelul extrage apoi spectrograma complexă din semnalul de undă folosind o fereastră Hann de dimensiune 1024 cu o mărime de salt de 320. Modelul utilizează apoi encoderul de text al modelului CLIP/CLAP pentru a extrage încorporările textuale cu supraveghere text.

Rezultate de evaluare

Pe seturi de date văzute

Următoarea figură compară performanța cadrului AudioSep pe seturi de date văzute în timpul fazei de antrenare, incluzând seturile de date de antrenare. Figura de mai jos reprezintă rezultatele evaluării cadrului AudioSep în comparație cu sistemele de bază, incluzând modelele de îmbunătățire a vorbirii, LASS și CLIP.

Așa cum se poate vedea în figură, cadrul AudioSep funcționează bine atunci când se utilizează captionări audio sau etichete text ca interogări de intrare, și rezultatele indică o performanță superioară a cadrului AudioSep în comparație cu modelele anterioare de separare a sunetului și a sursei audio.

Pe seturi de date nevăzute

Pentru a evalua performanța cadrului AudioSep într-un mediu zero-shot, dezvoltatorii au continuat să evalueze performanța pe seturi de date nevăzute, și cadrul AudioSep oferă o separare impresionantă a sunetului într-un mediu zero-shot, și rezultatele sunt afișate în figura de mai jos.

În plus, imaginea de mai jos arată rezultatele evaluării cadrului AudioSep împotriva îmbunătățirii vorbirii Voicebank-Demand.

Evaluarea cadrului AudioSep indică o performanță puternică și dorită pe seturi de date nevăzute într-un mediu zero-shot, și astfel face posibilă efectuarea de sarcini de operare a sunetului pe noi distribuții de date.

Vizualizarea rezultatelor de separare

Figura de mai jos arată rezultatele obținute atunci când dezvoltatorii au utilizat cadrul AudioSep-CLAP pentru a efectua vizualizări ale spectrogramelor pentru surse de sunet țintă reale, amestecuri audio și surse de sunet separate folosind interogări textuale diverse.

Compararea interogărilor textuale

Dezvoltatorii evaluează performanța cadrului AudioSep-CLAP și AudioSep-CLIP pe setul de date AudioCaps Mini, și utilizează etichetele evenimentelor AudioSet, captionările AudioCaps și descrierile naturale re-annotate pentru a examina efectele diferitelor interogări, și figura de mai jos arată un exemplu al setului de date AudioCaps Mini.

Concluzie

AudioSep este un model fundamental care are ca scop să fie un cadru de separare universală a sunetului în domeniul deschis care utilizează descrieri în limbaj natural pentru separarea sunetului. Așa cum s-a observat în timpul evaluării, cadrul AudioSep este capabil să efectueze învățare zero-shot și nesupervizată fără probleme, folosind captionări audio sau etichete text ca interogări. Rezultatele și performanța evaluării cadrului AudioSep indică o performanță puternică care depășește cadrele actuale de separare a sunetului, cum ar fi LASS, și ar putea fi capabil să rezolve limitările actuale ale cadrelor de separare a sunetului populare.

"Un inginer de profesie, un scriitor din inimă". Kunal este un scriitor tehnic cu o dragoste și o înțelegere profundă a inteligenței artificiale și a învățării automate, dedicat simplificării conceptelor complexe din aceste domenii prin documentația sa captivantă și informativă.