AI-modeller og plattformer
AudioSep : Separer hva du beskriver

LASS eller Language-queried Audio Source Separation er det nye paradigmet for CASA eller Computational Auditory Scene Analysis som har som mål å separere en mållyd fra en gitt blanding av lyd ved hjelp av en naturlig språklig forespørsel som gir en naturlig, men skalerbar grensesnitt for digitale lydoppgaver og -applikasjoner. Selv om LASS-rammeverkene har gjort betydelige fremgang i de siste årene når det gjelder å oppnå ønsket ytelse på bestemte lydkilder som musikkinstrumenter, er de ikke i stand til å separere mållyden i åpen domene.
AudioSep, er et grunnleggende modell som har som mål å løse de nåværende begrensningene i LASS-rammeverkene ved å aktivere mållydseparasjon ved hjelp av naturlig språklig forespørsel. Utviklerne av AudioSep-rammeverket har trent modellen omfattende på en rekke store multimodale datasamlinger, og har evaluert ytelsen til rammeverket på en rekke lydoppgaver, inkludert musikkinstrumentseparasjon, lydhendelsesseparasjon og taleforbedring blant mange andre. Den innledende ytelsen til AudioSep tilfredsstiller benchmarkene, og viser imponerende nullskuddlæringskapasiteter og leverer sterk lydseparasjonsytelse.
I denne artikkelen vil vi dykke dyptere inn i hvordan AudioSep-rammeverket fungerer, og vi vil evaluere arkitekturen til modellen, datasamlingene som brukes til trening og evaluering, og de essensielle konseptene som er involvert i AudioSep-modellens funksjon. La oss begynne med en grundig introduksjon til CASA-rammeverket.
CASA, USS, QSS, LASS-rammeverk : Grunnlaget for AudioSep
CASA eller Computational Auditory Scene Analysis er et rammeverk som brukes av utviklere til å designe maskinlyttingssystemer som har evnen til å oppfatte komplekse lydmiljøer på en måte som ligner på hvordan mennesker oppfatter lyd ved hjelp av deres auditive systemer. Lydseparasjon, med spesiell fokus på mållydseparasjon, er et grunnleggende forskningsområde innenfor CASA-rammeverket, og det har som mål å løse “cocktailparty-problemet” eller å separere virkelige lydopptak fra enkeltlydkilder eller -filer. Betoningen av lydseparasjon kan tilskrives hovedsakelig dens vidtrevende anvendelser, inkludert musikklydseparasjon, lydkilde-separasjon, taleforbedring, mållydidentifikasjon og mye mer.
Det meste av arbeidet med lydseparasjon som er gjort i fortiden dreier seg hovedsakelig om separasjon av en eller flere lydkilder, som musikkseparasjon eller taleseparasjon. En ny modell som kalles USS eller Universal Sound Separation har som mål å separere vilkårlige lyder i virkelige lydopptak. Imidlertid er det en utfordrende og begrensende oppgave å separere hver lydkilde fra en lydblanding, hovedsakelig på grunn av den vide rekken av forskjellige lydkilder som eksisterer i verden, som er den viktigste grunnen til at USS-metoden ikke er gjennomførbar for virkelige anvendelser som fungerer i sanntid.
En gjennomførbar alternativ til USS-metoden er QSS eller Query-basert Lydseparasjon, som har som mål å separere en enkelt eller mållydkilde fra lydblandingen basert på en bestemt sett med forespørsler. Takket være dette, tillater QSS-rammeverket utviklere og brukere å trekke ut de ønskede lydkildene fra blandingen basert på deres krav, noe som gjør QSS-metoden til en mer praktisk løsning for digitale virkelige anvendelser som multimediaredigering eller lydredigering.
Videre har utviklere nylig foreslått en utvidelse av QSS-rammeverket, LASS-rammeverket eller Language-queried Audio Source Separation, som har som mål å separere vilkårlige lydkilder fra en lydblanding ved å bruke naturlig språklig beskrivelse av mållydkilden. Ettersom LASS-rammeverket tillater brukere å trekke ut mållydkildene ved hjelp av en sett med naturlig språklig instruksjoner, kan det bli et kraftig verktøy med vidtrevende anvendelser i digitale lydanvendelser. Når det sammenlignes med tradisjonelle lydforespørsler eller visuelt forespørsler, tilbyr bruk av naturlig språklig instruksjoner for lydseparasjon en større grad av fordeler, da det legger til fleksibilitet og gjør innhenting av forespørselsinformasjon mye enklere og mer praktisk. Videre, når det sammenlignes med etikettforespørsel-basert lydseparasjonsrammeverk som bruker en forhåndsdefinert sett med instruksjoner eller forespørsler, begrenser ikke LASS-rammeverket antallet inndataforespørsler, og har fleksibiliteten til å generaliseres til åpen domene uten problemer.
Opprinnelig baserer LASS-rammeverket seg på overvåket læring, hvor modellen trenes på en sett med merket lyd-tekst-par-data. Imidlertid er hovedproblemet med denne tilnærmingen den begrensede tilgjengeligheten av annotert og merket lyd-tekst-data. For å redusere avhengigheten av LASS-rammeverket til annotert lyd-tekst-par-data, trenes modellene ved hjelp av multimodal overvåket læringstilnærming. Hovedmålet med å bruke en multimodal overvåket tilnærming er å bruke multimodal kontrastiv forhånds-treningmodeller som CLIP eller Contrastive Language Image Pre-training-modellen som forespørselskoderen for rammeverket. Ettersom CLIP-modellen har evnen til å justere tekst-embeddings med andre modaliteter som lyd eller visuell, tillater det utviklere å trene LASS-modellene ved hjelp av data-rike modaliteter, og tillater interferensen med tekstdata i en nullskudd-innstilling. De nåværende LASS-rammeverkene bruker imidlertid små-skala datasamlinger for trening, og anvendelser av LASS-rammeverket over hundrevis av potensielle domener er ennå ikke utforsket.
For å løse de nåværende begrensningene som LASS-rammeverkene møter, har utviklere introdusert AudioSep, et grunnleggende modell som har som mål å separere lyd fra en lydblanding ved hjelp av naturlig språklig beskrivelse. Fokus for AudioSep er å utvikle en forhånds-trent lydseparasjonsmodell som utnytter eksisterende store multimodale datasamlinger for å aktivere generalisering av LASS-modeller i åpen domene. For å sammenfatte, er AudioSep-modellen: “Et grunnleggende modell for universell lydseparasjon i åpen domene ved hjelp av naturlig språklig forespørsel eller beskrivelse, trenet på store multimodale datasamlinger”.
AudioSep : Nøkkelkomponenter og Arkitektur
Arkitekturen til AudioSep-rammeverket består av to nøkkelkomponenter: en tekstkoderer og en separasjonsmodell.
Tekstkodereren
AudioSep-rammeverket bruker en tekstkoderer fra CLIP eller Contrastive Language Image Pre-training-modellen eller CLAP eller Contrastive Language Audio Pre-training-modellen for å trekke ut tekst-embeddings fra en naturlig språklig forespørsel. Inndata-tekstforespørselen består av en sekvens av “N” token som deretter prosesseres av tekstkodereren for å trekke ut tekst-embeddings for den gitte inndata-språkforespørselen. Tekstkodereren bruker en stabel av transformer-blokker for å kode inndata-teksttoken, og utgangsrepresentasjonene samles etter at de er sendt gjennom transformer-lagene, noe som resulterer i utviklingen av en D-dimensjonal vektorrepresentasjon med fast lengde, hvor D korresponderer med dimensjonene til CLAP eller CLIP-modellene, mens tekstkodereren er frosset under treningperioden.
CLIP-modellen er forhånds-trent på en stor-skala datasamling av bilde-tekst-par-data ved hjelp av kontrastiv læring, som er hovedgrunnen til at dens tekstkoderer lærer å kartlegge tekstlige beskrivelser på det semantiske rommet som også deles av visuelle representasjoner. Fordelen AudioSep får ved å bruke CLIPs tekstkoderer er at det kan nå skaleres eller trenes LASS-modellen fra ubeskrivende audio-visuelt data ved hjelp av visuelle embeddings som en alternativ, noe som aktiverer trening av LASS-modeller uten krav til annotert eller merket lyd-tekst-data.
CLAP-modellen fungerer på samme måte som CLIP-modellen og bruker en tekst- og en audio-koderer for å koble lyd og språk, noe som bringer tekst- og audio-beskrivelser på et audio-tekst latent rom sammen.
Separasjonsmodell
AudioSep-rammeverket bruker en frekvens-domene ResUNet-modell som mates en blanding av lydklipp som separasjonsryggraden for rammeverket. Rammeverket fungerer ved å først anvende en STFT eller en Short-Time Fourier Transform på waveformen for å trekke ut et kompleks spektrum, magnitude-spektrum og fase av X. Modellen følger deretter samme innstilling og konstruerer en encoder-decoder-nettverk for å prosessere magnitude-spektrum.
ResUNet-encoder-decoder-nettverket består av 6 residual-blokker, 6 decoder-blokker og 4 bottleneck-blokker. Spektrumet i hver encoder-blokk bruker 4 residual-konvolusjonsblokker for å nedsample seg selv til en bottleneck-egenskap, mens decoder-blokkene bruker 4 residual-dekonvolusjonsblokker for å få separasjonskomponenter ved å oppsample egenskapene. Deretter etablerer hver av encoder-blokkene og deres korresponderende decoder-blokker en hoppeforbindelse som opererer på samme oppsamplings- eller nedsamplingsrate. Residual-blokkene består av 2 Leaky-ReLU-aktiveringslag, 2 batch-normaliseringslag og 2 CNN-lag, og videre introduserer rammeverket en ekstra residual-gjennomgang som kobler inndata og utdata av hver enkelt residual-blokk. ResUNet-modellen tar det komplekse spektrum X som inndata og produserer magnitude-masken M som utdata med fase-residuum som er betinget av tekst-embeddings som kontrollerer størrelsen på skala og rotasjon av vinkelen til spektrum. Den separerte komplekse spektrum kan deretter trekkes ut ved å multiplisere den forutsagte magnitude-masken og fase-residuum med STFT (Short-Time Fourier Transform) av blandingen.

I sitt rammeverk bruker AudioSep en FiLm eller Feature-wise Linearly modulert lag for å koble separasjonsmodellen og tekstkodereren etter deployering av konvolusjonsblokkene i ResUNet.
Trening og Tap
Under trening av AudioSep-modellen, bruker utviklerne støyforsterkningsmetoden og trener AudioSep-rammeverket fra ende til ende ved hjelp av en L1-tap-funksjon mellom grunn-sannheten og forutsagte waveformene.
Datasett og Benchmark
Som nevnt i tidligere avsnitt, er AudioSep et grunnleggende modell som har som mål å løse den nåværende avhengigheten av LASS-modeller til annotert lyd-tekst-par-data. AudioSep-modellen er trenet på en rekke datasamlinger for å utruste den med multimodale læringskapasiteter, og her er en detaljert beskrivelse av datasamlingen og benchmarkene som brukes av utviklerne til å trene AudioSep-rammeverket.
AudioSet
AudioSet er en svakt-merket stor-skala lyddatasamling som består av over 2 millioner 10-sekunders lydklipp som er trukket direkte fra YouTube. Hver lydklipp i AudioSet-datasamlingen er kategorisert av fraværet eller nærværet av lydklasser uten spesifikke tidspunkt for lydhendelsene. AudioSet-datasamlingen har over 500 distinkte lydklasser, inkludert naturlige lyder, menneskelige lyder, kjøretøylyder og mye mer.
VGGSound
VGGSound-datasamlingen er en stor-skala visuell-lyddatasamling som, lik AudioSet, er trukket direkte fra YouTube, og den inneholder over 200 000 video-klipper, hver med en varighet på 10 sekunder. VGGSound-datasamlingen er kategorisert i over 300 lydklasser, inkludert menneskelige lyder, naturlige lyder, fuglelyder og mye mer. Bruken av VGGSound-datasamlingen sikrer at objektet som produserer mållyden også er beskrevet i den korresponderende visuelle klippen.
AudioCaps
AudioCaps er den største offentlig tilgjengelige lyd-beskrivelsesdatasamlingen, og den består av over 50 000 10-sekunders lydklipp som er trukket fra AudioSet-datasamlingen. Data i AudioCaps er delt inn i tre kategorier: treningdata, testdata og valideringsdata, og lydklippene er menneskelige-annotert med naturlig språklig beskrivelse ved hjelp av Amazon (AMZN ) Mechanical Turk-plattformen. Det er verdt å merke seg at hver lydklipp i treningssamlingen har en enkelt beskrivelse, mens data i test- og valideringssamlingene hver har 5 grunn-sannhetsbeskrivelser.
ClothoV2
ClothoV2 er en lyd-beskrivelsesdatasamling som består av klipp trukket fra FreeSound-plattformen, og, lik AudioCaps, er hver lydklipp menneskelige-annotert med naturlig språklig beskrivelse ved hjelp av Amazon Mechanical Turk-plattformen.
WavCaps
Lik AudioSet, er WavCaps en svakt-merket stor-skala lyddatasamling som består av over 400 000 lydklipp med beskrivelser, og en total varighet på omtrent 7568 timer med treningdata. Lydklippene i WavCaps-datasamlingen er trukket fra en rekke lydkilder, inkludert BBC Sound Effects, AudioSet, FreeSound, SoundBible og mye mer.

Treningdetaljer
Under trening, sampler AudioSep-modellen tilfeldig to lydsegmenter fra to forskjellige lydklipp fra treningssamlingen, og deretter blander dem sammen for å skape en treningssamling hvor lengden av hver lydsegment er omtrent 5 sekunder. Modellen trekker deretter ut det komplekse spektrum fra waveform-signalen ved hjelp av en Hann-vindu på størrelse 1024 med en 320 hop-størrelse.
Modellen bruker deretter tekstkodereren til CLIP/CLAP-modellene for å trekke ut tekst-embeddings med tekst-overvåking som standardkonfigurasjon for AudioSep. For separasjonsmodellen, bruker AudioSep-rammeverket en ResUNet-lag bestående av 30 lag, 6 encoder-blokker og 6 decoder-blokker, lik arkitekturen i universell lydseparasjonsrammeverket. Videre har hver encoder-blokk to konvolusjonslag med en 3×3 kernel-størrelse, og antallet utgangs-egenskapskart i encoder-blokkene er 32, 64, 128, 256, 512 og 1024, henholdsvis. Decoder-blokkene deler symmetri med encoder-blokkene, og utviklerne anvender Adam-optimizeren for å trene AudioSep-modellen med en batch-størrelse på 96.
Evaluering av resultater
På sett datasamlinger
Følgende figur sammenligner ytelsen til AudioSep-rammeverket på sett datasamlinger under trening, inkludert treningssamlingene. Følgende figur viser benchmark-evaluering av AudioSep-rammeverket sammenlignet med basis-systemer, inkludert taleforbedringsmodeller, LASS og CLIP. AudioSep-modellen med CLIP-tekstkoderer er representert som AudioSep-CLIP, mens AudioSep-modellen med CLAP-tekstkoderer er representert som AudioSep-CLAP.

Som det kan ses i figuren, fungerer AudioSep-rammeverket godt når det brukes lyd-beskrivelser eller tekst-etiketter som inndata-forespørsler, og resultater indikerer overlegen ytelse til AudioSep-rammeverket sammenlignet med tidligere benchmark LASS og lyd-forespørsel-basert lydseparasjonsmodeller.
På usett datasamlinger
For å vurdere ytelsen til AudioSep i en nullskudd-innstilling, fortsatte utviklerne å evaluere ytelsen på usett datasamlinger, og AudioSep-rammeverket leverer imponerende separasjonsytelse i en nullskudd-innstilling, og resultater vises i figuren nedenfor.

Videre viser bildet nedenfor resultater fra evaluering av AudioSep-modellen mot Voicebank-Demand taleforbedring.

Evalueringen av AudioSep-rammeverket indikerer en sterk og ønsket ytelse på usett datasamlinger i en nullskudd-innstilling, og åpner dermed for å utføre lydoperasjoner på nye datafordelinger.
Visualisering av separasjonsresultater
Følgende figur viser resultater når utviklerne brukte AudioSep-CLAP-rammeverket for å visualisere spektrogrammer for grunn-sannhet mållydkilder, lydblandinger og separerte lydkilder ved hjelp av tekst-forespørsler av diverse lyder eller lydkilder. Resultatene tillot utviklerne å observere at spektrumets separerte kilde-mønster er nær grunn-sannheten, noe som ytterligere støtter de objektive resultater som ble funnet under eksperimentene.

Sammenligning av tekst-forespørsler
Utviklerne evaluerte ytelsen til AudioSep-CLAP og AudioSep-CLIP på AudioCaps Mini, og utviklerne brukte AudioSet-hendelses-etiketter, AudioCaps-beskrivelser og om-annoterte naturlig språklig beskrivelser for å undersøke effekten av forskjellige forespørsler, og følgende figur viser et eksempel på AudioCaps Mini i aksjon.

Konklusjon
AudioSep er et grunnleggende modell som er utviklet med mål om å være et åpen-domene universelt lydseparasjonsrammeverk som bruker naturlig språklig beskrivelse for lydseparasjon. Som observert under evalueringen, er AudioSep-rammeverket i stand til å utføre nullskudd- og uovervåket læring uten problemer ved hjelp av lyd-beskrivelser eller tekst-etiketter som inndata-forespørsler. Resultatene og evalueringen av AudioSep indikerer en sterk ytelse som overgår nåværende tilstand av kunstig lydseparasjonsrammeverk som LASS, og det kan være i stand til å løse nåværende begrensninger i populære lydseparasjonsrammeverk.












