AI-modeller og platforme
AudioSep: Separér Alt, Du Beskriver

LASS eller Language-queried Audio Source Separation er det nye paradigme for CASA eller Computational Auditory Scene Analysis, der sigter mod at separere en målsound fra en given blanding af lyd ved hjælp af en naturlig sprogforespørgsel, der giver en naturlig, men skalerbar grænseflade for digitale lydopgaver og -applikationer. Selvom LASS-rammerne har udviklet sig betydeligt i de seneste år med hensyn til at opnå ønsket præstation på bestemte lydkilder som musikinstrumenter, er de ikke i stand til at separere den mållyd i det åbne domæne.
AudioSep er et grundlæggende model, der sigter mod at løse de nuværende begrænsninger i LASS-rammerne ved at aktivere mållydseparation ved hjælp af naturlige sprogforespørgsler. Udviklerne af AudioSep-rammen har trænet modellen omfattende på en bred vifte af store multimodale datasæt og har vurderet rammenes præstation på en bred vifte af lydopgaver, herunder musikinstrumentseparation, lydeventseparation og taleforbedring blandt mange andre. Den initiale præstation af AudioSep tilfredsstiller benchmarkene, da den demonstrerer imponerende zero-shot-læringsfærdigheder og leverer stærk lydseparationspræstation.
I denne artikel vil vi dykke dybere i AudioSep-rammens funktion, da vi vil evaluere modellens arkitektur, datasættene brugt til træning og evaluering, og de væsentlige begreber, der er involveret i AudioSep-modellens funktion. Så lad os begynde med en grundlæggende introduktion til CASA-rammen.
CASA, USS, QSS, LASS-rammer: Grundlaget for AudioSep
CASA eller Computational Auditory Scene Analysis er en ramme, der bruges af udviklere til at designe maskinlytningssystemer, der kan opfange komplekse lydmiljøer på en måde, der ligner den måde, mennesker opfatter lyd ved hjælp af deres auditive systemer. Lydseparation, med særlig fokus på mållydseparation, er et grundlæggende område for forskning inden for CASA-rammen, og det sigter mod at løse “cocktail party-problemet” eller separere virkelige lydoptagelser fra enkeltlydkilder eller -filer. Betydningen af lydseparation kan tilskrives primært dets vidt udbredte anvendelser, herunder musiklydseparation, lydkilde-separation, taleforbedring, mållydidentifikation og meget mere.
Det meste af arbejdet med lydseparation, der er udført i fortiden, drejer sig primært om separation af en eller flere lydkilder, såsom musikseparation eller taleseparation. En ny model med navnet USS eller Universal Sound Separation sigter mod at separere vilkårlige lyde i virkelige lydoptagelser. Det er dog en udfordrende og begrænsende opgave at separere hver lydkilde fra en lydblanding, primært på grund af den brede vifte af forskellige lydkilder, der findes i verden, hvilket er den primære grund til, at USS-metoden ikke er gennemførbar for virkelige anvendelser, der fungerer i realtid.
En gennemførbar alternativ til USS-metoden er QSS eller Query-baseret Lydseparation, der sigter mod at separere en enkelt eller mållydkilde fra lydblandingen baseret på en bestemt sæt af forespørgsler. Takket være dette tillader QSS-rammen udviklere og brugere at trække de ønskede lydkilder ud af blandingen baseret på deres krav, hvilket gør QSS-metoden til en mere praktisk løsning for digitale virkelige anvendelser, såsom multimedieindholdsredigering eller lydredigering.
Desuden har udviklere nyligt foreslået en udvidelse af QSS-rammen, LASS-rammen eller Language-queried Audio Source Separation-rammen, der sigter mod at separere vilkårlige lydkilder fra en lydblanding ved at bruge naturlige sprogbeskrivelser af mållydkilden. Da LASS-rammen tillader brugere at trække mållydkilder ud ved hjælp af en sæt af naturlige sprogforespørgsler, kan det blive et kraftfuldt værktøj med vidt udbredte anvendelser i digitale lydanvendelser. Når det sammenlignes med traditionelle lydforespørgsler eller vision-forespørgsler, tilbyder brug af naturlige sprogforespørgsler til lydseparation en større grad af fordel, da det tilføjer fleksibilitet og gør erhvervelsen af forespørgselsinformation meget lettere og mere bekvem. Desuden, når det sammenlignes med mærkeforespørgselsbaserede lydseparationsrammer, der bruger en foruddefineret sæt af forespørgsler eller mærker, begrænser LASS-rammen ikke antallet af inputforespørgsler og har mulighed for at generalisere til åbent domæne uden problemer.
Oprindeligt afhænger LASS-rammen af overvåget læring, hvor modellen trænes på en sæt af mærkede lyd-tekst-parret data. Det primære problem med denne tilgang er den begrænsede tilgængelighed af annoterede og mærkede lyd-tekst data. For at reducere afhængigheden af LASS-rammen af annoterede lyd-tekst data trænes modellerne ved hjælp af multimodal supervision læring. Det primære formål bag at bruge en multimodal supervision tilgang er at bruge multimodale kontrastive præ-træningsmodeller, såsom CLIP eller Contrastive Language Image Pre Training model, som forespørgselskodifikator for rammen.
For at løse de nuværende begrænsninger, der er mødt af LASS-rammerne, har udviklere introduceret AudioSep, et grundlæggende model, der sigter mod at separere lyd fra en lydblanding ved hjælp af naturlige sprogbeskrivelser. Den nuværende fokus for AudioSep er at udvikle en præ-trænet lydseparationsmodel, der udnytter eksisterende store multimodale datasæt for at muliggøre generalisering af LASS-modeller i åbent domæne-anvendelser.
AudioSep: Nøglekomponenter og Arkitektur
AudioSep-rammens arkitektur består af to nøglekomponenter: en tekstkodifikator og en separationsmodel.
Tekstkodifikatoren
AudioSep-rammen bruger en tekstkodifikator fra CLIP eller Contrastive Language Image Pre Training model eller CLAP eller Contrastive Language Audio Pre Training model til at trække tekstembedding ud af en naturlig sprogforespørgsel.
Tekstkodifikatoren bruger en stak af transformer-blokke til at kodificere input-teksttokenene, og output-repræsentationerne samles efter, at de er passeret gennem transformer-lagene, hvilket resulterer i udviklingen af en D-dimensionel vektorrepræsentation med fast længde, hvor D svarer til dimensionerne af CLAP eller CLIP-modellerne, mens tekstkodifikatoren er frosset under træningsperioden.
CLIP-modellen er præ-trænet på et stort datasæt af billed-tekst-parret data ved hjælp af kontrastlæring, hvilket er den primære grund til, at dens tekstkodifikator lærer at kortlægge tekstbeskrivelser på det semantiske rum, der også deles af visuelle repræsentationer.
Separationsmodel
AudioSep-rammen bruger en frekvensdomæne ResUNet-model, der fødes med en blanding af lydklip som separationsryggraden for rammen.
ResUNet-kodifikator-dekodningsnetværket består af 6 residual-blokke, 6 dekodningsblokke og 4 flaskehalsblokke. Spektrografen i hver encoder-blok bruger 4 residual-konvolutionsblokke til at nedsample sig selv til en flaskehalsfunktion, mens dekodningsblokkene bruger 4 residual-dekonvolutionsblokke til at opnå separationskomponenterne ved at opsample funktionerne.

I sin ramme bruger AudioSep en FiLm eller Feature-wise Linearly moduleret lag til at brokke separationsmodellen og tekstkodifikatoren efter udrulningen af konvolutionsblokkene i ResUNet.
Træning og Tab
Under træningen af AudioSep-modellen bruger udviklerne støjforstærkning og træner AudioSep-rammen fra ende til ende ved hjælp af en L1-tab-funktion mellem grundsandheden og den forudsagte bølgeform.
Datasæt og Benchmark
Som nævnt i tidligere afsnit er AudioSep et grundlæggende model, der sigter mod at løse den nuværende afhængighed af LASS-modeller af annoterede lyd-tekst-parret datasæt. AudioSep-modellen er trænet på en bred vifte af datasæt for at udstyre den med multimodale læringsfærdigheder, og her er en detaljeret beskrivelse af datasættet og benchmarkene, der bruges af udviklerne til at træne AudioSep-rammen.
AudioSet
AudioSet er et svagt-mærket stort datasæt af lyd, der består af over 2 millioner 10-sekunders lydklip, der er trukket direkte fra YouTube. Hver lydklip i AudioSet-datasættet er kategoriseret af fraværet eller tilstedeværelsen af lydklasser uden specifikke tidspunktsdetaljer for lydeventerne.
VGGSound
VGGSound-datasættet er et stort visuelt-lyd-datasæt, der ligesom AudioSet er trukket direkte fra YouTube, og det indeholder over 200.000 video-klip, hver med en længde på 10 sekunder. VGGSound-datasættet er kategoriseret i over 300 lydklasser, herunder menneskeskabte lyde, naturlige lyde, fuglelyde og mere.
AudioCaps
AudioCaps er det største offentligt tilgængelige lyd-beskrivelsesdatasæt og består af over 50.000 10-sekunders lydklip, der er trukket fra AudioSet-datasættet.
ClothoV2
ClothoV2 er et lyd-beskrivelsesdatasæt, der består af klip trukket fra FreeSound-platformen, og ligesom AudioCaps er hver lydklip mærket med naturlige sprogbeskrivelser ved hjælp af Amazon (AMZN ) Mechanical Turk-platformen.
WavCaps
WavCaps er et svagt-mærket stort datasæt af lyd, der består af over 400.000 lydklip med beskrivelser, og en total køretid, der nærmer sig 7568 timer af træningsdata.

Træningsdetaljer
Under træningsfasen sampler AudioSep-modellen tilfældigt to lydsegmenter fra to forskellige lydklip fra træningsdatasættet og blandes derefter sammen for at skabe en træningsblanding, hvor længden af hver lydsegment er omkring 5 sekunder.
Modellen bruger derefter tekstkodifikatoren fra CLIP/CLAP-modellerne til at trække tekstembedding med tekstsupervision som standardkonfiguration for AudioSep.
Evaluationsresultater
På Sete Datasæt
Følgende figur sammenligner AudioSep-rammens præstation på sete datasæt under træningsfasen, herunder træningsdatasættet.

Som det kan ses i figuren, fungerer AudioSep-rammen godt, når den bruger lydbeskrivelser eller tekstmærker som inputforespørgsler, og resultaterne indikerer den overlegne præstation af AudioSep-rammen i forhold til tidligere benchmark LASS- og lydforespørgselsbaserede lydseparationsmodeller.
På Usete Datasæt
For at vurderere AudioSep-modellens præstation i en zero-shot-sætning fortsætter udviklerne med at evaluere præstationen på usete datasæt, og AudioSep-rammen leverer imponerende separationspræstation i en zero-shot-sætning, og resultaterne vises i figuren nedenfor.

Desuden viser billedet nedenfor resultaterne af at evaluere AudioSep-modellen mod Voicebank-Demand taleforbedring.

Evalueringen af AudioSep-rammen indikerer en stærk og ønsket præstation på usete datasæt i en zero-shot-sætning, og det åbner mulighed for at udføre lydoperationer på nye datafordelinger.
Visualisering af Separationsresultater
Figuren nedenfor viser resultaterne, der opnås, når udviklerne bruger AudioSep-CLAP-rammen til at visualisere spektrograffer for grundsandheds-mållydkilder, lydblandinger og separerede lydkilder ved hjælp af tekstforespørgsler af diverse lyde eller lyde.

Sammenligning af Tekstforespørgsler
Udviklerne vurderer AudioSep-CLAP og AudioSep-CLIP på AudioCaps Mini, og udviklerne bruger AudioSet-begivenhedslabels, AudioCaps-beskrivelser og genmærkede naturlige sprogbeskrivelser til at undersøge effekterne af forskellige forespørgsler, og følgende figur viser et eksempel på AudioCaps Mini i aktion.

Konklusion
AudioSep er et grundlæggende model, der er udviklet med det formål at være et åbent domæne-universelt lydseparationsramme, der bruger naturlige sprogbeskrivelser til lydseparation. Som observeret under evalueringen er AudioSep-rammen i stand til at udføre zero-shot- og usupervised-læring uden problemer ved hjælp af lydbeskrivelser eller tekstmærker som forespørgsler. Resultaterne og evaluationspræstationen af AudioSep indikerer en stærk præstation, der overgår nuværende tilstand af kunst lydseparationsrammer som LASS, og det kan muligvis være i stand til at løse de nuværende begrænsninger i populære lydseparationsrammer.












