AI-modeller och plattformar

AudioSep : Separera allt du beskriver

mm
Lägg till Unite.AI bland dina föredragna källor på Google

LASS eller Language-queried Audio Source Separation är den nya paradigmen för CASA eller Computational Auditory Scene Analysis som syftar till att separera en måltone från en given blandning av ljud med hjälp av en naturlig språkfråga som tillhandahåller en naturlig men skalbar gränssnitt för digitala ljuduppgifter och applikationer. Även om LASS-ramverken har utvecklats avsevärt under de senaste åren när det gäller att uppnå önskad prestanda på specifika ljudkällor som musikinstrument, kan de inte separera den måltone i det öppna området.

AudioSep, är ett grundläggande modell som syftar till att lösa de nuvarande begränsningarna i LASS-ramverken genom att möjliggöra måltone separation med hjälp av naturliga språkfrågor. Utvecklarna av AudioSep-ramverket har tränat modellen omfattande på en stor mängd storskaliga multimodala dataset och har utvärderat ramverkets prestanda på en stor mängd ljuduppgifter, inklusive musikinstrumentseparation, ljudhändelseseparation och talförbättring, bland många andra. Den initiala prestandan hos AudioSep tillfredsställer benchmarkerna eftersom den visar imponerande nollskottsinlärningsförmåga och levererar stark ljudseparationsprestanda.

I den här artikeln kommer vi att ta en djupare titt på hur AudioSep-ramverket fungerar, eftersom vi kommer att utvärdera modellens arkitektur, de dataset som används för träning och utvärdering, och de viktigaste begreppen som är involverade i AudioSep-modellens funktion. Så låt oss börja med en grundläggande introduktion till CASA-ramverket.

CASA, USS, QSS, LASS-ramverk : Grundvalen för AudioSep

CASA eller Computational Auditory Scene Analysis-ramverket är ett ramverk som används av utvecklare för att konstruera maskinlyssningssystem som kan uppfatta komplexa ljudmiljöer på ett sätt som liknar hur människor uppfattar ljud med hjälp av sina auditiva system. Ljudseparation, med särskild fokus på måltone separation, är ett grundläggande område för forskning inom CASA-ramverket, och det syftar till att lösa “cocktail party-problemet” eller separera riktiga ljudinspelningar från enskilda ljudkällinspelningar eller filer. Vikten av ljudseparation kan huvudsakligen tillskrivas dess omfattande tillämpningar, inklusive musikkällseparation, ljudkällseparation, talförbättring, måltoneidentifiering och mycket mer.

De flesta arbeten om ljudseparation som har gjorts tidigare kretsar huvudsakligen kring separationen av en eller flera ljudkällor, som musikseparation eller talseparation. En ny modell som kallas USS eller Universal Sound Separation syftar till att separera godtyckliga ljud i riktiga ljudinspelningar. Det är dock en utmanande och restriktiv uppgift att separera varje ljudkälla från en ljudblandning, främst på grund av den stora mängden olika ljudkällor som finns i världen, vilket är den främsta anledningen till att USS-metoden inte är genomförbar för riktiga tillämpningar som fungerar i realtid.

En genomförbar alternativ till USS-metoden är QSS eller Query-baserad Ljudseparation som syftar till att separera en enskild eller måltonekälla från ljudblandningen baserat på en viss uppsättning frågor. Tack vare detta tillåter QSS-ramverket utvecklare och användare att extrahera de önskade ljudkällorna från blandningen baserat på deras krav, vilket gör QSS-metoden till en mer praktisk lösning för digitala riktiga tillämpningar som multimediainnehållsredigering eller ljudredigering.

Utvecklare har nyligen föreslagit en utvidgning av QSS-ramverket, LASS-ramverket eller Language-queried Audio Source Separation-ramverket som syftar till att separera godtyckliga ljudkällor från en ljudblandning genom att använda naturliga språkbeskrivningar av måltonekällan. Eftersom LASS-ramverket tillåter användare att extrahera måltonekällorna med hjälp av en uppsättning naturliga språkinstruktioner, kan det bli ett kraftfullt verktyg med omfattande tillämpningar i digitala ljudapplikationer. När det jämförs med traditionella ljudfrågade eller vision-frågade metoder erbjuder användning av naturliga språkinstruktioner för ljudseparation en större grad av fördel eftersom det lägger till flexibilitet och gör det lättare och bekvämare att skaffa frågeinformation. Dessutom, när det jämförs med etikettfrågabaserad ljudseparationsramverk som använder en fördefinierad uppsättning instruktioner eller frågor, begränsar LASS-ramverket inte antalet indatafrågor och har flexibiliteten att generaliseras till öppet område utan ansträngning.

Ursprungligen bygger LASS-ramverket på övervakad inlärning, där modellen tränas på en uppsättning märkta ljud-text-parade data. Det primära problemet med detta tillvägagångssätt är den begränsade tillgängligheten av märkta och etiketterade ljud-text-data. För att minska LASS-ramverkets beroende av märkta ljud-text-data tränas modellerna med hjälp av multimodal övervakad inlärning. Det primära syftet med att använda en multimodal övervakad inlärningsmetod är att använda multimodala kontrastiva förträningsmodeller som CLIP eller Contrastive Language Image Pre Training-modellen som frågekodaren för ramverket. Eftersom CLIP-ramverket kan koppla textinbäddningar med andra modaliteter som ljud eller syn, tillåter det utvecklare att träna LASS-modellerna med hjälp av datarika modaliteter och tillåter interferens med den textuella datan i en nollskottinställning. De nuvarande LASS-ramverken använder dock småskaliga dataset för träning, och tillämpningar av LASS-ramverket över hundratals potentiella domäner är ännu inte utforskade.

För att lösa de nuvarande begränsningarna som LASS-ramverken står inför, har utvecklare introducerat AudioSep, ett grundläggande modell som syftar till att separera ljud från en ljudblandning med hjälp av naturliga språkbeskrivningar. Det nuvarande fokuset för AudioSep är att utveckla en förtränad ljudseparationsmodell som utnyttjar befintliga storskaliga multimodala dataset för att möjliggöra generalisering av LASS-modeller i öppet område. För att sammanfatta är AudioSep-modellen: “Ett grundläggande modell för universell ljudseparation i öppet område med hjälp av naturliga språkfrågor eller beskrivningar tränade på storskaliga ljud- och multimodala dataset”.

AudioSep : Nyckelkomponenter och Arkitektur

Arkitekturen för AudioSep-ramverket består av två nyckelkomponenter: en textkodare och en separationsmodell.

Textkodaren

AudioSep-ramverket använder en textkodare från CLIP eller Contrastive Language Image Pre Training-modellen eller CLAP eller Contrastive Language Audio Pre Training-modellen för att extrahera textinbäddningar inom en naturlig språkfråga. Inmatningstextfrågan består av en sekvens av “N” token som sedan bearbetas av textkodaren för att extrahera textinbäddningarna för den givna inmatningsspråkfrågan. Textkodaren använder en stapel av transformerblock för att koda inmatningstoken, och utmatningsrepresentationerna sammanfogas efter att de har passerat transformerlagren, vilket resulterar i en D-dimensionell vektorrepresentation med fast längd, där D motsvarar dimensionerna för CLAP- eller CLIP-modellerna, medan textkodaren är frusen under träningsperioden.

CLIP-modellen är förtränad på ett storskaligt dataset av bild-text-parade data med hjälp av kontrastiv inlärning, vilket är den primära anledningen till att dess textkodare lär sig att mappa textuella beskrivningar på det semantiska utrymmet som också delas av de visuella representationerna. Fördelen som AudioSep får genom att använda CLIP:s textkodare är att den nu kan skala upp eller träna LASS-modellen från oetiketterad ljud- och visuell data med hjälp av de visuella inbäddningarna som en alternativ, vilket möjliggör träning av LASS-modeller utan krav på märkta eller etiketterade ljud-text-data.

CLAP-modellen fungerar på samma sätt som CLIP-modellen och använder en kontrastiv inlärningsobjekt som använder en text- och ljudkodare för att koppla ljud och språk, vilket bringar text- och ljudbeskrivningar på ett ljud-text-latent utrymme som är sammanfogat.

Separationsmodell

AudioSep-ramverket använder en frekvensdomän ResUNet-modell som matas med en blandning av ljudklipp som separationsryggraden för ramverket. Ramverket fungerar genom att först applicera en STFT eller en Short-Time Fourier Transform på vågformen för att extrahera en komplex spektrum, magnitudspektrum och fasen av X. Modellen följer sedan samma inställning och konstruerar en encoder-decoder-nätverk för att bearbeta magnitudspektrumet.

ResUNet-encoder-decoder-nätverket består av 6 residualblock, 6 decoderblock och 4 flaskhalsblock. Spektrumet i varje encoderblock använder 4 residuala konvolutionsblock för att nedsample sig till en flaskhalsfunktion, medan decoderblocken använder 4 residuala dekonvolutionsblock för att erhålla separationskomponenterna genom att översample funktionerna. Efter detta etablerar varje encoderblock och dess motsvarande decoderblock en hoppanslutning som fungerar vid samma översampling eller nedsampletakt. Residualblocket i ramverket består av 2 Leaky-ReLU-aktiveringslager, 2 batchnormaliseringslager och 2 CNN-lager, och dessutom introducerar ramverket en ytterligare residualgenväg som kopplar in- och utgången av varje enskild residualblock. ResUNet-modellen tar den komplexa spektrumet X som inmatning och producerar magnitudmasken M som utmatning, med fasresiduen som villkorsstyrs av textinbäddningar som kontrollerar magnituden av skalning och rotationen av spektrumets vinkel. Den separerade komplexa spektrumet kan sedan extraheras genom att multiplicera den förutsagda magnitudmasken och fasresiduen med STFT (Short-Time Fourier Transform) av blandningen.

I sitt ramverk använder AudioSep en FiLm eller Feature-wise Linearly modulerad lager för att koppla separationsmodellen och textkodaren efter distributionen av konvolutionsblocken i ResUNet.

Träning och Förlust

Under träningsfasen använder utvecklare högtalarkompressionsmetoden och tränar AudioSep-ramverket från slutet till slutet med hjälp av en L1-förlustfunktion mellan grundtruthen och den förutsagda vågformen.

Dataset och Benchmark

Som nämnts i tidigare avsnitt är AudioSep ett grundläggande modell som syftar till att lösa den nuvarande beroendet av LASS-modeller på märkta ljud-text-parade dataset. AudioSep-modellen är tränad på en stor mängd dataset för att utrusta den med multimodala inlärningsförmågor, och här är en detaljerad beskrivning av dataset och benchmark som används av utvecklare för att träna AudioSep-ramverket.

AudioSet

AudioSet är ett svagt märkt storskaligt ljuddataset som består av över 2 miljoner 10-sekunders ljudklipp som extraheras direkt från YouTube. Varje ljudklipp i AudioSet-dataset är kategoriserat av frånvaron eller närvaron av ljudklasser utan specifika tidningsdetaljer för ljudhändelserna. AudioSet-dataset har över 500 distinkta ljudklasser, inklusive naturliga ljud, mänskliga ljud, fordonsljud och mycket mer.

VGGSound

VGGSound-dataset är ett storskaligt visuellt-ljud-dataset som, likt AudioSet, har hämtats direkt från YouTube, och det innehåller över 200 000 videoklipp, var och en med en längd av 10 sekunder. VGGSound-dataset är kategoriserat i över 300 ljudklasser, inklusive mänskliga ljud, naturliga ljud, fågelljud och mer. Användningen av VGGSound-dataset säkerställer att objektet som är ansvarigt för att producera måltone också är beskrivbart i den motsvarande visuella klippen.

AudioCaps

AudioCaps är det största offentligt tillgängliga ljudbeskrivningsdataset och består av över 50 000 10-sekunders ljudklipp som extraheras från AudioSet-dataset. Datat i AudioCaps är indelat i tre kategorier: träningsdata, testdata och valideringsdata, och ljudklippen är mänskligt annoterade med naturliga språkbeskrivningar med hjälp av Amazon (AMZN ) Mechanical Turk-plattformen. Det är värt att notera att varje ljudklipp i träningsdataset har en enda beskrivning, medan datat i test- och valideringsset har 5 grundtruth-beskrivningar vardera.

ClothoV2

ClothoV2 är ett ljudbeskrivningsdataset som består av klipp som hämtats från FreeSound-plattformen, och likt AudioCaps, är varje ljudklipp mänskligt annoterat med naturliga språkbeskrivningar med hjälp av Amazon Mechanical Turk-plattformen.

WavCaps

Likt AudioSet är WavCaps ett svagt märkt storskaligt ljuddataset som består av över 400 000 ljudklipp med beskrivningar, och en total löptid som uppskattar till 7568 timmar av träningsdata. Ljudklippen i WavCaps-dataset är hämtade från en stor mängd ljudkällor, inklusive BBC Sound Effects, AudioSet, FreeSound, SoundBible och mer.

Träningsdetaljer

Under träningsfasen slumpmässigt provar AudioSep-modellen två ljudsegment från två olika ljudklipp från träningsdataset och blandar sedan ihop dem för att skapa en träningsblandning där varje ljudsegments längd är cirka 5 sekunder. Modellen extraherar sedan det komplexa spektrumet från vågformssignalen med hjälp av ett Hann-fönster av storlek 1024 med en 320 hop-storlek.

Modellen använder sedan textkodaren från CLIP/CLAP-modellerna för att extrahera textinbäddningarna med textövervakning som standardkonfiguration för AudioSep. För separationsmodellen använder AudioSep-ramverket en ResUNet-lager som består av 30 lager, 6 encoderblock och 6 decoderblock som liknar arkitekturen som följs i det universella ljudseparationsramverket. Dessutom har varje encoderblock två konvolutionslager med en 3×3-kernelstorlek, med antalet utmatningsfunktioner för encoderblocken som är 32, 64, 128, 256, 512 och 1024, respektive. Decoderblocken delar symmetri med encoderblocken, och utvecklarna tillämpar Adam-optimisatorn för att träna AudioSep-modellen med en batchstorlek på 96.

Utvärderingsresultat

På Set Datasets

Följande figur jämför prestandan hos AudioSep-ramverket på set-datasets under träningsfasen, inklusive träningsdataset. Följande figur representerar benchmark-utvärderingsresultaten för AudioSep-ramverket när det jämförs med baslinjesystem, inklusive tal förbättringsmodeller, LASS och CLIP. AudioSep-modellen med CLIP-textkodare representeras som AudioSep-CLIP, medan AudioSep-modellen med CLAP-textkodare representeras som AudioSep-CLAP.

Som det kan ses i figuren, fungerar AudioSep-ramverket bra när det använder ljudbeskrivningar eller textetiketter som inmatningsfrågor, och resultaten indikerar den överlägsna prestandan hos AudioSep-ramverket när det jämförs med tidigare benchmark-LASS och ljudfrågade ljudseparationsmodeller.

På Oset Datasets

För att utvärdera prestandan hos AudioSep i en nollskottinställning, fortsatte utvecklarna att utvärdera prestandan på oset-datasets, och AudioSep-ramverket levererar imponerande separationsprestanda i en nollskottinställning, och resultaten visas i figuren nedan.

Dessutom visar bilden nedan resultaten från utvärderingen av AudioSep-modellen mot Voicebank-Demand tal förbättring.

Utvärderingen av AudioSep-ramverket indikerar en stark och önskad prestanda på oset-datasets i en nollskottinställning, och därmed möjliggör det att utföra ljudoperationer på nya datadistributioner.

Visualisering av Separationsresultat

Följande figur visar resultaten som erhållits när utvecklarna använde AudioSep-CLAP-ramverket för att visualisera spektrogram för grundtruth-måltonekällor, ljudblandningar och separerade ljudkällor med hjälp av textfrågor för olika ljud eller ljud. Resultaten tillät utvecklarna att observera att separerad källmönster för spektrogram är nära den grundtruth-källan, vilket ytterligare stöder de objektiva resultaten som erhållits under experimenten.

Jämförelse av Textfrågor

Utvecklarna utvärderade prestandan hos AudioSep-CLAP och AudioSep-CLIP på AudioCaps Mini, och utvecklarna använde AudioSet-händelseetiketter, AudioCaps-beskrivningar och omannoterade naturliga språkbeskrivningar för att undersöka effekterna av olika frågor, och följande figur visar ett exempel på AudioCaps Mini i aktion.

Slutsats

AudioSep är ett grundläggande modell som utvecklats med syftet att vara ett öppet område universellt ljudseparationsramverk som använder naturliga språkbeskrivningar för ljudseparation. Som observerat under utvärderingen, är AudioSep-ramverket kapabelt att utföra nollskottsinlärning och oövervakad inlärning utan ansträngning genom att använda ljudbeskrivningar eller textetiketter som frågor. Resultaten och utvärderingsprestandan hos AudioSep indikerar en stark prestanda som överträffar nuvarande tillstånd av konst ljudseparationsramverk som LASS, och det kan vara tillräckligt kapabelt för att lösa de nuvarande begränsningarna hos populära ljudseparationsramverk.

En ingenjör till yrket, en författare av hjärtat. Kunal är en teknisk skribent med ett djupt kärlek och förståelse för AI och ML, dedikerad till att förenkla komplexa begrepp inom dessa områden genom sin engagerande och informativa dokumentation.