AI-modellen en platforms

AudioSep: Scheid alles wat je beschrijft

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

LASS of Language-queried Audio Source Separation is het nieuwe paradigma voor CASA of Computational Auditory Scene Analysis dat zich richt op het scheiden van een doelgeluid van een gegeven mengsel van audio met behulp van een natuurlijke taalquery die een natuurlijke maar schaalbare interface biedt voor digitale audio taken en toepassingen. Hoewel de LASS-frames in de afgelopen jaren aanzienlijk zijn geavanceerd in termen van het bereiken van het gewenste resultaat op specifieke audio bronnen zoals muziekinstrumenten, zijn ze niet in staat om het doel audio te scheiden in het open domein.

AudioSep, is een fundamenteel model dat zich richt op het oplossen van de huidige beperkingen van LASS-frames door het mogelijk te maken om doel audio te scheiden met behulp van natuurlijke taalqueries. De ontwikkelaars van het AudioSep-frame hebben het model uitgebreid getraind op een breed scala aan grote multimodale datasets en hebben de prestaties van het frame geëvalueerd op een breed scala aan audio taken, waaronder muziekinstrumentenscheiding, audio-evenementenscheiding en het verbeteren van spraak onder veel andere. De initiële prestaties van AudioSep voldoen aan de benchmarks, aangezien het indrukwekkende zero-shot leer capaciteiten en sterke audio-scheiding prestaties laat zien.

In dit artikel zullen we een diepere duik nemen in de werking van het AudioSep-frame, waarbij we de architectuur van het model, de datasets die worden gebruikt voor training en evaluatie, en de essentiële concepten die betrokken zijn bij de werking van het AudioSep-model zullen evalueren. Laten we beginnen met een basisinleiding tot het CASA-frame.

CASA, USS, QSS, LASS-frames: De basis voor AudioSep

Het CASA- of Computational Auditory Scene Analysis-frame is een frame dat door ontwikkelaars wordt gebruikt om machine luister systemen te ontwerpen die in staat zijn om complexe geluidsomgevingen waar te nemen op een manier die vergelijkbaar is met de manier waarop mensen geluid waarnemen met hun auditieve systemen. Geluidsscheiding, met een speciale focus op doelgeluidsscheiding, is een fundamenteel onderzoeksgebied binnen het CASA-frame en richt zich op het oplossen van het “cocktail party-probleem” of het scheiden van echte audio-opnamen van individuele audio-bronopnamen of bestanden. De belangrijkheid van geluidsscheiding kan voornamelijk worden toegeschreven aan de brede toepassingen, waaronder muziekbron-scheiding, audio-bron-scheiding, spraakverbetering, doelgeluid-identificatie en veel meer.

Het meeste werk aan geluidsscheiding dat in het verleden is gedaan, draait voornamelijk om de scheiding van een of meer audio-bronnen, zoals muziekscheiding of spraakscheiding. Een nieuw model met de naam USS of Universal Sound Separation richt zich op het scheiden van willekeurige geluiden in echte audio-opnamen. Echter, het is een uitdagende en beperkende taak om elk geluid te scheiden van een audio-mengsel, voornamelijk vanwege de brede variëteit aan verschillende geluiden die in de wereld bestaan, wat de belangrijkste reden is waarom de USS-methode niet haalbaar is voor echte toepassingen die in real-time werken.

Een haalbare alternatief voor de USS-methode is de QSS- of Query-based Sound Separation-methode, die zich richt op het scheiden van een individueel of doelgeluid van het audio-mengsel op basis van een specifieke set queries. Dankzij dit, stelt het QSS-frame ontwikkelaars en gebruikers in staat om de gewenste audio-bronnen te extraheren uit het mengsel op basis van hun vereisten, waardoor het QSS-frame een meer praktische oplossing is voor digitale echte toepassingen zoals multimedia-inhoudsbewerking of audio-bewerking.

Bovendien hebben ontwikkelaars onlangs een uitbreiding van het QSS-frame voorgesteld, het LASS-frame of het Language-queried Audio Source Separation-frame, dat zich richt op het scheiden van willekeurige geluiden uit een audio-mengsel door gebruik te maken van natuurlijke taalbeschrijvingen van de doel audio-bron. Aangezien het LASS-frame gebruikers in staat stelt om de doel audio-bronnen te extraheren met behulp van een set natuurlijke taalinstructies, kan het een krachtig instrument worden met brede toepassingen in digitale audio-toepassingen. In vergelijking met traditionele audio-gevraagde of visueel-gevraagde methoden, biedt het gebruik van natuurlijke taalinstructies voor geluidsscheiding een grotere mate van flexibiliteit en maakt het verkrijgen van query-informatie veel gemakkelijker en handiger. Bovendien, in vergelijking met label query-gebaseerde audio-scheiding frames die gebruik maken van een vooraf gedefinieerde set instructies of queries, beperkt het LASS-frame het aantal invoerqueries niet en heeft het de flexibiliteit om te worden gegeneraliseerd naar het open domein.

Oorspronkelijk is het LASS-frame afhankelijk van begeleide leer, waarbij het model wordt getraind op een set gelabelde audio-tekst-gepaarde gegevens. Echter, het belangrijkste probleem met deze benadering is de beperkte beschikbaarheid van geannoteerde en gelabelde audio-tekstgegevens. Om de afhankelijkheid van het LASS-frame van geannoteerde audio-tekst-gegevens te verminderen, worden de modellen getraind met behulp van de multimodale supervisie leerbenadering. Het primaire doel achter het gebruik van een multimodale supervisiebenadering is om multimodale contrastieve pre-training modellen zoals het CLIP- of Contrastive Language Image Pre Training-model te gebruiken als query-encoder voor het frame. Aangezien het CLIP-frame in staat is om tekst-embeddings te aligneren met andere modaliteiten zoals audio of visie, stelt het ontwikkelaars in staat om de LASS-modellen te trainen met behulp van gegevensrijke modaliteiten en interfereert het met de tekstuele gegevens in een zero-shot-setting. De huidige LASS-frames maken echter gebruik van kleine schaal datasets voor training en toepassingen van het LASS-frame over honderden potentiële domeinen moeten nog worden onderzocht.

Om de huidige beperkingen van het LASS-frame op te lossen, hebben ontwikkelaars AudioSep geïntroduceerd, een fundamenteel model dat zich richt op het scheiden van geluid van een audio-mengsel met behulp van natuurlijke taalbeschrijvingen. De huidige focus voor AudioSep is om een voorgetraind geluidsscheidingsmodel te ontwikkelen dat bestaande grote multimodale datasets gebruikt om de generalisatie van LASS-modellen in open-domein toepassingen mogelijk te maken. Om samen te vatten, het AudioSep-model is: “Een fundamenteel model voor universele geluidsscheiding in het open domein met behulp van natuurlijke taalqueries of beschrijvingen getraind op grote schaal audio- en multimodale datasets”.

AudioSep: Sleutelcomponenten en architectuur

De architectuur van het AudioSep-frame bestaat uit twee sleutelcomponenten: een tekst-encoder en een scheiding-model.

De tekst-encoder

Het AudioSep-frame gebruikt een tekst-encoder van het CLIP- of Contrastive Language Image Pre Training-model of het CLAP- of Contrastive Language Audio Pre Training-model om tekst-embeddings te extraheren uit een natuurlijke taalquery. De invoer tekstquery bestaat uit een reeks van “N” tokens die vervolgens wordt verwerkt door de tekst-encoder om de tekst-embeddings te extraheren voor de gegeven invoer taalquery. De tekst-encoder maakt gebruik van een stapel transformatie-blokken om de invoer tekst-tokens te encoderen en de uitvoer-representaties worden geaggregeerd nadat ze zijn doorgegeven aan de transformatie-lagen, wat resulteert in de ontwikkeling van een D-dimensionale vector-representatie met vaste lengte, waarbij D overeenkomt met de dimensies van de CLAP- of CLIP-modellen, terwijl de tekst-encoder wordt bevroren tijdens de trainingsperiode.

Het CLIP-model is voorgetraind op een grote schaal dataset van image-tekst-gepaarde gegevens met behulp van contrastieve leer, wat de belangrijkste reden is waarom de tekst-encoder van het model tekstuele beschrijvingen op de semantische ruimte leert, die ook wordt gedeeld door de visuele representaties. Het voordeel dat AudioSep behaalt door het gebruik van de tekst-encoder van CLIP is dat het nu kan worden geschaald of getraind vanuit ongelabelde audio-visuele gegevens met behulp van de visuele embeddings als alternatief, waardoor het trainen van LASS-modellen mogelijk wordt zonder de noodzaak van geannoteerde of gelabelde audio-tekstgegevens.

Het CLAP-model werkt op een vergelijkbare manier als het CLIP-model en maakt gebruik van een contrastief leerdoel om tekst- en audio-encoders te verbinden, waardoor tekst- en audio-beschrijvingen op een audio-tekst latent ruimte worden gebracht.

Scheiding-model

Het AudioSep-frame maakt gebruik van een frequentie-domein ResUNet-model dat een mengsel van audio-clips als invoer krijgt als het scheiding-backbone voor het frame. Het frame werkt door eerst een STFT- of Short-Time Fourier Transform-toepassing op de waveform-signalen uit te voeren om een complex spectrogram, een magnitude spectrogram en de fase van X te extraheren. Het model volgt vervolgens dezelfde instelling en construeert een encoder-decoder-netwerk om de magnitude spectrogram te verwerken.

Het ResUNet-encoder-decoder-netwerk bestaat uit 6 resterende blokken, 6 decoder-blokken en 4 bottleneck-blokken. De spectrogram in elk encoder-blok gebruikt 4 resterende conventionele blokken om zichzelf naar een bottleneck-functie te downsamplen, terwijl de decoder-blokken 4 resterende deconvolutionele blokken gebruiken om de scheiding-componenten te verkrijgen door de functies op te schalen. Vervolgens stellen elk van de encoder-blokken en hun overeenkomstige decoder-blokken een skip-verbinding in die op hetzelfde upsampling- of downsampling-tarief werkt. Het resterende blok van het frame bestaat uit 2 Leaky-ReLU-activatie-lagen, 2 batch-normalisatie-lagen en 2 CNN-lagen, en bovendien introduceert het frame een extra resterende shortcut die de invoer en uitvoer van elk individueel resterend blok verbindt. Het ResUNet-model neemt het complexe spectrogram X als invoer en produceert de magnitude-masker M als uitvoer, met de fase-residu die wordt geconditioneerd op tekst-embeddings die de grootte van de schaal, de rotatie van de hoek van het spectrogram beheersen. Het gescheiden complexe spectrogram kan vervolgens worden geëxtraheerd door het voorspelde magnitude-masker en de fase-residu te vermenigvuldigen met de STFT van het mengsel.

In zijn frame gebruikt AudioSep een FiLm- of Feature-wise Linearly modulated-laag om het scheiding-model en de tekst-encoder te verbinden na de implementatie van de convolutionele blokken in het ResUNet.

Training en verlies

Tijdens de training van het AudioSep-model gebruiken ontwikkelaars de loudness-augmentatie-methode en trainen het AudioSep-frame end-to-end met behulp van een L1-verlies-functie tussen de grondwaarheid en de voorspelde waveform.

Datasets en benchmarks

Zoals eerder vermeld, is AudioSep een fundamenteel model dat zich richt op het oplossen van de huidige afhankelijkheid van LASS-modellen van geannoteerde audio-tekst-gepaarde datasets. Het AudioSep-model is getraind op een breed scala aan datasets om het te voorzien van multimodale leer-capaciteiten, en hieronder volgt een gedetailleerde beschrijving van de dataset en benchmarks die door ontwikkelaars worden gebruikt om het AudioSep-frame te trainen.

AudioSet

AudioSet is een zwak gelabelde grote schaal audio-dataset die bestaat uit meer dan 2 miljoen 10-seconde audio-snippets die rechtstreeks zijn geëxtraheerd uit YouTube. Elk audio-snippet in de AudioSet-dataset is gecategoriseerd door de afwezigheid of aanwezigheid van geluidsklassen zonder specifieke timing-details van de geluidsevents. De AudioSet-dataset heeft meer dan 500 verschillende geluidsklassen, waaronder natuurlijke geluiden, menselijke geluiden, voertuig-geluiden en veel meer.

VGGSound

De VGGSound-dataset is een grote schaal visueel-audio-dataset die net als AudioSet rechtstreeks is geëxtraheerd uit YouTube en bestaat uit meer dan 200.000 video-clips, elk met een lengte van 10 seconden. De VGGSound-dataset is gecategoriseerd in meer dan 300 geluidsklassen, waaronder menselijke geluiden, natuurlijke geluiden, vogel-geluiden en meer. Het gebruik van de VGGSound-dataset zorgt ervoor dat het object dat verantwoordelijk is voor het produceren van het doel-geluid ook beschrijfbaar is in de overeenkomstige visuele clip.

AudioCaps

AudioCaps is de grootste openbaar beschikbare audio-beschrijvingsdataset en bestaat uit meer dan 50.000 10-seconde audio-clips die zijn geëxtraheerd uit de AudioSet-dataset. De gegevens in de AudioCaps zijn verdeeld in drie categorieën: trainingsgegevens, testgegevens en validatiegegevens, en de audio-clips zijn door mensen geannoteerd met natuurlijke taalbeschrijvingen met behulp van het Amazon (AMZN ) Mechanical Turk-platform. Het is de moeite waard om op te merken dat elk audio-clip in de trainingsdataset één beschrijving heeft, terwijl de gegevens in de test- en validatie-sets elk vijf grondwaarheid-beschrijvingen hebben.

ClothoV2

De ClothoV2 is een audio-beschrijvingsdataset die bestaat uit clips die zijn geëxtraheerd uit het FreeSound-platform en, net als AudioCaps, elk audio-clip is door mensen geannoteerd met natuurlijke taalbeschrijvingen met behulp van het Amazon Mechanical Turk-platform.

WavCaps

Net als AudioSet is WavCaps een zwak gelabelde grote schaal audio-dataset die bestaat uit meer dan 400.000 audio-clips met beschrijvingen en een totale looptijd van ongeveer 7568 uur aan trainingsgegevens. De audio-clips in de WavCaps-dataset zijn geëxtraheerd uit een breed scala aan audio-bronnen, waaronder BBC Sound Effects, AudioSet, FreeSound, SoundBible en meer.

Trainingsdetails

Tijdens de trainingsfase selecteert het AudioSep-model willekeurig twee audio-segmenten uit twee verschillende audio-clips uit de trainingsdataset en mengt ze vervolgens om een trainingsmengsel te creëren, waarbij de lengte van elk audio-segment ongeveer 5 seconden is. Het model extracteert vervolgens het complexe spectrogram van de waveform-signalen met behulp van een Hann-venster van grootte 1024 met een hopgrootte van 320.

Het model maakt vervolgens gebruik van de tekst-encoder van de CLIP/CLAP-modellen om de tekstuele embeddings te extraheren met tekst-supervisie als standaardconfiguratie voor AudioSep. Voor het scheiding-model gebruikt het AudioSep-frame een ResUNet-laag bestaande uit 30 lagen, 6 encoder-blokken en 6 decoder-blokken, die overeenkomen met de architectuur die wordt gevolgd in het universele geluidsscheidingsframe. Bovendien heeft elk encoder-blok twee convolutionele lagen met een 3×3-kernelgrootte, waarbij het aantal uitvoer-functiekaarten van de encoder-blokken respectievelijk 32, 64, 128, 256, 512 en 1024 zijn. De decoder-blokken delen symmetrie met de encoder-blokken en de ontwikkelaars passen de Adam-optimizer toe om het AudioSep-model te trainen met een batchgrootte van 96.

Evaluatieresultaten

Op gezien datasets

De onderstaande figuur vergelijkt de prestaties van het AudioSep-frame op gezien datasets tijdens de trainingsfase, waaronder de trainingsdatasets. De onderstaande figuur toont de benchmark-evaluatieresultaten van het AudioSep-frame in vergelijking met basissystemen, waaronder spraakverbeteringsmodellen, LASS en CLIP. Het AudioSep-model met CLIP-tekst-encoder wordt weergegeven als AudioSep-CLIP, terwijl het AudioSep-model met CLAP-tekst-encoder wordt weergegeven als AudioSep-CLAP.

Zoals te zien is in de figuur, presteert het AudioSep-frame goed wanneer het gebruikmaakt van audio-beschrijvingen of tekstlabels als invoerqueries, en de resultaten geven aan dat het AudioSep-frame een superieure prestatie heeft in vergelijking met eerdere benchmark LASS- en audio-gevraagde geluidsscheidingsmodellen.

Op ongezien datasets

Om de prestaties van AudioSep te beoordelen in een zero-shot-setting, hebben ontwikkelaars de prestaties geëvalueerd op ongezien datasets en het AudioSep-frame levert indrukwekkende scheidingprestaties in een zero-shot-setting, en de resultaten worden weergegeven in de onderstaande figuur.

Bovendien toont de onderstaande afbeelding de resultaten van de evaluatie van het AudioSep-model tegenover Voicebank-Demand-spraakverbetering.

De evaluatie van het AudioSep-frame geeft aan dat het een sterke en gewenste prestatie heeft op ongezien datasets in een zero-shot-setting, en dit maakt het mogelijk om geluidsscheidings taken uit te voeren op nieuwe gegevensverdelingen.

Visualisatie van scheidingresultaten

De onderstaande figuur toont de resultaten die zijn verkregen toen de ontwikkelaars het AudioSep-CLAP-frame hebben gebruikt om visualisaties van spectrogrammen te maken voor grondwaarheid-doel audio-bronnen, audio-mengsels en gescheiden audio-bronnen met behulp van tekstqueries van diverse audio’s of geluiden. De resultaten stelden de ontwikkelaars in staat om te zien dat het spectrogram-patroon van de gescheiden bron dicht bij de bron van de grondwaarheid ligt, wat de objectieve resultaten die zijn verkregen tijdens de experimenten ondersteunt.

Vergelijking van tekstqueries

De ontwikkelaars hebben de prestaties van AudioSep-CLAP en AudioSep-CLIP geëvalueerd op AudioCaps Mini, en de ontwikkelaars hebben de AudioSet-eventlabels, de AudioCaps-beschrijvingen en opnieuw geannoteerde natuurlijke taalbeschrijvingen gebruikt om de effecten van verschillende queries te onderzoeken, en de onderstaande figuur toont een voorbeeld van AudioCaps Mini in actie.

Conclusie

AudioSep is een fundamenteel model dat is ontwikkeld met als doel een open-domein universeel geluidsscheidingsframe te zijn dat natuurlijke taalbeschrijvingen gebruikt voor geluidsscheiding. Zoals waargenomen tijdens de evaluatie, is het AudioSep-frame in staat om zero-shot- en onbegeleide leer uit te voeren door gebruik te maken van audio-beschrijvingen of tekstlabels als queries. De resultaten en evaluatieprestaties van AudioSep geven aan dat het een sterke prestatie heeft die de huidige staat van de kunst geluidsscheidingsframes zoals LASS overtreft, en het kan mogelijk zijn om de huidige beperkingen van populaire geluidsscheidingsframes op te lossen.

Een ingenieur van beroep, een schrijver van hart. Kunal is een technisch schrijver met een diepe liefde en begrip voor AI en ML, toegewijd aan het vereenvoudigen van complexe concepten in deze gebieden door middel van zijn boeiende en informatieve documentatie.