Yapay zeka modelleri ve platformları

AudioSep: Tanımladığınız Her Şeyi Ayırın

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

LASS veya Dil-istinatlı Ses Kaynağı Ayrımı, CASA veya Hesaplamalı İşitsel Sahne Analizi için yeni bir paradigmadır ve doğal dil sorgusu kullanarak verilen ses karışımından bir hedef sesi ayırmayı amaçlar. LASS çerçeveleri, müzik aletleri gibi belirli ses kaynakları üzerinde istenen performansı elde etme açısından son yıllarda önemli ölçüde ilerlemiş olsa da, açık alanlarda hedef sesi ayıramazlar.

AudioSep, LASS çerçevelerinin current sınırlamalarını çözmeyi amaçlayan bir temel modeldir ve doğal dil sorgularını kullanarak hedef ses ayrımını sağlar. AudioSep çerçevesinin geliştiricileri, modeli geniş bir yelpazede büyük ölçekli çoklu modal veri kümeleri üzerinde kapsamlı bir şekilde eğittiler ve çerçevenin performansı, müzik aleti ayrımı, ses olayı ayrımı ve konuşma iyileştirme dahil olmak üzere birçok ses görevi üzerinde değerlendirildi. AudioSep’in ilk performansı, etkileyici sıfır-şut öğrenme yetenekleri sergileyerek güçlü ses ayrımı performansı gösteriyor.

Bu makalede, AudioSep çerçevesinin çalışma şekline daha derinlemesine bakacağız, modelin mimarisini, eğitimi ve değerlendirmesi için kullanılan veri kümelerini ve AudioSep modelinin çalışma şeklindeki temel kavramları ele alacağız. Böylece, CASA çerçevesine temel bir giriş ile başlayalım.

CASA, USS, QSS, LASS Çerçeveleri: AudioSep için Temel

CASA veya Hesaplamalı İşitsel Sahne Analizi çerçevesi, geliştiricilerin insan işitsel sistemleri gibi karmaşık ses ortamlarını algılayabilen makine dinleme sistemleri tasarlamalarına olanak tanıyan bir çerçevedir. Ses ayrımı, özellikle hedef ses ayrımı, CASA çerçevesi içinde temel bir araştırma alanıdır ve “kokteyl partisi problemi” veya gerçek dünya ses kayıtlarını bireysel ses kaynak kayıtlarından veya dosyalarından ayırmayı çözmeyi amaçlar. Ses ayrımının önemi, müzik kaynağı ayrımı, ses kaynağı ayrımı, konuşma iyileştirme, hedef ses tanımlama ve daha birçok uygulama dahil olmak üzere geniş bir yelpazede uygulamalara sahip olmasından kaynaklanmaktadır.

Geçmişte yapılan meisten ses ayrımı çalışmaları, müzik ayrımı veya konuşma ayrımı gibi bir veya daha fazla ses kaynağını ayırmaya odaklanmıştır. USS veya Evrensel Ses Ayrımı adlı yeni bir model, gerçek dünya ses kayıtlarındaki keyfi sesleri ayırmayı amaçlar. Ancak, dünya üzerindeki farklı ses kaynaklarının geniş yelpazesi nedeniyle, her ses kaynağını ses karışımından ayırmak zor ve kısıtlayıcı bir görevdir ve bu nedenle USS yöntemi gerçek zamanlı çalışan gerçek dünya uygulamaları için uygun değildir.

USS yönteminin uygulanabilir bir alternatifi, QSS veya Sorgu Tabanlı Ses Ayrımı yöntemidir ve ses karışımından bir hedef ses kaynağını ayırmayı amaçlar. Bu, QSS çerçevesinin geliştiricilerin ve kullanıcıların ses karışımından istedikleri ses kaynaklarını çıkarmalarına olanak tanır ve bu nedenle QSS yöntemi, multimedya içerik düzenleme veya ses düzenleme gibi dijital gerçek dünya uygulamaları için daha pratik bir çözüm haline gelir.

Daha da önemlisi, geliştiriciler yakın zamanda QSS çerçevesinin bir uzantısı olan LASS veya Dil-istinatlı Ses Kaynağı Ayrımı çerçevesini önerdiler ve ses karışımından keyfi ses kaynaklarını ayırmayı amaçlar. LASS çerçevesi, hedef ses kaynaklarını doğal dil talimatları kullanarak çıkarmaya olanak tanır ve bu nedenle, dijital ses uygulamalarında geniş bir yelpazede uygulamalara sahip olabilecek güçlü bir araç olabilir. Geleneksel ses-istinatlı veya görme-istinatlı yöntemlerle karşılaştırıldığında, ses ayrımı için doğal dil talimatlarını kullanmak daha büyük bir esneklik sağlar ve sorgu bilgisinin edinilmesini daha kolay ve uygun hale getirir. Ayrıca, önceden tanımlanmış bir dizi talimat veya sorgu kullanan etiket-istinatlı ses ayrımı çerçeveleri ile karşılaştırıldığında, LASS çerçevesi, girdi sorgularının sayısını sınırlamaz ve açık alanlara sorunsuz bir şekilde genelleştirilebilir.

Öncelikle, LASS çerçevesi, etiketli ses-metin eşleştirilmiş veri kümeleri üzerinde gözetimli öğrenme kullanır. Ancak, bu yaklaşımın temel sorunu, etiketli ve gözetimli ses-metin veri kümelerinin sınırlı Verfügbarliğidir. LASS çerçevesinin, etiketli ses-metin veri kümelerine bağımlılığını azaltmak için, multimodal denetimli öğrenme yaklaşımı kullanılır. Multimodal denetimli öğrenme yaklaşımının temel amacı, CLIP veya Karşılaştırmalı Dil-Görüntü Ön Eğitim modeli gibi multimodal karşılaştırmalı ön eğitim modellerini çerçeveye sorgu kodlayıcı olarak kullanmaktır. CLIP modeli, görsel temsillerle paylaşılan bir anlamsal alanda metin açıklamalarını eşleştirmeyi öğrenir ve bu nedenle, geliştiricilerin, etiketli ses-metin veri kümelerine gerek kalmadan, veri-zengin modallıklar kullanarak LASS modellerini eğitmelerine olanak tanır ve metin verisi ile sıfır-şut ayarında etkileşime girilmesini sağlar. Mevcut LASS çerçeveleri, küçük ölçekli veri kümeleri kullanır ve LASS çerçevesinin yüzlerce potansiyel alandaki uygulamaları henüz keşfedilmemiştir.

LASS çerçevelerinin current sınırlamalarını çözmek için, geliştiriciler AudioSep’i tanıttiler, bir temel modeldir ve doğal dil açıklamaları kullanarak sesi ayırmayı amaçlar. AudioSep’in current odak noktası, mevcut büyük ölçekli multimodal veri kümelerini kullanarak LASS modellerinin açık alan uygulamalarında genelleştirilmesini sağlayan ön-eğitimli bir ses ayrımı modeli geliştirmektir. Özetle, AudioSep modeli: “Açık alan için doğal dil sorguları veya açıklamaları kullanarak evrensel ses ayrımı için bir temel model, büyük ölçekli ses ve multimodal veri kümeleri üzerinde eğitilir”dir.

AudioSep: Ana Bileşenler ve Mimari

AudioSep çerçevesinin mimarisi, iki ana bileşenden oluşur: bir metin kodlayıcı ve bir ayrım modeli.

Metin Kodlayıcı

AudioSep çerçevesi, CLIP veya Karşılaştırmalı Dil-Görüntü Ön Eğitim modeli veya CLAP veya Karşılaştırmalı Dil-Ses Ön Eğitim modeli metin kodlayıcısını, doğal dil sorgusundan metin gömme çıkararak kullanır. Giriş metin sorgusu, “N” token dizisinden oluşur ve metin kodlayıcı tarafından işlenerek, verilen giriş dil sorgusu için metin gömme çıkarılır. Metin kodlayıcı, girdi metin tokenlerini kodlamak için transformer bloklarının bir yığınını kullanır ve çıktı temsilleri, transformer katmanlarından geçirildikten sonra agreglanır, bu da D-boyutlu bir vektör temsiliğinin geliştirilmesine yol açar, burada D, CLAP veya CLIP modellerinin boyutuna karşılık gelir ve metin kodlayıcı, eğitim dönemi boyunca dondurulur.

CLIP modeli, büyük ölçekli bir görüntü-metin eşleştirilmiş veri kümesi üzerinde karşılaştırmalı öğrenme kullanılarak ön-eğitimlidir ve bu nedenle, metin kodlayıcısı, metin açıklamalarını paylaşılan bir anlamsal alanda görsel temsillerle eşleştirmeyi öğrenir. AudioSep’in CLIP’in metin kodlayıcısını kullanmasının avantajı, LASS modelinin, etiketli ses-metin veri kümelerine gerek kalmadan, görsel gömme kullanılarak eğitilebilmesidir, bu da LASS modellerinin eğitimi için etiketli ses-metin veri kümelerine bağımlılığını azaltır.

CLAP modeli, CLIP modeline benzer şekilde çalışır ve metin ve ses kodlayıcısını kullanarak ses ve dil arasında bir köprü kurar, bu da metin ve ses açıklamalarının aynı anlamsal alanda birleştirilmesine olanak tanır.

Ayrım Modeli

AudioSep çerçevesi, bir frekans-alanında ResUNet modeli kullanır ve çerçeveye ayırma omurgası olarak hizmet eder. Çerçevede, önce sinyal dalga formundan kompleks bir spektrogram çıkarmak için bir STFT veya Kısa-Zamanlı Fourier Dönüşümü uygulanır, ardından model, spektrogramı işlemek için bir kodlayıcı-dekodlayıcı ağına sahiptir.

ResUNet kodlayıcı-dekodlayıcı ağı, 6 kodlayıcı bloğu, 6 dekodlayıcı bloğu ve 4 darboğaz bloğu içerir. Her kodlayıcı bloğu, spektrogramı 4 artımlı konvolüsyonel bloğa indirgeme yoluyla bir darboğaz özelliğine dönüştürür, dekodlayıcı blokları ise özelliklerin üst örneklemesi yoluyla ayırma bileşenlerini elde etmek için 4 artımlı konvolüsyonel blokları kullanır. Her kodlayıcı ve dekodlayıcı bloğu, aynı üst örneklemeye veya alt örneklemeye sahip bir atlayış bağlantısı kurar. Çerçevedeki artımlı blok, 2 Leaky-ReLU aktivasyon katmanı, 2 toplu normalleştirme katmanı ve 2 CNN katmanından oluşur ve ayrıca, her artımlı bloğun girişi ve çıkışı arasında bir artımlı kısayol sağlar. ResUNet modeli, kompleks spektrogramı X olarak alır ve büyüklük maskesi M olarak üretir ve faz artığı, metin gömme koşullu olarak büyüklüğün ölçeklenmesini ve spektrogramın açısının dönmesini kontrol eder. Ayırılan kompleks spektrogram, öngörülen büyüklük maskesi ve faz artığının STFT ile çarpılmasıyla elde edilebilir.

AudioSep çerçevesinde, ayrım modeli ve metin kodlayıcısı arasında, ResUNet’in konvolüsyonel bloklarının dağıtılması之后, bir FiLm veya Özellik-Çarpımsal Lineer Modülasyon katmanı kullanılır.

Eğitim ve Kayıp

AudioSep modelinin eğitimi sırasında, geliştiriciler yükseklik artırma yöntemini kullanır ve AudioSep çerçevesini uçtan uca, ground truth ve öngörülen dalga formları arasındaki L1 kaybı fonksiyonu kullanarak eğitime tabi tutarlar.

Veri Kümeleri ve Benchmarklar

Önceki bölümlerde bahsedildiği gibi, AudioSep, LASS modellerinin etiketli ses-metin eşleştirilmiş veri kümelerine bağımlılığını çözmeyi amaçlayan bir temel modeldir. AudioSep modeli, multimodal öğrenme yetenekleri kazanmak için geniş bir yelpazede veri kümeleri üzerinde eğitilir ve burada, AudioSep çerçevesinin eğitimi ve değerlendirmesi için kullanılan veri kümeleri ve benchmarklar hakkında ayrıntılı bir açıklama bulunmaktadır.

AudioSet

AudioSet, 2 milyondan fazla 10 saniyelik ses parçalarından oluşan bir zayıf-etiketli büyük ölçekli ses veri kümesidir ve doğrudan YouTube’dan çıkarılmıştır. Her ses parçası, ses sınıflarının varlığı veya yokluğu tarafından kategorilere ayrılmıştır, ancak ses olaylarının özel zamanlama ayrıntıları yoktur. AudioSet veri kümesi, doğal sesler, insan sesleri, araç sesleri ve daha fazlası dahil olmak üzere 500’den fazla farklı ses sınıfı içerir.

VGGSound

VGGSound veri kümesi, YouTube’dan alınan büyük ölçekli bir görsel-ses veri kümesidir ve her biri 10 saniye uzunluğunda 200.000’den fazla video klip içerir. VGGSound veri kümesi, insan sesleri, doğal sesler, kuş sesleri ve daha fazlası dahil olmak üzere 300’den fazla ses sınıfına ayrılmıştır. VGGSound veri kümesinin kullanılması, hedef sesi üreten nesnenin de ilgili görsel klip tarafından tanımlanabileceğini sağlar.

AudioCaps

AudioCaps, halka açık olarak mevcut en büyük ses açıklama veri kümesidir ve AudioSet veri kümesinden çıkarılan 50.000’den fazla 10 saniyelik ses parçalarını içerir. AudioCaps veri kümesi, eğitim verileri, test verileri ve doğrulama verileri olmak üzere üç kategoriye ayrılmıştır ve ses parçaları, Amazon (AMZN ) Mechanical Turk platformu kullanılarak doğal dil açıklamalarıyla insan tarafından etiketlenmiştir. Eğitim veri kümesindeki her ses parçası için bir açıklama bulunurken, test ve doğrulama kümelerindeki her ses parçası için 5 ground-truth açıklama bulunmaktadır.

ClothoV2

ClothoV2, FreeSound platformundan alınan ses parçalarından oluşan bir ses açıklama veri kümesidir ve AudioCaps gibi, her ses parçası Amazon Mechanical Turk platformu kullanılarak doğal dil açıklamalarıyla insan tarafından etiketlenmiştir.

WavCaps

WavCaps, AudioSet gibi, zayıf-etiketli büyük ölçekli bir ses veri kümesidir ve 400.000’den fazla ses parçası ve açıklamaları içerir, toplam çalışma süresi yaklaşık 7568 saatlik eğitim verisine karşılık gelir. WavCaps veri kümesindeki ses parçaları, BBC Sound Effects, AudioSet, FreeSound, SoundBible ve daha fazlası gibi çeşitli ses kaynaklarından alınmıştır.

Eğitim Ayrıntıları

Eğitim aşamasında, AudioSep modeli eğitim veri kümesinden iki farklı ses parçasını rastgele örnekler ve bunları birleştirerek bir eğitim karışımı oluşturur, her ses parçasının uzunluğu yaklaşık 5 saniyedir. Model daha sonra, Hann penceresi boyutu 1024 ve 320 atlayış boyutu ile dalga formundan kompleks bir spektrogram çıkarmak için bir STFT uygular.

Model daha sonra, AudioSep için varsayılan yapılandırma olan metin denetimi ile CLIP/CLAP modellerinin metin kodlayıcısını kullanarak metin gömme çıkarır. Ayrım modeli için, AudioSep çerçevesi, 30 katman, 6 kodlayıcı bloğu ve 6 dekodlayıcı bloğu içeren bir ResUNet katmanı kullanır, bu da evrensel ses ayrımı çerçevesinde kullanılan mimariyi takip eder. Ayrıca, her kodlayıcı bloğu, 32, 64, 128, 256, 512 ve 1024 olmak üzere sırasıyla 2 konvolüsyonel katman ve 4 artımlı konvolüsyonel bloğa sahiptir. Dekodlayıcı blokları, kodlayıcı blokları ile simetriktir ve geliştiriciler, AudioSep modelini eğitmek için Adam optimizatörünü ve 96’lık bir toplu boyutu kullanır.

Değerlendirme Sonuçları

Görülen Veri Kümeleri Üzerinde

Aşağıdaki şekil, AudioSep çerçevesinin eğitim aşamasında görülen veri kümeleri üzerindeki performansını, temel sistemler dahil olmak üzere Speech Enhancement modelleri, LASS ve CLIP ile karşılaştırmalı olarak gösterir. AudioSep-CLIP, CLIP metin kodlayıcısı ile AudioSep modelini temsil ederken, AudioSep-CLAP, CLAP metin kodlayıcısı ile AudioSep modelini temsil eder.

Şekilde görüldüğü gibi, AudioSep çerçevesi, ses açıklamaları veya metin etiketleri kullanılarak girdi sorguları olarak iyi bir performans sergiler ve sonuçlar, AudioSep çerçevesinin önceki benchmark LASS ve ses-istinatlı ses ayrımı modellerine kıyasla üstün performansını gösterir.

Görülmemiş Veri Kümeleri Üzerinde

AudioSep’in sıfır-şut ayarındaki performansını değerlendirmek için, geliştiriciler görülmemiş veri kümeleri üzerindeki performansını devam ettirdiler ve AudioSep çerçevesi, sıfır-şut ayarında etkileyici bir ayırma performansı sergiler, sonuçlar aşağıdaki şekilde gösterilir.

Ayrıca, aşağıdaki resim, AudioSep modelinin Voicebank-Demand konuşma iyileştirme üzerindeki değerlendirme sonuçlarını gösterir.

AudioSep çerçevesinin değerlendirmesi, görülmemiş veri kümeleri üzerindeki güçlü ve istenen bir performans sergilediğini gösterir ve bu da yeni veri dağılımlarında ses işlemleri görevlerini gerçekleştirmeyi sağlar.

Ayrılma Sonuçlarının Görselleştirilmesi

Aşağıdaki şekil, geliştiricilerin AudioSep-CLAP çerçevesini kullanarak çeşitli sesler veya seslerin metin sorguları için ground-truth hedef sesleri, ses karışımı ve ayrılmış sesleri spektrogramlarının görselleştirme sonuçlarını gösterir. Sonuçlar, geliştiricilerin, ayrılmış ses kaynağının spektrogram deseninin ground-truth kaynağına yakın olduğunu gözlemlemelerine olanak tanır, bu da deneyler sırasında elde edilen nesnel sonuçları destekler.

Metin Sorgularının Karşılaştırılması

Geliştiriciler, AudioCaps Mini üzerinde AudioSep-CLAP ve AudioSep-CLIP’in performansını değerlendirir ve AudioSet olay etiketleri, AudioCaps açıklamaları ve yeniden etiketlenmiş doğal dil açıklamalarını kullanarak farklı sorguların etkilerini incelemek için kullanır, aşağıdaki şekil, AudioCaps Mini’nin bir örneğini gösterir.

Sonuç

AudioSep, doğal dil açıklamaları kullanarak ses ayrımını gerçekleştiren açık alan evrensel ses ayrımı çerçevesi olarak geliştirilen bir temel modeldir. Değerlendirme sırasında görüldüğü gibi, AudioSep çerçevesi, ses açıklamaları veya metin etiketleri kullanılarak girdi sorguları olarak sıfır-şut öğrenme ve gözetimsiz öğrenme gerçekleştirebilir. AudioSep’in sonuçları ve değerlendirme performansı, mevcut durumun en iyi ses ayrımı çerçevelerini aşan güçlü bir performans sergiler ve popüler ses ayrımı çerçevelerinin current sınırlamalarını çözmeye yetecek kadar güçlü olabilir.

Mesleği mühendis, kalbi yazar. Kunal, AI ve ML'ye derin bir sevgi ve anlayışla technical writer, bu alanlardaki karmaşık kavramları etkileyici ve bilgilendirici belgelerle basitleştirmeye adanmış.