Yapay zeka modelleri ve platformları

Metin-Müzik Üretici AI: Stability Audio, Google’ın MusicLM ve Daha Fazlası

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Müzik, insan ruhuna seslenen bir sanat formu, hepimizin sürekli bir arkadaşı olmuştur. Yapay zeka kullanarak müzik oluşturma several on yıl önce başladı. İlk denemeler basit ve sezgisel idi, temel algoritmalar monoton melodiler oluşturuyordu. Ancak teknoloji ilerledikçe, AI müzik üreticilerinin karmaşıklığı ve yetenekleri de arttı, derin öğrenme ve Doğal Dil İşleme (NLP) bu teknolojide kilit roller oynamaya başladı.

Bugün, Spotify gibi platformlar kullanıcıların dinleme deneyimlerini iyileştirmek için AI’ı kullanıyor. Bu derin öğrenme algoritmaları, tempo ve mood gibi çeşitli müzik unsurlarına dayalı olarak bireysel tercihleri analiz ediyor ve kişiselleştirilmiş şarkı önerileri oluşturuyor. Ayrıca, daha geniş dinleme kalıplarını analiz ediyor ve internet üzerindeki şarkı ile ilgili tartışmaları analiz ederek ayrıntılı şarkı profilleri oluşturuyor.

Illiac Suite for String Quartet 1957’de oluşturulan ilk önemli eserdi. Bu, Monte Carlo algoritmasını kullandı, bir dizi rasgele sayı kullanarak pitch ve ritmi geleneksel müzik teorisi ve istatistiksel olasılıkların sınırları içinde belirledi.

Midjourney kullanarak oluşturulan görüntü

Midjourney kullanarak oluşturulan görüntü

O zamanlar, başka bir öncü, Iannis Xenakis, müzik oluşturmak için olasılık dağılımları içeren stokastik süreçleri kullandı. Bilgisayarlar ve FORTRAN dilini kullanarak, birden fazla olasılık fonksiyonunu birleştirdi, farklı grafik temsilcilerinin çeşitli ses alanlarına karşılık geldiği bir model oluşturdu.

Müzikte AI’ın Kökeni: Algoritmik Bestecilikten Üretken Modellemeye Bir Yolculuk

Müzik dünyasında AI’ın ilk karıştığı dönem, 1950’ler ile 1970’ler arasında,主要 olarak algoritmik besteciliğe odaklandı. Bu, bir dizi tanımlı kural kullanarak müzik oluşturma yöntemiydi.

Metni Müziğe Çevirme Karmaşıklığı

Müzik, melodi, harmoni, ritim ve tempo gibi unsurları içeren zengin ve çok boyutlu bir veri formatında depolanır, metni müziğe çevirmek son derece karmaşıktır. Bir standard şarkı, bir bilgisayarda neredeyse bir milyon sayı ile temsil edilir, bu rakam diğer veri formatlarına göre daha yüksektir.

Ses oluşturma alanı, gerçekçi ses oluşturma zorluklarını aşmak için yenilikçi yaklaşımlar görüyor. Bir yöntem, bir spektrogram oluşturup ardından onu ses’e geri dönüştürmektir.

Diğer bir strateji, müziklerin sembolik temsilini, gibi nota kağıdını kullanır, bu da müzisyenler tarafından yorumlanabilir ve çalınabilir. Bu yöntem, Chamber Ensemble Generator gibi araçlar ile başarılı bir şekilde dijitalleştirildi, MIDI formatında müzik oluşturuyor, bu da bilgisayarlar ve müzik aletleri arasındaki iletişimi sağlayan bir protokoldür.

Bu yaklaşımlar, bu alanda ilerlemeyi sağlasa da, kendi sınırlamaları ile birlikte gelir, ses oluşturmanın karmaşık doğasını vurgular.

Transformer-based otoregresif modeller ve U-Net-based difüzyon modelleri, ses, metin, müzik ve daha fazlasının oluşturulmasında devlet-sanatlı (SOTA) sonuçlar üretiyor. OpenAI’ın GPT serisi ve diğer çoğu LLM, transformerları kullanarak ya encoder, decoder veya her ikisini de kullanıyor. Sanat/görüntü tarafında, MidJourney, Stability AI ve DALL-E 2 difüzyon çerçevelerini kullanıyor. Bu iki temel teknoloji, ses sektöründe de SOTA sonuçlarına ulaşılmasında kilit rol oynamıştır. Bu makalede, Google’ (GOOGL ) ın MusicLM ve Stable Audio’nun bu teknolojilerin mucizevi yeteneklerine tanıklık eden örneklerine dalacağız.

Google’ın MusicLM

Google’ın MusicLM Mayıs ayında yayınlandı. MusicLM, metin duygusuna uygun yüksek-fidelite müzik parçaları oluşturabilir. Hirarşik dizilimden-dizilime modelleme kullanarak, MusicLM 24 kHz’de uzun süreler boyunca müzik oluşturabilir.

Model, metin girişlerine uymakla kalmaz, aynı zamanda melodilere de şartlandırabilir. Bu, bir melodiye dayalı olarak metin tarzı açıklamalarına göre uyarlanabilir.

Teknik Bilgiler

MusicLM, 2022’de ses oluşturma için tanıtılan AudioLM ilkelerinin üzerine kuruludur. AudioLM, bir dizi kaba-ince ses diskret birimler kullanarak, yani tokenler kullanarak, ses oluşturma işlemini bir dil modelleme görevi olarak gerçekleştirir. Bu yaklaşım, uzun süreler boyunca yüksek-fidelite ve uzun vadeli tutarlılık sağlar.

Müzik oluşturma işlemini kolaylaştırmak için, MusicLM, AudioLM’nin yeteneklerini metin şartlandırması için genişletir, yani oluşturulan ses, girdi metninin inceliklerine uyumlu hale gelir. Bu, bir ortak gömme alanı oluşturmak için MuLan adlı bir ortak müzik-metin modeli kullanarak gerçekleştirilir. Bu strateji, eğitim sırasında açıklamalara gerek kalmadan, modelin büyük ses-only corpora üzerinde eğitilmesine olanak tanır.

MusicLM modeli ayrıca SoundStream‘i ses tokenleştirici olarak kullanır, bu, 24 kHz’de 6 kbps’de etkileyici bir fidelite ile 24 kHz müzik oluşturabilir, artık vektör kuantizasyonu (RVQ) kullanarak verimli ve yüksek kaliteli ses sıkıştırması sağlar.

MusicLM'nin temel modellerinin bağımsız ön-eğitim süreci: SoundStream, w2v-BERT ve MuLan

MusicLM’nin ön-eğitim süreci: SoundStream, w2v-BERT ve MuLan | Kaynak: burada

Dahası, MusicLM, melodi şartlandırması yeteneklerini genişletir, bu da basit bir mırıldanmış melodiye dayalı olarak, metin tarzı açıklamalarına göre uyarlanabilen bir müzik deneyimi oluşturulmasına olanak tanır.

MusicLM’nin geliştiricileri ayrıca, 5.5k müzik-metin çiftlerinden oluşan bir veri kümesi olan MusicCaps‘i açık kaynak olarak yayınladılar. Burada bulunabilir: MusicCaps on Hugging Face.

Google’ın MusicLM ile AI ses parçaları oluşturmaya hazır mısınız? Başlamak için buraya tıklayın:

  1. Resmi MusicLM web sitesini ziyaret edin ve “Başlayın”ı tıklayın.
  2. İlgilinizi kaydedin, “İlgilinizi kaydedin”i seçin.
  3. Google hesabınızla giriş yapın.
  4. Erişim verildiğinde, “Şimdi Deneyin”i tıklayarak başlayın.

Aşağıda, denediğim birkaç örnek.prompt vardır:

“Medikitatif şarkı, sakin ve rahatlatıcı, flüt ve gitar ile. Müzik yavaş, huzur ve sakinlik duygusu yaratmaya odaklanıyor.”

“jazz with saxophone”

Önceki SOTA modelleri gibi Riffusion ve Mubert ile karşılaştırıldığında, MusicLM daha çok tercih edildi, katılımcılar metin açıklamaları ile 10 saniyelik ses kliplerinin uyumluluğunu daha yüksek puanladı.

MusicLM Performansı

MusicLM Performansı, Kaynak: burada

Stability Audio

Stability AI geçen hafta “Stable Audio” adlı bir latent difüzyon modeli mimarisini tanıttı, bu, metin meta verileri ve ses dosyası süresine ve başlangıç zamanına bağlı olarak şartlandırılmış bir yaklaşımdır. Bu yaklaşım, Google’ın MusicLM gibi, oluşturulan sesin içeriği ve uzunluğu üzerinde kontrol sağlar, bu da belirtilen uzunlukta ses klipleri oluşturulmasına olanak tanır.

Teknik Bilgiler

Stable Audio, bir dizi bileşenden oluşur, bunlar arasında bir Variational Autoencoder (VAE) ve bir U-Net-based şartlandırılmış difüzyon modeli bulunur, bunlar birlikte bir metin kodlayıcı ile çalışır.

Bir VAE, bir metin kodlayıcı ve bir U-Net-based şartlandırılmış difüzyon modelinin entegrasyonunu gösteren bir illüstrasyon

Stable Audio Mimarisi, Kaynak: burada

VAE, stereo sesi, gürültüye karşı dayanıklı ve tersinebilir bir kayıp veri kodlamasına sıkıştırarak, daha hızlı oluşturma ve eğitim sağlar, bu da ham ses örnekleriyle çalışmaya gerek kalmadan eğitim sürecini hızlandırır.

Metin kodlayıcı, CLAP modelinden türetilir, metin ve ses arasındaki karmaşık ilişkileri anlamada kilit bir rol oynar, girdi metninin tokenleştirilmiş hali için bilgilendirici bir temsil sağlar. Bu, CLAP metin kodlayıcısının bir önceki katmanından metin özelliklerinin kullanılmasıyla gerçekleştirilir, bunlar daha sonra difüzyon U-Net’e çapraz-dikkat katmanları aracılığıyla entegre edilir.

Önemli bir yön, zaman gömmelerinin dahil edilmesidir, bunlar, ses parçasının başlangıç saniyesi ve orijinal ses dosyasının toplam süresine dayalı olarak hesaplanır. Bu değerler, saniye başına öğrenilmiş gömme olarak hesaplanır ve U-Net’in çapraz-dikkat katmanlarına prompt tokenleri ile birlikte beslenir, bu da kullanıcıların çıktı sesinin genel uzunluğunu belirlemesine olanak tanır.

Stable Audio modeli, AudioSparx ile işbirliği içinde, 800.000’den fazla ses dosyasından oluşan geniş bir veri kümesi kullanılarak eğitildi.

Stable audio reklamları

Stable audio reklamları

Stable Audio, ücretsiz bir sürüm sunar, bu da ayda 20 adet 20 saniyelik parça oluşturulmasına olanak tanır ve 12$/ay’lık Pro planı, 90 saniyeye kadar olan 500 parça oluşturulmasına izin verir.

Aşağıda, Stable Audio kullanarak oluşturduğum bir ses parçası vardır.

Midjourney kullanarak oluşturulan görüntü

Midjourney kullanarak oluşturulan görüntü

“Sinematik, Soundtrack Gentle Rainfall, Ambient, Rahatlatıcı, Uzakta Köpek Havlaması, Sakinleştirici Yaprak Hışırtısı, İncelikli Rüzgar, 40 BPM”

Bu tür ince işlenmiş ses parçalarının uygulamaları sınırsızdır. Film yapımcıları, bu teknolojiyi kullanarak zengin ve etkileyici ses manzaraları oluşturabilir. Reklamcılık sektöründe, bu tür özelleştirilmiş ses parçalarını kullanabilir. Ayrıca, bu araç, bireysel yaratıcılar ve sanatçılara, sınırsız bir potansiyel canvas sunar, böylece hikayeler anlatan, duygular uyandıran ve derinlikte previously zor ulaşılan atmosferler oluşturabilir.

Prompting İpuçları

Metin promtları kullanarak mükemmel ses oluşturun. İşte başlamanız için bir rehber:

  1. Ayrıntılı Olun: Türleri, duyguları ve enstrümanları belirtin. Örneğin: Sinematik, Vahşi Batı, Perküsyon, Gerilim, Atmosferik
  2. Duygu Ayarları: Müzikal ve duygusal terimleri birleştirerek istenen duyguyu iletin.
  3. Enstrüman Seçimi: Enstrüman adlarını sıfatlarla güçlendirin, örneğin “Yankılı Gitar” veya “Güçlü Korо”.
  4. BPM: Tempoyu türle uyumlu hale getirin, örneğin “170 BPM” için bir Drum ve Bass parçası.

Kapanış Notları

Midjourney kullanarak oluşturulan görüntü

Midjourney kullanarak oluşturulan görüntü

Bu makalede, AI tarafından oluşturulan müzik/ses, algoritmik bestecilikten modern üretken AI çerçevelerine kadar bir yolculuğa girdik. Bu teknolojiler, derin öğrenme ve SOTA sıkıştırma modellerini kullanarak, sadece müzik oluşturma değil, aynı zamanda dinleyicilerin deneyimlerini iyileştirme yeteneklerine sahiptir.

Ancak, bu alan sürekli evrim geçiriyor, uzun vadeli tutarlılığı koruma ve AI tarafından oluşturulan müziğin kimliği gibi engeller, bu alanda öncü olanları zorluyor. Sadece bir hafta önce, AI tarafından oluşturulan bir şarkı, Drake ve The Weeknd’in stillerini taklit etti ve ilk olarak bu yıl online olarak yayıldı, ancak daha sonra Grammy adaylığı listesinden çıkarıldı, bu da AI tarafından oluşturulan müziğin endüstrideki meşruiyeti surrounding tartışmasını gösteriyor (kaynak). AI, müzik ve dinleyiciler arasında köprüler kurmaya devam ederken, teknoloji ile sanatın bir arada yaşadığı bir ekosistem yaratıyor, yeniliği teşvik ediyor ve geleneğe saygı gösteriyor.

Son beş yıldır Makine Öğrenimi ve Derin Öğrenme dünyasına kendimi adamış bulunuyorum. Tutkum ve uzmanlığım, özellikle AI/ML'ye odaklanarak 50'den fazla çeşitli yazılım mühendisliği projesine katkıda bulunmama yol açtı. Süregelen meraklılığım da beni Doğal Dil İşleme alanına yöneltti, bu alana daha da derinlemesine girmeye hevesliyim.