Yapay zeka modelleri ve platformları

OpenAI Yeni Bir AI Programı Geliştirdi: Jukebox

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Bağımsız araştırma kuruluşu OpenAI, Jukebox adlı yeni bir tür generatif AI’yi piyasaya sürdü. Jukebox, müzik üretme yeteneği nedeniyle bu ismi almıştır. Jukebox AI, enstrümantasyon ve hatta şarkı sözleri gibi özelliklere göre sesler üretebilmektedir. OpenAI araştırma ekibi, AI’yi sıkıştırılmış ses klipleri ve çeşitli şarkı sözleri parçaları üzerinde eğitim vererek oluşturdu.

TechCrunch’un haberine göre, OpenAI araştırmacıları, modeli ham ses klipleri kullanarak eğitti ve modele ses üretme yeteneği kazandırdı. Bu, diğer müzik üretim uygulamalarının genellikle “sembolik müzik” (MIDI müziği gibi) kullanmasına karşılık gelir; bu, notalar ve perdeler hakkında bilgi içerir, ancak gerçek ses içermez. Araştırmacılar, modeli eğitmek için convolutional neural networks kullandı, sesi sıkıştırdı ve neural ağın yorumlayabileceği bir formata dönüştürdü. Daha sonra, bir transformer kullanılarak sıkıştırılmış ses üretildi ve veri ses formatına dönüştürmek için upsampling yapıldı.

Jukebox’u oluştururken, OpenAI, sesin karmaşık ve yoğun doğasını ele almak için bir yöntem geliştirmek zorunda kaldı. Araştırmacılar, sesin sürekli doğasını, her biri 1/128 saniye uzunluğunda olan parçalara ayırarak ele aldı. Hedef, şarkıları, problemi çözülemez hale getirmeyecek kadar büyük, ancak modellerin şarkıların desenini öğrenip yeniden oluşturabileceği kadar küçük ve kesin parçalara ayırmaktı.

OpenAI tarafından kullanılan teknik, şirketin daha önce ürettiği bir müzik üretim AI’si olan MuseNet ile bazı ortaklıklar paylaşmaktadır. MuseNet, MIDI dosyaları üzerinde eğitilmiş ve çeşitli stillerde müzik üretme yeteneğine sahipti, ancak şarkıların genel melodisi üzerinde odaklanmıştı ve şarkı sözleri üretemezdi. Buna karşılık, Jukebox kendi şarkı sözlerini müzikle birlikte üretebilmektedir. Şarkı sözleri, OpenAI araştırmacıları tarafından “ortak yazar” olarak rehberlik edilerek, belirli stillerde şarkı sözleri oluşturmak için modeli yönlendirmektedir. Jukebox sistemi, 1,2 milyon şarkının metin ve meta verilerini içeren LyricWiki’den alınan şarkı sözleri üzerinde eğitilmiştir.

Modelin şarkı sözleri ile ilgili olarak, araştırmacılar ilk olarak, şarkı sözlerini yaklaşık bir şarkı süresine yaymak için basit bir heuristik kullandılar ve belirli bir şarkı parçasına karşılık gelen metni analiz ettiler. Bu basit yaklaşım genel olarak iyi çalıştı, ancak araştırmacılar, şarkı sözlerinin özellikle hızlı olduğu durumlarda bunun bozulduğunu keşfettiler. Bu sorunu çözmek için, şarkıdan vokaller çıkarıldı ve şarkı sözleri metni ile hizalandı, böylece şarkı sözleri için kelime düzeyinde hizalamalar elde edildi. Daha sonra, şarkı sözleri için bir kodlama katmanı ve müzik parçalarına şarkı sözlerini key-value çiftleri kullanarak eşleyen bir dikkat katmanı kullanıldı. Sonuç, şarkı sözleri ve vokallerin oldukça kesin bir şekilde eşleşmesiydi.

Makale yazarları, Jukebox’un beberapa sınırlamalara sahip olduğunu ve gelecekteki çalışmaların AI’nin yeteneklerini geliştirmeyi hedefleyeceğini de not etmektedir. Yazarlar, bir blog yazısında şöyle demektedir:

“Jukebox, müzik kalitesi, tutarlılık, ses örneği uzunluğu ve sanatçı, tür ve şarkı sözlerine bağlılık açısından bir adım ileri représentsa da, bu üretimler ve insan tarafından oluşturulan müzik arasında önemli bir fark vardır. Örneğin, oluşturulan şarkılar yerel müziksel tutarlılık gösterir, geleneksel akor kalıplarını takip edebilir ve hatta etkileyici sololar içerebilir, ancak tanıdık daha büyük müziksel yapılar gibi koro gibi şeyleri duymayız.”

Şu anda, model belirli bir tür veya hatta belirli bir sanatçı tarzında şarkılar üretme yeteneğine sahiptir. Örneğin, Elvis Presley, Katy Perry veya Rage Against the Machine tarzı şarkılar üretebilir. Şarkılar, bir tür veya bir şarkıcının tarzına göre tanınabilir, ancak aynı zamanda oldukça kaba, genellikle bir parodi veya bir şarkının kötü bir kapağı gibi geliyor. Buna rağmen, teknik başarı etkileyicidir. AI üretim sistemini oluşturan araştırmacılar, müzik üretme yeteneğine sahip bir program üzerinde çalışmaya karar verdiler, çünkü görev zor olduğu için ve araştırmacılar tekniklerini iyileştirme planları yapıyorlar. Bazı şarkıları burada dinleyebilirsiniz.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.