Yapay zeka modelleri ve platformları

Araştırmacılar Çince ve İngilizce Şarkı Söyleyebilen AI Modeli Oluşturdu

mm
Unite.AI sitesini Google'daki tercih ettiğiniz kaynaklara ekleyin

Microsoft ve Zhajiang Üniversitesi’nden bir araştırma ekibi, yakın zamanda birçok dilde şarkı söyleyebilen bir AI modeli oluşturdu. VentureBeat’in raporuna göre, ekibin geliştirdiği DeepSinger AI, çeşitli müzik sitelerinden alınan verilere dayalı olarak eğitildi ve şarkıcının sesinin tınısını yakalayan algoritmalar kullanıldı.

AI şarkıcının “sesini” oluşturmak, hem pitch hem de audio süresini tahmin edebilen ve kontrol edebilen algoritmalar gerektirir. İnsanlar şarkı söylerken, ürettiği sesler basit konuşma seslerine kıyasla çok daha karmaşık ritimlere ve desenlere sahiptir. Ekibin aşması gereken bir diğer sorun, konuşma/söz eğitimi için yeterli veri bulunmasına rağmen, şarkı eğitimi veri setlerinin oldukça nadir olmasıydı. Bu zorlukları, şarkıların hem ses hem de sözlerin analiz edilmesi gerektiği gerçeğiyle birleştirin, şarkı oluşturma sorunu inanılmaz derecede karmaşık hale gelir.

Araştırmacılar tarafından oluşturulan DeepSinger sistemi, bu zorlukları audio verilerini madencilik ve dönüştürme yapan bir veri işleme hattı geliştirerek aştı. Şarkı klipleri çeşitli müzik sitelerinden çıkarıldı, ardından şarkı geri kalan audio’dan izole edildi ve cümlelere bölündü. Sonraki adım, her bir fonemin süresini belirlemekti, bu da her bir fonemi temsil eden bir dizi örnek oluşturdu. Veri temizleme, distorsiyonlu eğitim örnekleriyle başa çıkmak için, sözler ve eşlik eden audio örnekleri güven skoruna göre sıralandıktan sonra yapıldı.

Aynı yöntemler görünüşe göre çeşitli diller için de çalışıyor. DeepSinger, 89 farklı şarkıcının 92 saatten fazla şarkı söylediği Çince, Kantonca ve İngilizce vokal örneklerine dayalı olarak eğitildi. Çalışmanın sonuçları, DeepSinger sisteminin, pitch doğruluğu ve şarkıların doğal sesi gibi metriklere göre yüksek kaliteli “şarkı” örnekleri oluşturabildiğini gösterdi. Araştırmacılar, 20 kişiye DeepSinger tarafından oluşturulan şarkıları ve eğitim şarkılarını bu metriklere göre değerlendirmesini istedi ve oluşturulan örnekler ile gerçek audio arasındaki skor farkı oldukça küçüktü. Katılımcılar, DeepSinger’a 0,34 ile 0,76 arasında değişen bir ortalama görüş puanı verdi.

İleriye bakıldığında, araştırmacılar, WaveNet gibi doğal sesli konuşma oluşturmak için özel olarak tasarlanmış teknolojilerle birlikte DeepSinger’ın alt modellerini ortaklaşa eğitmek yoluyla oluşturulan seslerin kalitesini geliştirmeye çalışmak istiyorlar.

DeepSinger sistemi, şarkıcılara ve diğer müzik sanatçılarına stüdyoya geri dönmeye gerek kalmadan çalışmalarında düzeltmeler yapma konusunda yardımcı olabilir. Ayrıca, bir sanatçının asla yapmadığı bir şarkıyı söylediği izlenimini yaratarak audio deepfake oluşturmak için de potansiyel olarak kullanılabilir. Alay veya hiciv için kullanılabileceği gibi, aynı zamanda şüpheli yasal durumu vardır.

DeepSinger, müzik ve sesle etkileşim şeklini değiştirebilecek yeni AI tabanlı müzik ve ses sistemleri dalgasının yalnızca bir parçasıdır. OpenAI yakın zamanda, belirli bir tür veya hatta belirli bir sanatçı tarzı olan orijinal müzik parçaları oluşturabilen kendi AI sistemini JukeBox olarak adlandırdı. Diğer müzik AI araçları arasında Google’ın Magenta ve Amazon’un DeepComposer (AMZN ) bulunur. Magenta, otomatik davul eşliklerinden basit müzik tabanlı video oyunlarına kadar her şeyi üretmek için kullanılan açık kaynaklı bir audio (ve görüntü) manipülasyon kütüphanesidir. Diğer taraftan, Amazon’un DeepComposer’ı, kendi müzik tabanlı derin öğrenme modellerini eğitmek ve özelleştirmek isteyenlere yöneliktir, bu da kullanıcıların önceden eğitilmiş örnek modelleri almasına ve ihtiyaçlarına göre modelleri ayarlamasına olanak tanır.

(GOOGL )

DeepSinger tarafından oluşturulan bazı audio örneklerini bu bağlantıda dinleyebilirsiniz.

Blog yazarı ve programcı, Machine Learning ve Deep Learning konularında uzmanlık sahibi. Daniel, başkalarının AI'nin gücünü sosyal fayda için kullanmasına yardımcı olmak umudu taşıyor.