نماذج ومنصات الذكاء الاصطناعي
باحثون يخترعون نموذجًا ذكياً يمكنه الغناء باللغتين الصينية والإنجليزية
فريق من الباحثين من مايكروسوفت وجامعة زهاجيانغ قد أنشأ مؤخرًا نموذجًا ذكياً يمكنه الغناء باللغات المتعددة. كما ذكرت VentureBeat، تم تدريب نموذج DeepSinger الذي طوّره الفريق على بيانات من مواقع موسيقية مختلفة، باستخدام خوارزميات قادرة على التقاط نبرة صوت المغني.
إن توليد “صوت” لمغني ذكي يتطلب خوارزميات قادرة على التنبؤ والتحكم في كل من высота الصوت ومدة الصوت. عندما يغني الناس، فإن الأصوات التي ينتجونها لها إيقاعات وأنماط أكثر تعقيدًا مقارنة بالكلام البسيط. كان أحد المشاكل التي واجهها الفريق هو أن هناك كمية معقولة من بيانات التدريب للكلام المتحدث، ولكن مجموعات بيانات التدريب للغناء نادرة. ادمج هذه التحديات مع حقيقة أن الأغاني تحتاج إلى تحليل الصوت والكلمات، ومشكلة توليد الغناء معقدة بشكل لا يصدق.
أ超عت نظام DeepSinger الذي أنشأه الباحثون هذه التحديات من خلال تطوير خط أنابيب بيانات قام بتعدين وتحويل البيانات الصوتية. تم استخراج مقاطع الغناء من مواقع موسيقية مختلفة، ثم تم عزل الغناء عن باقي الصوت وقسمته إلى جمل. كانت الخطوة التالية هي تحديد مدة كل صوت في الكلمات، مما أدى إلى سلسلة من العينات تمثل كل صوت فريد في الكلمات. يتم تنظيف البيانات للتعامل مع أي عينات تدريب مشوهة بعد فرز الكلمات والصوت المصاحب وفقًا لدرجة الثقة.
الأساليب نفسها تبدو أنها تعمل للغات متعددة. تم تدريب DeepSinger على عينات صوتية صينية وكانتونية وإنجليزية من 89 مغنيًا يغني لمدة أكثر من 92 ساعة. وجدت نتائج الدراسة أن نظام DeepSinger كان قادرًا على توليد عينات غناء عالية الجودة وفقًا لمقاييس مثل دقة الارتفاع وكيفية صوت الغناء الطبيعي. كان لديهم 20 شخصًا يقيّمون الأغاني التي أنتجها DeepSinger والأغاني التدريبية وفقًا لهذه المقاييس، وكان الفجوة بين الدرجات للعينات المولدة والصوت الحقيقي صغيرة جدًا. أعطى المشاركون لDeepSinger درجة رأي متوسطة تختلف بين 0.34 و 0.76.
في المستقبل، يريد الباحثون محاولة تحسين جودة الأصوات المولدة من خلال تدريب النماذج الفرعية المختلفة التي يتكون منها DeepSinger، بمساعدة تقنيات متخصصة مثل WaveNet المصممة خصيصًا لمهمة توليد كلام طبيعي الصوت من خلال موجات الصوت.
يمكن استخدام نظام DeepSinger لمساعدة المغنين والفنانين الموسيقيين الآخرين على إجراء تصحيحات على عملهم دون الحاجة إلى العودة إلى الاستوديو لمجلس تسجيل آخر. يمكن أن يستخدم أيضًا لإنشاء أوديو ديبفيك، مما يجعل يبدو وكأن الفنان غنى أغنية لم يغنيها في الواقع. في حين يمكن استخدامه للفكاهة أو السخرية، إلا أنه من غير القانوني.
DeepSinger هو واحد من موجة جديدة من أنظمة الموسيقى والصوت القائمة على الذكاء الاصطناعي التي يمكن أن ت改变 كيفية تفاعل الموسيقى والبرمجيات. أصدرت OpenAI مؤخرًا نظامها الذكي الخاص، الذي أطلق عليه اسم JukeBox، والذي يمكنه إنتاج مسارات موسيقية أصلية بنمط معين أو حتى فنان معين. تشمل الأدوات الموسيقية الأخرى القائمة على الذكاء الاصطناعي ماجنتا من جوجل وديب كومبوزر من أمازون. ماجنتا هي مكتبة مفتوحة المصدر لتعديل الصوت (والصور) يمكن استخدامها لإنتاج كل شيء من دعم الطبل الآلي إلى ألعاب فيديو موسيقية بسيطة. في حين أن ديب كومبوزر من أمازون يستهدف الأشخاص الذين يريدون تدريب ونظامتهم الخاصة بنماذج التعلم العميق القائمة على الموسيقى، مما يسمح للمستخدم بتحويل نماذج العينة المسبقة التدريب وتعديلها وفقًا لاحتياجاتهم.
يمكنك الاستماع إلى بعض عينات الصوت التي أنتجها DeepSinger في هذا الرابط.












