زاوية Anderson

أبحاث الذكاء الاصطناعي تتطلع إلى تحكمات حجم منفصلة للحوار والموسيقى والأصوات

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تتعاون أبحاث جديدة بقيادة شركة ميتسوبيشي في إمكانية استخراج ثلاث مسارات صوتية منفصلة من مصدر صوتي أصلية، وتحلل المسار الصوتي إلى كلام وموسيقى وأصوات (أي ضوضاء محيطة).

منذ أن هذه هي إطار عمل المعالجة بعد الحقيقة، فإنه يقدم إمكانية للgenerations اللاحقة من منصات عرض الوسائط المتعددة، بما في ذلك المعدات الاستهلاكية، لتقديم تحكمات حجم ثلاثية النقاط، مما يسمح للمستخدم بزيادة صوت الحوار أو خفض صوت المسار الصوتي.

في الشريط القصير أدناه من الفيديو المرافق لأبحاث (انظر نهاية المقال للفيديو الكامل)، نرى جوانب مختلفة من المسار الصوتي تبرز عندما يسحب المستخدم عنصر تحكم عبر مثلث مع كل من المكونات الصوتية الثلاث في زاوية:

شريط قصير من الفيديو المرافق للورقة (انظر التضمين في نهاية المقال). عندما يسحب المستخدم المؤشر نحو أحد الجوانب الثلاثة المستخرجة من المسار الصوتي الثلاثي في واجهة المثلث (على اليمين)، يبرز الصوت هذا الجزء من المسار الصوتي. على الرغم من أن الفيديو الأطول يذكر عددًا من الأمثلة الإضافية على يوتيوب، يبدو أنها غير متاحة حاليًا. المصدر: https://vimeo.com/634073402

الورقة بعنوان مشكلة شوكة الكوكتيل: فصل صوت ثلاثي للصوت الحقيقي، وهي تأتي من الباحثين في مختبرات أبحاث ميتسوبيشي إلكتريك (MERL) في كامبريدج، ماساتشوستس، و قسم الهندسة الذكية في جامعة إنديانا في إلينوي.

فصل جوانب المسار الصوتي

سُميت التحدي بـ “مشكلة حفلة الكوكتيل” لأنها تتضمن عزل عناصر متشابكة بشكل حاد من المسار الصوتي، مما يخلق خريطة طريق تشبه شوكة (انظر الصورة أدناه). في الممارسة، قد يكون للمسارات الصوتية متعددة القنوات (أي ستيريو وأكثر) كميات مختلفة من أنواع المحتوى، مثل الحوار والموسيقى والمناخ، خاصة وأن الحوار يعتاد السيطرة على القناة الوسطى في مزيج دولبي 5.1. حاليًا، ومع ذلك، فإن مجال البحث النشط جدًا عن فصل الصوت يركز على التقاط هذه الخيوط من مسار صوتي منفرد ومخبز، كما تفعل الأبحاث الحالية.

شوكة الكوكتيل - استخراج ثلاث مسارات صوتية متميزة من مسار صوتي منفرد ومخلوط.

شوكة الكوكتيل – استخراج ثلاث مسارات صوتية متميزة من مسار صوتي منفرد ومخلوط. المصدر: https://arxiv.org/pdf/2110.09958.pdf

ركزت الأبحاث الحديثة على استخراج الكلام في مختلف البيئات، غالبًا لأغراض إزالة الضوضاء من صوت الكلام للاستفادة لاحقًا من أنظمة معالجة اللغة الطبيعية (NLP)، ولكن أيضًا على عزل أصوات الغناء الأرشيفية، إما لإنشاء نسخ اصطناعية من المطربين الحقيقين (حتى الموتى)، أو لتسهيل عزل الموسيقى على طريقة الكراوكي.

مجموعة بيانات لكل جانب

حتى الآن، لم يُمنح الكثير من الاعتبار لاستخدام هذا النوع من تقنية الذكاء الاصطناعي لمنح المستخدمين المزيد من التحكم في مزيج المسار الصوتي. لذلك، قام الباحثون بتحديد المشكلة وتطوير مجموعة بيانات جديدة كمساعدة للبحث المستمر في فصل الصوت متعدد الأنواع، بالإضافة إلى اختبارها على إطارات فصل صوتية موجودة.

المجموعة الجديدة من البيانات التي طورها المؤلفون تسمى قسم واعادة إنتاج (DnR)، وهي مستمدة من مجموعات بيانات سابقة LibriSpeech و Free Music Archive و مجموعة بيانات Freesound 50k (FSD50K). لأولئك الذين يرغبون في العمل مع DnR من البداية، يجب إعادة بناء المجموعة من ثلاث مصادر؛ بخلاف ذلك، ستكون متاحة قريبًا في Zenodo، وفقًا للمؤلفين. ومع ذلك، في وقت الكتابة، الرابط الذي تم توفيره على GitHub لأدوات استخراج المصدر غير نشط حاليًا، لذلك قد يضطر المهتمون إلى الانتظار لفترة.

وجد الباحثون أن هيكل CrossNet غير مخلوط (XUMX) المقترح من سوني في مايو يعمل بشكل جيد بشكل خاص مع DnR.

هيكل صوتي CrossNet من سوني.

هيكل صوتي CrossNet من سوني.

يزعم المؤلفون أن نماذج استخراج التعلم الآلي الخاصة بهم تعمل بشكل جيد على مسارات صوتية من يوتيوب، على الرغم من أن التقييمات المقدمة في الورقة تستند إلى بيانات اصطناعية، والفيديو الرئيسي المرفق (المضمن أدناه) هو حاليًا الوحيد الذي يبدو أنه متاح.

تتكون كل من المجموعات الثلاث المستخدمة من مجموعة من النوع من الإخراج الذي يتعين فصلُه من مسار صوتي: FSD50K مشغول بالأصوات، ويتضمن 50,000 مقطع صوتي أحادي ذو تردد 44.1 كيلوهرتز ومُصنّف بـ 200 علامة تصنيف من أونتولوجيا AudioSet من جوجل؛ وتتضمن Free Music Archive 100,000 أغنية ستيريو تغطي 161 نوعًا من الموسيقى، على الرغم من أن المؤلفين استخدموا مجموعة فرعية تحتوي على 25,000 أغنية، لمواجهة FSD50K؛ ويوفر LibriSpeech 100 ساعة من عينات الكتب الصوتية كملفات صوتية mp3 بسرعة 44.1 كيلوهرتز.

العمل المستقبلي

يتوقع المؤلفون مزيدًا من العمل على المجموعة ودمج النماذج المنفصلة التي تم تطويرها لأبحاث إضافية في إطارات التعرف على الكلام وتصنيف الصوت، مع تضمين توليد تعليمات تلقائية للكلام والصوت غير الكلامي. كما يعتزمون تقييم إمكانيات نهج إعادة المزج التي يمكن أن تقلل من العيوب الحسية، والتي لا تزال المشكلة المركزية عند تقسيم مسار صوتي مخلوط إلى مكوناته الأساسية.

يمكن أن تكون هذا النوع من الفصل متاحًا في المستقبل كسلعة استهلاكية في التلفزيونات الذكية التي تدمج شبكات استدلال محسنة للغاية، على الرغم من أنه يبدو من المحتمل أن التطبيقات المبكرة ستحتاج إلى بعض الوقت المسبق للمعالجة والتخزين. يستخدم سامسونج بالفعل الشبكات العصبية المحلية للتحسين، في حين أن معالج سوني الاعرفي XR، المستخدم في سلسلة برافيا، يتحليل و يعيد تفسير المسارات الصوتية على أساس حي عبر الذكاء الاصطناعي الخفيف المتكامل.

تتكرر نداءات التحكم أكبر في مزيج المسار الصوتي دوريًا، ومعظم الحلول المقترحة يجب أن تتعامل مع حقيقة أن المسار الصوتي قد تم بالفعل تخفيضه وفقًا للمعايير الحالية (وافتراضات حول ما يريد المشاهدون) في صناعات الأفلام والتلفزيون.

أصبح أحد المشاهدين، الذي كان منزعجًا من التفاوت الصادم لمستويات الصوت بين عناصر مختلفة من مسارات الصوت للأفلام، يائسًا لدرجة أنه طور محول تلقائي لتعديل الحجم يمكنه تحقيق توازن في الحجم للأفلام والتلفزيون.

على الرغم من أن التلفزيونات الذكية تقدم مجموعة متنوعة من الطرق لمحاولة تعزيز صوت الحوار ضد مستويات الحجم الكبيرة للموسيقى، إلا أنها جميعًا تكافح ضد القرارات المتخذة في وقت المزج، ويمكن القول إن رؤية منتجي المحتوى الذين يرغبون في أن يختبر الجمهور مساراتهم الصوتية بالضبط كما تم إعدادها.

يبدو أن منتجي المحتوى قد يتعارضون مع هذا الإضافة المحتملة إلى “ثقافة الإعادة”، حيث سبق أن أعرب عدد من الشخصيات البارزة في الصناعة عن انزعاجهم من الخوارزميات التلفزيونية الافتراضية بعد المعالجة مثل تحسين الحركة.

https://vimeo.com/634073402

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai