نماذج ومنصات الذكاء الاصطناعي

OpenVoice: تمكين التكرار الصوتي الفوري المتنوع

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

في 합성 النص إلى الكلام (TTS)، يسمح التكرار الصوتي الفوري (IVC) لنموذج TTS بتكرار صوت أي متحدث مرجعي باستخدام عينة صوتية قصيرة، دون الحاجة إلى تدريب إضافي للمتحدث المرجعي. يُعرف هذا الأسلوب أيضًا باسم 합성 النص إلى الكلام من الصفر. يسمح подход التكرار الصوتي الفوري بمرونة في تخصيص الصوت المولَّد ويتضح قيمته بشكل كبير عبر مجموعة واسعة من الحالات الواقعية، بما في ذلك بوتات الدردشة المخصصة وإنشاء المحتوى والتفاعلات بين البشر ونمذجة اللغة الكبيرة (LLMs).

على الرغم من أن إطارات التكرار الصوتي الحالية تقوم بعملهم جيدًا، إلا أنها تواجه بعض التحديات في المجال، بما في ذلك مراقبة أسلوب الصوت المرنة، أي أن النماذج تفتقر إلى القدرة على التلاعب بأسلوب الصوت بمرنة بعد تكرار الصوت. وتعتبر مشكلة أخرى كبيرة تواجهها إطارات التكرار الصوتي الفوري الحالية هي تكرار الصوت العابر للغات من الصفر، أي أن النماذج الحالية تتطلب الوصول إلى مجموعة بيانات متعددة المتحدثين متعددة اللغات أو MSML بغض النظر عن اللغة.

لمواجهة هذه القضايا، عمل المطورون على OpenVoice، وهو إطار تكرار صوتي فوري مفتوح المصدر يهدف إلى حل التحديات التالية التي تواجه إطارات التكرار الصوتي الفوري الحالية.

في هذه المقالة، سنناقش إطار OpenVoice بعمق، وسنكشف عن هيكله الذي يسمح له بالحصول على أداء متفوق عبر مهام التكرار الصوتي الفوري. لذا دعونا نبدأ.

OpenVoice: تمكين التكرار الصوتي الفوري المتنوع

كما ذكرنا سابقًا، يسمح التكرار الصوتي الفوري، المعروف أيضًا باسم 합성 النص إلى الكلام من الصفر، لنموذج TTS بتكرار صوت أي متحدث مرجعي باستخدام عينة صوتية قصيرة، دون الحاجة إلى تدريب إضافي للمتحدث المرجعي. يعتبر التكرار الصوتي الفوري موضوعًا ساخنًا في البحث مع الأعمال الحالية بما في ذلك إطارات XTTS وVALLE التي تستخرج تعبئة المتحدث و/أو الرموز الصوتية من الصوت المرجعي الذي يخدم كشرط للنموذج التلقائي.

على الرغم من أن نماذج التكرار الصوتي الفوري التلقائي تكرر لون الصوت بشكل ملحوظ، إلا أنها تفشل في التلاعب بمتغيرات الأسلوب الأخرى، بما في ذلك المقطع، العاطفة، الاستراحات، والايقاع. بالإضافة إلى ذلك، تتعرض النماذج التلقائية لانخفاض سرعة الاستدلال، وتكلفة تشغيلها مرتفعة. النماذج الحالية مثل إطار YourTTS ي采用 نهج غير تلقائي يظهر سرعة استدلال كلامية أسرع بشكل كبير من إطارات التكرار الصوتي الفوري التلقائية، لكنها لا تزال غير قادرة على تقديم مراقبة مرنة لأسلوب الصوت للمستخدمين.

للمواجهة التحديات التي تواجه إطارات التكرار الصوتي الفوري الحالية، عمل المطورون على OpenVoice، وهو إطار تكرار صوتي فوري مفتوح المصدر يهدف إلى حل التحديات التالية التي تواجه إطارات التكرار الصوتي الفوري الحالية.

  1. التحدي الأول هو تمكين إطارات التكرار الصوتي الفوري من مراقبة مرنة لمتغيرات الأسلوب بالإضافة إلى لون الصوت، بما في ذلك المقطع، الايقاع، النبرة، والاستراحات. تعتبر متغيرات الأسلوب حاسمة لإنشاء محادثات طبيعية وخطاب بدلاً من سرد النص المدخل بطريقة مملة.
  2. التحدي الثاني هو تمكين إطارات التكرار الصوتي الفوري من تكرار الأصوات العابرة للغات في إعداد من الصفر.
  3. التحدي النهائي هو تحقيق سرعات استدلال فعلية عالية دون تدهور الجودة.

للمواجهة العوائق الأولى، يتم تصميم هيكل إطار OpenVoice بطريقة تفصل المكونات في الصوت إلى أفضل ما يمكن. بالإضافة إلى ذلك، يولد OpenVoice لون الصوت، اللغة، وميزات الصوت الأخرى بشكل مستقل، مما يسمح للإطار بالتلاعب بميزات اللغة الفردية وأسلوب الصوت بمرنة.

OpenVoice: المنهجية والهيكل

الإطار الفني لإطار OpenVoice فعال وبسيط التنفيذ. لا يوجد سر في أن تكرار لون الصوت لأي متحدث، وإضافة لغة جديدة، وتمكين مراقبة مرنة لمتغيرات الصوت في نفس الوقت يمكن أن يكون تحديًا. هذا هو الحال لأن تنفيذ هذه المهام الثلاث في نفس الوقت يتطلب Parameters المسيطر عليها لتتقاطع باستخدام جزء كبير من مجموعات البيانات التوليفية.

في 합성 النص إلى الكلام العادي، لمهام لا تتطلب تكرار الصوت، من السهل إضافة مراقبة لمتغيرات الأسلوب الأخرى. بناءً على ذلك، يهدف إطار OpenVoice إلى فصل مهام التكرار الصوتي الفوري إلى مهام فرعية. يُقترح استخدام نموذج TTS للمتحدث الأساسي لمراقبة متغيرات اللغة والأسلوب، ويوظف محول لون الصوت لدمج لون الصوت المرجعي في الصوت المولَّد.

في جوهره، يعتمد إطار OpenVoice على مكونين: محول لون الصوت، ونموذج TTS للمتحدث الأساسي. يمكن أن يكون نموذج TTS للمتحدث الأساسي نموذجًا لمتحدث واحد أو متحدثين متعددين، مما يسمح بمراقبة دقيقة لمتغيرات الأسلوب، اللغة، والمقطع.

يوفر إطار OpenVoice مرونة كبيرة فيما يتعلق بنموذج TTS للمتحدث الأساسي، حيث يمكنه استخدام نموذج VITS مع تعديلات طفيفة تتيح له قبول تعبئة اللغة والأسلوب في معاينة المدة وترميز النص.

فيما يتعلق بالمكون الثاني، محول لون الصوت، فهو مكون من نوع معالجة-مترجم يحتوي على تدفق عادي قابل للعكس في المركز.

المحول الكامل لمحول لون الصوت هو محول بسيط من نوع CNN ثنائي الأبعاد يعمل على المخطط الصوتي للمتحدث المرجعي، وينتج متجه ميزة واحد يحتوي على معلومات لون الصوت.

تعتمد طبقات التدفق العادي على خرج محول الميزة وتنتج تمثيل ميزة يحافظ على جميع خصائص الأسلوب ولكن يلغي معلومات لون الصوت.

يُطبق إطار OpenVoice طبقات التدفق العادي في الاتجاه العكسي، ويتخذ تمثيلات الميزة كمدخل وينتج طبقات التدفق العادي.

ثم يفكّك إطار OpenVoice طبقات التدفق العادي إلى موجات сыة باستخدام مجموعة من التconvolutions المنعكسة.

الهيكل الكامل لإطار OpenVoice هو هيكل متوازي بدون استخدام أي مكون تلقائي.

مكون محول لون الصوت مشابه لمحول الصوت من حيث المفهوم، ولكنه يختلف فيما يتعلق بالوظيفة، وأهداف التدريب، والتحيز الاستقرائي في هيكل النموذج.

تشارك طبقات التدفق العادي نفس الهيكل مثل نماذج الكلام القائمة على التدفق، ولكنها تختلف فيما يتعلق بالوظيفة وأهداف التدريب.

علاوة على ذلك، هناك نهج بديل لاستخراج تمثيلات الميزة، والطريقة المنفذة بواسطة إطار OpenVoice توفر جودة صوت أفضل.

كما أنه من الجدير بالذكر أن إطار OpenVoice لا يهدف إلى اختراع مكونات في هيكل النموذج، بل كلا المكونين الرئيسيين، محول لون الصوت ونموذج TTS للمتحدث الأساسي، يتم استخلاصهما من الأعمال الحالية.

الهدف الرئيسي لإطار OpenVoice هو تشكيل هيكل منفصل يفصل بين التحكم في اللغة وأسلوب الصوت عن تكرار لون الصوت.

على الرغم من أن النهج بسيط، إلا أنه فعال بشكل خاص في المهام التي تتحكم في الأسلوب واللهجات أو مهام التعميم على لغات جديدة.

تحقيق نفس التحكم عند استخدام هيكل مقترن يتطلب كمية كبيرة من الحوسبة والبيانات، ولا يتعمم جيدًا على لغات جديدة.

في جوهره، الفلسفة الرئيسية لإطار OpenVoice هي فصل توليد اللغة وأسلوب الصوت عن توليد لون الصوت.

إحدى نقاط القوة الرئيسية لإطار OpenVoice هي أن الصوت المكرر هو سلس وذو جودة عالية طالما يتحدث نموذج TTS للمتحدث الواحد بسلاسة.

OpenVoice: التجربة والنتائج

تقييم مهام تكرار الصوت هو موضوع صعب بسبب العديد من الأسباب.

نظرًا للreasons الثلاثة المذكورة أعلاه، من غير العادل مقارنة الأعمال الحالية رقميًا.

تكرار دقيق للون الصوت

为了 تحليل أدائه، يُنشئ المطورون مجموعة اختبار مع أفراد مجهولين، وشخصيات ألعاب و مشاهير يشكلون قاعدة المتحدثين المرجعيين، ويتوزع الصوت على نطاق واسع بما في ذلك عينات محايدة و أصوات تعبيرية فريدة.

مراقبة مرنة لأسلوب الصوت

أحد أهداف إطار OpenVoice هو مراقبة أسلوب الصوت بمرنة باستخدام محول لون الصوت الذي يمكن تعديل لون الصوت مع الحفاظ على جميع ميزات الصوت الأخرى والخصائص.

تشير التجارب إلى أن النموذج يحافظ على أسلوب الصوت بعد تحويله إلى لون الصوت المرجعي.

تكرار صوت عابر للغات

يتمكن إطار OpenVoice من تحقيق تكرار صوت عابر للغات في إعداد من الصفر دون الحاجة إلى بيانات متعددة المتحدثين متعددة اللغات أو MSML.

  1. النموذج قادر على تكرار لون الصوت للمتحدث المرجعي بدقة عندما تكون لغة المتحدث المرجعي غير موجودة في مجموعة بيانات MSML.
  2. علاوة على ذلك، عندما تكون لغة المتحدث المرجعي غير موجودة، يمكن لإطار OpenVoice تكرار صوت المتحدث المرجعي وتحدث باللغة التي يدعمها نموذج TTS للمتحدث الأساسي.

أفكار ختامية

في هذه المقالة، ناقشنا إطار OpenVoice، وهو إطار تكرار صوتي فوري متنوع يكرر صوت أي مستخدم وينتج كلامًا في لغات متعددة باستخدام عينة صوتية قصيرة من المتحدث المرجعي.

يُظهر إطار OpenVoice أن نماذج التكرار الصوتي الفوري يمكنها تكرار لون الصوت للمتحدث المرجعي، وتحقيق مراقبة دقيقة لأسلوب الصوت بما في ذلك المقطع، الايقاع، النبرة، والاستراحات، وحتى العواطف.

يتمكن إطار OpenVoice من تقديم نتائج تكرار صوتي فوري متفوقة مع كونها قابلة للحوسبة مع تكاليف تشغيل تصل إلى 10 أضعاف أقل من واجهات برمجة التطبيقات الحالية ذات الأداء الأقل.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.