نماذج ومنصات الذكاء الاصطناعي
HierSpeech++ : الاستدلال المتغير الهيئري لتركيب الصوت بدون إطلاق النار
التطورات الحديثة والتقدم في قدرات نماذج اللغة الكبيرة لعبت دورًا حاسمًا في تقدم الإطارات القائمة على LLM لتركيب الصوت وتوليد الكلام، خاصة في إعدادات بدون إطلاق النار. شهدت الإطارات التقليدية لتركيب الصوت تقدمًا كبيرًا نتيجة لإضافة ميزات إضافية مثل الكودك الصوتي العصبي للصوت المتقطع ووحدات الكلام. على الرغم من أن إطارات توليد الصوت والكلام هذه توفر نتائج مرضية، هناك masih مجال للتحسين، حيث أن الإطارات الحالية القائمة على LLM تتمتع بثلاثة قيود رئيسية
- هم يميلون إلى توليد خرج صوتي تلقائي يؤدي إلى نقص في المتانة وتباطؤ في سرعة التداخل وينتج عن ذلك تلفظ خاطئ أو تخطي أو تكرار.
- هم يعتمدون بشكل كبير على وحدات الكلام المنفصلة أو الكودك الصوتي العصبي المسبق التدريب.
- هم يتطلبون كمية كبيرة من بيانات التدريب.
لمواجهة المشاكل المذكورة أعلاه، وتحسين قدرات نماذج الصوت والكلام القائمة على LLM، قام المطورون بإنشاء HierSpeech++، وهو تركيب صوتي قوي وكفء لتحويل الصوت والنص إلى كلام أو مهام TTS. إطار HierSpeech++ يعتمد على التعلم الهيئري لتركيب الصوت الذي لا يزيد فقط من المتانة ولكن أيضًا يضيف إلى التعبيرية للصوت الاصطناعي بينما يزيد من الطبيعية وشباهة المتحدث في الصوت الاصطناعي حتى في إعدادات بدون إطلاق النار.
في هذه المقالة، سنناقش إطار HierSpeech++ بالتفصيل، ونلقي نظرة على هيكله ونتائجه عند مقارنته بنماذج توليد النص والصوت الحالية. لذا، دعونا نبدأ.
HierSpeech++ : الاستدلال المتغير الهيئري لتركيب الصوت بدون إطلاق النار
HierSpeech++ هو إطار تركيب صوت سريع ومتين وكفء لتركيب الصوت بدون إطلاق النار، يستخدم خط أنابيب تركيب الصوت الهيئري، وبالاعتماد على هذا الإطار من النهاية إلى النهاية، يمكن لنموذج HierSpeech++ تحقيق أقصى إمكانات توليد الشكل الموجي عالي الجودة لجسور الفجوة بين التمثيلات الدلالية والصوتية من خلال اعتماد تمثيل صوتي ذاتي الإشراف كتمثيل دالالي للصوت، وبالتالي يحاول حل القيود الحالية لتعديل الأسلوب.
جودة إعادة بناء الصوت لهذه الإطارات يمكن تحسينها بشكل أكبر باستخدام محول متغير شرطي هيراركي كما هو مستخدم في إطار HierSpeech. على الرغم من إمكانياتها، فإن نماذج خط الأنابيب التدريبي من النهاية إلى النهاية تتمتع بقيود معينة، خاصة في إعدادات بدون إطلاق النار، حيث يمكنها توليد عينات صوتية ذات جودة عالية، ولكن شباهة المتحدث في مهام التكرار الصوتي بدون إطلاق النار لا تزال تعاني من تعقيد حسابي كبير.
من ناحية أخرى، تعمل نماذج تركيب الصوت القائمة على الانتشار جيدًا فيما يتعلق bằng تعديلات المتحدث، لكنها لا تزال بعيدة عن الكمال لأنها تستخدم عملية توليد تفاعلية تبطئ من سرعة الاستدلال، وهي عرضة للبيانات الصاخبة، ونتيجة لعدم تطابق بين التدريب والاستدلال في عملية التوليد بخطوتين بين المخطط الطيفي الميل وGROUND الحقيقي، فإن جودة الصوت ليست على مستوى عال.
للمواجهة مع التحديات التي تواجه سلالتها، يستخدم نموذج HierSpeech++ تركيب صوتي هرمي وتركيب صوتي فائق الدقة ومكون نص إلى.vec، ويقدم تركيب صوتي هرمي محسّن مبني على محول متغير شرطي هرمي. في محاولة لتعزيز جودة الصوت وراء الجودة الحسية، يعتمد إطار HierSpeech++ على صوت ثنائي لتعزيز البوستر الصوتي الخلفي، ويعزز تعميم خارج التوزيع من خلال استخدام مولد هرمي قابل للتكيف مع التوليد الشرطي واللاشرطي.
- استخدام إطار تركيب الصوت الهيئري للسيطرة على نقل أسلوب الصوت والتنغيم.
- تمكين قابلية توسيع البيانات وتوليد صوت عالي الدقة عن طريق عينة الشكل الموجي الصوتي من 16 إلى 48 كيلوهرتز.
- تحقيق القدرة البشرية عبر مهام تحويل الصوت بدون إطلاق النار وتوليد النص إلى كلام.
HierSpeech++ : مكونات النموذج وهيكله
كما ناقشنا، HierSpeech++ هو نموذج لتركيب الصوت بدون إطلاق النار يهدف إلى تحقيق دقة على مستوى الإنسان فيما يتعلق بتشابه الصوت وطبيعة الكلام.

يتكون نموذج HierSpeech++ من مكونات مختلفة، بما في ذلك تركيب صوتي هرمي وتركيب صوتي فائق الدقة ونص إلى.vec، تعمل معًا لتمكين تدريب كل نموذج لاستخدام كمية كبيرة من بيانات الصوت منخفضة الدقة لتحويل الصوت. دعونا نناقش هيكل الإطار ونتحدث عن كل مكون.
تمثيلات الصوت
نظرًا لأن نطاق التردد البشري يقع تحت 4 كيلوهرتز، فإن إطار HierSpeech++ يخفض عينة الصوت إلى 16 كيلوهرتز لتركيب الصوت. بالإضافة إلى ذلك، من أجل إعادة بناء إشارة الصوت، من المهم استخدام على الأقل ضعف أعلى مكون تردد الصوت بالإضافة إلى خفض عينة الصوت.

للاتمثيلات الصوتية، يستخدم إطار التحدث إلى النص التقليدية مخطط طيف ميل كوسمة صوتية وسيطة، ثم يتم تحويله من الشكل الموجي باستخدام تحويل فورييه الزمني القصير. ومع ذلك، يُلاحظ أن الخصائص الصوتية غنية بالتمثيلات التي تتضمن العديد من السمات، بما في ذلك المحتوى والتنطق، ومعلومات الصوت، وغيرها، مما يجعل من الصعب على الإطار استنتاج هذه التمثيلات، مما يؤدي إلى تلفظ خاطئ أو نقص في التشابه أو تقليل الصوت.
متحركًا إلى الأمام، لاستخراج تمثيل دالالي مستمر من الشكل الموجي، يستخدم إطار HierSpeech++ إطار Wav2Vec على عكس النهج الشائع لتمثيل الصوت الذاتي الإشراف للتمثيلات الدلالية. على الرغم من أن هذا النهج يُعتبر بديلًا جيدًا لنموذج غني أحادي اللغة، إلا أنه يؤثر على قدرات التكرار الصوتي بدون إطلاق النار للنموذج من حيث المتانة والتعبير، خاصة في مهام التوليد الصوتي المتعددة اللغات.
تركيب الصوت الهرمي
مكون تركيب الصوت الهرمي هو الحجر الزاوي لإطار HierSpeech++ لأنه يسمح بتدريب الوحدة بدون استخدام أي تسميات مثل نصوص النص أو معرف المتحدث، ويعتمد فقط على بيانات الصوت.

يستخدم تركيب الصوت الهرمي محول صوتي ثنائي لتحديد تمثيلات صوتية أكثر غنى وشمولا. بالإضافة إلى ذلك، يستخدم تركيب الصوت الهرمي محول الشكل الموجي لاستخراج المعلومات من الشكل الموجي الصوتي الخام، ويربطه بتمثيل الطيف الخطي، و cuốiًا يعرض التمثيل الصوتي كتمثيل مترافق.
للمواجهة مع التمثيلات الدلالية غير المرتبطة بالمتحدث ومرتبطة بالمتحدث، يستخدم إطار HierSpeech++ تمثيل صوتي ذاتي الإشراف متعددة المسارات، حيث يتم استخدام كل تمثيل فردي لتعديل الأسلوب الهيئري مع التمثيلات الدلالية المستخرجة لاستخراج المعلومات اللغوية من طبقة الوسطى من MMS.
نص إلى.vec
لتركيب الصوت من النص، يستخدم إطار HierSpeech++ نموذج نص إلى.vec الذي يولد ترددًا أساسيًا وتمثيلًا دالاليًا من تسلسل النص، ويعتمد على بحث التموضع المتوازي مع محول متغير ذاتي للتركيب الداخلي للنص والصوت.

يستبدل إطار HierSpeech++ مخطط الطيف الخطي بتمثيل خطي ذاتي الإشراف، ويعيد بناء نفس التمثيل كإخراج للنص إلى.vec.
تركيب الصوت الفائق الدقة أو تركيب الصوت الفائق
يتدرب إطار HierSpeech++ على مجموعة بيانات منخفضة الدقة نسبيًا من حيث كفاءة البيانات ومدى توفرها، ويعيد عينة الشكل الموجي الصوتي منخفضة الدقة إلى شكل موجي صوتي عالي الدقة من 16 إلى 48 كيلوهرتز.

الهيكل
يتكون محول المحتوى لنموذج نص إلى.vec من 16 طبقة WaveNet غير متسلسلة مع حجم نووي 5 و 256، في حين أن محول المحتوى يحتوي على 8 طبقات WaveNet غير متسلسلة مع حجم نووي 5 و 512.

الشكل أعلاه يظهر خط أنابيب الاستدلال لإطار HierSpeech++ الذي يبدأ باستخراج التمثيلات الدلالية من الصوت بتردد 16 كيلوهرتز، وتردد أساسي باستخدام خوارزمية YAPPT.
التجربة والنتائج
يستخدم الإطار مجموعة بيانات LibriTTS العامة لتدريب مكون تركيب الصوت الهرمي، مع خطوة أولى هي تدريب النموذج على مجموعات فرعية trainclean من مجموعة البيانات، واستخدام البيانات المتبقية لتمكين نقل أسلوب الصوت المحسّن.

إعادة البناء والمهام الإعادة التركيب وتحويل الصوت
للتقييم الأداء لإطار HierSpeech++ في مهام إعادة البناء وإعادة التركيب، قام المطورون بسبعة معايير موضوعية، وتم عرض النتائج في الأشكال التالية لمهام إعادة البناء وإعادة التركيب على التوالي.


للمهام تحويل الصوت، يستخدم الإطار两个 معيار موضوعي للتقييم: تشابه الصوت MOS و mean opinion score of nMOS مع ثلاثة معايير موضوعية للطبيعية واثنين من معايير التشابه الموضوعية.

متحركًا إلى الأمام، الهدف الرئيسي لإطار HierSpeech++ هو تمكين تركيب الصوت بدون إطلاق النار، وللتقييم الأداء بدون إطلاق النار، يتم مقارنته بنماذج أساسية أخرى مثل AutoVC و VoiceMixer و Diffusion-based models وغيرها، مع عرض النتائج في الشكل التالي.

الأشكال التالية تعرض نتائج تحويل النص إلى كلام بدون إطلاق النار مع مسودات ضجيج ومسودات ضجيج شديد على التوالي.


أفكار ختامية
في هذه المقالة، ناقشنا نموذج HierSpeech++، وهو نهج جديد لتمكين تركيب صوت قوي وفعال في إعدادات بدون إطلاق النار، وتجاوز القيود التي تواجه إطارات تركيب الصوت الحالية، بما في ذلك الاعتماد الكبير على كميات كبيرة من بيانات التدريب، والاعتماد على وحدات الصوت المنفصلة أو الكودك الصوتي العصبي المسبق التدريب، وتميل إلى توليد خرج صوتي تلقائي يؤدي إلى نقص في المتانة وتباطؤ في سرعة التداخل وينتج عن ذلك تلفظ خاطئ أو تخطي أو تكرار.
- استخدام إطار تركيب الصوت الهيئري للسيطرة على نقل أسلوب الصوت والتنغيم.
- تمكين قابلية توسيع البيانات وتوليد صوت عالي الدقة عن طريق عينة الشكل الموجي الصوتي من 16 إلى 48 كيلوهرتز.
- تحقيق القدرة البشرية عبر مهام تحويل الصوت بدون إطلاق النار وتوليد النص إلى كلام.












