एआई मॉडल और प्लेटफ़ॉर्म
स्टाइलटीटीएस 2: बड़े भाषा मॉडल के साथ मानव-स्तरीय टेक्स्ट-से-स्पीच
प्राकृतिक और सिंथेटिक भाषण संश्लेषण दृष्टिकोण में वृद्धि के कारण, पिछले कुछ वर्षों में एआई उद्योग द्वारा हासिल की गई एक प्रमुख उपलब्धि प्रभावी ढंग से टेक्स्ट-से-स्पीच फ्रेमवर्क को संश्लेषित करना है जिसमें विभिन्न उद्योगों में संभावित अनुप्रयोग हैं, जिनमें ऑडियोबुक, वर्चुअल सहायक, वॉइस-ओवर कथन और अधिक शामिल हैं, जिनमें से कुछ राज्य-ऑफ-द-आर्ट मॉडल व्यापक श्रृंखला में मानव-स्तरीय प्रदर्शन और दक्षता प्रदान करते हैं। भाषण से संबंधित कार्य। हालांकि, उनके मजबूत प्रदर्शन के बावजूद, अभी भी विभिन्न कार्यों के लिए सुधार की गुंजाइश है, जो व्यक्तिपरक और विविध भाषण, शून्य-शॉट पाठ-से-भाषण फ्रेमवर्क के लिए बड़ी मात्रा में प्रशिक्षण डेटा की आवश्यकता के लिए धन्यवाद, और बाहरी या वितरित पाठों के लिए लचीलापन।
इस लेख में, हम StyleTTS-2 के बारे में बात करेंगे, एक मजबूत और नवीन टेक्स्ट-से-स्पीच फ्रेमवर्क जो StyleTTS फ्रेमवर्क के आधार पर बनाया गया है, और राज्य-ऑफ-द-आर्ट टेक्स्ट-से-स्पीच प्रणालियों की ओर अगले कदम को प्रस्तुत करने का लक्ष्य रखता है। StyleTTS2 फ्रेमवर्क भाषण शैलियों को लेटेंट रैंडम वेरिएबल के रूप में मॉडल करता है, और इन भाषण शैलियों या यादृच्छिक वेरिएबल को नमूना लेने के लिए एक संभावित प्रसार मॉडल का उपयोग करता है, जिससे StyleTTS2 फ्रेमवर्क को संदर्भ ऑडियो इनपुट का उपयोग किए बिना वास्तविक भाषण को संश्लेषित करने की अनुमति मिलती है। इस दृष्टिकोण के कारण, StyleTTS2 फ्रेमवर्क वर्तमान राज्य-ऑफ-द-आर्ट टेक्स्ट-से-स्पीच फ्रेमवर्क की तुलना में बेहतर परिणाम प्रदान करता है और प्रसार मॉडल फ्रेमवर्क द्वारा प्रदान की जाने वाली विविध भाषण संश्लेषण का लाभ उठाने में सक्षम है। हम StyleTTS2 फ्रेमवर्क पर विस्तार से चर्चा करेंगे, और इसकी वास्तुकला और विधि के बारे में बात करेंगे, साथ ही परिणामों पर भी नजर डालेंगे। तो आइए शुरू करें।
स्टाइलटीटीएस 2 टेक्स्ट-से-स्पीच संश्लेषण के लिए: एक परिचय
स्टाइलटीटीएस 2 एक नवीन टेक्स्ट-से-स्पीच संश्लेषण मॉडल है जो मानव-स्तरीय टीटीएस फ्रेमवर्क बनाने की ओर अगले कदम को लेता है, और यह स्टाइलटीटीएस पर आधारित है, जो एक शैली-आधारित पाठ-से-भाषण उत्पन्न मॉडल है। StyleTTS2 फ्रेमवर्क भाषण शैलियों को लेटेंट रैंडम वेरिएबल के रूप में मॉडल करता है, और इन भाषण शैलियों या यादृच्छिक वेरिएबल को नमूना लेने के लिए एक संभावित प्रसार मॉडल का उपयोग करता है, जिससे StyleTTS2 फ्रेमवर्क को संदर्भ ऑडियो इनपुट का उपयोग किए बिना वास्तविक भाषण को संश्लेषित करने की अनुमति मिलती है। शैलियों को लेटेंट रैंडम वेरिएबल के रूप में मॉडल करना StyleTTS2 फ्रेमवर्क को इसके पूर्ववर्ती, StyleTTS फ्रेमवर्क से अलग करता है, और यह इनपुट पाठ के लिए सबसे उपयुक्त भाषण शैली को उत्पन्न करने का लक्ष्य रखता है बिना संदर्भ ऑडियो इनपुट की आवश्यकता के, और यह प्रभावी लेटेंट प्रसार को प्राप्त करने में सक्षम है जबकि प्रसार मॉडल द्वारा प्रदान की जाने वाली विविध भाषण संश्लेषण क्षमताओं का लाभ उठाता है। इसके अलावा, StyleTTS2 फ्रेमवर्क में पूर्व-प्रशिक्षित बड़े एसएलएम (भाषण भाषा मॉडल) को विवेचक के रूप में नियुक्त करता है, जैसे कि WavLM फ्रेमवर्क, और इसे अपने नए नवाचारी अंतर्निहित अवधि मॉडलिंग दृष्टिकोण के साथ जोड़ती है ताकि फ्रेमवर्क को अंत से अंत तक प्रशिक्षित किया जा सके और अंततः प्राकृतिकता में सुधार के साथ भाषण का उत्पादन किया जा सके। इसके दृष्टिकोण के कारण, StyleTTS2 फ्रेमवर्क वर्तमान राज्य-ऑफ-द-आर्ट फ्रेमवर्क को भाषण उत्पादन कार्यों के लिए पार करता है और शून्य-शॉट सेटिंग में बड़े पैमाने पर भाषण मॉडल के पूर्व-प्रशिक्षण के लिए सबसे कुशल फ्रेमवर्क में से एक है।
आगे बढ़ते हुए, मानव-स्तरीय पाठ-से-स्पीच संश्लेषण प्रदान करने के लिए, StyleTTs2 फ्रेमवर्क मौजूदा कार्यों से सीखने को शामिल करता है, जिनमें भाषण संश्लेषण के लिए प्रसार मॉडल और बड़े भाषण भाषा मॉडल शामिल हैं। प्रसार मॉडल आमतौर पर भाषण संश्लेषण कार्यों के लिए उपयोग किए जाते हैं क्योंकि वे बारीक भाषण नियंत्रण और विविध भाषण नमूना क्षमताओं को प्रदान करते हैं। हालांकि, प्रसार मॉडल गैर-पुनरावृत्ति फ्रेमवर्क की तुलना में उतने कुशल नहीं होते हैं और इसका एक प्रमुख कारण लक्ष्य भाषण की अवधि तक लेटेंट प्रतिनिधित्व, वेवफॉर्म और मेल-स्पेक्ट्रोग्राम को पुनरावृत्ति रूप से नमूना लेने की आवश्यकता है।
दूसरी ओर, बड़े भाषण भाषा मॉडल के आसपास हाल के कार्यों ने पाठ-से-स्पीच उत्पादन कार्यों की गुणवत्ता में सुधार करने और वक्ता के अनुकूल होने की उनकी क्षमता का संकेत दिया है। बड़े भाषण भाषा मॉडल आमतौर पर पाठ इनपुट को पूर्व-प्रशिक्षित भाषण भाषा फ्रेमवर्क से प्राप्त क्वांटाइज्ड या निरंतर प्रतिनिधित्व में परिवर्तित करते हैं ताकि भाषण पुनर्निर्माण कार्यों के लिए उपयोग किया जा सके। हालांकि, इन भाषण भाषा मॉडल की विशेषताएं सीधे भाषण संश्लेषण के लिए अनुकूलित नहीं हैं। इसके विपरीत, StyleTTS2 फ्रेमवर्क बड़े एसएलएम फ्रेमवर्क द्वारा प्राप्त ज्ञान का लाभ उठाता है और विरोधी प्रशिक्षण का उपयोग करके भाषण भाषा मॉडल की विशेषताओं को संश्लेषित करने के लिए लेटेंट स्थान मैप का उपयोग किए बिना सीखता है, और इसलिए, सीधे भाषण संश्लेषण के लिए अनुकूलित लेटेंट स्थान सीखता है।
स्टाइलटीटीएस 2: वास्तुकला और विधि
इसके मूल में, स्टाइलटीटीएस 2 अपने पूर्ववर्ती, स्टाइलटीटीएस फ्रेमवर्क पर आधारित है, जो एक गैर-आत्म-निर्भर पाठ-से-स्पीच फ्रेमवर्क है जो संदर्भ ऑडियो से शैली वेक्टर को प्राप्त करने के लिए एक शैली एनकोडर का उपयोग करता है, जिससे अभिव्यक्तिपूर्ण और प्राकृतिक भाषण उत्पादन संभव हो जाता है। स्टाइलटीटीएस फ्रेमवर्क में उपयोग किया जाने वाला शैली वेक्टर सीधे एनकोडर, अवधि और पूर्वानुमानकर्ताओं में एकीकृत किया जाता है एडाप्टिव इंस्टेंस नॉर्मलाइजेशन (AdaIN) का उपयोग करके, जिससे स्टाइलटीटीएस मॉडल विभिन्न प्रोसोडी, अवधि और यहां तक कि भावनाओं के साथ भाषण आउटपुट उत्पन्न करने में सक्षम होता है। स्टाइलटीटीएस फ्रेमवर्क में कुल 8 मॉडल होते हैं जो तीन श्रेणियों में विभाजित होते हैं
- भाषण प्रणाली या भाषण उत्पादन प्रणाली जिसमें एक शैली एनकोडर, एक पाठ एनकोडर और एक भाषण डिकोडर शामिल है।
- प्रोसोडी और अवधि पूर्वानुमानकर्ताओं का उपयोग करके एक पाठ-से-स्पीच पूर्वानुमान प्रणाली।
- एक उपयोगिता प्रणाली जिसमें एक पाठ संरेखक, एक पिच निकालने वाला और प्रशिक्षण के लिए एक विवेचक शामिल है।
इसके दृष्टिकोण के कारण, स्टाइलटीटीएस फ्रेमवर्क नियंत्रित और विविध भाषण संश्लेषण से संबंधित राज्य-ऑफ-द-आर्ट प्रदर्शन प्रदान करता है। हालांकि, इस प्रदर्शन में कुछ कमियां हैं, जैसे कि नमूना गुणवत्ता में गिरावट, अभिव्यक्तिपूर्ण सीमाएं और वास्तविक समय में भाषण-हिंदering अनुप्रयोगों पर निर्भरता।
स्टाइलटीटीएस फ्रेमवर्क में सुधार करते हुए, स्टाइलटीटीएस 2 मॉडल व्यापक और विविध पाठ-से-स्पीच कार्यों के साथ-साथ बेहतर प्रदर्शन प्रदान करता है, जिसमें बाहरी प्रदर्शन में सुधार और मानव-स्तरीय गुणवत्ता शामिल है। स्टाइलटीटीएस 2 फ्रेमवर्क एक अंत से अंत तक प्रशिक्षण प्रक्रिया का उपयोग करता है जो विभिन्न घटकों को विरोधी प्रशिक्षण के साथ संयुक्त रूप से अनुकूलित करता है और सीधे तरंगरूप संश्लेषण को जोड़ती है। स्टाइलटीटीएस फ्रेमवर्क के विपरीत, स्टाइलटीटीएस 2 फ्रेमवर्क भाषण शैली को एक लेटेंट वेरिएबल के रूप में मॉडल करता है और प्रसार मॉडल का उपयोग करके इसका नमूना लेता है, जिससे स्टाइलटीटीएस 2 फ्रेमवर्क को संदर्भ ऑडियो का उपयोग किए बिना वास्तविक भाषण को संश्लेषित करने की अनुमति मिलती है। आइए इसके घटकों पर विस्तार से चर्चा करें।
हस्तक्षेप के लिए अंत से अंत तक प्रशिक्षण
स्टाइलटीटीएस 2 फ्रेमवर्क में, एक अंत से अंत तक प्रशिक्षण दृष्टिकोण का उपयोग हस्तक्षेप के लिए विभिन्न पाठ-से-स्पीच घटकों को अनुकूलित करने के लिए किया जाता है जो निर्धारित घटकों पर निर्भर नहीं है। स्टाइलटीटीएस 2 फ्रेमवर्क यह हासिल करता है कि डिकोडर को सीधे शैली वेक्टर, पिच और ऊर्जा वक्र, और संरेखित प्रतिनिधित्व से तरंगरूप उत्पन्न करने के लिए संशोधित किया जाए। फ्रेमवर्क तब डिकोडर की अंतिम प्रोजेक्शन परत को हटा देता है और इसे एक तरंगरूप डिकोडर से बदल देता है। स्टाइलटीटीएस 2 फ्रेमवर्क दो एनकोडर का उपयोग करता है: हिफिगन-आधारित डिकोडर जो सीधे तरंगरूप उत्पन्न करता है, और एक आईएसटीएफटी-आधारित डिकोडर जो चरण और परिमाण का उत्पादन करता है जो तरंगरूप में परिवर्तित हो जाता है ताकि हस्तक्षेप और प्रशिक्षण में तेजी लाई जा सके।

उपरोक्त चित्र पूर्व-प्रशिक्षण और संयुक्त प्रशिक्षण के लिए उपयोग किए जाने वाले अकουσ्टिक मॉडल का प्रतिनिधित्व करता है। प्रशिक्षण समय को कम करने के लिए, मॉड्यूल पहले पूर्व-प्रशिक्षण चरण में अनुकूलित किए जाते हैं, उसके बाद संयुक्त प्रशिक्षण के दौरान पिच निकालने वाले को छोड़कर सभी घटकों का अनुकूलन किया जाता है। संयुक्त प्रशिक्षण के दौरान पिच निकालने वाले को अनुकूलित नहीं किया जाता है क्योंकि यह पिच वक्र के लिए आधारभूत सत्य प्रदान करता है।

उपरोक्त चित्र भाषण भाषा मॉडल के विरोधी प्रशिक्षण और हस्तक्षेप का प्रतिनिधित्व करता है, जिसमें वावेलएम फ्रेमवर्क पूर्व-प्रशिक्षित लेकिन पूर्व-संयुक्त नहीं है। यह प्रक्रिया ऊपर वर्णित प्रक्रिया से भिन्न है क्योंकि यह विभिन्न इनपुट पाठ ले सकता है लेकिन प्रत्येक बैच में पैरामीटर को अद्यतन करने के लिए ग्रेडिएंट को जमा करता है।
शैली प्रसार
स्टाइलटीटीएस 2 फ्रेमवर्क एक सशर्त वितरण के माध्यम से भाषण को मॉडल करने का लक्ष्य रखता है जो एक लेटेंट वेरिएबल का अनुसरण करता है, और यह वेरिएबल सामान्यीकृत भाषण शैली कहलाता है, जो भाषण नमूने में फोनेटिक सामग्री के दायरे से परे किसी भी विशेषता का प्रतिनिधित्व करता है, जिसमें शब्दिक तनाव, प्रोसोडी, बोलने की दर और यहां तक कि फॉर्मेंट संक्रमण शामिल हैं।
भाषण भाषा मॉडल विवेचक
भाषण भाषा मॉडल अपनी सामान्य क्षमता के लिए जाने जाते हैं जो विभिन्न सेमेंटिक और अकουσ्टिक पहलुओं पर मूल्यवान जानकारी को एन्कोड करने में सक्षम होते हैं, और एसएलएम प्रतिनिधित्व पारंपरिक रूप से मानव धारणा की नकल करने में सक्षम होते हैं ताकि संश्लेषित भाषण की गुणवत्ता का मूल्यांकन किया जा सके। स्टाइलटीटीएस 2 फ्रेमवर्क विरोधी प्रशिक्षण दृष्टिकोण का उपयोग करके एसएलएम एनकोडर की क्षमता का लाभ उठाता है और एक 12-परत वावेलएम फ्रेमवर्क को विवेचक के रूप में नियुक्त करता है। यह दृष्टिकोण फ्रेमवर्क को बाहरी पाठों पर प्रदर्शन में सुधार करने में सक्षम बनाता है। इसके अलावा, ओवरफिटिंग समस्याओं से बचने के लिए, फ्रेमवर्क बाहरी और वितरित पाठों को समान संभावना के साथ नमूना लेता है।
विभेद्य अवधि मॉडलिंग
पारंपरिक रूप से, एक अवधि पूर्वानुमानकर्ता का उपयोग पाठ-से-स्पीच फ्रेमवर्क में किया जाता है जो फोनीम अवधि का उत्पादन करता है, लेकिन इन अवधि पूर्वानुमानकर्ताओं द्वारा उपयोग की जाने वाली अपसैंपलिंग विधियां अक्सर अंत से अंत तक प्रशिक्षण प्रक्रिया के दौरान ग्रेडिएंट प्रवाह को अवरुद्ध करती हैं, और नेचरलस्पीच फ्रेमवर्क मानव-स्तरीय पाठ-से-स्पीच रूपांतरण के लिए एक ध्यान-आधारित अपसैंपलर का उपयोग करता है। हालांकि, स्टाइलटीटीएस 2 फ्रेमवर्क इस दृष्टिकोण को विरोधी प्रशिक्षण के दौरान अस्थिर पाता है क्योंकि स्टाइलटीटीएस 2 विरोधी प्रशिक्षण के साथ विभेद्य अपसैंपलिंग का उपयोग करता है जिसमें अतिरिक्त शब्दों के नुकसान के कारण लंबाई में विचलन के कारण अतिरिक्त शब्द नहीं होते हैं। हालांकि एक नरम गतिशील समय वार्पिंग दृष्टिकोण का उपयोग इस विचलन को कम करने में मदद कर सकता है, इसका उपयोग न केवल गणनात्मक रूप से महंगा है, बल्कि विरोधी प्रशिक्षण उद्देश्यों या मेल-रिकंस्ट्रक्शन कार्यों के साथ इसकी स्थिरता भी एक चिंता का विषय है। इसलिए, मानव-स्तरीय प्रदर्शन प्राप्त करने और प्रशिक्षण प्रक्रिया को स्थिर करने के लिए, स्टाइलटीटीएस 2 फ्रेमवर्क एक गैर-पैरामीट्रिक अपसैंपलिंग दृष्टिकोण का उपयोग करता है। गॉसियन अपसैंपलिंग एक लोकप्रिय गैर-पैरामीट्रिक अपसैंपलिंग दृष्टिकोण है जो फोनीम के लिए अनुमानित अवधि को परिवर्तित करने के लिए उपयोग किया जाता है, हालांकि इसकी सीमाएं हैं जो गॉसियन कERNEL की निर्धारित लंबाई के कारण होती हैं। यह गॉसियन अपसैंपलिंग पर प्रतिबंध इसकी क्षमता को सीमित करता है ताकि विभिन्न लंबाई के संरेखण को सटीक रूप से मॉडल किया जा सके।
इस सीमा से निपटने के लिए, स्टाइलटीटीएस 2 फ्रेमवर्क एक नए गैर-पैरामीट्रिक अपसैंपलिंग दृष्टिकोण का प्रस्ताव करता है जो किसी अतिरिक्त प्रशिक्षण की आवश्यकता नहीं है और संरेखण की विभिन्न लंबाई को ध्यान में रखने में सक्षम है। प्रत्येक फोनीम के लिए, स्टाइलटीटीएस 2 फ्रेमवर्क संरेखण को एक यादृच्छिक वेरिएबल के रूप में मॉडल करता है और यह सूचकांक को इंगित करता है जिसके साथ फोनीम भाषण फ्रेम के साथ संरेखित होता है।
मॉडल प्रशिक्षण और मूल्यांकन
स्टाइलटीटीएस 2 फ्रेमवर्क को तीन डेटासेट पर प्रशिक्षित और प्रयोग किया जाता है: वीसीटीके, लिब्रिटीटीएस और एलजेएस्पीच। स्टाइलटीटीएस 2 फ्रेमवर्क का एकल-स्पीकर घटक एलजेएस्पीच डेटासेट पर प्रशिक्षित होता है, जिसमें लगभग 13,000+ ऑडियो नमूने होते हैं जो 12,500 प्रशिक्षण नमूनों, 100 सत्यापन नमूनों और लगभग 500 परीक्षण नमूनों में विभाजित होते हैं, जिनका संयुक्त रन समय लगभग 24 घंटे होता है। फ्रेमवर्क का बहु-वक्ता घटक वीसीटीके डेटासेट पर प्रशिक्षित होता है, जिसमें 100 से अधिक मूल वक्ताओं के साथ 44,000+ ऑडियो क्लिप होते हैं, जो 43,500 प्रशिक्षण नमूनों, 100 सत्यापन नमूनों और लगभग 500 परीक्षण नमूनों में विभाजित होते हैं। अंत में, शून्य-शॉट अनुकूलन क्षमताओं से लैस करने के लिए, फ्रेमवर्क को लिब्रिटीटीएस डेटासेट के संयोजन पर प्रशिक्षित किया जाता है, जिसमें लगभग 250 घंटे के ऑडियो क्लिप होते हैं जो 1,150 से अधिक वक्ताओं के साथ होते हैं। इसके प्रदर्शन का मूल्यांकन करने के लिए, मॉडल दो मेट्रिक्स का उपयोग करता है: एमओएस-एन (मीन ओपिनियन स्कोर ऑफ नेचुरलनेस) और एमओएस-एस (मीन ओपिनियन स्कोर ऑफ सिमिलैरिटी)।

परिणाम
स्टाइलटीटीएस 2 फ्रेमवर्क में उपयोग किए गए दृष्टिकोण और विधि को इसके प्रदर्शन में देखा जा सकता है, क्योंकि मॉडल कई राज्य-ऑफ-द-आर्ट टीटीएस फ्रेमवर्क को पार करता है, विशेष रूप से नेचरलस्पीच डेटासेट पर, और इस प्रक्रिया में डेटासेट के लिए एक नया मानक स्थापित करता है। इसके अलावा, स्टाइलटीटीएस 2 फ्रेमवर्क वीसीटीके डेटासेट पर राज्य-ऑफ-द-आर्ट विट्स फ्रेमवर्क को पार करता है, और परिणाम निम्नलिखित चित्र में दिखाए गए हैं।

स्टाइलटीटीएस 2 मॉडल एलजेएस्पीच डेटासेट पर पिछले मॉडलों को भी पार करता है, और यह पूर्ववर्ती फ्रेमवर्क द्वारा प्रदर्शित की गई गुणवत्ता में कोई गिरावट नहीं दिखाता है जब यह बाहरी या वितरित पाठों पर आता है। इसके अलावा, शून्य-शॉट सेटिंग में, स्टाइलटीटीएस 2 मॉडल प्राकृतिकता में मौजूदा वैल-ई फ्रेमवर्क को पार करता है, हालांकि यह समानता के मामले में पीछे रहता है। हालांकि, यह ध्यान देने योग्य है कि स्टाइलटीटीएस 2 फ्रेमवर्क प्रतिस्पर्धी प्रदर्शन हासिल करता है尽管 यह केवल 245 घंटे के ऑडियो नमूनों पर प्रशिक्षित होता है, जब वैल-ई फ्रेमवर्क के लिए 60k घंटे से अधिक प्रशिक्षण की तुलना में यह एक डेटा-कुशल विकल्प साबित होता है।

आगे बढ़ते हुए, भावना लेबल वाले ऑडियो पाठ डेटा की अनुपस्थिति के कारण, स्टाइलटीटीएस 2 फ्रेमवर्क जीपीटी-4 मॉडल का उपयोग करके विभिन्न भावनाओं में 500 से अधिक उदाहरणों को उत्पन्न करता है ताकि इसकी प्रसार प्रक्रिया द्वारा बनाए गए शैली वेक्टर का दृश्यीकरण किया जा सके।

पहले चित्र में, एलजेएस्पीच मॉडल से शैली वेक्टर द्वारा इनपुट पाठ भावनाओं के प्रति भावनात्मक शैलियों का प्रदर्शन किया जाता है, और यह स्टाइलटीटीएस 2 फ्रेमवर्क की क्षमता को प्रदर्शित करता है कि यह विभिन्न भावनाओं के साथ अभिव्यक्तिपूर्ण भाषण को संश्लेषित कर सकता है। दूसरा चित्र पांच व्यक्तिगत वक्ताओं के लिए विशिष्ट समूहों को दिखाता है, जो एक ही ऑडियो फ़ाइल से विविधता की एक विस्तृत श्रृंखला को प्रदर्शित करता है। अंतिम चित्र वक्ता 1 से भावनाओं के ढीले समूह को प्रकट करता है, और यह दर्शाता है कि भावना-आधारित समूह प्रमुख हैं, जो यह संकेत देते हैं कि संदर्भ ऑडियो नमूने और इसके इनपुट स्वर की परवाह किए बिना वक्ता के भावनात्मक स्वर को मैनिप्यूलेट करने की संभावना है। प्रसार-आधारित दृष्टिकोण का उपयोग करने के बावजूद, स्टाइलटीटीएस 2 फ्रेमवर्क मौजूदा राज्य-ऑफ-द-आर्ट फ्रेमवर्क को पार करता है, जिनमें विट्स, प्रोडिफ और फास्टडिफ शामिल हैं।

अंतिम विचार
इस लेख में, हमने स्टाइलटीटीएस 2 के बारे में बात की है, जो एक नवीन, मजबूत और नवाचारी पाठ-से-स्पीच फ्रेमवर्क है जो स्टाइलटीटीएस फ्रेमवर्क के आधार पर बनाया गया है और राज्य-ऑफ-द-आर्ट पाठ-से-स्पीच प्रणालियों की ओर अगले कदम को प्रस्तुत करने का लक्ष्य रखता है। स्टाइलटीटीएस 2 फ्रेमवर्क भाषण शैलियों को लेटेंट रैंडम वेरिएबल के रूप में मॉडल करता है और इन भाषण शैलियों या यादृच्छिक वेरिएबल को नमूना लेने के लिए एक संभावित प्रसार मॉडल का उपयोग करता है, जिससे स्टाइलटीटीएस 2 फ्रेमवर्क को संदर्भ ऑडियो इनपुट का उपयोग किए बिना वास्तविक भाषण को संश्लेषित करने की अनुमति मिलती है। स्टाइलटीटीएस 2 फ्रेमवर्क शैली प्रसार और एसएलएम विवेचक का उपयोग करके पाठ-से-स्पीच कार्यों पर मानव-स्तरीय प्रदर्शन प्राप्त करता है और विभिन्न भाषण कार्यों पर मौजूदा राज्य-ऑफ-द-आर्ट फ्रेमवर्क को पार करता है।












