साक्षात्कार

फिल मार्शल, स्पोकन के संस्थापक और सीईओ – साक्षात्कार श्रृंखला

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

Phil Marshall, स्पोकन के संस्थापक और सीईओ, एक चिकित्सक, आविष्कारक, प्रौद्योगिकी उद्यमी और विज्ञान कथा लेखक हैं जिनका करियर स्वास्थ्य देखभाल, डिजिटल मीडिया, कृत्रिम बुद्धिमत्ता और उत्पाद नवाचार तक फैला है। 2024 में स्पोकन लॉन्च करने से पहले, मार्शल ने Conversa Health की सह-स्थापना की, जो एक व्यक्तिगत रोगी सहभागिता और वार्तालाप एआई कंपनी थी, जिसे 2021 में Amwell ने अधिग्रहित किया और यह उनके स्वचालित वर्चुअल केयर व्यवसाय का हिस्सा बन गई। अपने करियर के शुरुआती चरण में, उन्होंने WebMD में उत्पाद रणनीति के उपाध्यक्ष के रूप में एक दशक से अधिक काम किया, बाद में Press Ganey Associates में वरिष्ठ उपाध्यक्ष, उत्पाद प्रबंधन के रूप में कार्य किया, और सहयोगी वीडियो तकनीक स्टार्टअप JumperCut की स्थापना की। उनका कार्य अब एआई, कहानी कहने, मस्तिष्क‑कंप्यूटर इंटरफ़ेस और ज्ञान प्रौद्योगिकियों के संगम पर केंद्रित है, जो उनकी तकनीकी और उद्यमी पृष्ठभूमि को विज्ञान कथा और उभरते डिजिटल इंटरैक्शन रूपों में उनकी रुचियों के साथ जोड़ता है।

Spoken एक एआई‑संचालित ऑडियोबुक प्लेटफ़ॉर्म है जो लेखकों, प्रकाशकों और अधिकार धारकों को पांडुलिपियों को पेशेवर रूप से निर्मित ऑडियो में बदलने में मदद करता है, बिना पारंपरिक रिकॉर्डिंग स्टूडियो पर निर्भर हुए। इसकी तकनीक पांडुलिपि की भाषा, शैली, कथा संरचना और पात्रों का विश्लेषण करती है और फिर कथन और संवाद के लिए अलग‑अलग आवाज़ें निर्धारित करती है, जिससे एकल‑वाचक, द्वि‑वाचक और मल्टी‑कास्ट उत्पादन संभव होते हैं। लेखक कस्टम‑जनरेटेड आवाज़ें उपयोग कर सकते हैं, 100 से अधिक भुगतान किए गए पेशेवर आवाज़ कलाकारों में से चुन सकते हैं, या अपनी स्वयं की आवाज़ क्लोन कर सकते हैं, जबकि वे अपने कार्य, मास्टर और वितरण अधिकारों के मालिक रहते हैं। स्पोकन एक एप्लिकेशन प्रोग्रामिंग इंटरफ़ेस (API) भी प्रदान करता है जो बड़े कैटलॉग वाले प्रकाशकों को ऑडियोबुक बनाने में मदद करता है, और यह एक नैतिक एआई मॉडल पर जोर देता है जिसमें लिखा हुआ कार्य उसके सिस्टम को प्रशिक्षित करने के लिए उपयोग नहीं किया जाता और मानव आवाज़ कलाकारों को उचित प्रतिफल दिया जाता है।

आपका करियर चिकित्सा और WebMD में उत्पाद रणनीति से लेकर Conversa Health की स्थापना और अब स्पोकन तक गया है। ऑडियोबुक निर्माण में कौन सी समस्या ने आपको स्पोकन स्थापित करने के लिए प्रेरित किया, और आपके पिछले वार्तालाप एआई कार्य ने आज आप जिस प्लेटफ़ॉर्म का निर्माण कर रहे हैं, उसे कैसे प्रभावित किया?

Conversa के साथ, हमारा मिशन देखभाल टीम की आवाज़ को व्यक्तिगत आउटरीच, फ़ॉलो‑अप प्रश्न और मार्गदर्शन को स्वचालित करके विस्तारित करना था, जो एक बड़े स्वास्थ्य प्रणाली के क्लिनिकल विभाग द्वारा फोन पर सीधे रोगियों को प्रदान किया जाता यदि उनके पास समय होता। शुरू में, हमने बॉट को एक व्यक्तित्व, Cate, के साथ मानवरूप दिया, जो प्रथम पुरुष में स्वयं को संदर्भित करता था। अंततः, मैंने महसूस किया कि मानवता का दिखावा करना असत्य है। Cate कोई व्यक्ति नहीं था, और मैं नहीं चाहता था कि रोगी इसे ऐसा समझें। इसलिए, हमने व्यक्तित्व नाम हटा दिया और इसे एक बहुवचन “We” में बदल दिया ताकि इसे देखभाल टीम का विस्तार माना जाए, जो वास्तव में था। इस अनुभव ने मुझे सिखाया कि स्वचालित समाधान अभी भी मानवीय देखभाल के प्रामाणिक विस्तार जैसा महसूस हो सकते हैं, बिना मानव होने का दिखावा किए।

स्पोकन की ओर बढ़ते हुए, हम प्रामाणिक, मानव‑केन्द्रित अभिव्यक्ति पर ध्यान केंद्रित करते हैं। वह समस्या जिसे हम हल करने में मदद करते हैं स्पष्ट है – अधिकांश कहानियों को उनके पूर्ण ऑडियो संभावनाओं के साथ सबसे तेज़ी से बढ़ते श्रोताओं तक पहुंच नहीं मिल पाती, क्योंकि समय और लागत की बाधाएँ होती हैं – लेकिन मानव का वास्तविक विस्तार बनने की मेरी दीर्घकालिक दर्शन ने बड़ी भूमिका निभाई। एआई पॉडकास्ट जो बैंटर बनाते हैं या एजेंट जो सहानुभूति का नाटक करते हैं, के विपरीत, स्पोकन का मल्टी‑कास्ट नैरेशन लेखक के वास्तविक शब्दों को जीवन देता है। क्योंकि हम कहानियां बता रहे हैं, न कि मानव अंतःक्रिया की नकल, इसलिए हमारे एआई को व्यक्ति होने का कोई दिखावा नहीं है। ये कहानी के पात्र हैं, इसलिए हम किसी भी भ्रम और टकराव से बचने में भाग्यशाली हैं।

एक हार्ड विज्ञान कथा लेखक और एआई उद्यमी दोनों के रूप में, आपने एक बार कृत्रिम बुद्धिमत्ता के विकास को कैसे देखा था, और वास्तविक एआई विकास ने आपके कल्पित भविष्य से सबसे अधिक कहाँ भिन्नता दिखाई?

यह प्रश्न मेरे दिल के बहुत करीब है। मैं कला, विज्ञान और प्रौद्योगिकी के संगम पर जीना पसंद करता हूँ, और अपने निकट‑भविष्य के विज्ञान‑कथा में स्वचालित प्रणालियों को दर्शाना इसका एक शानदार उदाहरण है। वास्तव में, मैं जिन सभी भविष्य की कंपनियों के बारे में लिखता हूँ – और कई हैं – उनका एक डोमेन मेरे पास है, एक उत्पाद जो मैंने डिजाइन किया है, और एक अवधारणा जो मैं मानता हूँ कि एक दिन वास्तविक कंपनी बन सकती है। यहाँ तक कि मेरे घर के सामने की मूर्ति भी The Kite Factory के आधुनिक आकार पर आधारित है, एक ऐसी कंपनी जिसकी मैं कल्पना करता हूँ कि वह एक दिन एंटी‑ग्रैविटी तकनीक बनाएगी जो ग्रह को बदल देगी!

एआई पर ध्यान केंद्रित करते हुए, मुझे समस्या तब आती है जब भविष्य की विज्ञान‑कथा यह नहीं बताती कि लोग जानकारी को कैसे प्राप्त, उपयोग और साझा करते हैं। वर्ष 2100 में, क्या वे अभी भी प्रश्नों के उत्तर के लिए फोन का उपयोग करेंगे? मेरा लेखन और वास्तविक जीवन में सिद्धांत सरल है: जो कुछ स्वचालित किया जा सकता है वह स्वचालित हो जाएगा, और हम हमेशा अधिक रीयल‑टाइम, अधिक सहयोगी और अधिक शारीरिक रूप से एकीकृत जानकारी की ओर प्रवृत्त रहेंगे। हालांकि, मैं व्यक्तिगत रूप से इम्प्लांट्स से नफ़रत करता हूँ। इसलिए, मेरी पुस्तक की पृष्ठभूमि में, जब एलन मस्क ने अपने Starlink सैटेलाइट्स को अपने Neuralink इम्प्लांट्स से जोड़ा और सीधे लोगों के दिमाग में संदेश प्रसारित करना शुरू किया, तो हमने मस्तिष्क इम्प्लांट्स को प्रतिबंधित कर दिया!

भिन्नता के प्रश्न पर: क्योंकि मैं मानता हूँ कि जो कुछ स्वचालित किया जा सकता है वह स्वचालित हो जाएगा, तथ्यात्मक प्रश्नों का स्वचालन एक सरल अनिवार्यता के रूप में हो रहा है। हालांकि, जब बात दिल के मामलों – कला, संगीत और कहानियों – की आती है, तो एक छोटा अंतर है। एआई पूर्व‑मौजूद पैटर्न पर प्रशिक्षित है, इसलिए वह कभी भी पूरी तरह नया कुछ नहीं बना सकता। फिर भी लोग एआई का उपयोग करके कहानियां लिख रहे हैं, कला बना रहे हैं और संगीत रचना कर रहे हैं। यह कैसे संभव है? क्योंकि कला को पूरी तरह नया या अनोखा होने की आवश्यकता नहीं है। मेरा मानना है कि भविष्य में जो रचनाएँ मानक से बाहर होंगी, वे और अधिक मूल्यवान होंगी। आशा है कि हम तब भी इसे पहचान पाएँगे।

एक हालिया Edison Research अध्ययन ने स्पोकन के मल्टी‑कास्ट उत्पादन की तुलना एक पेशेवर रूप से निर्मित, एकल‑वाचक मानव संस्करण से की। आप स्पोकन के लाभ का कितना हिस्सा आधारभूत एआई तकनीक को देते हैं, और कितना प्रत्येक पात्र को अलग आवाज़ देने से आता है? पूर्ण मानव कास्ट के मुकाबले परिणाम कैसे भिन्न हो सकते हैं?

कहानी और प्रत्येक पात्र को उनका परिपूर्ण आवाज़ देने का विश्लेषण वास्तव में हमारे एआई का एक बड़ा हिस्सा है। हम एक गहन एजेंटिक प्रक्रिया के माध्यम से कहानी की मूल परतों को निकालते हैं, जैसे शैली और भाषा जैसे बुनियादी तत्वों से लेकर लहजा और शैली द्वारा निर्धारित ताल तक, साथ ही कई पात्रों के आपसी संवाद की दृश्य सामंजस्यता तक। इन सभी एआई‑चालित परतों से वास्तविक पात्र आवाज़ नैरेशन बनती है। इसे हम “मैजिक मोड” कहते हैं, और आप इसे रंगों को मिलाने जैसा समझ सकते हैं।

जब परिणाम पूर्ण मानव कास्ट से कैसे भिन्न हो सकते हैं, तो यह मुख्यतः लागत और कार्यप्रवाह पर निर्भर करता है। एक‑क्लिक और सैकड़ों डॉलर, पूर्ण कास्ट की तुलना में, स्वतंत्र लेखकों और अधिकांश प्रकाशकों के लिए सुलभ नहीं है, इसलिए यह हमारी तुलना बिंदु नहीं था। गुणवत्ता के संबंध में, मेरा मानना है कि हम पहले ही पूर्ण कास्ट के बराबर पहुँच रहे हैं, इसलिए गुणवत्ता में अंतर अब स्पष्ट नहीं रहेगा।

Spoken Multi‑Cast ने पात्र‑आधारित दृश्यों में उच्च रेटिंग प्राप्त की, जबकि मानव नैरेशन ने विवरणात्मक भागों में बेहतर प्रदर्शन किया। गैर‑संवादात्मक भागों को एआई नैरेशन के लिए विशेष रूप से कठिन क्यों माना जाता है, और आप इस अंतर को कम करने के लिए क्या कर रहे हैं?

वास्तव में, यह नहीं कि गैर‑संवादात्मक भाग एआई के लिए कठिन हैं; बल्कि एआई को काम करने वाले डायनामिक की संख्या अभी भी एक मानव आवाज़ कलाकार की तुलना में कम है। एकल नैरेटर एक अंश में लाने वाले सभी सूक्ष्म इन्फ्लेक्शन और डिलीवरी को सोचें। मल्टी‑कास्ट में, हालांकि, डायनामिक की संख्या बहुत अधिक होती है क्योंकि पात्र आवाज़ों के विविध, व्यक्तिगत टिम्बर और उन्हें मिलाने की प्रक्रिया, फिर से, रंगों को मिलाने जैसी होती है। इसका मतलब है कि मल्टी‑कास्ट दृश्यों में कई लोगों के बीच की इंटरैक्शन की वास्तविकता को एकल नैरेटर की तुलना में अधिक प्रभावी ढंग से प्रस्तुत किया जा सकता है।

अंतर को कम करने के लिए, एकल‑वाचक एआई नैरेशन में उपयोग किए जाने वाले डायनामिक की संख्या बढ़ती रहेगी, और अंतर घटता रहेगा।

सैंपल सुनने से पहले केवल 31% प्रतिभागियों ने एआई‑नैरेटेड ऑडियोबुक में रुचि व्यक्त की, लेकिन स्पोकन मल्टी‑कास्ट का अनुभव करने के बाद यह आंकड़ा 65% तक बढ़ गया। प्रदर्शन के कौन से तत्वों ने उनके दृष्टिकोण में सबसे अधिक परिवर्तन किया, ऐसा आप मानते हैं?

वास्तव में, यह उल्टा था, और सर्वेक्षण के इस डिज़ाइन तत्व का बहुत महत्व है। 65% ने कहा कि वे इस नैरेशन के साथ पूरी ऑडियोबुक सुनेंगे, अंश सुनने के बाद, एआई होने का पता चलने से पहले। फिर हमने सामान्य रूप से पूछा कि क्या वे एआई द्वारा नैरेटेड ऑडियोबुक सुनने के लिए तैयार होंगे, और केवल 31% ने हाँ कहा। अगला प्रश्न था कि क्या उन्हें लगा कि उन्होंने जो सुना वह एआई था। केवल 39% जिन्होंने स्पोकन मल्टी‑कास्ट सुना, उसे एआई मानते थे, जबकि 35% ने मानव संस्करण को एआई समझा। इससे हमारा अगला प्रश्न उभरा: अब जब आप जानते हैं, तो क्या आप एआई द्वारा नैरेटेड ऑडियोबुक सुनने के लिए तैयार होंगे? इस प्रश्न का उत्तर 43% तक बढ़ गया, और हम अपने 65% लक्ष्य की ओर अंतर को कम करने के लिए सक्रिय रूप से अनुकूलन कर रहे हैं।

क्या आप हमें उस एजेंटिक एआई वर्कफ़्लो के बारे में बता सकते हैं जो अपलोड की गई पांडुलिपि को मल्टी‑वॉइस ऑडियोबुक में बदलता है, जिसमें सिस्टम स्पीकर की पहचान, पात्रों की व्याख्या, आवाज़ असाइनमेंट, और भावना, समय‑निर्धारण और डिलीवरी का निर्धारण शामिल है?

हमारी प्रक्रिया पर अभी पेटेंट चल रहे हैं, इसलिए मैं इसे उच्च स्तर पर सारांशित करता हूँ: यह एक अत्यधिक एजेंटिक प्रक्रिया है जो कई परतों को प्रदान करती है। यह दो वर्षों से अधिक समय में परिपूर्ण हुई है। कहानी की बुनियादी बातें, कहानी की ताल, दृश्य सामंजस्यता, और अंत में सटीक पात्र आवाज़ें—जिन्हें मैं “पेंट का कोट” कहता हूँ—सब इसका हिस्सा हैं। भावनात्मक डिलीवरी और टाइमिंग का आर्क प्राप्त करना अत्यंत महत्वपूर्ण है, और हम इसे सबसे अधिक महत्व देते हैं। अक्सर लोगों को आश्चर्य होता है कि नैरेशन के लिए उपयोग किया गया एआई वास्तविक नैरेशन में उपयोग किए गए एआई से लगभग 5 गुना अधिक है।

लेखक अंतिम उत्पादन पर कितनी रचनात्मक नियंत्रण रखता है, और जब एआई किसी पात्र, उच्चारण, भावनात्मक बीट या कथा इरादे को गलत समझता है तो कौन से उपकरण उपलब्ध हैं?

लेखक को अंतिम उत्पादन पर पूर्ण नियंत्रण होता है। चाहे वह भावनात्मक इन्फ्लेक्शन हो, लहजा, आवाज़ का टिम्बर हो या टाइमिंग, वह सब नियंत्रित करता है। हमारा लक्ष्य है कि हम एक‑क्लिक में इसे जितना संभव हो उतना उत्कृष्ट बना सकें। यदि लेखक, प्रकाशक या निर्माता को किसी अंश की बहुत विशिष्ट डिलीवरी चाहिए, तो वे “Speak It” का उपयोग करके अपने माइक्रोफ़ोन में बोल सकते हैं और दिखा सकते हैं कि वे इसे कैसे चाहते हैं, और पात्र आवाज़ सुंदरता से उसका पालन करेगी।

हम मानते हैं कि लेखकों को अपने कार्य पर पूर्ण स्वामित्व महसूस होना चाहिए, यहाँ तक कि उनके ओपनिंग और क्लोज़िंग क्रेडिट में उपयोग की गई आवाज़ पर भी। यहाँ तक कि “Made with Spoken” भी उनके चुने हुए आवाज़ का उपयोग करेगा, जिसमें यदि वे चाहें तो उनका अपना व्यक्तिगत आवाज़ भी शामिल होगा।

Spoken लेखकों को कस्टम‑जनरेटेड आवाज़ें तथा पेशेवर नैरेटरों के स्वीकृत आवाज़ क्लोन उपयोग करने की अनुमति देता है, जिन्हें उनके आवाज़ उपयोग पर मुआवजा दिया जाता है। इस मॉडल में सहमति, स्वामित्व, मुआवजा, अधिकारों की वापसी, और अनधिकृत क्लोनिंग से सुरक्षा कैसे निर्मित है?

हम केवल उन आवाज़ साझेदारों का उपयोग करते हैं जो एक सख्त नैतिक कोड का पालन करते हैं, जिसमें आवाज़ के अनधिकृत उपयोग का पता लगाना और उसे रोकना शामिल है (विशेषकर प्रसिद्ध व्यक्तियों की आवाज़ों की सुरक्षा के लिए)। उदाहरण के लिए, हमारे लाइब्रेरी में ElevenLabs की कई शीर्ष आवाज़ें हैं। उन आवाज़ कलाकारों को हमारे लेखकों द्वारा प्रत्येक उपयोग के लिए भुगतान किया जाता है।

क्या आप देखते हैं कि एआई नैरेशन मुख्यतः ऑडियोबुक बाजार को विस्तारित करेगा, जिससे पहले आर्थिक रूप से असंभव शीर्षक संभव हो जाएंगे, या यह पारंपरिक उत्पादन के कुछ हिस्सों को भी प्रतिस्थापित करेगा? तकनीक के परिपक्व होने पर कौन‑से भूमिकाएँ स्पष्ट रूप से मानव रहेंगे?

हम एक अत्यधिक विस्तारित ऑडियोबुक बाजार की कल्पना करते हैं जो नए पाठकों को आकर्षित करेगा, विशेषकर हमारी नई, जीवंत मल्टी‑कास्ट क्षमताओं के कारण। अंत में, यह विस्तारित बाजार प्रौद्योगिकी और मानव दोनों के मिश्रण से संचालित होगा। समय बताएगा, लेकिन यह परिवर्तन शायद इस बात से कम जुड़ा होगा कि आवाज़ प्रतिभा मानव है या एआई, बल्कि लेखक/प्रोड्यूसर नियंत्रण के कार्यप्रवाह और दर्शकों की बदलती सुनने की आदतों से अधिक जुड़ा होगा।

Spoken ऑडियोबुक उत्पादन को प्रकाशन, खोज, स्ट्रीमिंग, समुदाय और मुद्रीकरण के साथ जोड़ता है। एआई अंततः कहानी कहने को स्वयं कैसे बदल सकता है, न कि केवल मौजूदा ऑडियोबुक उत्पादन प्रक्रिया को तेज़ और कम लागत वाला बनाकर?

“कहानी में खो जाना” का अर्थ क्या है? यही वास्तव में इस सबका मूल है: दर्शकों को एक immersive ऑडियो अनुभव देना, जब पात्र‑आधारित कथा की मांग बढ़ रही है और ऑडियो कहानी सुनने का प्रमुख माध्यम बन रहा है। अंत में, चाहे वह लघु कहानी हो, व्यक्तिगत स्मृति, फैन‑फिक या महाकाव्य फैंटेसी, जीवंत, प्राकृतिक डिलीवरी को तेज़ और कम लागत पर बनाना दीर्घकालिक प्रभाव डालेगा। वर्तमान ऑडियोबुक बाजार निकट‑अवधि का अवसर है, लेकिन शॉर्ट‑फ़ॉर्म, वर्टिकल शॉर्ट्स, सीरियल्स, फैन‑फिक और कई अन्य शाखाएँ इसके परिणामस्वरूप फलेंगी। और जब वे फलेंगी, हम चाहते हैं कि Spoken Multi‑CastTM उनका हृदय बन जाए।

उत्कृष्ट साक्षात्कार के लिए धन्यवाद, जो पाठक अधिक जानना चाहते हैं उन्हें Spoken पर viist करना चाहिए। 

एंटोनी एक दूरदर्शी नेता और यूनाइट.एआई के संस्थापक भागीदार हैं, जो कि एआई और रोबोटिक्स के भविष्य को आकार देने और बढ़ावा देने के लिए एक अटूट जुनून से प्रेरित हैं। एक连续 उद्यमी, वह मानता है कि एआई समाज के लिए उतना ही विघटनकारी होगा जितना कि बिजली, और अक्सर विघटनकारी प्रौद्योगिकियों और एजीआई की संभावना के बारे में उत्साहित होता है।

एक भविष्यवाणी के रूप में, वह इन नवाचारों के बारे में जानने के लिए समर्पित है कि वे हमारी दुनिया को कैसे आकार देंगे। इसके अलावा, वह सिक्योरिटीज़.io के संस्थापक हैं, जो एक मंच है जो भविष्य को फिर से परिभाषित करने और पूरे क्षेत्रों को पुनः आकार देने वाली नवीनतम प्रौद्योगिकियों में निवेश पर केंद्रित है।