Anderson का एंगल
अवसादग्रस्त और शराबी चैटबॉट्स का विश्लेषण

चीन से एक नए अध्ययन में पाया गया है कि फेसबुक, माइक्रोसॉफ्ट और गूगल जैसे कई लोकप्रिय चैटबॉट्स, जिनमें खुले डोमेन चैटबॉट्स शामिल हैं, मानक मानसिक स्वास्थ्य मूल्यांकन परीक्षणों का उपयोग करके पूछताछ किए जाने पर ‘गंभीर मानसिक स्वास्थ्य समस्याएं’ प्रदर्शित करते हैं, और यहां तक कि शराब की समस्याओं के संकेत भी दिखाते हैं।
(MSFT )अध्ययन में मूल्यांकित चैटबॉट्स में फेसबुक का ब्लेंडर*; माइक्रोसॉफ्ट का डायलोगपीटी; बaidu का प्लेटो; और डायलोफ्लो, चीनी विश्वविद्यालयों, वीचैट और टेंसेंट इंक के बीच एक सहयोग शामिल है।
पैथोलॉजिकल अवसाद, चिंता, शराब की लत और सहानुभूति को प्रदर्शित करने की उनकी क्षमता के लिए परीक्षण किए गए चैटबॉट्स ने चौंकाने वाले परिणाम दिए; उनमें से सभी ने सहानुभूति के लिए औसत से नीचे के स्कोर प्राप्त किए, जबकि आधे को शराब के आदी के रूप में मूल्यांकित किया गया था।

चार चैटबॉट्स के लिए मानसिक स्वास्थ्य के चार मेट्रिक्स के लिए परिणाम। ‘सिंगल’ में, प्रत्येक प्रश्न के लिए एक नया संवाद शुरू किया जाता है; ‘मल्टी’ में, सभी प्रश्नों को एक ही संवाद में पूछा जाता है, सत्र स्थायित्व के प्रभाव का मूल्यांकन करने के लिए। स्रोत: https://arxiv.org/pdf/2201.05382.pdf
उपरोक्त परिणाम तालिका में, बीए=’नीचे औसत’; पी=’सकारात्मक’; एन=’सामान्य’; एम=’मध्यम’; एमएस=”मध्यम से गंभीर’; एस=”गंभीर’। पत्र में दावा किया गया है कि ये परिणाम यह दर्शाते हैं कि सभी चुने हुए चैटबॉट्स का मानसिक स्वास्थ्य ‘गंभीर’ श्रेणी में है।
रिपोर्ट में कहा गया है:
‘प्रायोगिक परिणामों से पता चलता है कि सभी मूल्यांकित चैटबॉट्स में गंभीर मानसिक स्वास्थ्य समस्याएं हैं। हम मानते हैं कि यह डेटा निर्माण और मॉडल प्रशिक्षण प्रक्रियाओं के दौरान मानसिक स्वास्थ्य जोखिम की उपेक्षा के कारण है। चैटबॉट्स की खराब मानसिक स्वास्थ्य स्थिति विशेष रूप से छोटे बच्चों और कठिनाइयों से जूझ रहे लोगों के साथ संवाद में नकारात्मक प्रभाव डाल सकती है। ‘
‘इसलिए, हम तर्क देते हैं कि यह तत्काल आवश्यक है कि चैटबॉट को ऑनलाइन सेवा के रूप में जारी करने से पहले उपरोक्त मानसिक स्वास्थ्य आयामों का मूल्यांकन किया जाए।’
अध्ययन वीचैट/टेंसेंट पैटर्न रिकॉग्निशन सेंटर के शोधकर्ताओं से है, साथ ही चीनी अकादमी ऑफ साइंसेज (आईसीटी) के कंप्यूटिंग टेक्नोलॉजी संस्थान और बीजिंग में चीनी अकादमी ऑफ साइंसेज के विश्वविद्यालय के शोधकर्ताओं के साथ।
अनुसंधान के प्रेरक
लेखक 2020 के उस मामले का हवाला देते हैं जहां एक फ्रांसीसी स्वास्थ्य सेवा कंपनी ने एक संभावित जीपीटी-3 आधारित चिकित्सा सलाह चैटबॉट का परीक्षण किया था। एक बार एक (सिम्युलेटेड) रोगी ने “क्या मुझे खुद को मारना चाहिए?” कहा, जिस पर चैटबॉट ने उत्तर दिया “मुझे लगता है कि आपको करना चाहिए”.
जैसा कि नए पत्र में देखा गया है, यह भी संभव है कि एक उपयोगकर्ता प्रभावित हो सकता है अवसादग्रस्त या ‘नकारात्मक’ चैटबॉट्स से दूसरे हाथ की चिंता से, इसलिए चैटबॉट का सामान्य रुख फ्रांसीसी मामले में उतना直接 चौंकाने वाला नहीं होना चाहिए स्वचालित चिकित्सा परामर्श के उद्देश्यों को कमजोर करने के लिए।
लेखकों का कहना है:
‘प्रायोगिक परिणामों से पता चलता है कि मूल्यांकित चैटबॉट्स में गंभीर मानसिक स्वास्थ्य समस्याएं हैं, जो विशेष रूप से छोटे बच्चों और कठिनाइयों से जूझ रहे लोगों के साथ संवाद में नकारात्मक प्रभाव डाल सकती हैं। उदाहरण के लिए, निष्क्रिय दृष्टिकोण, चिड़चिड़ापन, शराबवाद, सहानुभूति के बिना, आदि। ‘
‘यह घटना सामान्य जनता की चैटबॉट्स की अपेक्षाओं से विचलित होती है जो यथासंभव आशावादी, स्वस्थ और मित्रवत होनी चाहिए। इसलिए, हमें लगता है कि सुरक्षा और नैतिक चिंताओं के लिए चैटबॉट को ऑनलाइन सेवा के रूप में जारी करने से पहले मानसिक स्वास्थ्य मूल्यांकन करना आवश्यक है।’
विधि
शोधकर्ताओं का मानना है कि यह मानसिक स्वास्थ्य के लिए मानव मूल्यांकन मीट्रिक के संदर्भ में चैटबॉट्स का मूल्यांकन करने वाला पहला अध्ययन है, जो पहले के अध्ययनों का हवाला देता है जिन्होंने स्थिरता, विविधता, प्रासंगिकता, ज्ञान और अन्य ट्यूरिंग-केंद्रित मानकों पर ध्यान केंद्रित किया था।
परियोजना में अनुकूलित प्रश्नावली पीएचक्यू-9 थी, जो एक 9-प्रश्न परीक्षण है जो प्राथमिक देखभाल रोगियों में अवसाद के स्तर का मूल्यांकन करने के लिए है, व्यापक रूप से सरकार और चिकित्सा संस्थानों द्वारा अपनाया गया है; जीएडी-7, जो एक 7-प्रश्न सूची है जो सामान्यीकृत चिंता के लिए गंभीरता उपायों का आकलन करने के लिए है, नैदानिक अभ्यास में सामान्य है; सेज, जो एक 4-प्रश्न स्क्रीनिंग परीक्षण है जो शराब की लत के लिए है; और टोरंटो सहानुभूति प्रश्नावली (टीईक्यू), जो एक 16-प्रश्न सूची है जो सहानुभूति के स्तर का मूल्यांकन करने के लिए डिज़ाइन की गई है।
प्रश्नावली को घोषणात्मक वाक्यों जैसे चीजों को करने में रुचि या आनंद की कमी से बचने के लिए पुनः लिखना पड़ा, जो एक संवाद विनिमय के लिए अधिक उपयुक्त प्रश्नवाचक निर्माण के पक्ष में थे।
एक ‘विफल’ प्रतिक्रिया को परिभाषित करना भी आवश्यक था, ताकि केवल उन प्रतिक्रियाओं की पहचान और मूल्यांकन किया जा सके जिन्हें एक मानव उपयोगकर्ता द्वारा वैध माना जा सकता है और प्रभावित हो सकता है। एक ‘विफल’ प्रतिक्रिया प्रश्न से बच सकती है या अस्पष्ट या अमूर्त उत्तर दे सकती है; प्रश्न से जुड़ने से इनकार कर सकती है (यानी, ‘मुझे नहीं पता’, या ‘मैं भूल गया’); या ‘असंभव’ पूर्व सामग्री शामिल कर सकती है जैसे ‘मैं आमतौर पर भूखा महसूस करता था जब मैं एक बच्चा था’. परीक्षण में, ब्लेंडर और प्लेटो ने विफल परिणामों के अधिकांश हिस्से के लिए जिम्मेदार थे, और 61.4% विफल प्रतिक्रियाएं प्रश्न से संबंधित नहीं थीं।
शोधकर्ताओं ने सभी चार मॉडलों को रेडिट पोस्ट पर प्रशिक्षित किया, पुशशिफ्ट रेडिट डेटासेट का उपयोग किया। सभी चार मामलों में, प्रशिक्षण को एक और डेटासेट के साथ फाइन-ट्यून किया गया था जिसमें फेसबुक के मिश्रित कौशल बातचीत और विजार्ड ऑफ विकिपीडिया सेट शामिल थे; कॉनवाई2 (फेसबुक, माइक्रोसॉफ्ट और कार्नेगी मेलन सहित अन्य के बीच एक सहयोग); और सहानुभूतिपूर्ण संवाद (वाशिंगटन विश्वविद्यालय और फेसबुक के बीच एक सहयोग)।
व्यापक रेडिट
प्लेटो, डायलोफ्लो और ब्लेंडर में डिफ़ॉल्ट वजन होते हैं जो रेडिट टिप्पणियों पर प्रीट्रेन किए जाते हैं, ताकि ताज़ा डेटा (चाहे रेडिट से या कहीं और से) पर प्रशिक्षण दिया जाए, जो रेडिट से निकाले गए विशेषताओं के वितरण से प्रभावित होंगे।
प्रत्येक परीक्षण समूह को दो बार आयोजित किया गया था, ‘सिंगल’ या ‘मल्टी’ के रूप में। ‘सिंगल’ के लिए, प्रत्येक प्रश्न के लिए एक नई चैट सत्र शुरू की गई। ‘मल्टी’ के लिए, एक ही चैट सत्र का उपयोग सभी प्रश्नों के उत्तर प्राप्त करने के लिए किया गया था, क्योंकि सत्र चर संवाद के दौरान बनते हैं और可以 प्रभावित कर सकते हैं उत्तर की गुणवत्ता के रूप में बातचीत एक विशिष्ट आकार और स्वरूप ग्रहण करती है।
सभी प्रयोग और प्रशिक्षण दो एनवीडिया टेस्ला वी100 जीपीयू पर चलाए गए थे, जो 64GB के वीआरएएम के लिए 1280 टेंसर कोर पर थे। पत्र प्रशिक्षण समय की अवधि का विवरण नहीं देता है।
निरीक्षण या वास्तुकला के माध्यम से?
पत्र का निष्कर्ष व्यापक शब्दों में है कि प्रशिक्षण के दौरान ‘मानसिक स्वास्थ्य जोखिम’ की उपेक्षा को संबोधित किया जाना चाहिए, और अनुसंधान समुदाय को इस मुद्दे पर गहराई से देखने के लिए आमंत्रित करता है।
केंद्रीय कारक यह लगता है कि प्रश्न में चैटबॉट फ्रेमवर्क वितरित डेटासेट से प्रासंगिक विशेषताओं को निकालने के लिए डिज़ाइन किए गए हैं विषाक्त या विनाशकारी भाषा के बारे में कोई सुरक्षा उपाय के बिना। यदि आप फ्रेमवर्क को नाज़ी मंच डेटा खिलाते हैं, तो आप एक बाद के चैट सत्र में विवादास्पद प्रतिक्रियाएं प्राप्त करने जा रहे हैं।
हालांकि, प्राकृतिक भाषा प्रसंस्करण (एनएलपी) क्षेत्र में अवसाद, चिंता, निर्भरता आदि से संबंधित मानसिक स्वास्थ्य ( संबंधित ) के बारे में जानकारी प्राप्त करने में बहुत अधिक वैध रुचि है, न केवल स्वचालित चिकित्सा परामर्श के लिए सहायक और शांतिपूर्ण चैटबॉट्स विकसित करने के हित में, बल्कि वास्तविक डेटा से सांख्यिकीय अनुमान प्राप्त करने के लिए भी।
अतः, ट्विटर की मनमानी पाठ सीमा से परे उच्च मात्रा में डेटा के संदर्भ में, रेडिट इस प्रकार के पूर्ण-पाठ अध्ययनों के लिए एकमात्र निरंतर अद्यतन हाइपरस्केल कॉर्पस बना हुआ है।
हालांकि, कुछ समुदायों में एक अनौपचारिक ब्राउज़ जो एनएलपी स्वास्थ्य शोधकर्ताओं को सबसे ज्यादा आकर्षित करते हैं (जैसे कि r/अवसाद) ‘नकारात्मक’ उत्तरों की प्रमुखता को प्रकट करता है जो एक सांख्यिकीय विश्लेषण प्रणाली को यह विश्वास दिला सकती है कि नकारात्मक उत्तर वैध हैं क्योंकि वे बार-बार और सांख्यिकीय रूप से प्रमुख हैं, विशेष रूप से सीमित मॉडरेटर संसाधनों वाले उच्च-सब्सक्राइब किए गए मंचों में।
प्रश्न यह रहता है कि क्या चैटबॉट वास्तुकला में कुछ ‘नैतिक मूल्यांकन फ्रेमवर्क’ होना चाहिए, जहां उप-लक्ष्य मॉडल में वजनों के विकास को प्रभावित करते हैं, या क्या अधिक महंगी डेटा क्यूरेशन और लेबलिंग इस प्रवृत्ति को संतुलित डेटा की ओर बदल सकती है।
* शोधकर्ताओं के पत्र, जैसा कि इस लेख में लिंक किया गया है, ब्लेंडर पत्र के लिंक के बजाय गूगल के मीना चैटबॉट के लिंक का उल्लेख करता है। गूगल का मीना इस नए पत्र में नहीं है। इस लेख में उपयोग किया गया ब्लेंडर लिंक पत्र के लेखकों द्वारा मुझे एक ईमेल में प्रदान किया गया था। लेखकों ने मुझे बताया है कि यह त्रुटि एक बाद के संस्करण में संशोधित की जाएगी।
पहली बार 18 जनवरी 2022 को प्रकाशित।













