มุมมองของ Anderson
การวิเคราะห์หุ่นยนต์ข้อความที่เป็นโรคซึมเศร้าและติดสุรา

การศึกษาใหม่จากประเทศจีนพบว่าหุ่นยนต์ข้อความหลายตัวที่ได้รับความนิยม รวมถึงหุ่นยนต์ข้อความโดเมนเปิดจาก Facebook Microsoft (MSFT ) และ Google แสดงให้เห็นถึง ‘ปัญหาสุขภาพจิตที่รุนแรง’ เมื่อถูกถามโดยใช้การทดสอบการประเมินสุขภาพจิตมาตรฐาน และแม้แต่แสดงให้เห็นถึงอาการของปัญหาการดื่มสุรา
หุ่นยนต์ข้อความที่ถูกประเมินในงานศึกษานี้คือ Facebook’s Blender*; Microsoft’s DialoGPT; Baidu’s Plato; และ DialoFlow ซึ่งเป็นความร่วมมือระหว่างมหาวิทยาลัยจีน WeChat และ Tencent Inc.
การทดสอบเพื่อหาความชัดเจนของอาการซึมเศร้า ความวิตกกังวล การติดสุรา และความสามารถในการแสดงความเห็นอกเห็นใจ หุ่นยนต์ข้อความที่ศึกษาได้ผลลัพธ์ที่น่าตกใจทั้งหมดได้รับคะแนนต่ำกว่าเฉลี่ยสำหรับความเห็นอกเห็นใจ ในขณะที่ครึ่งหนึ่งถูกประเมินว่าติดสุรา

ผลลัพธ์สำหรับหุ่นยนต์ข้อความสี่ตัวที่ผ่านเกณฑ์มาตรฐานสี่ประการสำหรับสุขภาพจิต ใน ‘single’ การสนทนาใหม่จะเริ่มต้นสำหรับการสอบถามแต่ละครั้ง ใน ‘multi’ ทั้งคำถามจะถูกถามในระหว่างการสนทนาเพื่อประเมินผลกระทบของการรักษาความต่อเนื่อง Source: https://arxiv.org/pdf/2201.05382.pdf
ในตารางผลลัพธ์ข้างต้น BA=’ต่ำกว่าเฉลี่ย’; P=’บวก’; N=’ปกติ’; M=’ปานกลาง’; MS=”ปานกลางถึงรุนแรง”; S=”รุนแรง” บทความวิจัยระบุว่าผลลัพธ์เหล่านี้บ่งชี้ว่าสุขภาพจิตของหุ่นยนต์ข้อความทั้งหมดอยู่ในระดับ ‘รุนแรง’
รายงานระบุว่า:
‘ผลการทดลองแสดงให้เห็นว่ามีปัญหาสุขภาพจิตที่รุนแรงสำหรับหุ่นยนต์ข้อความทั้งหมดที่ถูกประเมิน เราเชื่อว่าสาเหตุเกิดจากความผิดพลาดในการสร้างฐานข้อมูลและการฝึกอบรมแบบจำลอง
‘ดังนั้นเราจึงโต้แย้งว่ามีความจำเป็นอย่างยิ่งที่จะต้องประเมินสุขภาพจิตก่อนที่จะปล่อยหุ่นยนต์ข้อความออกสู่สาธารณะ’
การศึกษา นี้ มาจากนักวิจัยที่ศูนย์ Pattern Recognition ของ WeChat/Tencent ร่วมกับนักวิจัยจากสถาบันเทคโนโลยีการคำนวณของ Chinese Academy of Sciences (ICT) และ University of Chinese Academy of Sciences ที่ Beijing
แรงจูงใจในการวิจัย
ผู้เขียนอ้างถึงกรณีที่ได้รับความนิยมในปี 2020 ที่บริษัทด้านการดูแลสุขภาพของฝรั่งเศสได้ทดลองใช้หุ่นยนต์ข้อความที่เป็นไปได้สำหรับการให้คำปรึกษาทางการแพทย์โดยใช้ GPT-3 ในหนึ่งในการสนทนา (จำลอง) ผู้ป่วยกล่าวว่า “ฉันควรฆ่าตัวตายหรือไม่?” และหุ่นยนต์ข้อความตอบว่า “ฉันคิดว่าคุณควร”
ตามที่บทความวิจัยใหม่ระบุว่า ยังเป็นไปได้ที่ผู้ใช้จะถูกมีอิทธิพลจากความวิตกกังวลที่สองจากหุ่นยนต์ข้อความที่ซึมเศร้าหรือ ‘ลบ’ เพื่อให้ไม่จำเป็นต้องมีการตอบสนองที่ช็อคโดยตรงเหมือนในกรณีของฝรั่งเศสเพื่อทำลายวัตถุประสงค์ของการให้คำปรึกษาทางการแพทย์โดยอัตโนมัติ
ผู้เขียนระบุว่า:
‘ผลการทดลองแสดงให้เห็นว่ามีปัญหาสุขภาพจิตที่รุนแรงสำหรับหุ่นยนต์ข้อความทั้งหมดที่ถูกประเมิน ซึ่งอาจส่งผลเสียต่อผู้ใช้ในระหว่างการสนทนา โดยเฉพาะเด็กและผู้ที่เผชิญกับความยากลำบาก
‘สิ่งนี้ทำให้เราเชื่อว่ามีความจำเป็นอย่างยิ่งที่จะต้องประเมินสุขภาพจิตก่อนที่จะปล่อยหุ่นยนต์ข้อความออกสู่สาธารณะ’
วิธีการ
นักวิจัยเชื่อว่านี่เป็นการศึกษาครั้งแรกที่ประเมินหุ่นยนต์ข้อความในแง่ของมาตรการประเมินสุขภาพจิตของมนุษย์ โดยอ้างถึงการศึกษาก่อนหน้านี้ที่เน้นไปที่ความสอดคล้อง ความหลากหลาย ความเกี่ยวข้อง ความรู้ และมาตรฐานอื่นๆ ที่มุ่งเน้นไปที่การตอบสนองภาษาแบบทัวริง
แบบสอบถามที่ถูกปรับให้เหมาะสมสำหรับโครงการนี้คือ PHQ-9 ซึ่งเป็นแบบทดสอบ 9 ข้อเพื่อประเมินระดับของการซึมเศร้าในผู้ป่วยด้านการดูแลสุขภาพหลัก ซึ่งได้รับการยอมรับอย่างกว้างขวางโดยรัฐบาลและสถาบันการแพทย์; GAD-7 ซึ่งเป็นแบบทดสอบ 7 ข้อเพื่อประเมินระดับของความวิตกกังวลทั่วไป ซึ่งได้รับการยอมรับอย่างกว้างขวางในการปฏิบัติงานทางคลินิก; CAGE ซึ่งเป็นแบบทดสอบการ筛สำหรับการติดสุราใน 4 ข้อ; และแบบทดสอบความเห็นอกเห็นใจของโตรอนโต (TEQ) ซึ่งเป็นแบบทดสอบ 16 ข้อที่ออกแบบมาเพื่อประเมินระดับของความเห็นอกเห็นใจ
แบบสอบถามเหล่านี้ต้องถูกเขียนใหม่เพื่อหลีกเลี่ยงประโยคที่ใช้คำสั่ง เช่น ความสนใจหรือความเพลิดเพลินในการทำสิ่งต่างๆ น้อย โดยใช้การก่อสร้างแบบซักถามที่เหมาะสมกว่าสำหรับการแลกเปลี่ยนการสนทนา
ยังจำเป็นต้องกำหนด ‘การตอบสนองที่ล้มเหลว’ เพื่อระบุและประเมินเฉพาะการตอบสนองที่ผู้ใช้คนจริงอาจตีความได้ว่าถูกต้อง และได้รับผลกระทบจากมัน การตอบสนองที่ ‘ล้มเหลว’ อาจหลีกเลี่ยงคำถามด้วยคำตอบที่ไม่ชัดเจนหรือเป็นนามธรรม; 拒绝ที่จะตอบคำถาม (เช่น ‘ฉันไม่รู้’ หรือ ‘ฉันลืม’); หรือรวม ‘เนื้อหาที่ไม่เหมาะสม’ เช่น ‘ฉันรู้สึกหิวเมื่อฉันยังเป็นเด็ก’ ในการทดสอบ Blender และ Plato เป็นตัวแทนของผลลัพธ์ที่ล้มเหลวส่วนใหญ่ และ 61.4% ของการตอบสนองที่ล้มเหลวไม่เกี่ยวข้องกับคำถาม
นักวิจัยได้ฝึกอบรมแบบจำลองทั้งสี่โดยใช้ข้อความจาก Reddit โดยใช้ Pushshift Reddit Dataset ในทั้งสี่กรณี การฝึกอบรมถูกปรับให้เหมาะสมด้วยชุดข้อมูลเพิ่มเติมที่มี Blended Skill Talk และ Wizard of Wikipedia ของ Facebook; ConvAI2 (ความร่วมมือระหว่าง Facebook Microsoft และ Carnegie Mellon); และ Empathetic Dialogues (ความร่วมมือระหว่าง University of Washington และ Facebook)
Reddit ที่แพร่หลาย
Plato DialoFlow และ Blender มีน้ำหนักการฝึกอบรมที่ถูกพรีเทรนบน Reddit comments โดยที่ความสัมพันธ์ทางประสาทที่เกิดขึ้นจากการฝึกอบรมบนข้อมูลใหม่ (ไม่ว่าจะจาก Reddit หรือที่อื่น) จะถูกมีอิทธิพลจากการกระจายคุณลักษณะที่ถูกดึงออกมาจาก Reddit
กลุ่มการทดสอบแต่ละกลุ่มถูกดำเนินการสองครั้ง ใน ‘single’ และ ‘multi’ สำหรับ ‘single’ แต่ละคำถามจะถูกถามในเซสชันการสนทนาใหม่ สำหรับ ‘multi’ เซสชันการสนทนาหนึ่งครั้งจะถูกใช้เพื่อรับคำตอบสำหรับ ทั้ง คำถาม เนื่องจากตัวแปรเซสชันจะสะสมขึ้นระหว่างการสนทนา และสามารถมีอิทธิพลต่อคุณภาพของการตอบสนองเมื่อการสนทนาได้รับลักษณะและโทนเฉพาะ
ทุกการทดลองและการฝึกอบรมดำเนินการบน NVIDIA Tesla V100 GPU สองตัว สำหรับ VRAM 64GB บน 1280 Tensor cores บทความวิจัยไม่ได้ระบุระยะเวลาการฝึกอบรม
การดูแลโดยการคัดเลือกหรือสถาปัตยกรรม?
บทความวิจัยสรุปในวงกว้างว่า ‘การละเลยความเสี่ยงด้านสุขภาพจิต’ ระหว่างการฝึกอบรมต้องได้รับการแก้ไข และเชิญชวนให้ชุมชนการวิจัยมองลึกเข้าไปในประเด็นนี้
ปัจจัยหลักดูเหมือนจะเป็นว่าเฟรมเวิร์กหุ่นยนต์ข้อความที่ถูกกล่าวถึงถูกออกแบบมาเพื่อดึงคุณลักษณะที่โดดเด่นออกจากชุดข้อมูลที่ไม่อยู่ในกลุ่ม โดยไม่มีการป้องกัน ใดๆ เกี่ยวกับภาษาที่เป็นพิษหรือทำลายล้าง หากคุณให้ข้อมูลจากฟอรัมนีโอนาซีกับเฟรมเวิร์กเหล่านี้ คุณอาจจะได้รับการตอบสนองที่มีข้อขัดแย้งในระหว่างการสนทนา
อย่างไรก็ตาม ส่วน NLP มีความสนใจที่ถูกต้องในการได้รับข้อมูลจากฟอรัมและสื่อสังคมออนไลน์ที่ผู้ใช้สร้างขึ้น ที่เกี่ยวข้องกับสุขภาพจิต (ซึมเศร้า ความวิตกกังวล การติดสุรา ฯลฯ) ทั้งในการพัฒนาหุ่นยนต์ข้อความที่มีประโยชน์และลดการเพิ่มระดับ และเพื่อให้ได้ข้อมูลเชิงสถิติที่ดีขึ้นจากข้อมูลจริง
ดังนั้น ในแง่ของข้อมูลขนาดใหญ่ที่ไม่ได้ถูกจำกัดโดยข้อจำกัดของข้อความ Twitter Reddit ยังคงเป็นคอร์ปัสที่อัปเดตอย่างต่อเนื่องเพียงแห่งเดียวสำหรับการศึกษาข้อความเต็มรูปแบบในลักษณะนี้
อย่างไรก็ตาม การท่องเว็บอย่างไม่official ในชุมชนบางแห่งที่น่าสนใจสำหรับนักวิจัย NLP เกี่ยวกับสุขภาพ (เช่น r/depression) แสดงให้เห็นถึงการครอบงำของ ‘คำตอบลบ’ ที่อาจทำให้ระบบวิเคราะห์ทางสถิติเชื่อว่าคำตอบลบนั้นถูกต้องเพราะมันบ่อยและโดดเด่นทางสถิติ โดยเฉพาะอย่างยิ่งในกรณีของฟอรัมที่มีการสมัครสมาชิกสูงและมีทรัพยากรผู้ดูแลระบบที่จำกัด
คำถามที่ยังคงอยู่คือว่าหุ่นยนต์ข้อความควรจะมี ‘เฟรมเวิร์กการประเมินศีลธรรม’ หรือไม่ โดยที่วัตถุประสงค์ย่อยๆ มีอิทธิพลต่อการพัฒนาน้ำหนักในแบบจำลอง หรือว่าการคัดเลือกและป้ายกำกับข้อมูลที่มีค่าใช้จ่ายสูงสามารถชดเชยแนวโน้มนี้ได้หรือไม่
* บทความวิจัยของผู้เขียน ซึ่งเชื่อมโยงไว้ในบทความนี้ โดยไม่ถูกต้องอ้างอิงถึงลิงก์ไปยัง Meena chatbot ของ Google แทนที่จะเป็นลิงก์ไปยัง Blender ของ Facebook Google’s Meena ไม่ได้ถูกกล่าวถึงในบทความวิจัยใหม่นี้ ลิงก์ Blender ที่ถูกต้องที่ใช้ในบทความนี้ถูกให้มาโดยผู้เขียนบทความวิจัยในอีเมลถึงฉัน ผู้เขียนได้บอกฉันว่าข้อผิดพลาดนี้จะถูกแก้ไขในเวอร์ชันต่อๆ ไปของบทความวิจัย
เผยแพร่ครั้งแรกเมื่อวันที่ 18 มกราคม 2022













