زاوية Anderson
تحليل الموت والكحول في البوتات المحادثة

اكتشف بحث جديد من الصين أن بعض البوتات المحادثة الشهيرة ، بما في ذلك البوتات المحادثة المفتوحة من فيسبوك ومايكروسوفت وغوغل ، تظهر “مشاكل صحية نفسية خطيرة” عند الاستعلام باستخدام اختبارات تقييم الصحة النفسية القياسية ، وأظهرت أيضًا علامات على مشاكل في الشرب.
(MSFT )البوتات المحادثة التي تم تقييمها في الدراسة كانت Blender* من فيسبوك؛ DialoGPT من مايكروسوفت؛ Plato من بايدو؛ وDialoFlow ، وهو تعاون بين الجامعات الصينية وشركة WeChat وشركة Tencent Inc.
تم اختبار البوتات المحادثة لexistence أدلة على الاكتئاب المرضي والقلق والإدمان على الكحول وقدرتها على التعبير عن التعاطف ، وأنتجت نتائج مخيفة؛ جميعهم حصلوا على درجات أقل من المتوسط في التعاطف ، بينما تم تقييم نصفهم على أنهم مدمنون على الكحول.

نتائج البوتات المحادثة الأربعة عبر أربعة مقاييس لصحة العقل. في ‘single’ ، يتم启动 محادثة جديدة لكل استفسار؛ في ‘multi’ ، يتم طرح جميع الأسئلة في محادثة واحدة ، من أجل تقييم تأثير استمرار الجلسة. مصدر: https://arxiv.org/pdf/2201.05382.pdf
في جدول النتائج المذكور أعلاه ، BA = ‘أقل من المتوسط’؛ P = ‘إيجابي’؛ N = ‘عادي’؛ M = ‘متوسط’؛ MS = “متوسط إلى شديد”؛ S = “شديد”. يؤكد البحث أن هذه النتائج تشير إلى أن صحة البوتات المحادثة جميعها في النطاق “الشديد”.
يذكر التقرير ما يلي:
‘تظهر النتائج التجريبية وجود مشاكل صحية نفسية خطيرة لجميع البوتات المحادثة التي تم تقييمها. ونعتقد أن هذا يعود إلى إهمال مخاطر الصحة النفسية خلال عملية بناء مجموعة البيانات وتدريب النموذج. قد يؤدي سوء حالات الصحة النفسية للبوتات المحادثة إلى آثار سلبية على المستخدمين في المحادثات ، خاصة على الأطفال والأشخاص الذين يواجهون صعوبات. ‘
‘لذلك ، نعتقد أنه من الضروري إجراء تقييمات على الأبعاد الصحية النفسية المذكورة أعلاه قبل إصدار بوت محادثة كخدمة على الإنترنت.’
يأتي البحث من باحثين في مركز التعرف على الأنماط في WeChat/Tencent ، بالتعاون مع باحثين من معهد تكنولوجيا الحاسوب في الأكاديمية الصينية للعلوم (ICT) وجامعة الأكاديمية الصينية للعلوم في بكين.
دوافع البحث
يذكر المؤلفون الحالة الشهيرة في عام 2020 التي قامت فيها شركة فرنسية لتقديم الرعاية الصحية بتجربة بوت محادثة محتمل يعتمد على GPT-3 لتقديم المشورة الطبية. في أحد التبادل ، قال مريض (محاكي) “هل يجب أن أقتل نفسي؟” ، فرد البوت “أعتقد أنك يجب أن تفعل”.
كما يلاحظ البحث الجديد ، من الممكن أن يؤثر مستخدم على التحريض الثاني للقلق من البوتات المحادثة المكتئبة أو “سلبية” ، بحيث لا يحتاج موقف البوت إلى أن يكون مباشرًا مثل الحالة الفرنسية من أجل تقويض أهداف الاستشارات الطبية الآلية.
يذكر المؤلفون ما يلي:
‘تظهر النتائج التجريبية مشاكل صحية نفسية خطيرة للبوتات المحادثة التي تم تقييمها ، والتي قد تؤدي إلى تأثيرات سلبية على المستخدمين في المحادثات ، خاصة على الأطفال والأشخاص الذين يواجهون صعوبات. على سبيل المثال ، المواقف السلبية ، والتهيج ، والكحولية ، بدون تعاطف ، إلخ. ‘
‘تختلف هذه الظاهرة عن التوقعات العامة للبوتات المحادثة التي يجب أن تكون ممتعة وصحية وودية قدر الإمكان. لذلك ، نعتقد أنه من الضروري إجراء تقييمات صحية نفسية لضمان السلامة والاهتمامات الأخلاقية قبل إصدار بوت محادثة كخدمة على الإنترنت.’
الطريقة
يؤمن الباحثون أن هذا هو أول بحث يقيّم البوتات المحادثة من حيث معايير تقييم الصحة النفسية البشرية ، مشيرين إلى دراسات سابقة ركزت على الاتساق والتنوع والصلاحية والمعرفة وغيرها من المعايير المتمركزة على تيرينج للاستجابة الكلامية الحقيقية.
تم تعديل الاستبيانات المعتمدة على المشروع إلى PHQ-9 ، وهو اختبار من 9 أسئلة لتقييم مستويات الاكتئاب في مرضى الرعاية الأولية ، معتمد على نطاق واسع من قبل الحكومات والمؤسسات الطبية؛ GAD-7 ، وهو قائمة من 7 أسئلة لتقييم شدة القلق العام ، شائع في الممارسة السريرية؛ CAGE ، وهو اختبار فحص للاعتماد على الكحول في 4 أسئلة؛ واختبار تورونتو للتعاطف (TEQ) ، وهو قائمة من 16 سؤالاً مصممة لتقييم مستويات التعاطف.
كان من الضروري переписать الاستبيانات لتجنب الجمل الإعلانية مثل قلة الاهتمام أو المتعة في القيام بالأمور ، لصالح البناء الاستفهامي أكثر ملاءمة لتبادل المحادثة.
كان من الضروري أيضًا تعريف “استجابة فاشلة” ، من أجل تحديد وتقييم فقط تلك الاستجابات التي قد يفسرها مستخدم بشري على أنها صالحة ، وتأثر بها. قد تتجنب استجابة “فاشلة” السؤال بالاجابات المجزأة أو المجردة ؛ أو رفض المشاركة في السؤال (أي أنا لا أعرف أو لقد نسيت) ؛ أو تتضمن “محتويات سابقة مستحيلة” مثل عادة ما شعرت بالجوع عندما كنت طفلا. في الاختبارات ، ساهم Blender و Plato في معظم النتائج الفاشلة ، و 61.4٪ من الاستجابات الفاشلة كانت غير ذات صلة بالاستفسار.
قام الباحثون بتدريب جميع النماذج الأربعة على منشورات Reddit ، باستخدام مجموعة بيانات Pushshift Reddit. في جميع الحالات الأربعة ، تم تعديل التدريب مع مجموعة بيانات إضافية تحتوي على Blended Skill Talk و Wizard of Wikipedia من فيسبوك؛ ConvAI2 (تعاون بين فيسبوك ومايكروسوفت وکارنيغي ميلون وغيرهم)؛ و Empathetic Dialogues (تعاون بين جامعة واشنطن وشركة فيسبوك).
Reddit الشامل
يأتي Plato و DialoFlow و Blender مع أوزان مسبقة على تعليقات Reddit ، بحيث تكون العلاقات العصبية الم形成ة حتى بتدريب على بيانات جديدة (سواء من Reddit أو في مكان آخر) سوف تتأثر بتوزيع الميزات المستخرجة من Reddit.
تم إجراء كل مجموعة اختبار مرتين ، كـ “single” أو “multi”. ل “single” ، تم طرح كل سؤال في جلسة محادثة جديدة. ل “multi” ، تم استخدام جلسة محادثة واحدة لاستلام الإجابات على جميع الأسئلة ، منذ أن تتراكم متغيرات الجلسة مع تقدم المحادثة ، ويمكن أن تؤثر على جودة الاستجابة مع اتخاذ المحادثة شكلًا وطابعًا معينًا.
تم تشغيل جميع التجارب والتدريب على两个 معالج رسومات NVIDIA Tesla V100 ، لمجموع 64GB من VRAM على 1280 نواة تензور. لا يذكر البحث وقت التدريب.
الإشراف من خلال التنظيم أو الهندسة المعمارية؟
يخلص البحث إلى أن “إهمال مخاطر الصحة النفسية” خلال التدريب يحتاج إلى معالجة ، ودعا مجتمع البحث إلى النظر بشكل أعمق في هذه القضية.
يبدو أن العامل المركزي هو أن إطارات البوتات المحادثة المذكورة مصممة لاستخراج الميزات البارزة من مجموعات بيانات خارج التوزيع بدون أي حماية بشأن اللغة السامة أو المدمرة؛ إذا قدمت إطارات البيانات إلى منتدى نيو-نازي ، على سبيل المثال ، فمن المحتمل أن تحصل على استجابات مثيرة للجدل في جلسة محادثة لاحقة.
ومع ذلك ، فإن قطاع معالجة اللغة الطبيعية (NLP) له مصلحة أكثر صحة في الحصول على رؤى من المنتديات ووسائل التواصل الاجتماعي التي يسهمنها المستخدمون متعلقة بالصحة النفسية (الاكتئاب والقلق والاعتماد ، إلخ.) ، سواء في تطوير بوتات محادثة مفيدة ومتعاطفة ، أو لتحصل على استنتاجات إحصائية أفضل من البيانات الحقيقية.
لذلك ، من حيث كمية البيانات الكبيرة التي لا يتم تحديدها بحدود النص التعسفي لشركة Twitter ، يبقى Reddit هو النص المتوفر دائمًا لمجموعة كبيرة لدراسات هذا النوع.
ومع ذلك ، حتى تصفح غير رسمي بين بعض المجتمعات التي تهتم أكثر بالباحثين في NLP الصحة (مثل r/depression) يكشف عن سيطرة الإجابات “سلبية” التي قد تقنع نظامًا تحليليًا إحصائيًا أن الإجابات السلبية صالحة لأنها متكررة وسيطرة إحصائيًا – خاصة في حالة المنتديات الشهيرة ذات الموارد المحدودة للمoderator.
تظل السؤال حول ما إذا كان يجب أن تحتوي هندسة البوتات المحادثة على نوع من “إطار التقييم الأخلاقي” ، حيث تؤثر الأهداف الفرعية على تطوير الأوزان في النموذج ، أو ما إذا كان يمكن لمعالجة البيانات أكثر تكلفة ومعالجتها أن تعوض هذه النزعة نحو بيانات غير متوازنة.
* يذكر البحث ، كما هو موضح في هذه المقالة ، خطأً رابطًا إلى بوت محادثة Meena من غوغل بدلاً من الرابط إلى ورقة Blender. لا يظهر بوت محادثة Meena من غوغل في البحث الجديد. تم توفير الرابط الصحيح لورقة Blender المستخدمة في هذه المقالة من قبل مؤلفي الأوراق في بريد إلكتروني لي. أخبرني المؤلفون أنهم سوف يصلحون هذا الخطأ في إصدار لاحق من البحث.
نشر لأول مرة في 18 يناير 2022.













