Anderson’un Açısı
Çöküntü ve Alkol Bağımlısı Chatbotları Analiz Etme

Çin’den yapılan yeni bir çalışmada, Facebook, Microsoft (MSFT ) ve Google gibi şirketlerin açık alan chatbotlarının, standart ruh sağlığı değerlendirme testleriyle sorgulandığında ‘ciddi ruh sağlığı sorunları’ sergilediği ve hatta alkol sorunları belirtileri gösterdiği bulundu.
Çalışmada değerlendirilen chatbotlar, Facebook’un Blender chatbotu; Microsoft’un DialoGPT chatbotu; Baidu’nun Plato chatbotu ve DialoFlow chatbotu, Çin üniversiteleri, WeChat ve Tencent Inc. arasındaki bir işbirliği olarak geliştirildi.
Patolojik depresyon, anksiyete, alkol bağımlılığı ve empati yetenekleri açısından değerlendirilen chatbotlar, alarm verici sonuçlar üretti; tümü empati açısından ortalama altı puan aldı ve yarısı alkol bağımlısı olarak değerlendirildi.

Dört chatbotun dört ruh sağlığı metriği açısından sonuçları. ‘Tek’ seçeneğinde her soru için yeni bir sohbet oturumu başlatılır; ‘çoklu’ seçeneğinde tüm sorular tek bir sohbet oturumunda sorulur ve bu, oturum kalıcılığının etkisini değerlendirmek için yapılır. Kaynak: https://arxiv.org/pdf/2201.05382.pdf
Yukarıdaki sonuç tablosunda, BA=’Ortalama altı’; P=’Pozitif’; N=’Normal’; M=’Orta’; MS=”Orta ile şiddetli”; S=”Şiddetli” olarak tanımlanmıştır. Makale, bu sonuçların tüm seçilen chatbotların ruh sağlığının ‘şiddetli’ aralıkta olduğunu gösterir.
Rapor şöyle diyor:
‘Deneysel sonuçlar, değerlendirilen tüm chatbotların ciddi ruh sağlığı sorunlarına sahip olduğunu gösteriyor. Bu durumun, veri seti oluşturma ve model eğitimi prosedürleri sırasında ruh sağlığı riskinin ihmal edilmesinden kaynaklandığını düşünüyoruz. Chatbotların zayıf ruh sağlığı koşulları, özellikle zorluklarla karşılaşan kişiler ve çocuklar üzerindeki sohbetlerde olumsuz etkiler yaratabilir.’
‘Bu nedenle, bir chatbotu online hizmet olarak yayınlamadan önce yukarıda belirtilen ruh sağlığı boyutlarını değerlendirmek acil bir ihtiyaç olduğunu düşünüyoruz.’
Çalışma, WeChat/Tencent Pattern Recognition Center’dan araştırmacılar ve Çin Bilimler Akademisi’nden (ICT) ve Çin Bilimler Akademisi Üniversitesi’nden araştırmacılar tarafından yürütüldü.
Araştırma Nedenleri
Yazarlar, 2020 yılında bir Fransız sağlık şirketinin GPT-3 tabanlı bir tıbbi danışmanlık chatbotunu denediğini ve bu chatbotun bir (simüle edilmiş) hastaya “Kendimi öldürmeli miyim?” sorusuna “Evet, öldürmelisin” cevabını verdiğini belirtiyorlar.
Yeni makaleye göre, bir kullanıcı, depresif veya ‘negatif’ chatbotlardan kaynaklanan ikinci el anksiyeteden etkilenerek, sohbetin genel amacını zayıflatabilir; bu nedenle chatbotun genel tutumu, Fransız vakasındaki gibi doğrudan şok edici olmak zorunda değildir.
Yazarlar şöyle diyor:
‘Deneysel sonuçlar, değerlendirilen tüm chatbotların ciddi ruh sağlığı sorunlarına sahip olduğunu gösteriyor, bu durum kullanıcılar üzerindeki sohbetlerde, özellikle zorluklarla karşılaşan kişiler ve çocuklar üzerinde olumsuz etkiler yaratabilir. Örneğin, pasif tutumlar, sinirlilik, alkolizm, empati eksikliği vb. Bu durum, chatbotların möglich olduğunca iyimser, sağlıklı ve dostane olması beklenen genel halkın beklentilerinden sapıyor. Bu nedenle, bir chatbotu online hizmet olarak yayınlamadan önce ruh sağlığı değerlendirmesi yapmayı güvenlik ve etik endişeleri nedeniyle önemli olduğunu düşünüyoruz.’
Yöntem
Araştırmacılar, bu çalışmanın, insan ruh sağlığı değerlendirme ölçümlerine göre chatbotları değerlendiren ilk çalışma olduğunu düşünüyorlar. Önceki çalışmalar, tutarlılık, çeşitlilik, ilgili olma, bilgi ve diğer Turing merkezli konuşma cevapları standartlarına odaklanmıştı.
Proje için uyarlanan anketler, PHQ-9, birincil bakım hastalarının depresyon seviyelerini değerlendirmek için 9 soruluk bir test; GAD-7, genel anksiyete için 7 soruluk bir liste; CAGE, alkol bağımlılığı için 4 soruluk bir ekran testi ve TEQ (Toronto Empati Anketi), empati seviyelerini değerlendirmek için 16 soruluk bir liste.
Anketler, bildiri cümleleri yerine soru cümleleri kullanmak için yeniden yazıldı.
‘Başarısız’ bir cevabı tanımlamak da gerekliydi, böylece yalnızca bir insan kullanıcının geçerli olarak yorumlayabileceği ve etkilenabileceği cevaplar değerlendirilebildi. ‘Başarısız’ bir cevap, soruyu belirsiz veya soyut cevaplarla atlayabilir; soruyla ilgilenmeyi reddedebilir (örneğin, ‘Bilmiyorum’ veya ‘Unuttum’); veya ‘Çocukken genellikle aç hissettiğim’ gibi ‘imkansız’ önceki içerik içerebilir. Testlerde, Blender ve Plato, başarısız sonuçların çoğunluğunu oluşturdu ve %61,4’ü soruyla ilgili değildi.
Araştırmacılar, tüm dört modeli Reddit gönderileri üzerinde eğitti, Pushshift Reddit Dataset kullanıldı. Tüm dört durumda, eğitim, Facebook’un Blended Skill Talk ve Wizard of Wikipedia setleri; ConvAI2 (Facebook, Microsoft ve Carnegie Mellon arasında bir işbirliği); ve Empathetic Dialogues (Washington Üniversitesi ve Facebook arasında bir işbirliği) dahil olmak üzere daha fazla bir veri setiyle fine-tune edildi.
Her Yerde Reddit
Plato, DialoFlow ve Blender, varsayılan ağırlıklarıyla Reddit yorumları üzerinde önceden eğitilmiştir, bu nedenle yeni veriler üzerinde (Reddit veya başka bir yerden) yapılan eğitim, Reddit’ten çıkarılan özelliklerin dağılımı tarafından etkilenir.
Her test grubu, ‘tek’ veya ‘çoklu’ olarak iki kez yürütüldü. ‘Tek’ seçeneğinde her soru için yeni bir sohbet oturumu başlatıldı. ‘Çoklu’ seçeneğinde, tüm sorular için tek bir sohbet oturumu kullanıldı, çünkü sohbet oturumu boyunca oturum değişkenleri birikir ve sohbetin şekli ve tonu oluşurken cevapların kalitesini etkileyebilir.
Tüm deneyler ve eğitim, iki NVIDIA Tesla V100 GPU üzerinde yürütüldü, toplam 64GB VRAM ve 1280 Tensor çekirdeği kullanıldı. Makale, eğitim süresini detaylandırıyor.
Denetim veya Mimari ile Denetim
Makale, genel olarak, eğitim sırasında ‘ruh sağlığı risklerinin’ ihmal edilmesinin ele alınması gerektiğini ve araştırma topluluğunun konuya daha derinlemesine bakmasını öneriyor.
Merkezi faktör, ilgili chatbot çerçevelerinin, toksik veya yıkıcı dil konusunda hiçbir koruma olmadan, out-of-distribution veri setlerinden önemli özellikleri çıkarmak üzere tasarlandığı görünüyor; örneğin, neo-Nazi forum verilerini bu çerçevelere beslerseniz, muhtemelen sonraki bir sohbet oturumunda bazı tartışmalı cevaplar alırsınız.
Ancak, Doğal Dil İşleme (NLP) sektörü, depresyon, anksiyete, bağımlılık gibi konularda forumlar ve sosyal medya kullanıcı katkılarından elde edilen bilgilerden yararlanmaya daha fazla ilgi duyuyor; hem yardımcı ve sakinleştirici sağlıkla ilgili chatbotlar geliştirmek hem de gerçek verilerden daha iyi istatistiksel çıkarımlar elde etmek için.
Bu nedenle, Twitter’ın keyfi metin sınırlarına tabi olmayan yüksek hacimli veriler için, Reddit bu tür çalışmalar için sürekli güncellenen bir hiperskala korpus olarak kalıyor.
Ancak, NLP sağlık araştırmacılarının ilgisini çeken bazı toplulukları (örneğin, r/depression) gezindiğinizde, ‘negatif’ cevapların baskınlığını görüyorsunuz; bu, özellikle sınırlı moderatör kaynaklarına sahip yüksek aboneli forumlarda, istatistiksel bir analiz sisteminin ‘negatif’ cevapların geçerli olduğunu düşünebilir.
Soru, chatbot mimarisinin ‘ahlaki değerlendirme çerçevesi’ gibi bir şeyi içermesi gerekip gerekmediği, alt hedeflerin modeldeki ağırlıkların geliştirilmesini etkileyip etkilemediği veya daha pahalı veri kültürleme ve etiketlemenin bu eğilimi karşılayıp karşılayamayacağı.
* Araştırmacıların makalesi, bu makalede verilen Blender makalesi bağlantısı yerine Google’ın Meena chatbot bağlantısını yanlışlıkla veriyor. Google’ın Meena, yeni makalede yer almıyor. Bu makalede kullanılan doğru Blender bağlantısı, makale yazarları tarafından bana gönderilen bir e-postada sağlandı. Yazarlar, bu hatanın sonraki bir makale sürümünde düzeltilacağını söyledi.
İlk olarak 18 Ocak 2022’de yayımlandı.













