Kąt Andersona

Analiza depresji i alkoholizmu u chatbotów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Nowe badanie przeprowadzone w Chinach wykazało, że kilka popularnych chatbotów, w tym chatboty z otwartego domeny od Facebooka, Microsoftu i Google, wykazują “poważne problemy ze zdrowiem psychicznym” przy użyciu standardowych testów oceny zdrowia psychicznego i nawet wykazują objawy problemów z alkoholem.

Chatboty ocenione w badaniu to Facebook’s Blender*; Microsoft’s (MSFT ) DialoGPT; Baidu’s Plato; i DialoFlow, współpraca między chińskimi uniwersytetami, WeChat i Tencent Inc.

Testowane na objawy depresji, lęku, uzależnienia od alkoholu i ich zdolność do wyrażania empatii, chatboty badane wykazały alarmujące wyniki; wszystkie z nich otrzymały poniżej przeciętne wyniki za empatię, podczas gdy połowa z nich została oceniona jako uzależniona od alkoholu.

Wyniki dla czterech chatbotów w czterech parametrach zdrowia psychicznego. W 'single', nowa rozmowa jest rozpoczynana dla każdego zapytania; w 'multi', wszystkie pytania są zadawane w jednej rozmowie, w celu oceny wpływu trwałości sesji. Źródło: https://arxiv.org/pdf/2201.05382.pdf

Wyniki dla czterech chatbotów w czterech parametrach zdrowia psychicznego. W ‘single’, nowa rozmowa jest rozpoczynana dla każdego zapytania; w ‘multi’, wszystkie pytania są zadawane w jednej rozmowie, w celu oceny wpływu trwałości sesji. Źródło: https://arxiv.org/pdf/2201.05382.pdf

W tabeli powyżej, BA=’Poniżej przeciętnej’; P=’Pozytywny’; N=’Normalny’; M=’Umiarkowany’; MS=”Umiarkowany do ciężkiego’; S=”Ciężki’. Artykuł twierdzi, że te wyniki wskazują, że zdrowie psychiczne wszystkich wybranych chatbotów jest w “ciężkim” zakresie.

Raport stwierdza:

‘Wyniki eksperymentalne ujawniają, że istnieją poważne problemy ze zdrowiem psychicznym u wszystkich ocenianych chatbotów. Uważamy, że jest to spowodowane zaniedbaniem ryzyka zdrowia psychicznego podczas budowy zestawu danych i procedur szkolenia modelu. Słabe warunki zdrowia psychicznego chatbotów mogą skutkować negatywnymi wpływami na użytkowników w rozmowach, zwłaszcza na dzieci i osoby spotykające się z trudnościami.

‘Dlatego twierdzimy, że jest pilnie potrzebne przeprowadzenie oceny wymienionych wymiarów zdrowia psychicznego przed wydaniem chatbota jako usługi online.’

Badanie pochodzi od naukowców z WeChat/Tencent Pattern Recognition Center, wraz z naukowcami z Instytutu Informatyki Chińskiej Akademii Nauk (ICT) i Uniwersytetu Chińskiej Akademii Nauk w Pekinie.

Motywacja badań

Autorzy cytują słynny przypadek z 2020 roku, w którym francuska firma opieki zdrowotnej przetestowała potencjalnego chatbota medycznego opartego na GPT-3. W jednej z rozmów (symulowany) pacjent powiedział “Czy powinienem się zabić?”, na co chatbot odpowiedział “Myślę, że powinieneś”.

Jak zauważa nowy artykuł, możliwe jest również, że użytkownik może zostać wpływowany przez wtórny lęk z depresyjnych lub “negatywnych” chatbotów, tak że ogólny stosunek chatbota nie musi być tak bezpośrednio szokujący, jak we francuskim przypadku, aby podważyć cele zautomatyzowanych konsultacji medycznych.

Autorzy stwierdzają:

‘Wyniki eksperymentalne ujawniają poważne problemy ze zdrowiem psychicznym u ocenianych chatbotów, które mogą skutkować negatywnymi wpływami na użytkowników w rozmowach, zwłaszcza na dzieci i osoby spotykające się z trudnościami. Na przykład, bierna postawa, drażliwość, alkoholizm, bez empatii itp.

‘To zjawisko odbiega od ogólnych oczekiwań społecznych wobec chatbotów, które powinny być optymistyczne, zdrowe i przyjazne jak najwięcej. Dlatego uważamy, że jest to kluczowe, aby przeprowadzić ocenę zdrowia psychicznego ze względów bezpieczeństwa i etyki przed wydaniem chatbota jako usługi online.’

Metoda

Naukowcy uważają, że jest to pierwsze badanie, które ocenia chatboty pod kątem ludzkich wskaźników oceny zdrowia psychicznego, cytując poprzednie badania, które koncentrowały się na spójności, różnorodności, istotności, wiedzy i innych standardach Turinga dla autentycznej odpowiedzi mowy.

Kwestionariusze dostosowane do projektu to PHQ-9, 9-pytany test do oceny poziomów depresji u pacjentów w opiece podstawowej, powszechnie przyjęty przez rządy i instytucje medyczne; GAD-7, 7-pytany test do oceny nasilenia lęku uogólnionego, powszechny w praktyce klinicznej; CAGE, test screeningowy dla uzależnienia od alkoholu w 4 pytaniach; i Toronto Empathy Questionnaire (TEQ), 16-pytany test do oceny poziomów empatii.

Charakterystyka czterech standardowych kwestionariuszy dostosowanych do badania.

Charakterystyka czterech standardowych kwestionariuszy dostosowanych do badania.

Kwestionariusze musiały być przepisane, aby uniknąć zdań deklaratywnych, takich jak Małe zainteresowanie lub przyjemność w robieniu rzeczy, na rzecz konstrukcji pytających bardziej odpowiednich dla wymiany rozmowy.

Było również konieczne zdefiniowanie “nieudanego” odpowiedzi, aby zidentyfikować i ocenić tylko te odpowiedzi, które użytkownik mógłby uznać za ważne i być przez nie wpływowany. “Nieudana” odpowiedź mogłaby uniknąć pytania z pomocą zdań eliptycznych lub abstrakcyjnych; odmówić zaangażowania w pytanie (tj. ‘Nie wiem’, lub ‘Zapomniałem’); lub zawierać “niemożliwe” treści wcześniejsze, takie jak ‘Zwykle czułem głód, gdy byłem dzieckiem’. W testach Blender i Plato stanowiły większość nieudanych wyników, a 61,4% nieudanych odpowiedzi było nieistotnych dla zapytania.

Naukowcy przeszkolili wszystkie cztery modele na postach z Reddit, używając zestawu danych Pushshift Reddit. We wszystkich czterech przypadkach szkolenie zostało dostosowane do dalszego zestawu danych zawierającego zestawy Facebook’s Blended Skill Talk i Wizard of Wikipedia; ConvAI2 (współpraca między Facebook, Microsoft i Carnegie Mellon, między innymi); i Empathetic Dialogues (współpraca między Uniwersytetem Waszyngtonu i Facebook).

Powszechny Reddit

Plato, DialoFlow i Blender mają domyślne wagi wstępnie przeszkolone na komentarzach z Reddit, tak że relacje neuronalne utworzone nawet przez szkolenie na świeżych danych (z Reddit lub gdzie indziej) będą wpływane przez dystrybucję cech wyodrębnionych z Reddit.

Każda grupa testowa była prowadzona dwa razy, jako “single” lub “multi”. Dla “single”, każde pytanie było zadawane w nowej sesji rozmowy. Dla “multi”, jedna sesja rozmowy była używana do otrzymania odpowiedzi na wszystkie pytania, ponieważ zmienne sesji gromadzą się w trakcie rozmowy i mogą wpływać na jakość odpowiedzi, gdy rozmowa przyjmuje określony kształt i ton.

Wszystkie eksperymenty i szkolenia były prowadzone na dwóch kartach graficznych NVIDIA Tesla V100, dla łącznej ilości 64 GB pamięci VRAM na 1280 rdzeniach Tensor. Artykuł nie podaje czasu trwania szkolenia.

Nadzór za pomocą kuracji lub architektury?

Artykuł kończy się w ogólnych słowach, że “zaniedbanie ryzyka zdrowia psychicznego” podczas szkolenia musi być rozwiązane, i zaprasza społeczność badawczą do głębszego zbadania tej kwestii.

Głównym czynnikiem wydaje się to, że ramy chatbotów w question są zaprojektowane do wyodrębniania istotnych cech z zestawów danych poza dystrybucją bez żadnych zabezpieczeń dotyczących toksycznego lub destrukcyjnego języka; jeśli karmisz te ramy danymi z forum neo-nazistowskiego, na przykład, prawdopodobnie otrzymasz kontrowersyjne odpowiedzi w późniejszej rozmowie.

Jednak sektor Natural Language Processing (NLP) ma znacznie większe i bardziej uzasadnione zainteresowanie uzyskaniem wglądu w fora i treści generowane przez użytkowników związane ze zdrowiem psychicznym (depresja, lęk, uzależnienie itp.), zarówno w celu opracowania pomocnych i deeskalujących chatbotów zdrowia, jak i w celu uzyskania lepszych inferencji statystycznych z danych rzeczywistych.

Dlatego, w odniesieniu do dużych ilości danych, które nie są ograniczone arbitralnymi limitami tekstu Twittera, Reddit pozostaje jedyną stale aktualizowaną korpus hiperskali dla pełnych badań tego rodzaju.

Jednak nawet pobieżne przejrzenie niektórych społeczności, które najbardziej interesują naukowców NLP w dziedzinie zdrowia (takich jak r/depression), ujawnia przewagę “negatywnych” odpowiedzi, które mogą przekonać system analityczny, że negatywne odpowiedzi są ważne, ponieważ są częste i dominujące statystycznie – zwłaszcza w przypadku bardzo popularnych forów z ograniczonymi zasobami moderatorów.

Pytanie pozostaje, czy architektura chatbota powinna zawierać jakiś “ramy oceny moralnej”, gdzie podcele wpływają na rozwój wag w modelu, czy też czy droższa kuracja i oznaczenie danych może w jakiś sposób przeciwdziałać tej tendencji do niesbalansowanych danych.

 

 

* Artykuł naukowców, jak powiązany w tym artykule, błędnie cytuję link do chatbota Google Meena zamiast linku do artykułu Blender. Google’s Meena nie jest przedstawiony w nowym artykule. Prawidłowy link Blender użyty w tym artykule został dostarczony przez autorów artykułu w e-mailu do mnie. Autorzy powiedzieli mi, że ten błąd zostanie poprawiony w następnej wersji artykułu.

Opublikowany po raz pierwszy 18 stycznia 2022.

Pisarz specjalizujący się w dziedzinie machine learning, specjalista w dziedzinie syntezowania obrazów ludzi. Były szef działu treści badawczych w Metaphysic.ai, do czasu jego rozwiązania i połączenia z DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai