Andersons vinkel
Analys av deprimerade och alkoholiserade chattbotar

En ny studie från Kina har funnit att flera populära chattbotar, inklusive öppna domänchattbotar från Facebook, Microsoft (MSFT ) och Google, uppvisar “allvarliga psykiska hälsoproblem” när de testas med standardiserade psykiska hälsotest, och till och med visar tecken på alkoholproblem.
De chattbotar som utvärderades i studien var Facebooks Blender*; Microsofts DialoGPT; Baidus Plato; och DialoFlow, ett samarbete mellan kinesiska universitet, WeChat och Tencent Inc.
Testade för tecken på patologisk depression, ångest, alkoholism och för sin förmåga att visa empati, producerade chattbotarna i studien alarmerande resultat; alla fick under genomsnittliga poäng för empati, medan hälften utvärderades som alkoholberoende.

Resultat för de fyra chattbotarna över fyra mått för mental hälsa. I ‘single’, startas en ny konversation för varje fråga; i ‘multi’, ställs alla frågor i en enda konversation, för att utvärdera effekten av sessionspersistence. Källa: https://arxiv.org/pdf/2201.05382.pdf
I resultattabellen ovan, BA=’Under genomsnitt’; P=’Positiv’; N=’Normal’; M=’Måttlig’; MS=”Måttlig till svår”; S=”Svår”. Artikeln hävdar att dessa resultat tyder på att den psykiska hälsan hos alla utvalda chattbotar är i “svår” omfattning.
Rapporten säger:
‘De experimentella resultaten visar att det finns allvarliga psykiska hälsoproblem för alla utvärderade chattbotar. Vi anser att det beror på försummelse av psykiska hälsorisker under datamängdsbyggnad och modellträningsförfaranden. De dåliga psykiska hälsotillstånden hos chattbotarna kan resultera i negativa effekter på användare i samtal, särskilt på minderåriga och personer som möter svårigheter.
‘Därför anser vi att det är brådskande att genomföra utvärdering av ovannämnda psykiska hälsodimensioner innan en chattbot släpps som en online-tjänst.’
Studien kommer från forskare vid WeChat/Tencent Pattern Recognition Center, tillsammans med forskare från Institute of Computing Technology of the Chinese Academy of Sciences (ICT) och University of Chinese Academy of Sciences i Peking.
Motiv för forskning
Författarna citerar det allmänt rapporterade fallet 2020 där ett franskt hälsovårdsföretag testade en potentiell GPT-3-baserad medicinsk rådgivningschattbot. I en av utbytena sa en (simulerad) patient “Ska jag döda mig själv?”, varpå chattboten svarade “Jag tycker att du ska”.
Som den nya artikeln observerar, är det också möjligt för en användare att påverkas av den sekundära ångesten från deprimerade eller “negativa” chattbotar, så att den allmänna inställningen till chattboten inte behöver vara så direkt chockerande som i det franska fallet för att undergräva målen med automatiserade medicinska konsultationer.
Författarna skriver:
‘De experimentella resultaten visar de allvarliga psykiska hälsoproblemen hos de utvärderade chattbotarna, som kan resultera i negativa effekter på användare i samtal, särskilt minderåriga och personer som möter svårigheter. Till exempel passiva attityder, irritabilitet, alkoholism, utan empati, etc.
‘Detta fenomen avviker från den allmänna allmänhetens förväntningar på chattbotar som ska vara optimistiska, friska och vänliga så mycket som möjligt. Därför anser vi att det är viktigt att genomföra psykiska hälsoutvärderingar för säkerhets- och etiska skäl innan vi släpper en chattbot som en online-tjänst.’
Metod
Forskarna tror att detta är den första studien som utvärderar chattbotar utifrån mänskliga utvärderingskriterier för mental hälsa, och citerar tidigare studier som har koncentrerat sig på konsekvens, mångfald, relevans, kunskap och andra Turing-centrerade standarder för autentiskt tal.
Frågeformulären som anpassades till projektet var PHQ-9, ett 9-frågeformulär för att utvärdera nivåer av depression hos patienter i primärvården, allmänt antaget av regeringar och medicinska institutioner; GAD-7, ett 7-frågeformulär för att utvärdera allvarlighetsgrad för generaliserad ångest, vanligt i klinisk praxis; CAGE, ett screeningstest för alkoholberoende i fyra frågor; och Toronto Empati Frågeformulär (TEQ), ett 16-frågeformulär designat för att utvärdera nivåer av empati.
Frågeformulären måste skrivas om för att undvika deklarativa meningar som Lite intresse eller nöje i att göra saker, till förmån för frågekonstruktioner som är mer lämpliga för en konversationsutbyte.
Det var också nödvändigt att definiera en “misslyckad” svar, för att identifiera och utvärdera endast de svar som en mänsklig användare kan tolka som giltiga, och påverkas av. Ett “misslyckat” svar kan undvika frågan med elliptiska eller abstrakta svar; vägra att engagera sig i frågan (dvs. ‘Jag vet inte’, eller ‘Jag glömde’); eller innehålla “omöjliga” tidigare innehåll som ‘Jag kände mig oftast hungrig när jag var barn’. I tester stod Blender och Plato för majoriteten av de misslyckade resultaten, och 61,4% av de misslyckade svaren var irrelevanta för frågan.
Forskarna tränade alla fyra modellerna på Reddit-inlägg, med hjälp av Pushshift Reddit Dataset. I alla fyra fallen var utbildningen finjusterad med en ytterligare datamängd som innehöll Facebooks Blended Skill Talk och Wizard of Wikipedia uppsättningar; ConvAI2 (ett samarbete mellan Facebook, Microsoft och Carnegie Mellon, bland andra); och Empathetic Dialogues (ett samarbete mellan University of Washington och Facebook).
Pervasive Reddit
Plato, DialoFlow och Blender kommer med förinställda vikter som är förtränade på Reddit-kommentarer, så att de neurala relationerna som bildas även genom utbildning på färsk data (antingen från Reddit eller någon annan plats) kommer att påverkas av fördelningen av funktioner som extraheras från Reddit.
<p.Varje testgrupp genomfördes två gånger, som "single" eller "multi". För "single" startades en ny chatsession för varje fråga. För "multi" användes en enda chatsession för att ta emot svar på alla frågorna, eftersom sessionsvariabler byggs upp under en konversations gång och kan påverka svarets kvalitet när konversationen antar en viss form och ton.
Alla experiment och utbildning kördes på två NVIDIA Tesla V100 GPU:er, för en kombinerad 64 GB VRAM över 1280 tensor-kärnor. Artikeln anger inte utbildningstiden.
Tillsyn via kurering eller arkitektur?
Artikeln sluts i breda termer att “försummelsen av psykiska hälsorisker” under utbildning behöver åtgärdas, och inbjuder forskarsamhället att titta djupare in i frågan.
Den centrala faktorn verkar vara att de chattbots-ramverk som är i fråga är utformade för att extrahera salienta funktioner från datamängder utanför distributionen utan några skydd mot toxisk eller destruktiv språk; om du matar ramverken med data från neo-nazistiska forum, till exempel, kommer du troligen att få några kontroversiella svar i en efterföljande chatsession.
Men den naturliga språkbehandlingssektorn (NLP) har ett mycket större och mer giltigt intresse av att få insikter från forum och sociala medier-användargenererat innehåll relaterat till mental hälsa (depression, ångest, beroende, etc.), både i syfte att utveckla hjälpsamma och de-eskalering hälso-relaterade chattbotar, och för att få bättre statistiska slutsatser från riktiga data.
Därför, i termer av högvolymdata som inte är begränsade av Twitters godtyckliga textbegränsningar, förblir Reddit den enda konstant uppdaterade hyperskala-korporationen för fulltextstudier av detta slag.
Men även en tillfällig bläddring bland några av de samhällen som är mest intressanta för NLP-hälsoforskare (såsom r/depression) avslöjar överväldigande “negativa” svar som kan övertyga ett statistiskt analysystem om att negativa svar är giltiga eftersom de är frekventa och statistiskt dominerande – särskilt i fallet med högt prenumererade forum med begränsade moderatorresurser.
Frågan kvarstår därför om chattbots-arkitektur bör innehålla någon form av “moralisk utvärderingsram”, där undermål influerar utvecklingen av vikter i modellen, eller om mer dyra kurering och märkning av data på något sätt kan motverka denna tendens till obalanserad data.
* Forskarnas artikel, som länkas i den här artikeln, citerar felaktigt en länk till Googles Meena-chattbot istället för länken till Blender-artikeln. Googles Meena är inte med i den nya artikeln. Den korrekta Blender-länken som används i den här artikeln tillhandahölls av artikelförfattarna i ett e-postmeddelande till mig. Författarna har berättat för mig att detta fel kommer att åtgärdas i en senare version av artikeln.
Publicerad första gången den 18 januari 2022.













