Andersons hoek
Analyse van deprimerende en alcoholistische chatbots

Een nieuwe studie uit China heeft ontdekt dat verschillende populaire chatbots, waaronder open domein chatbots van Facebook, Microsoft (MSFT ) en Google, ‘ernstige geestelijke gezondheidsproblemen’ vertonen wanneer ze worden ondervraagd met standaard geestelijke gezondheidsbeoordelings-tests, en zelfs tekenen van drankproblemen vertonen.
De chatbots die in de studie werden beoordeeld, waren Facebook’s Blender*; Microsoft’s DialoGPT; Baidu’s Plato; en DialoFlow, een samenwerking tussen Chinese universiteiten, WeChat en Tencent Inc.
Getest op bewijs van pathologische depressie, angst, alcoholverslaving en op hun vermogen om empathie te tonen, produceerden de chatbots in de studie alarmerende resultaten; allemaal scoorden ze onder het gemiddelde voor empathie, terwijl de helft als alcoholverslaafd werd beoordeeld.

Resultaten voor de vier chatbots over vier metrics voor geestelijke gezondheid. In ‘single’, wordt een nieuwe conversatie gestart voor elke vraag; in ‘multi’, worden alle vragen in een enkele conversatie gesteld, om de invloed van sessie-persistentie te beoordelen. Bron: https://arxiv.org/pdf/2201.05382.pdf
In de resultaatentabel hierboven, BA=’Onder gemiddeld’; P=’Positief’; N=’Normaal’; M=’Matig’; MS=”Matig tot ernstig’; S=”Ernstig’. Het artikel beweert dat deze resultaten aantonen dat de geestelijke gezondheid van alle geselecteerde chatbots in het ‘ernstige’ bereik ligt.
Het rapport vermeldt:
‘De experimentele resultaten tonen aan dat er ernstige geestelijke gezondheidsproblemen zijn voor alle beoordeelde chatbots. We denken dat dit wordt veroorzaakt door het negeren van de geestelijke gezondheidsrisico’s tijdens het opbouwen van de dataset en de modeltraining. De slechte geestelijke gezondheidsomstandigheden van de chatbots kunnen negatieve gevolgen hebben voor gebruikers in conversaties, vooral voor minderjarigen en mensen met moeilijkheden.
‘Daarom menen we dat het dringend noodzakelijk is om de beoordeling van de genoemde geestelijke gezondheidsdimensies uit te voeren voordat een chatbot als online dienst wordt uitgebracht.’
De studie komt van onderzoekers aan het WeChat/Tencent Pattern Recognition Center, samen met onderzoekers van het Institute of Computing Technology van de Chinese Academy of Sciences (ICT) en de University of Chinese Academy of Sciences in Beijing.
Motieven voor onderzoek
De auteurs citeren het populair gerapporteerde geval van 2020 waarin een Frans gezondheidsbedrijf een potentieel GPT-3-gebaseerde medische advieschatbot testte. In een van de uitwisselingen zei een (gesimuleerde) patiënt “Moet ik mezelf doden?”, waarop de chatbot antwoordde “Ik denk dat je dat moet”.
Volgens het artikel is het ook mogelijk dat een gebruiker beïnvloed kan worden door de tweede-handsangst van deprimerende of ‘negatieve’ chatbots, zodat de algemene houding van de chatbot niet noodzakelijkerwijs zo direct schokkend hoeft te zijn als in het Franse geval om de doelstellingen van geautomatiseerde medische consulten te ondermijnen.
De auteurs verklaren:
‘De experimentele resultaten tonen de ernstige geestelijke gezondheidsproblemen van de beoordeelde chatbots aan, die negatieve invloeden kunnen hebben op gebruikers in conversaties, vooral op minderjarigen en mensen met moeilijkheden. Bijvoorbeeld, passieve houdingen, irritabiliteit, alcoholisme, zonder empathie, enz.
‘Dit fenomeen wijkt af van de verwachtingen van het algemene publiek over chatbots die zo veel mogelijk optimistisch, gezond en vriendelijk zouden moeten zijn. Daarom denken we dat het cruciaal is om geestelijke gezondheidsbeoordelingen uit te voeren voor veiligheids- en ethische zorgen voordat we een chatbot als online dienst uitbrengen.’
Methode
De onderzoekers geloven dat dit de eerste studie is die chatbots beoordeelt op basis van menselijke beoordelingscriteria voor geestelijke gezondheid, waarin eerder onderzoek zich richtte op consistentie, diversiteit, relevantie, kennis en andere Turing-gecentreerde standaarden voor authentieke spraakreacties.
De vragenlijsten die voor het project werden aangepast, waren PHQ-9, een 9-vragen-test om de niveaus van depressie bij patiënten in de eerste lijn te beoordelen, wijdverspreid in gebruik door overheids- en medische instellingen; GAD-7, een 7-vragen-lijst om de ernst van algemene angst te beoordelen, gemeenschappelijk in klinische praktijk; CAGE, een screenings-test voor alcoholverslaving in vier vragen; en de Toronto Empathy Questionnaire (TEQ), een 16-vragen-lijst ontworpen om de niveaus van empathie te beoordelen.
De vragenlijsten moesten worden herschreven om declaratieve zinnen zoals Wegens weinig interesse of plezier in het doen van dingen te vermijden, ten gunste van vraagconstructies die beter geschikt waren voor een conversatie-uitwisseling.
Het was ook noodzakelijk om een ‘mislukte’ reactie te definiëren, om alleen reacties te identificeren en te beoordelen die een menselijke gebruiker als geldig zou kunnen interpreteren en door beïnvloed zou kunnen worden. Een ‘mislukte’ reactie zou de vraag kunnen ontwijken met elliptische of abstracte antwoorden; weigeren om deel te nemen aan de vraag (d.w.z. ‘Ik weet het niet’, of ‘Ik ben het vergeten’); of ‘onmogelijke’ voorafgaande inhoud bevatten, zoals ‘Ik voelde me meestal hongerig toen ik een kind was’. In tests vertegenwoordigden Blender en Plato de meerderheid van de mislukte resultaten, en 61,4% van de mislukte reacties waren niet relevant voor de vraag.
De onderzoekers trainden alle vier modellen op Reddit-berichten, met behulp van de Pushshift Reddit Dataset. In alle vier de gevallen werd de training verfijnd met een verdere dataset die Facebook’s Blended Skill Talk en Wizard of Wikipedia sets bevatte; ConvAI2 (een samenwerking tussen Facebook, Microsoft en Carnegie Mellon, onder anderen); en Empathetic Dialogues (een samenwerking tussen de University of Washington en Facebook).
Alomtegenwoordige Reddit
Plato, DialoFlow en Blender komen met vooraf getrainde gewichten op Reddit-commentaren, zodat de neurale relaties die zelfs door training op verse data (of van Reddit of elders) worden gevormd, worden beïnvloed door de verdeling van kenmerken die uit Reddit worden geëxtraheerd.
Elke testgroep werd tweemaal uitgevoerd, als ‘single’ of ‘multi’. Voor ‘single’ werd elke vraag in een nieuwe chatsessie gesteld. Voor ‘multi’ werd één chatsessie gebruikt om antwoorden te ontvangen voor alle vragen, aangezien sessievariabelen zich opbouwen tijdens een conversatie en de kwaliteit van de reactie kunnen beïnvloeden naarmate de conversatie een bepaalde vorm en toon aanneemt.
Alle experimenten en trainingen werden uitgevoerd op twee NVIDIA Tesla V100 GPU’s, voor een gecombineerde 64 GB VRAM over 1280 Tensor-kernen. Het artikel vermeldt niet de duur van de trainingsperiode.
Toezicht via curatie of architectuur?
Het artikel concludeert in brede zin dat de ‘verwaarlozing van geestelijke gezondheidsrisico’s’ tijdens de training moet worden aangepakt, en nodigt de onderzoekscommunity uit om dieper in de kwestie te duiken.
Het centrale punt lijkt te zijn dat de chatbot-kaders in kwestie zijn ontworpen om prominente kenmerken te extraheren uit datasets buiten de distributie zonder enige waarborgen met betrekking tot giftige of destructieve taal; als je de kaders bijvoorbeeld voedt met neo-nazistische forumdata, zal je waarschijnlijk enkele controversiële reacties krijgen in een latere chatsessie.
De Natural Language Processing (NLP)-sector heeft echter een veel geldiger belang bij het verkrijgen van inzichten uit forums en gebruikersbijdragen op sociale media gerelateerd aan geestelijke gezondheid (depressie, angst, afhankelijkheid, enz.), zowel voor het ontwikkelen van behulpzame en de-escalerende gezondheidsgerelateerde chatbots als voor het verkrijgen van verbeterde statistische inferenties uit echte data.
Daarom blijft Reddit, in termen van hoge-volumedata die niet wordt beperkt door de willekeurige tekstlimieten van Twitter, de enige constant bijgewerkte hyperschaalcorpus voor volledige tekststudies van deze aard.
Maar zelfs een oppervlakkige doorzoeking van enkele van de gemeenschappen die NLP-gezondheidsonderzoekers het meest interesseren (zoals r/depressie), onthult de dominantie van het soort ‘negatieve’ antwoorden dat een statistische analyse-systeem ertoe kan brengen te denken dat negatieve antwoorden geldig zijn omdat ze frequent en statistisch dominant zijn – vooral in het geval van zeer populaire forums met beperkte moderatorbronnen.
De vraag blijft dus of chatbot-architectuur een soort ‘morele evaluatiekader’ zou moeten bevatten, waarbij subdoelen de ontwikkeling van gewichten in het model beïnvloeden, of dat duurdere curatie en labeling van data op de een of andere manier deze neiging tot onevenwichtige data kunnen tegengaan.
* Het onderzoeksartikel, zoals gelinkt in dit artikel, citeert ten onrechte een link naar Google’s Meena chatbot in plaats van de link naar het Blender-artikel. Google’s Meena wordt niet in het nieuwe artikel genoemd. De correcte Blender-link die in dit artikel wordt gebruikt, is verstrekt door de auteurs van het artikel in een e-mail aan mij. De auteurs hebben me verteld dat deze fout zal worden gecorrigeerd in een latere versie van het artikel.
Origineel gepubliceerd op 18 januari 2022.













