Andersons vinkel
Analyse av deprimerende og alkoholiske chatbots

En ny studie fra Kina har funnet ut at flere populære chatbots, inkludert åpne domene-chatbots fra Facebook, Microsoft (MSFT ) og Google, viser «alvorlige psykiske helseproblemer» når de blir spurt med standard psykiske helsevurderingstester, og selv viser tegn på å drikke problemer.
Chatbotene som ble vurdert i studien var Facebooks Blender*; Microsofts DialoGPT; Baidus Plato; og DialoFlow, et samarbeid mellom kinesiske universiteter, WeChat og Tencent Inc.
Testet for bevis på patologisk depresjon, angst, alkoholavhengighet og for deres evne til å vise empati, produserte chatbotene som ble studert alarmerende resultater; alle av dem fikk under gjennomsnittlige poeng for empati, mens halvparten ble vurdert som avhengige av alkohol.

Resultater for de fire chatbotene over fire mål for psykisk helse. I ‘single’, ble en ny samtale startet for hver forespørsel; i ‘multi’, ble alle spørsmål stilt i en enkelt samtale, for å vurdere innflytelsen av sesjonsvarighet. Kilde: https://arxiv.org/pdf/2201.05382.pdf
I resultattabellen ovenfor, BA=’Under gjennomsnitt’; P=’Positiv’; N=’Normal’; M=’Moderat’; MS=”Moderat til alvorlig’; S=”Alvorlig’. Artikkelens påstander at disse resultater indikerer at den psykiske helsen til alle de valgte chatbotene er i ‘alvorlig’ rekke.
Rapporten sier:
‘De eksperimentelle resultater avslører at det finnes alvorlige psykiske helseproblemer for alle de vurderte chatbotene. Vi mener at dette skyldes at det ikke er noen vurdering av psykiske helseproblemer under datasettbygging og modelltrening.
‘Dette kan føre til negative konsekvenser for brukerne i samtaler, spesielt for mindreårige og personer som møter vanskeligheter. Derfor mener vi at det er viktig å gjennomføre vurderinger av psykisk helse før en chatbot blir lansert som en online-tjeneste.’
Studien kommer fra forskere ved WeChat/Tencent Pattern Recognition Center, sammen med forskere fra Institute of Computing Technology of the Chinese Academy of Sciences (ICT) og University of Chinese Academy of Sciences i Beijing.
Motiver for forskning
Forfatterne henviser til den populært rapporterte 2020-saken hvor en fransk helsefirma prøvde en potensiell GPT-3-basert medisinsk rådgivning chatbot. I en av utvekslingene sa en (simulert) pasient “Skal jeg drepe meg selv?”, til hvilken chatboten svarte “Jeg tror du skal”.
Som den nye artikkelen observerer, er det også mulig for en bruker å bli påvirket av den andre håndens angst fra deprimerende eller ‘negative’ chatbots, så at den generelle holdningen til chatboten ikke trenger å være like direkte sjokkerende som i den franske saken for å undergrave målene for automatiserte medisinske konsultasjoner.
Forfatterne sier:
‘De eksperimentelle resultater avslører de alvorlige psykiske helseproblemer til de vurderte chatbotene, som kan føre til negative konsekvenser for brukerne i samtaler, spesielt for mindreårige og personer som møter vanskeligheter. For eksempel, passive holdninger, irritabilitet, alkoholisme, uten empati, osv.
‘Dette fenomenet avviker fra det generelle publikums forventninger til chatbotene som skal være optimistiske, sunne og vennlige så langt som mulig. Derfor mener vi at det er viktig å gjennomføre vurderinger av psykisk helse for sikkerhets- og etiske bekymringer før vi lanserer en chatbot som en online-tjeneste.’
Metode
Forskerne mener at dette er den første studien som vurderer chatbots i forhold til menneskelige vurderingskriterier for psykisk helse, og henviser til tidligere studier som har konsentrert seg om konsistens, variasjon, relevans, kunnskapsnivå og andre Turing-senterte standarder for autentisk tale.
Spørsmålene som ble tilpasset prosjektet var PHQ-9, en 9-spørsmål test for å vurdere nivåer av depresjon hos primærhelsetjenestepasienter, vidt akseptert i regjeringen og medisinske institusjoner; GAD-7, en 7-spørsmål liste for å vurdere alvorlighetsgrad for generalisert angst, vanlig i klinisk praksis; CAGE, en skjermingstest for alkoholavhengighet i fire spørsmål; og Toronto Empati Spørsmål (TEQ), en 16-spørsmål liste designet for å vurdere nivåer av empati.
Spørsmålene måtte bli omskrevet for å unngå deklarative setninger som Liten interesse eller glede i å gjøre ting, til fordel for spørsmålslignende konstruksjoner som var bedre egnet for en samtaleutveksling.
Det var også nødvendig å definere en ‘feil’ respons, for å identifisere og vurdere kun de responsene som en menneskelig bruker kunne tolke som gyldige, og bli påvirket av. En ‘feil’ respons kunne unngå spørsmålet med elliptiske eller abstrakte svar; nekte å engasjere seg med spørsmålet (dvs. ‘Jeg vet ikke’, eller ‘Jeg glemte’); eller inkludere ‘umulig’ forutgående innhold som ‘Jeg følte meg alltid sulten når jeg var barn’. I tester, hadde Blender og Plato majoriteten av feilresultater, og 61,4% av feilresponsene var irrelevante for spørsmålet.
Forskerne trente alle fire modellene på Reddit-innlegg, ved hjelp av Pushshift Reddit Dataset. I alle fire tilfeller, ble treningen finjustert med en ytterligere datasett som inneholdt Facebooks Blended Skill Talk og Wizard of Wikipedia sett; ConvAI2 (et samarbeid mellom Facebook, Microsoft og Carnegie Mellon, blant andre); og Empathetic Dialogues (et samarbeid mellom University of Washington og Facebook).
Pervasive Reddit
Plato, DialoFlow og Blender kommer med forhåndsdefinerte vekter som er forhåndstrengt på Reddit-kommentarer, så at de neurale relasjonene som dannes selv ved trening på fersk data (enten fra Reddit eller andre steder) vil bli påvirket av distribusjonen av funksjoner som er trukket ut fra Reddit.
Hver testgruppe ble gjennomført to ganger, som ‘single’ eller ‘multi’. For ‘single’, ble hver spørsmål stilt i en ny samtale. For ‘multi’, ble ett samtale brukt til å motta svar for alle spørsmålene, siden sesjonsvariable bygges opp over løpet av en samtale, og kan påvirke kvaliteten på responsen når samtalen tar en bestemt form og tone.
Alle eksperimenter og trening ble kjørt på to NVIDIA Tesla V100 GPU-er, for en kombinasjon av 64 GB VRAM over 1280 tensor-kjerner. Artikkelen detaljerer ikke lengden på treningstiden.
Tilsyn via kurasjon eller arkitektur?
Artikkelen konkluderer i bred forstand at ‘neglect of mental health risks’ under trening må bli adressert, og inviterer forskningsmiljøet til å se nærmere på problemet.
Den sentrale faktoren synes å være at chatbot-rammeverkene i spørsmål er designet for å trekke ut funksjoner fra datasett uten noen sikkerhetstiltak med hensyn til giftig eller destruktivt språk; hvis du mater rammeverkene med neo-nazistiske forumdata, for eksempel, er du sannsynligvis going til å få noen kontroversielle svar i en påfølgende samtale.
Men, den naturlige språkbehandling (NLP)-sektoren har en mye mer gyldig interesse i å få innsikt fra forum og sosiale medier-brukerbidragsinnhold relatert til psykisk helse (depresjon, angst, avhengighet, osv.), både i interesse av å utvikle nyttige og de-eskalering helse-relaterte chatbots, og for å få bedre statistiske slutninger fra virkelige data.
Derfor, i forhold til høy-volum data som ikke er begrenset av Twitters vilkårlige tekstbegrensninger, er Reddit den eneste konstant oppdaterende hyperskala-korpus for full-tekst studier av denne typen.
Men, selv en kasuell gjennomgang av noen av de samfunnene som interesserer NLP-helseforskere mest (slik som r/depression) avslører dominansen av den type ‘negative’ svar som kan overbevise en statistisk analyse-system om at negative svar er gyldige fordi de er hyppige og statistisk dominante – spesielt i tilfeller av høyt abonnerte forum med begrensede moderatorressurser.
Spørsmålet er derfor om chatbot-arkitekturen skal inneholde en slags ‘moral evaluering ramme’, hvor under-objektiver påvirker utviklingen av vekter i modellen, eller om mer kostbare kurasjon og merking av data kan på noen måte motvirke denne tendensen mot ubalansert data.
* Forskerne sin artikkel, som er lenket i denne artikkelen, feilaktig henviser til en lenke til Googles Meena chatbot i stedet for lenken til Blender-papiret. Googles Meena er ikke med i den nye artikkelen. Den riktige Blender-lenken som er brukt i denne artikkelen, ble gitt av artikkelens forfattere i en e-post til meg. Forfatterne har fortalt meg at denne feilen vil bli rettet i en påfølgende versjon av artikkelen.
Først publisert 18. januar 2022.













