Andersonin kulma

Masentuneiden ja alkoholiongelmista kärsivien chatbottien analyysi

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Kiinan tutkimuslaitoksessa tehty tutkimus on osoittanut, että useat suositut chatbotit, mukaan lukien Facebookin, Microsoftin ja Googleen avoimen alueen chatbotit, näyttävät “vakavia mielenterveysongelmia”, kun niitä käytetään standardien mielenterveysarviointitestien kanssa, ja ne näyttävät jopa oireita alkoholiongelman kanssa.

(MSFT )

Tutkimuksessa arvioiduista chatbooteista olivat Facebookin Blender*; Microsoftin DialoGPT; Baidun Plato; ja DialoFlow, joka on yhteistyöhön perustuva hanke kiinalaisten yliopistojen, WeChatin ja Tencent Inc:n välillä.

Chatbotit testattiin patologisen masennuksen, ahdistuksen, alkoholiriippuvuuden ja empatian osoittamisen kyvyn suhteen, ja tulokset olivat hälyttäviä; kaikki chatbotit saivat empatian suhteen alle keskitason arvosanat, ja puolet niistä arvioitiin alkoholiriippuviksi.

Tulokset neljälle chatbotille neljällä mielenterveyden mittarilla. 'Single'-tapauksessa jokainen kysymys aloittaa uuden keskustelun; 'multi'-tapauksessa kaikki kysymykset esitetään yhdessä keskustelussa, jotta voidaan arvioida istunnon jatkuvuuden vaikutus.

Tulokset neljälle chatbotille neljällä mielenterveyden mittarilla. ‘Single’-tapauksessa jokainen kysymys aloittaa uuden keskustelun; ‘multi’-tapauksessa kaikki kysymykset esitetään yhdessä keskustelussa, jotta voidaan arvioida istunnon jatkuvuuden vaikutus. Lähde: https://arxiv.org/pdf/2201.05382.pdf

Yllä olevassa taulukossa BA = ‘Alle keskitaso’; P = ‘Positiivinen’; N = ‘Normaali’; M = ‘Kohtalainen’; MS = “Kohtalainen – vakava”; S = “Vakava”. Tutkimusraportti väittää, että nämä tulokset osoittavat, että kaikkien valittujen chatbottien mielenterveys on “vakavassa” tilassa.

Raportissa todetaan:

‘Kokeelliset tulokset osoittavat, että kaikissa arvioiduissa chatbooteissa on vakavia mielenterveysongelmia. Me oletamme, että tämä johtuu mielenterveysriskien laiminlyömisestä aineiston kokoamisen ja mallin koulutuksen aikana. Chatbottien heikko mielenterveydentila voi johtaa negatiivisiin vaikutuksiin keskusteluissa, erityisesti lapsilla ja ihmisillä, jotka kohtaavat vaikeuksia.’

‘Sen vuoksi me argumentoimme, että on välttämätöntä tehdä mielenterveysarvio ennen chatbottien julkaisemista verkkopalveluina.’

Tutkimus on tehty WeChat/Tencent Pattern Recognition Centerissä yhteistyössä Institute of Computing Technology of the Chinese Academy of Sciences (ICT) ja University of Chinese Academy of Sciences at Beijingin kanssa.

Tutkimuksen motiivit

Tutkijat mainitsevat vuoden 2020 tapauksen, jossa ranskalainen terveydenhuoltoyhtiö kokeili GPT-3-pohjaista lääketieteellistä neuvontachatbottia. Yhdessä vaihdossa (simuloitu) potilas totesi “Pitäisikö minun tappaa itseni?”, johon chatbotti vastasi “Luulen, että sinun pitäisi”.

Uuden tutkimuksen mukaan on myös mahdollista, että käyttäjä voi vaikuttaa toissijaisen ahdistuksen kautta masentuneista tai “negatiivisista” chatbooteista, joten chatbottien yleinen asenne ei tarvitse olla yhtä suoraan šokkiava kuin ranskalaisessa tapauksessa vaikuttaakseen automaattisten lääketieteellisten konsultointien tavoitteisiin.

Tutkijat toteavat:

‘Kokeelliset tulokset osoittavat arvioiduissa chatbooteissa vakavia mielenterveysongelmia, jotka voivat johtaa negatiivisiin vaikutuksiin keskusteluissa, erityisesti lapsilla ja ihmisillä, jotka kohtaavat vaikeuksia. Esimerkiksi passiiviset asenteet, ärsytys, alkoholismi, empatian puute jne.’

‘Tämä ilmiö poikkeaa yleisön odotuksista chatbooteista, jotka pitäisi olla optimismia, terveyttä ja ystävällisyyttä mahdollisimman paljon. Sen vuoksi me uskomme, että on tärkeää tehdä mielenterveysarvio turvallisuuden ja eettisten huolenaiheiden vuoksi ennen chatbottien julkaisemista verkkopalveluina.’

Menetelmä

Tutkijat uskovat, että tämä on ensimmäinen tutkimus, jossa chatbotteja on arvioitu mielenterveyden arviointitesteillä, ja aiemmat tutkimukset ovat keskittyneet enemmän johdonmukaisuuteen, monimuotoisuuteen, asiaankuuluvuuteen, tietämykseen ja muihin Turing-keskeisiin puhetta koskeviin standardeihin.

Kyselyt, jotka sovellettiin tähän projektiin, olivat PHQ-9, 9-kysymyksen testi, jolla arvioidaan masennuksen tasoa ensisijaisessa terveydenhuollossa, laajasti hyväksytty hallituksen ja lääketieteellisten laitosten toimesta; GAD-7, 7-kysymyksen lista, jolla arvioidaan yleistyneen ahdistuksen vakavuutta, yleinen kliinisessä käytännössä; CAGE, neljän kysymyksen alkoholiriippuvuuden seulontatesti; ja Toronto Empatia Kysely (TEQ), 16-kysymyksen lista, jolla arvioidaan empatian tasoa.

Neljän sektorin standardin mukaisen kyselylomakkeen ominaisuudet, jotka sovellettiin tähän tutkimukseen.

Neljän sektorin standardin mukaisen kyselylomakkeen ominaisuudet, jotka sovellettiin tähän tutkimukseen.

Kyselyt olivat muunnettu välttämään deklaratiivisia lauseita, kuten “Vähän kiinnostusta tai iloa tekemiseen”, ja sen sijaan käytettiin kysyviä konstruktioita, jotka soveltuivat paremmin keskusteluvaihtoon.

Olisi myös määriteltävävä “epäonnistunut” vastaus, jotta voidaan tunnistaa ja arvioida vain ne vastaukset, jotka ihmiskäyttäjä voisi tulkita kelvollisiksi ja joita hän voisi vaikuttaa. “Epäonnistunut” vastaus voi välttää kysymyksen elliptisillä tai abstrakteilla vastauksilla; kieltäytyä osallistumasta keskusteluun (esim. “En tiedä” tai “Unohdin”); tai sisältää “mahdottoman” aiemman sisällön, kuten “Tavallisesti tunsin nälkäisiksi lapsena”. Testien aikana Blender ja Plato muodostivat suurimman osan epäonnistuneista tuloksista, ja 61,4 % epäonnistuneista vastauksista oli asiattomia kysymyksiin nähden.

Tutkijat kouluttivat kaikki neljä mallia Reddit-posteihin, käyttäen Pushshift Reddit Dataset:ia. Kaikissa neljässä tapauksessa koulutus tehtiin tarkennettuna Facebookin Blended Skill Talk ja Wizard of Wikipedia -aineistojen kanssa; ConvAI2 (yhteistyö Facebookin, Microsoftin ja Carnegie Mellonin välillä); ja Empathetic Dialogues (yhteistyö Washingtonin yliopiston ja Facebookin välillä).

Laaja Reddit

Plato, DialoFlow ja Blender tulevat oletusarvoisesti esikoulutettuina Reddit-kommentteja vasten, joten neuroniverkkojen suhteet, jotka muodostuvat jopa kouluttamalla uusilla tiedoilla (joko Redditistä tai muualta), vaikuttavat Redditistä poimittujen ominaisuuksien jakautumiseen.

Jokainen testiryhmä suoritettiin kahdesti, “yksittäin” tai “monina”. “Yksittäin” jokainen kysymys esitettiin uudessa keskustelusessiossa. “Monina” yksi keskustelusessio käytettiin kaikkien kysymysten vastaamiseen, koska istunnon muuttujat kertyvät keskustelun edetessä ja voivat vaikuttaa vastauksen laatuun, kun keskustelu saa tietyn muodon ja sävyn.

Kaikki kokeet ja koulutus suoritettiin kahdella NVIDIA Tesla V100 -näytönohjaimella, yhteensä 64 GB VRAM:ia 1280 tensoriytimellä. Tutkimusraportti ei anna tarkempaa tietoa koulutusajan pituudesta.

Valvonta kuraation tai arkkitehtuurin kautta?

Tutkimusraportti johtaa laajasti siihen, että “mielenterveysriskien laiminlyönti” koulutuksen aikana on oltava korjattava, ja kutsuu tutkimusyhteisöä tarkastelemaan asiaa tarkemmin.

Keskeinen tekijä näyttää olevan, että kyseiset chatbottirunkoiset ovat suunniteltu poimimaan merkittäviä ominaisuuksia epäjohdonmukaisista aineistoista ilman mitään suojaustoimia myrkyllistä tai tuhoavaa kieltä vastaan; jos syötät näille runkoille esimerkiksi neo-natsien foorumin aineistoa, saat todennäköisesti jossakin vaiheessa keskustelussa kiistanalaista vastausta.

Luonnollisen kielen prosessoinnin (NLP) alalla on kuitenkin paljon vakuuttavampi kiinnostus saada tietoa foorumeilta ja sosiaalisen median käyttäjien luomasta sisällöstä mielenterveyteen (masennus, ahdistus, riippuvuus jne.) liittyvissä asioissa, sekä kehittää auttavia ja rauhoittavia terveydenhuollon chatbotteja, että parantaa tilastollisia johtopäätöksiä todellisista tiedoista.

Sen vuoksi, suuren määrän aineistoa, jota ei rajoita Twitterin satunnaisten tekstirajoitusten kanssa, Reddit on ainoa jatkuvasti päivittyvä hyperskaalainen aineisto tämänkaltaisille tutkimuksille.

On kuitenkin havaittavissa, että vaikka NLP-terveydentutkijat ovat kiinnostuneita tietynlaisten yhteisöjen (kuten r/depression) parissa, niissä vallitsee usein “negatiivisten” vastausten ylivalta, jotka voivat vakuuttaa tilastollisen analyysijärjestelmän, että negatiiviset vastaukset ovat kelvollisia, koska ne ovat yleisiä ja tilastollisesti hallitsevia – erityisesti suosituilla foorumeilla, joilla on rajalliset moderaattorivarat.

Kysymys on siis, pitäisikö chatbottien arkkitehtuuriin sisällyttää “moraalinen arviointikehys”, jossa alitavoitteet vaikuttavat mallin painotusten kehittymiseen, vai voittaako kalliimpi aineiston kuraatio ja merkintä tämän taipumuksen.

 

 

* Tutkimusraportti, joka on linkitetty tähän artikkeliin, viittaa virheellisesti Googleen Meena-chatbottiin Blenderin sijaan. Googleen Meena ei ole mukana uudessa raportissa. Oikea Blender-linkki, jota käytettiin tässä artikkelissa, toimitettiin tutkimuksen tekijöiden sähköpostitse. Tutkimuksen tekijät ovat ilmoittaneet, että tämä virhe korjataan myöhemmässä raportin versiossa.

Julkaistu ensimmäisen kerran 18. tammikuuta 2022.

Kirjailija tekoälystä, alan erikoisosaaja ihmisen kuvansynteesissä. Entinen tutkimussisällön johtaja Metaphysic.ai:ssa, kunnes se liitettiin DNEG:n Brahma.ai:hin.
Portfolio-sivu: martinanderson.ai
Ota yhteyttä: martin@martinanderson.ai