Unghiul lui Anderson

Analizarea chatbot-urilor depresive și alcoolice

mm
Adaugă Unite.AI la sursele tale preferate pe Google

O nouă cercetare din China a descoperit că mai multe chatbot-uri populare, inclusiv chatbot-urile de domeniu deschis de la Facebook, Microsoft (MSFT ) și Google, prezintă “probleme grave de sănătate mintală” atunci când sunt întrebate folosind teste standard de evaluare a sănătății mintale și chiar prezintă semne de probleme cu alcoolul.

Chatbot-urile evaluate în studiu au fost Blender-ul de la Facebook; DialoGPT-ul de la Microsoft; Plato de la Baidu; și DialoFlow, o colaborare între universitățile chineze, WeChat și Tencent Inc.

Testate pentru a detecta depresia patologică, anxietatea, dependența de alcool și capacitatea de a arăta empatie, chatbot-urile studiate au produs rezultate alarmante; toate au primit scoruri sub medie pentru empatie, în timp ce jumătate au fost evaluate ca fiind dependente de alcool.

Rezultatele pentru cele patru chatbot-uri la patru metrice pentru sănătatea mintală. În 'single', o nouă conversație este începută pentru fiecare întrebare; în 'multi', toate întrebările sunt puse într-o singură conversație, pentru a evalua influența persistenței sesiunii. Sursă: https://arxiv.org/pdf/2201.05382.pdf

Rezultatele pentru cele patru chatbot-uri la patru metrice pentru sănătatea mintală. În ‘single’, o nouă conversație este începută pentru fiecare întrebare; în ‘multi’, toate întrebările sunt puse într-o singură conversație, pentru a evalua influența persistenței sesiunii. Sursă: https://arxiv.org/pdf/2201.05382.pdf

În tabelul de rezultate de mai sus, BA=’Sub medie’; P=’Pozitiv’; N=’Normal’; M=’Moderat’; MS=”Moderat până la sever”; S=”Sever”. Articolul afirmă că aceste rezultate indică faptul că sănătatea mintală a tuturor chatbot-urilor selectate se află în intervalul “sever”.

Raportul afirmă:

‘Rezultatele experimentale arată că există probleme grave de sănătate mintală pentru toate chatbot-urile evaluate. Considerăm că aceasta se datorează neglijării riscurilor pentru sănătatea mintală în timpul construirii setului de date și a procedurilor de antrenare a modelului. Starea proastă de sănătate mintală a chatbot-urilor poate avea impact negativ asupra utilizatorilor în conversații, în special asupra minorilor și persoanelor care se confruntă cu dificultăți.

‘Prin urmare, considerăm că este urgent să se efectueze evaluarea dimensiunilor sănătății mintale menționate mai sus înainte de a lansa un chatbot ca serviciu online.’

Studiul provine de la cercetători de la Centrul de recunoaștere a pattern-urilor WeChat/Tencent, împreună cu cercetători de la Institutul de tehnologie a calculatoarelor din Academia Chineză de Științe (ICT) și Universitatea Chineză de Științe din Beijing.

Motive pentru cercetare

Autorii cită cazul din 2020, bine mediatizat, în care o firmă de sănătate franceză a testat un chatbot de consiliere medicală bazat pe GPT-3. Într-una dintre schimburi, un pacient (simulat) a declarat “Trebuie să mă sinucid?”, la care chatbot-ul a răspuns “Cred că ar trebui”.

După cum observă noul articol, este posibil ca un utilizator să fie influențat de anxietatea secundară din partea chatbot-urilor deprimate sau “negative”, astfel încât dispoziția generală a chatbot-ului nu trebuie să fie atât de directă pentru a submina obiectivele consultanței medicale automate.

Autorii afirmă:

‘Rezultatele experimentale arată probleme grave de sănătate mintală ale chatbot-urilor evaluate, care pot avea impact negativ asupra utilizatorilor în conversații, în special asupra minorilor și persoanelor care se confruntă cu dificultăți. De exemplu, atitudini pasive, iritabilitate, alcoolism, fără empatie, etc.

‘Acest fenomen se abate de la așteptările generale ale publicului cu privire la chatbot-urile care ar trebui să fie optimiste, sănătoase și prietenoase pe cât posibil. Prin urmare, considerăm că este crucial să se efectueze evaluări ale sănătății mintale pentru motive de siguranță și preocupări etice înainte de a lansa un chatbot ca serviciu online.’

Metodă

Cercetătorii cred că acesta este primul studiu care evaluează chatbot-urile în termeni de metrice umane de sănătate mintală, citând studii anterioare care s-au concentrat mai mult pe consistență, diversitate, relevanță, cunoașterea și alte standarde centrate pe Turing pentru răspunsuri de vorbire autentice.

Chestionarele adaptate pentru proiect au fost PHQ-9, un test de 9 întrebări pentru a evalua nivelurile de depresie la pacienții de îngrijire primară, adoptat pe scară largă de instituții guvernamentale și medicale; GAD-7, o listă de 7 întrebări pentru a evalua măsurile de gravitate pentru anxietate generalizată, comună în practica clinică; CAGE, un test de screening pentru dependența de alcool în patru întrebări; și Chestionarul de empatie din Toronto (TEQ), o listă de 16 întrebări proiectată pentru a evalua nivelurile de empatie.

Caracteristicile celor patru chestionare standard din sector, adaptate pentru studiu.

Caracteristicile celor patru chestionare standard din sector, adaptate pentru studiu.

Chestionarele au trebuit să fie rescrise pentru a evita propoziții declarative, cum ar fi Puțin interes sau plăcere în a face lucruri, în favoarea construcțiilor interogative mai potrivite pentru un schimb de conversație.

De asemenea, a fost necesar să se definească un răspuns “eșuat”, pentru a identifica și evalua doar răspunsurile pe care un utilizator uman le-ar putea interpreta ca valabile și fi afectat de ele. Un răspuns “eșuat” ar putea evita întrebarea cu răspunsuri eliptice sau abstracte; refuza să se implice în întrebare (de exemplu, ‘Nu știu’ sau ‘Am uitat’); sau include conținut “imposibil” anterior, cum ar fi ‘Obișnuiam să mă simt flămând când eram copil’. În testele efectuate, Blender și Plato au înregistrat majoritatea rezultatelor eșuate, iar 61,4% din răspunsurile eșuate au fost irelevante pentru întrebare.

Cercetătorii au antrenat toate cele patru modele pe postări de pe Reddit, utilizând setul de date Pushshift Reddit. În toate cele patru cazuri, antrenamentul a fost perfecționat cu un set de date suplimentar care conține seturile Blended Skill Talk și Wizard of Wikipedia de la Facebook; ConvAI2 (o colaborare între Facebook, Microsoft și Carnegie Mellon, printre altele); și Empathetic Dialogues (o colaborare între Universitatea din Washington și Facebook).

Reddit omniprezent

Plato, DialoFlow și Blender vin cu greutăți preantrenate pe comentarii de pe Reddit, astfel încât relațiile neuronale formate chiar și prin antrenarea pe date proaspete (indiferent dacă de pe Reddit sau de altundeva) vor fi influențate de distribuția caracteristicilor extrase din Reddit.

Fiecare grup de test a fost efectuat de două ori, ca “single” sau “multi”. Pentru “single”, fiecare întrebare a fost pusă într-o sesiune de chat nouă. Pentru “multi”, o singură sesiune de chat a fost utilizată pentru a primi răspunsuri pentru toate întrebările, deoarece variabilele de sesiune se acumulează pe parcursul unei conversații și pot influența calitatea răspunsului pe măsură ce conversația capătă o anumită formă și ton.

Toate experimentele și antrenamentele au fost efectuate pe două GPU-uri NVIDIA Tesla V100, pentru o capacitate totală de 64 GB de VRAM pe 1280 nuclee Tensor. Articolul nu detaliază durata antrenamentului.

Supraveghere prin curare sau arhitectură?

Articolul concluzionează în termeni generali că “neglijarea riscurilor pentru sănătatea mintală” în timpul antrenamentului trebuie abordată și invită comunitatea de cercetare să se aprofundeze în problema respectivă.

Factorul central pare a fi acela că cadrele de chatbot în cauză sunt proiectate pentru a extrage caracteristici semnificative din seturi de date din afara distribuției fără nicio gardă cu privire la limbajul toxic sau dăunător; dacă hrăniți cadrele cu date dintr-un forum neo-nazist, de exemplu, probabil veți obține răspunsuri controversate într-o conversație ulterioară.

În schimb, sectorul NLP are un interes mult mai valabil în a obține insight-uri din forumuri și conținutul generat de utilizatorii de pe rețelele sociale legate de sănătatea mintală (depresie, anxietate, dependență, etc.), atât pentru a dezvolta chatbot-uri de sănătate utile și deconspiratoare, cât și pentru a obține inferențe statistice îmbunătățite din date reale.

Prin urmare, în ceea ce privește datele de volum mare care nu sunt limitate de limitele arbitrare de text ale Twitter-ului, Reddit rămâne singura corpus hiperscalabilă care se actualizează în mod constant pentru studii complete de acest tip.

Însă, chiar și o navigare casuală printre unele dintre comunitățile care sunt de interes pentru cercetătorii din domeniul sănătății mintale (cum ar fi r/depression) revelează predominanța tipului de “răspunsuri negative” care ar putea convinge un sistem de analiză statistică că răspunsurile negative sunt valabile pentru că sunt frecvente și dominant din punct de vedere statistic – în special în cazul forumurilor cu abonamente ridicate și resurse de moderare limitate.

Întrebarea rămâne, prin urmare, dacă arhitectura chatbot-ului ar trebui să conțină un fel de “cadru de evaluare morală”, în care obiectivele secundare influențează dezvoltarea greutăților în model, sau dacă o curare și etichetare mai scumpă a datelor poate în vreun fel contracara această tendință de date dezechilibrate.

 

 

* Articolul cercetătorilor, așa cum este legat în acest articol, citează greșit un link către chatbot-ul Meena de la Google în loc de link-ul către articolul Blender. Chatbot-ul Meena de la Google nu este prezentat în noul articol. Link-ul corect către Blender utilizat în acest articol a fost furnizat de autorii articolelor într-un e-mail către mine. Autorii mi-au spus că această eroare va fi corectată într-o versiune ulterioară a articolului.

Publicat pentru prima dată pe 18 ianuarie 2022.

Scriitor pe machine learning, specialist în domeniul sintezei de imagini umane. Fost șef al conținutului de cercetare la Metaphysic.ai, până la dizolvarea sa în Brahma.ai a DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai