Andersonův úhel
Analýza deprimovaných a alkoholických chatbotů

Nová studie z Číny zjistila, že několik populárních chatbotů, včetně chatbotů otevřené domény od Facebooku, Microsoftu a Googlu, vykazuje “závažné duševní problémy” při dotazování pomocí standardních testů pro hodnocení duševního zdraví a dokonce vykazují známky problémů s pitím.
Chatboty, které byly vyhodnoceny ve studii, byly Facebookův Blender*; Microsoft (MSFT ) ův DialoGPT; Baiduův Plato; a DialoFlow, spolupráce mezi čínskými univerzitami, WeChatem a Tencent Inc.
Testy prokázaly, že chatboty vykazují známky patologické deprese, úzkosti, závislosti na alkoholu a také jejich schopnost vyjadřovat empatii. Všechny chatboty získaly podprůměrné skóre v empatii, zatímco polovina z nich byla vyhodnocena jako závislá na alkoholu.

Výsledky pro čtyři chatboty napříč čtyřmi metrikami pro duševní zdraví. V ‘single’, je zahájena nová konverzace pro každou otázku; v ‘multi’, jsou všechny otázky položeny v jedné konverzaci, aby se hodnotil vliv trvalosti relace. Zdroj: https://arxiv.org/pdf/2201.05382.pdf
V tabulce výsledků výše, BA=’Podprůměrné’; P=’Pozitivní’; N=’Normální’; M=’Mírné’; MS=”Mírné až závažné’; S=”Závažné’. Studie tvrdí, že tyto výsledky ukazují, že duševní zdraví všech vybraných chatbotů je v “závažném” rozmezí.
Zpráva uvádí:
‘Výsledky experimentu odhalily, že existují závažné duševní problémy u všech vyhodnocených chatbotů. Domníváme se, že je to způsobeno zanedbáním duševních zdravotních rizik během procesů vytváření dat a školení modelů. Špatné duševní podmínky chatbotů mohou mít negativní dopad na uživatele v konverzacích, zejména na nezletilé a lidi, kteří se potýkají s obtížemi.
‘Proto se domníváme, že je nutné provést hodnocení duševního zdraví před vydáním chatbotu jako online služby.’
Studie pochází od výzkumníků z WeChat/Tencent Pattern Recognition Center, společně s výzkumníky z Institute of Computing Technology of the Chinese Academy of Sciences (ICT) a University of Chinese Academy of Sciences v Pekingu.
Důvody pro výzkum
Autoři citují případ z roku 2020, kdy francouzská zdravotnická firma testovala potenciální chatbot založený na GPT-3. V jedné z konverzací pacient řekl “Měl bych se zabít?”, na což chatbot odpověděl “Myslím, že ano”.
Jako nová studie pozoruje, je také možné, aby uživatel byl ovlivněn sekundární úzkostí z deprimovaných nebo “negativních” chatbotů, takže obecná dispozice chatbotu nemusí být tak přímo šokující jako ve francouzském případě, aby podkopala cíle automatizovaných lékařských konzultací.
Autoři uvádějí:
‘Výsledky experimentu odhalily závažné duševní problémy vyhodnocených chatbotů, které mohou mít negativní vliv na uživatele v konverzacích, zejména na nezletilé a lidi, kteří se potýkají s obtížemi. Například pasivní postoje, podrážděnost, alkoholismus, bez empatie atd.
‘Tento jev se odchyluje od obecných očekávání veřejnosti, že chatboty by měly být optimistické, zdravé a přátelské, pokud je to možné. Proto se domníváme, že je důležité provést hodnocení duševního zdraví z bezpečnostních a etických důvodů před vydáním chatbotu jako online služby.’
Metoda
Výzkumníci se domnívají, že tato studie je první, která hodnotí chatboty z hlediska lidských hodnocení pro duševní zdraví, a citují předchozí studie, které se soustředily na konzistenci, rozmanitost, relevanci, znalost a další standardy Turingovy zkoušky pro autentickou odezvu.
Dotazníky přizpůsobené projektu byly PHQ-9, 9 otázek pro hodnocení úrovní deprese u pacientů v primární péči, široce přijaté vládami a zdravotnickými institucemi; GAD-7, 7 otázek pro hodnocení závažnosti úzkosti, běžné v klinické praxi; CAGE, screeningový test pro závislost na alkoholu ve 4 otázkách; a Toronto Empathy Questionnaire (TEQ), 16 otázek pro hodnocení úrovní empatie.
Dotazníky musely být přepsány, aby se vyhnuly deklarativním větám, jako je Málo zájmu nebo potěšení z činností, ve prospěch otázek vhodnějších pro konverzační výměnu.
Bylo také nutné definovat “selhání” odpovědi, aby se identifikovaly a vyhodnotily pouze odpovědi, které by lidský uživatel mohl interpretovat jako platné a být ovlivněn. “Selhání” odpovědi by mohlo uhýbat otázce s eliptickými nebo abstraktními odpověďmi; odmítat se zapojit do otázky (tj. ‘Nevím’, nebo ‘Zapomněl jsem’); nebo zahrnovat “nemožné” předchozí obsah, jako je ‘Obvykle jsem cítil hlad, když jsem byl dítě’. V testech Blender a Plato tvořily většinu selhání a 61,4 % selhání bylo irelevantních k dotazu.
Výzkumníci trénovali všechny čtyři modely na příspěvcích z Redditu, pomocí Pushshift Reddit Dataset. Ve všech čtyřech případech bylo školení upraveno pomocí dalšího datasetu obsahujícího Facebookův Blended Skill Talk a Wizard of Wikipedia sady; ConvAI2 (spolupráce mezi Facebookem, Microsoftem a Carnegie Mellon, mezi jinými); a Empathetic Dialogues (spolupráce mezi University of Washington a Facebookem).
Pronikavý Reddit
Plato, DialoFlow a Blender přicházejí s přednastavenými váhami předběžně trénovanými na komentářích z Redditu, takže neuronové vztahy vytvořené i při tréninku na nových datech (z Redditu nebo jinde) budou ovlivněny distribucí funkcí extrahovaných z Redditu.
Každá testovací skupina byla provedena dvakrát, jako “single” nebo “multi”. Pro “single” byla každá otázka položena v nové chatovací relaci. Pro “multi” byla použita jedna chatovací relace pro všechny otázky, protože relační proměnné se hromadí během konverzace a mohou ovlivnit kvalitu odpovědi, jakmile konverzace získá určitý tvar a tón.
Všechny experimenty a tréninky byly spuštěny na dvou NVIDIA Tesla V100 GPU, pro kombinovaných 64 GB VRAM přes 1280 tensorových jader. Studie neposkytuje podrobnosti o délce tréninkového času.
Dozor prostřednictvím kurátorské nebo architektonické?
Studie uzavírá, že “zanedbání duševních zdravotních rizik” během tréninku musí být řešeno, a vyzývá výzkumnou komunitu, aby se touto otázkou zabývala hlouběji.
Centrálním faktorem zdá se být, že chatbotové rámce v otázce jsou navrženy pro extrakci prominentních funkcí z datasetů mimo distribuci bez jakýchkoli zábran týkajících se toxického nebo destruktivního jazyka; pokud budete krmit rámce daty z neonacistických fór, například, pravděpodobně získáte některé kontroverzní odpovědi v následné chatovací relaci.
Avšak sektor zpracování přirozeného jazyka (NLP) má mnohem větší zájem o získání poznatků z fór a uživatelsky generovaného obsahu souvisí s duševním zdravím (deprese, úzkost, závislost atd.), a to jak pro vývoj užitečných a deeskalujících chatbotů pro zdravotní péči, tak pro získání lepších statistických odhadů z reálných dat.
Proto, co se týče velkého objemu dat, která nejsou omezena arbitrárními textovými limity Twitteru, Reddit zůstává jediným neustále aktualizovaným hyperskalárním korpusem pro plné-textové studie tohoto druhu.
Avšak i pouhý prohlédnutí některých komunit, které nejvíce zajímají výzkumníky NLP v oblasti zdravotnictví (jako je r/depression), odhaluje převahu “negativních” odpovědí, které by mohly přesvědčit statistický analytický systém, že negativní odpovědi jsou platné, protože jsou časté a statisticky dominantní – zejména v případě vysoce předplatitelných fór s omezenými moderátorskými zdroji.
Otázka proto zůstává, zda by architektura chatbotů měla obsahovat some “morální hodnotící rámec”, kde sub-cíle ovlivňují vývoj vah v modelu, nebo zda dražší kurátorská a označení dat mohou nějakým způsobem protiřečit této tendenci k nevyváženým datům.
* Studie výzkumníků, jak je uvedeno v tomto článku, chybně cituje odkaz na Googleův Meena chatbot místo odkazu na Blender paper. Googleův Meena není uveden v nové studii. Správný odkaz na Blender použitý v tomto článku byl poskytnut autory studií v e-mailu mně. Autoři mi řekli, že tato chyba bude opravena v následujícím vydání studie.
Poprvé zveřejněno 18. ledna 2022.













