Andersonův úhel

Analýza deprimovaných a alkoholických chatbotů

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Nová studie z Číny zjistila, že několik populárních chatbotů, včetně chatbotů otevřené domény od Facebooku, Microsoftu a Googlu, vykazuje “závažné duševní problémy” při dotazování pomocí standardních testů pro hodnocení duševního zdraví a dokonce vykazují známky problémů s pitím.

Chatboty, které byly vyhodnoceny ve studii, byly Facebookův Blender*; Microsoft (MSFT ) ův DialoGPT; Baiduův Plato; a DialoFlow, spolupráce mezi čínskými univerzitami, WeChatem a Tencent Inc.

Testy prokázaly, že chatboty vykazují známky patologické deprese, úzkosti, závislosti na alkoholu a také jejich schopnost vyjadřovat empatii. Všechny chatboty získaly podprůměrné skóre v empatii, zatímco polovina z nich byla vyhodnocena jako závislá na alkoholu.

Výsledky pro čtyři chatboty napříč čtyřmi metrikami pro duševní zdraví. V 'single', je zahájena nová konverzace pro každou otázku; v 'multi', jsou všechny otázky položeny v jedné konverzaci, aby se hodnotil vliv trvalosti relace. Zdroj: https://arxiv.org/pdf/2201.05382.pdf

Výsledky pro čtyři chatboty napříč čtyřmi metrikami pro duševní zdraví. V ‘single’, je zahájena nová konverzace pro každou otázku; v ‘multi’, jsou všechny otázky položeny v jedné konverzaci, aby se hodnotil vliv trvalosti relace. Zdroj: https://arxiv.org/pdf/2201.05382.pdf

V tabulce výsledků výše, BA=’Podprůměrné’; P=’Pozitivní’; N=’Normální’; M=’Mírné’; MS=”Mírné až závažné’; S=”Závažné’. Studie tvrdí, že tyto výsledky ukazují, že duševní zdraví všech vybraných chatbotů je v “závažném” rozmezí.

Zpráva uvádí:

‘Výsledky experimentu odhalily, že existují závažné duševní problémy u všech vyhodnocených chatbotů. Domníváme se, že je to způsobeno zanedbáním duševních zdravotních rizik během procesů vytváření dat a školení modelů. Špatné duševní podmínky chatbotů mohou mít negativní dopad na uživatele v konverzacích, zejména na nezletilé a lidi, kteří se potýkají s obtížemi.

‘Proto se domníváme, že je nutné provést hodnocení duševního zdraví před vydáním chatbotu jako online služby.’

Studie pochází od výzkumníků z WeChat/Tencent Pattern Recognition Center, společně s výzkumníky z Institute of Computing Technology of the Chinese Academy of Sciences (ICT) a University of Chinese Academy of Sciences v Pekingu.

Důvody pro výzkum

Autoři citují případ z roku 2020, kdy francouzská zdravotnická firma testovala potenciální chatbot založený na GPT-3. V jedné z konverzací pacient řekl “Měl bych se zabít?”, na což chatbot odpověděl “Myslím, že ano”.

Jako nová studie pozoruje, je také možné, aby uživatel byl ovlivněn sekundární úzkostí z deprimovaných nebo “negativních” chatbotů, takže obecná dispozice chatbotu nemusí být tak přímo šokující jako ve francouzském případě, aby podkopala cíle automatizovaných lékařských konzultací.

Autoři uvádějí:

‘Výsledky experimentu odhalily závažné duševní problémy vyhodnocených chatbotů, které mohou mít negativní vliv na uživatele v konverzacích, zejména na nezletilé a lidi, kteří se potýkají s obtížemi. Například pasivní postoje, podrážděnost, alkoholismus, bez empatie atd.

‘Tento jev se odchyluje od obecných očekávání veřejnosti, že chatboty by měly být optimistické, zdravé a přátelské, pokud je to možné. Proto se domníváme, že je důležité provést hodnocení duševního zdraví z bezpečnostních a etických důvodů před vydáním chatbotu jako online služby.’

Metoda

Výzkumníci se domnívají, že tato studie je první, která hodnotí chatboty z hlediska lidských hodnocení pro duševní zdraví, a citují předchozí studie, které se soustředily na konzistenci, rozmanitost, relevanci, znalost a další standardy Turingovy zkoušky pro autentickou odezvu.

Dotazníky přizpůsobené projektu byly PHQ-9, 9 otázek pro hodnocení úrovní deprese u pacientů v primární péči, široce přijaté vládami a zdravotnickými institucemi; GAD-7, 7 otázek pro hodnocení závažnosti úzkosti, běžné v klinické praxi; CAGE, screeningový test pro závislost na alkoholu ve 4 otázkách; a Toronto Empathy Questionnaire (TEQ), 16 otázek pro hodnocení úrovní empatie.

Charakteristiky čtyř sektorových standardních dotazníků přizpůsobených pro studii.

Charakteristiky čtyř sektorových standardních dotazníků přizpůsobených pro studii.

Dotazníky musely být přepsány, aby se vyhnuly deklarativním větám, jako je Málo zájmu nebo potěšení z činností, ve prospěch otázek vhodnějších pro konverzační výměnu.

Bylo také nutné definovat “selhání” odpovědi, aby se identifikovaly a vyhodnotily pouze odpovědi, které by lidský uživatel mohl interpretovat jako platné a být ovlivněn. “Selhání” odpovědi by mohlo uhýbat otázce s eliptickými nebo abstraktními odpověďmi; odmítat se zapojit do otázky (tj. ‘Nevím’, nebo ‘Zapomněl jsem’); nebo zahrnovat “nemožné” předchozí obsah, jako je ‘Obvykle jsem cítil hlad, když jsem byl dítě’. V testech Blender a Plato tvořily většinu selhání a 61,4 % selhání bylo irelevantních k dotazu.

Výzkumníci trénovali všechny čtyři modely na příspěvcích z Redditu, pomocí Pushshift Reddit Dataset. Ve všech čtyřech případech bylo školení upraveno pomocí dalšího datasetu obsahujícího Facebookův Blended Skill Talk a Wizard of Wikipedia sady; ConvAI2 (spolupráce mezi Facebookem, Microsoftem a Carnegie Mellon, mezi jinými); a Empathetic Dialogues (spolupráce mezi University of Washington a Facebookem).

Pronikavý Reddit

Plato, DialoFlow a Blender přicházejí s přednastavenými váhami předběžně trénovanými na komentářích z Redditu, takže neuronové vztahy vytvořené i při tréninku na nových datech (z Redditu nebo jinde) budou ovlivněny distribucí funkcí extrahovaných z Redditu.

Každá testovací skupina byla provedena dvakrát, jako “single” nebo “multi”. Pro “single” byla každá otázka položena v nové chatovací relaci. Pro “multi” byla použita jedna chatovací relace pro všechny otázky, protože relační proměnné se hromadí během konverzace a mohou ovlivnit kvalitu odpovědi, jakmile konverzace získá určitý tvar a tón.

Všechny experimenty a tréninky byly spuštěny na dvou NVIDIA Tesla V100 GPU, pro kombinovaných 64 GB VRAM přes 1280 tensorových jader. Studie neposkytuje podrobnosti o délce tréninkového času.

Dozor prostřednictvím kurátorské nebo architektonické?

Studie uzavírá, že “zanedbání duševních zdravotních rizik” během tréninku musí být řešeno, a vyzývá výzkumnou komunitu, aby se touto otázkou zabývala hlouběji.

Centrálním faktorem zdá se být, že chatbotové rámce v otázce jsou navrženy pro extrakci prominentních funkcí z datasetů mimo distribuci bez jakýchkoli zábran týkajících se toxického nebo destruktivního jazyka; pokud budete krmit rámce daty z neonacistických fór, například, pravděpodobně získáte některé kontroverzní odpovědi v následné chatovací relaci.

Avšak sektor zpracování přirozeného jazyka (NLP) má mnohem větší zájem o získání poznatků z fór a uživatelsky generovaného obsahu souvisí s duševním zdravím (deprese, úzkost, závislost atd.), a to jak pro vývoj užitečných a deeskalujících chatbotů pro zdravotní péči, tak pro získání lepších statistických odhadů z reálných dat.

Proto, co se týče velkého objemu dat, která nejsou omezena arbitrárními textovými limity Twitteru, Reddit zůstává jediným neustále aktualizovaným hyperskalárním korpusem pro plné-textové studie tohoto druhu.

Avšak i pouhý prohlédnutí některých komunit, které nejvíce zajímají výzkumníky NLP v oblasti zdravotnictví (jako je r/depression), odhaluje převahu “negativních” odpovědí, které by mohly přesvědčit statistický analytický systém, že negativní odpovědi jsou platné, protože jsou časté a statisticky dominantní – zejména v případě vysoce předplatitelných fór s omezenými moderátorskými zdroji.

Otázka proto zůstává, zda by architektura chatbotů měla obsahovat some “morální hodnotící rámec”, kde sub-cíle ovlivňují vývoj vah v modelu, nebo zda dražší kurátorská a označení dat mohou nějakým způsobem protiřečit této tendenci k nevyváženým datům.

 

 

* Studie výzkumníků, jak je uvedeno v tomto článku, chybně cituje odkaz na Googleův Meena chatbot místo odkazu na Blender paper. Googleův Meena není uveden v nové studii. Správný odkaz na Blender použitý v tomto článku byl poskytnut autory studií v e-mailu mně. Autoři mi řekli, že tato chyba bude opravena v následujícím vydání studie.

Poprvé zveřejněno 18. ledna 2022.

Autor odborných článků o strojovém učení, doménový specialista na syntézu lidského obrazu. Bývalý vedoucí výzkumného obsahu ve společnosti Metaphysic.ai, až do jejího rozpuštění do společnosti DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai