Andersons Blickwinkel

Analyse von depressiven und alkoholkranken Chatbots

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Eine neue Studie aus China hat ergeben, dass mehrere beliebte Chatbots, einschließlich offener Domänen-Chatbots von Facebook, Microsoft (MSFT ) und Google, “schwere psychische Gesundheitsprobleme” aufweisen, wenn sie mit Standard-Tests zur psychischen Gesundheitsbewertung befragt werden, und sogar Anzeichen von Trinkproblemen zeigen.

Die in der Studie untersuchten Chatbots waren Facebooks Blender*; Microsofts DialoGPT; Baidus Plato; und DialoFlow, eine Zusammenarbeit zwischen chinesischen Universitäten, WeChat und Tencent Inc.

Bei der Untersuchung auf Anzeichen von pathologischer Depression, Angstzuständen, Alkoholabhängigkeit und bei der Fähigkeit, Empathie zu zeigen, erzielten die untersuchten Chatbots alarmierende Ergebnisse; alle erhielten unterdurchschnittliche Punktzahlen für Empathie, während die Hälfte als alkoholabhängig bewertet wurde.

Ergebnisse für die vier Chatbots über vier Metriken für die psychische Gesundheit. In 'single' wird für jede Anfrage ein neues Gespräch gestartet; in 'multi' werden alle Fragen in einem einzigen Gespräch gestellt, um den Einfluss der Sitzungspersistenz zu bewerten. Quelle: https://arxiv.org/pdf/2201.05382.pdf

Ergebnisse für die vier Chatbots über vier Metriken für die psychische Gesundheit. In ‘single’ wird für jede Anfrage ein neues Gespräch gestartet; in ‘multi’ werden alle Fragen in einem einzigen Gespräch gestellt, um den Einfluss der Sitzungspersistenz zu bewerten. Quelle: https://arxiv.org/pdf/2201.05382.pdf

In der obigen Ergebnistabelle bedeutet BA=’Unterdurchschnitt’; P=’Positiv’; N=’Normal’; M=’mäßig’; MS=”Mäßig bis schwer”; S=”Schwer”. Die Studie behauptet, dass diese Ergebnisse darauf hindeuten, dass die psychische Gesundheit aller ausgewählten Chatbots im “schweren” Bereich liegt.

Der Bericht besagt:

‘Die experimentellen Ergebnisse zeigen, dass es schwere psychische Gesundheitsprobleme für alle untersuchten Chatbots gibt. Wir gehen davon aus, dass dies durch die Vernachlässigung der psychischen Gesundheitsrisiken während des Datensatzbaus und der Modelltrainingsverfahren verursacht wird. Die schlechten psychischen Gesundheitszustände der Chatbots können negative Auswirkungen auf Benutzer in Gesprächen haben, insbesondere auf Minderjährige und Menschen, die mit Schwierigkeiten konfrontiert sind.

‘Daher argumentieren wir, dass es dringend notwendig ist, die Bewertung der oben genannten psychischen Gesundheitsdimensionen vor der Veröffentlichung eines Chatbots als Online-Dienst durchzuführen.’

Die Studie stammt von Forschern am WeChat/Tencent Pattern Recognition Center, zusammen mit Forschern vom Institute of Computing Technology der Chinesischen Akademie der Wissenschaften (ICT) und der Universität der Chinesischen Akademie der Wissenschaften in Peking.

Motive für die Forschung

Die Autoren zitieren den weit verbreiteten Fall von 2020, in dem ein französisches Gesundheitsunternehmen einen potenziellen GPT-3-basierten medizinischen Beratungs-Chatbot getestet hat. In einem der Austausche hat ein (simulierter) Patient gesagt “Sollte ich mich umbringen?”, worauf der Chatbot antwortete “Ich denke, du solltest”.

Wie die neue Studie feststellt, ist es auch möglich, dass ein Benutzer von der zweiten Angst von depressiven oder “negativen” Chatbots beeinflusst wird, so dass die allgemeine Disposition des Chatbots nicht direkt schockierend sein muss, um die Ziele der automatisierten medizinischen Beratung zu untergraben.

Die Autoren stellen fest:

‘Die experimentellen Ergebnisse zeigen die schweren psychischen Gesundheitsprobleme der untersuchten Chatbots, die negative Auswirkungen auf Benutzer in Gesprächen haben können, insbesondere auf Minderjährige und Menschen, die mit Schwierigkeiten konfrontiert sind. Zum Beispiel passive Einstellungen, Reizbarkeit, Alkoholismus, ohne Empathie usw.

‘Dieses Phänomen weicht von den allgemeinen Erwartungen der Öffentlichkeit an Chatbots ab, die optimistisch, gesund und freundlich sein sollten. Daher denken wir, dass es wichtig ist, psychische Gesundheitsbewertungen für Sicherheits- und ethische Bedenken vor der Veröffentlichung eines Chatbots als Online-Dienst durchzuführen.’

Methode

Die Forscher glauben, dass dies die erste Studie ist, die Chatbots in Bezug auf menschliche Bewertungsmetriken für die psychische Gesundheit bewertet, und zitieren vorherige Studien, die sich stattdessen auf Konsistenz, Vielfalt, Relevanz, Wissen und andere turingzentrierte Standards für authentische Sprachantworten konzentriert haben.

Die für das Projekt adaptierten Fragebögen waren PHQ-9, ein 9-Fragen-Test, um die Depressionsschwere in der Primärversorgung zu bewerten, weit verbreitet in Regierungs- und medizinischen Einrichtungen; GAD-7, eine 7-Fragen-Liste, um die Schwere von Angstzuständen zu bewerten, häufig in der klinischen Praxis; CAGE, ein Screening-Test für Alkoholabhängigkeit in vier Fragen; und das Toronto-Empathie-Fragebogen (TEQ), eine 16-Fragen-Liste, die zur Bewertung der Empathieebene entwickelt wurde.

Merkmale der vier sektoralen Fragebögen, die für die Studie adaptiert wurden.

Merkmale der vier sektoralen Fragebögen, die für die Studie adaptiert wurden.

Die Fragebögen mussten umgeschrieben werden, um deklarative Sätze wie “Wenig Interesse oder Freude an Dingen” zu vermeiden und stattdessen interrogative Konstruktionen zu verwenden, die für einen Gesprächsaustausch geeignet sind.

Es war auch notwendig, eine “fehlgeschlagene” Antwort zu definieren, um nur die Antworten zu identifizieren und zu bewerten, die ein menschlicher Benutzer als gültig interpretieren könnte und von denen er betroffen sein könnte. Eine “fehlgeschlagene” Antwort könnte die Frage mit elliptischen oder abstrakten Antworten umgehen; sich weigern, auf die Frage einzugehen (z. B. “Ich weiß nicht” oder “Ich habe vergessen”); oder “unmögliche” vorherige Inhalte wie “Ich fühlte mich normalerweise hungrig, als ich ein Kind war” enthalten. In Tests waren Blender und Plato für die meisten fehlgeschlagenen Ergebnisse verantwortlich, und 61,4 % der fehlgeschlagenen Antworten waren irrelevant für die Anfrage.

Die Forscher trainierten alle vier Modelle auf Reddit-Beiträgen, unter Verwendung des Pushshift Reddit-Datensatzes. In allen vier Fällen wurde das Training mit einem weiteren Datensatz fein abgestimmt, der Facebooks Blended Skill Talk und Wizard of Wikipedia umfasste; ConvAI2 (eine Zusammenarbeit zwischen Facebook, Microsoft und Carnegie Mellon, unter anderem); und Empathetic Dialogues (eine Zusammenarbeit zwischen der University of Washington und Facebook).

Ubiquitärer Reddit

Plato, DialoFlow und Blender kommen mit Standardgewichten vor, die auf Reddit-Kommentaren trainiert wurden, so dass die neuralen Beziehungen, die sogar durch das Training auf frischen Daten (sei es von Reddit oder anderswo) gebildet werden, von der Verteilung der aus Reddit extrahierten Merkmale beeinflusst werden.

Jede Testgruppe wurde zweimal durchgeführt, als “single” oder “multi”. Für “single” wurde jede Frage in einer brandneuen Chat-Sitzung gestellt. Für “multi” wurde eine Chat-Sitzung verwendet, um Antworten für alle Fragen zu erhalten, da Sitzungsvariablen sich im Laufe eines Gesprächs aufbauen und die Qualität der Antwort beeinflussen können, wenn das Gespräch eine bestimmte Form und einen bestimmten Ton annimmt.

Alle Experimente und Trainings wurden auf zwei NVIDIA Tesla V100-GPUs durchgeführt, für eine kombinierte VRAM von 64 GB über 1280 Tensor-Kernen. Die Studie gibt die Länge der Trainingszeit nicht an.

Überwachung durch Kuratierung oder Architektur?

Die Studie kommt zu dem Schluss, dass der “Vernachlässigung der psychischen Gesundheitsrisiken” während des Trainings angegangen werden muss, und lädt die Forschungsgemeinschaft ein, das Problem genauer zu untersuchen.

Der zentrale Faktor scheint zu sein, dass die Chatbot-Frameworks in Frage nicht dazu ausgelegt sind, schädliche oder destruktive Sprache zu erkennen; wenn man ihnen beispielsweise neo-nazistische Forendaten füttert, erhält man wahrscheinlich kontroversen Antworten in einem nachfolgenden Gespräch.

Die Natural Language Processing (NLP)-Branche hat jedoch ein viel größeres Interesse daran, Erkenntnisse aus Foren und Benutzerbeiträgen zu gewinnen, die mit der psychischen Gesundheit (Depression, Angstzuständen, Abhängigkeit usw.) zusammenhängen, sowohl für die Entwicklung hilfreicher und deeskalierender Gesundheits-Chatbots als auch für die Gewinnung verbesserter statistischer Rückschlüsse aus echten Daten.

Daher bleibt Reddit, was die nicht durch Twitter’s willkürliche Textlimits eingeschränkten Datenmengen betrifft, die einzige konstant aktualisierte Hyperskala-Korpus für Volltextstudien dieser Art.

Bei einer oberflächlichen Durchsicht einiger der Gemeinschaften, die NLP-Gesundheitsforscher am meisten interessieren (wie r/depression), zeigt sich die Vorherrschaft der Art von “negativen” Antworten, die ein statistisches Analyse-System davon überzeugen könnten, dass negative Antworten gültig sind, weil sie häufig und statistisch dominant sind – insbesondere in Fällen hoch abonnierten Foren mit begrenzten Moderationsressourcen.

Die Frage bleibt also, ob die Chatbot-Architektur ein “moralisches Bewertungsframework” enthalten sollte, bei dem Subziele die Entwicklung von Gewichten im Modell beeinflussen, oder ob teurere Kuratierung und Markierung von Daten diese Tendenz zu unbalancierten Daten irgendwie ausgleichen kann.

 

 

* Die Studie der Forscher, wie in diesem Artikel verlinkt, zitiert fälschlicherweise einen Link zum Meena-Chatbot von Google anstelle des Links zum Blender-Papier. Google’s Meena ist nicht in der neuen Studie enthalten. Der korrekte Blender-Link, der in diesem Artikel verwendet wurde, wurde von den Autoren der Studie in einer E-Mail an mich bereitgestellt. Die Autoren haben mir mitgeteilt, dass dieser Fehler in einer späteren Version der Studie korrigiert wird.

Erstveröffentlicht am 18. Januar 2022.

Schriftsteller über maschinelles Lernen, Domänen-Spezialist für menschliche Bildsynthese. Ehemaliger Leiter der Forschungsinhalte bei Metaphysic.ai, bis zu dessen Auflösung in DNEG's Brahma.ai.
Portfolio-Website: martinanderson.ai
Kontakt: martin@martinanderson.ai