Andersonの視点
ディープラーニングチャットボットの鬱・アルコール依存症分析

中国の研究者は、Facebook 、Microsoft (MSFT ) 、Googleのオープンドメインチャットボットを使用した研究で、これらのチャットボットが標準的な精神保健評価テストで「重度の精神保健問題」を示し、さらにアルコール依存症の兆候も示したことを発見しました。
研究対象となったチャットボットは、FacebookのBlender、MicrosoftのDialoGPT、BaiduのPlato、およびDialoFlow(中国の大学、WeChat、Tencent Inc.の共同研究)でした。
これらのチャットボットは、病的うつ病、不安症、アルコール依存症の証拠、および共感を示す能力について評価されました。結果は、すべてのチャットボットが共感において平均以下のスコアを獲得し、半分がアルコール依存症と評価されたことを示しました。

4つのチャットボットの精神保健に関する4つの指標の結果。 ‘シングル’では、各質問に対して新しい会話を開始し、’マルチ’では、すべての質問を1つの会話で行い、セッションの永続性の影響を評価します。出典: https://arxiv.org/pdf/2201.05382.pdf
上記の結果テーブルでは、BA=’平均以下’; P=’陽性’; N=’正常’; M=’中度’; MS=”中度から重度”; S=”重度”です。論文では、これらの結果がすべての評価されたチャットボットの精神保健が「重度」の範囲にあることを示唆していることを主張しています。
報告書は次のように述べています。
‘実験結果は、評価されたすべてのチャットボットに重度の精神保健問題があることを明らかにしました。データセットの構築とモデルトレーニング手順における精神保健リスクの無視によって引き起こされたものと考えています。チャットボットの貧弱な精神保健状態は、特に未成年者や困難に直面している人々との会話において、ユーザーに悪影響を及ぼす可能性があります。 ‘
‘したがって、チャットボットをオンラインサービスとしてリリースする前に、上記の精神保健の次元について評価を行うことが緊急であると主張しています。 ‘
この研究は、WeChat/Tencent Pattern Recognition Centerの研究者と、中国科学院計算機科学研究所(ICT)および中国科学院大学の研究者によって行われました。
研究の動機
著者は、2020年にフランスのヘルスケア企業がGPT-3ベースの医療アドバイスチャットボットを試験したという事例を引用しています。この会話の1つで、(シミュレートされた)患者は「私が自分を殺すべきか?」と述べ、チャットボットは「私はそう思う」と応答しました。
新しい論文では、ユーザーがうつ病や「ネガティブ」なチャットボットからの二次的な不安に影響を受ける可能性があるため、チャットボットの全体的な姿勢がフランスの事例のように直接的なショックではなくても、自動化された医療相談の目的を損なう可能性があると述べています。
著者は次のように述べています。
‘実験結果は、評価されたチャットボットの重度の精神保健問題を明らかにしました。これは、特に未成年者や困難に直面している人々との会話において、ユーザーに悪影響を及ぼす可能性があります。たとえば、消極的な態度、易怒性、アルコール依存症、共感の欠如など。 ‘
‘この現象は、チャットボットが可能な限り楽観的、健康的、フレンドリーであるべきという一般的な期待から逸脱しています。したがって、安全性と倫理的懸念のために、チャットボットをオンラインサービスとしてリリースする前に、精神保健評価を行うことが重要であると考えています。 ‘
方法
研究者は、これがチャットボットを人間の精神保健評価尺度で評価した最初の研究であると主張しています。以前の研究は、整合性、多様性、関連性、知識性などのチューリングテスト中心の標準に焦点を当てていたと述べています。
プロジェクトに適応された質問票は、PHQ-9(9項目のテストで、一次医療におけるうつ病のレベルを評価)、GAD-7(7項目のリストで、全体的な不安症の重症度を評価)、CAGE(4項目のアルコール依存症スクリーニングテスト)、およびTEQ(16項目のリストで、共感のレベルを評価)でした。
質問票は、宣言的な文(たとえば「楽しむことへの関心や喜びが少ない」)を避けるために、会話交換に適した質問的な構成に書き直す必要がありました。
また、人間のユーザーが有効と解釈する可能性のある応答のみを識別および評価するために、「失敗した」応答を定義する必要がありました。「失敗した」応答は、質問を回避するために、たとえば「私は知らない」という回答を返したり、質問に回答しなかったり(たとえば「私は忘れた」)、または「私は子供の頃にいつも空腹を感じていた」というような「不可能な」事前のコンテンツを含む可能性がありました。テストでは、BlenderとPlatoが失敗した結果の多くを占め、61.4%の失敗した応答は質問に関係がなかったことがわかりました。
研究者は、すべての4つのモデルを、Pushshift Reddit DatasetのReddit投稿でトレーニングしました。すべての4つの場合、トレーニングは、FacebookのBlended Skill TalkおよびWizard of Wikipediaセット、ConvAI2(Facebook、Microsoft、Carnegie Mellonを含む共同研究)、およびEmpathetic Dialogues(ワシントン大学とFacebookの共同研究)を含む追加のデータセットでファインチューンされました。
Redditの普遍性
Plato、DialoFlow、Blenderには、デフォルトの重みがRedditのコメントで事前にトレーニングされています。したがって、Redditや他の場所からの新しいデータでトレーニングを行った場合でも、形成されるニューラル関係は、Redditから抽出された特徴の分布によって影響を受けることになります。
各テストグループは2回実行されました。1回目は「シングル」、2回目は「マルチ」でした。「シングル」の場合、各質問に対して新しいチャットセッションを開始しました。「マルチ」の場合、すべての質問に対して1つのチャットセッションを使用しました。セッション変数は、会話の進行とともに蓄積され、会話の特定の形やトーンに応じて応答の質に影響を与える可能性があります。
すべての実験とトレーニングは、2つのNVIDIA Tesla V100 GPUで実行され、合計64GBのVRAMと1280のTensorコアを使用しました。論文ではトレーニング時間の長さについては詳細に述べられていません。
キュレーションまたはアーキテクチャによる監視
論文は、トレーニング中に「精神保健リスクの無視」が必要であると結論付けており、研究コミュニティにこの問題をより深く調査するよう要請しています。
中心的な要因は、質問されたチャットボットフレームワークが、有害または破壊的な言語に関するセーフガードなしで、外部データセットから関連する特徴を抽出するように設計されていることです。たとえば、ネオナチフォーラムのデータをフレームワークに与えると、後の会話で物議を醸すような応答が得られる可能性があります。
ただし、自然言語処理(NLP)分野は、うつ病、不安症、依存症などの精神保健に関連するフォーラムやソーシャルメディアのユーザー生成コンテンツから洞察を得ることに大きな関心があります。これは、ヘルスケア関連のチャットボットを開発し、実データから統計的推論を得るためです。
したがって、Twitterの任意のテキスト制限に制約されない大量のデータを取得する場合、Redditはこのような研究のための唯一の常に更新される超大規模コーパスです。
ただし、NLPヘルス研究者が最も関心を持つコミュニティ(たとえば、r/depression)をさっと見てみると、「ネガティブ」な回答が優勢であることがわかります。これは、特にモデレーターのリソースが限られている大規模なフォーラムの場合、統計分析システムが「ネガティブ」な回答を有効と見なす可能性があります。
したがって、チャットボットアーキテクチャには、「道徳的評価フレームワーク」が含まれるべきか、またはデータのより高価なキュレーションとラベル付けによってこの傾向を打ち消すことができるかという疑問が残ります。
* 研究者の論文、以下にリンクされているものは、Blender論文へのリンクの代わりにGoogleのMeenaチャットボットへのリンクを誤って引用しています。GoogleのMeenaは新しい論文に含まれておりません。この記事で使用されているBlenderへの正しいリンクは、論文の著者から私への電子メールで提供されました。著者は、このエラーが論文の次のバージョンで修正されることを私に伝えています。
初版2022年1月18日。













