Anderson의 관점
우울증과 알코올 중독 챗봇 분석

중국에서 수행된 새로운 연구에 따르면 페이스북, 마이크로소프트, 구글의 오픈 도메인 챗봇을 포함한 여러 인기 챗봇이 표준적인 정신 건강 평가 테스트를 사용하여 질의하면 ‘심각한 정신 건강 문제’를 나타내며, 심지어 음주 문제의 징후도 나타낸다고 합니다.
(MSFT )연구에서 평가된 챗봇은 페이스북의 Blender*; 마이크로소프트의 DialoGPT; 바이두의 Plato; 그리고 DialoFlow, 중국 대학, WeChat, 텐센트 사와의 협력입니다.
병리학적 우울증, 불안, 알코올 중독의 증거와 공감 능력을 평가하기 위해 테스트된 챗봇은 놀라운 결과를 생산했습니다. 모두 공감 능력에서 평균以下 점수를 받았으며, 절반은 알코올 중독으로 평가되었습니다.

네 개의 챗봇에 대한 정신 건강 평가 결과. ‘single’에서는 각 질문마다 새로운 대화 세션이 시작되며, ‘multi’에서는 모든 질문이 하나의 대화 세션에서 묻는 방식으로 세션 지속성의 영향을 평가합니다. 출처: https://arxiv.org/pdf/2201.05382.pdf
위의 결과 표에서, BA=’평균以下’; P=’양성’; N=’정상’; M=’중간’; MS=”중간에서 심각한”; S=”심각한”입니다. 이 논문은 이러한 결과가 평가된 모든 챗봇의 정신 건강이 ‘심각한’ 범위에 있음을 나타낸다고 주장합니다.
보고서는 다음과 같이 말합니다:
‘실험 결과, 평가된 모든 챗봇에서 심각한 정신 건강 문제가 있음을 보여주었습니다. 우리는 데이터셋 구축과 모델 훈련 과정에서 정신 건강 위험을 무시한 것이 원인이라고 생각합니다. 챗봇의 나쁜 정신 건강 상태는 특히 어려움에 직면한 사람이나 소아에게 대화에서 부정적인 영향을 미칠 수 있습니다. ‘
‘따라서 우리는 챗봇을 온라인 서비스로 출시하기 전에 정신 건강 평가를 수행하는 것이 긴급하다고 주장합니다.’
이 연구는 웨이차트/텐센트 패턴 인식 센터의 연구자와 중국 과학 아카데미(ICT)와 베이징의 중국 과학 아카데미 대학교의 연구자들이 함께 수행했습니다.
연구 동기
저자들은 2020년에 프랑스의 한 의료 회사에서 GPT-3 기반 의료 상담 챗봇을 테스트한 경우를 인용합니다. 한 시뮬레이션된 환자가 “나는 자살해야 할까?”라고 말했을 때, 챗봇은 “나는 네가 자살해야 한다고 생각한다”라고 대답했습니다.
새로운 논문은 또한 사용자가 우울증이나 ‘부정적인’ 챗봇의 두 번째 불안을 받을 수 있으며, 챗봇의 일반적인 태도가 프랑스의 경우와 같이 직접적으로 충격적일 필요는 없지만 자동화된 의료 상담의 목표를 저해할 수 있다고 관찰합니다.
저자들은 다음과 같이 말합니다:
‘실험 결과, 평가된 모든 챗봇에서 심각한 정신 건강 문제가 있음을 보여주었습니다. 이는 특히 어려움에 직면한 사람이나 소아에게 대화에서 부정적인 영향을 미칠 수 있습니다. 예를 들어, 수동적인 태도,易怒성, 알코올 중독, 공감 능력 없음 등이 있습니다. ‘
‘이 현상은 일반 대중이 기대하는 챗봇의 최적의 상태, 즉 최대한 건강하고 친절한 상태와 다릅니다. 따라서 우리는 안전과 윤리적인 문제로 인해 챗봇을 온라인 서비스로 출시하기 전에 정신 건강 평가를 수행하는 것이 중요하다고 생각합니다.’
방법
연구자들은 이것이 챗봇을 인간의 정신 건강 평가 기준으로 평가하는 최초의 연구라고 믿으며, 이전 연구는 일관성, 다양성, 관련성, 지식성 및 튜링 중심의 진정한 대화 응답 기준에 중점을 두었다고 주장합니다.
이 프로젝트에 적응된 설문지는 PHQ-9로, 1차 진료 환자의 우울증 수준을 평가하는 9개 질문 테스트입니다. 이는 정부와 의료 기관에서 널리 채택되고 있습니다. 일반적으로 임상 환경에서 사용되는 GAD-7은 일반화된 불안의 심각도를 평가하는 7개 질문 목록입니다. 일반적으로 임상 환경에서 사용됩니다. CAGE는 알코올 중독을 평가하는 4개 질문 테스트입니다. 토론토 공감 질문지(TEQ)는 16개 질문으로 구성된 목록으로 공감 능력을 평가하기 위해 설계되었습니다.
질문지는 대화 교환에 더 적합한 질문 형식으로 다시 작성되어야 했습니다. 즉, “무언가를 하는 데 관심이나 즐거움이 없다”와 같은 선언문 문장을 피해야 했습니다.
또한 ‘실패한’ 응답을 정의해야 했습니다. 즉, 인간 사용자가 유효한 것으로 간주하고 영향을 받을 수 있는 응답만을 식별하고 평가해야 했습니다. ‘실패한’ 응답은 질문을 피하거나 추상적인 답변을 줄 수 있습니다. 예를 들어, “나는 모른다” 또는 “나는 잊었다”와 같은 답변을 줄 수 있습니다. 또는 “나는 어렸을 때 항상 배가 고파했다”와 같은 이전에 불가능한 내용을 포함할 수 있습니다. 테스트에서 Blender와 Plato는 실패한 결과의 대부분을 차지했으며, 61.4%의 실패한 응답은 질문과 관련이 없었습니다.
연구자들은 네 개의 모델을 모두 Reddit 게시글로 훈련시켰습니다. 훈련은 Pushshift Reddit Dataset을 사용하여 세부적으로 조정되었습니다. 네 가지 경우 모두 훈련은 페이스북의 Blended Skill Talk와 Wizard of Wikipedia 세트; ConvAI2(페이스북, 마이크로소프트, 카네기 멜런 대학 등이 협력); 그리고 Empathetic Dialogues(워싱턴 대학교와 페이스북이 협력)를 포함하는 추가 데이터셋으로 세부적으로 조정되었습니다.
퍼져있는 Reddit
Plato, DialoFlow, Blender는 기본적으로 Reddit 댓글로 사전 훈련된 가중치를 가지고 있으므로, Reddit 또는 다른 데이터에서 훈련을 받은 신경망 관계는 Reddit에서 추출된 특징의 분포에 의해 영향을 받습니다.
각 테스트 그룹은 두 번씩 수행되었습니다. ‘single’에서는 각 질문마다 새로운 채팅 세션이 시작되었습니다. ‘multi’에서는 하나의 채팅 세션에서 모든 질문에 대한 답변을 받았습니다. 채팅 세션에서 세션 변수가 축적되며, 채팅의 특정 형태와 음调에 영향을 받을 수 있습니다.
모든 실험과 훈련은 64GB의 VRAM과 1280개의 텐서 코어를 갖춘 두 개의 NVIDIA Tesla V100 GPU에서 수행되었습니다. 이 논문은 훈련 시간의 길이를 자세히 설명하지 않습니다.
감독을 통한 감독 또는 아키텍처?
이 논문은 결론적으로 훈련 중에 정신 건강 위험을 무시한 것이 해결되어야 한다고 주장하며, 연구 커뮤니티에 이 문제를 더 깊이 조사할 것을 요청합니다.
중심적인 요인은 이러한 챗봇 프레임워크가 유독성 또는 파괴적인 언어에 대한 어떠한 안전 장치도 없이 분산된 데이터셋에서 관련 특징을 추출하도록 설계되었다는 것입니다. 예를 들어, 네오 나치 포럼 데이터를 프레임워크에 공급한다면, 이후의 채팅 세션에서 논란의 여지가 있는 답변을 받을 수 있습니다.
그러나 자연어 처리(NLP) 분야는 정신 건강(우울증, 불안, 의존성 등)에 관련된 포럼 및 소셜 미디어 사용자 기여 콘텐츠에서 통찰력을 얻는 데 더 큰 관심이 있습니다. 이는 도움이 되고 긴장된 건강 관련 챗봇을 개발하고 실제 데이터에서 개선된 통계적 추론을 얻는 데 모두 중요합니다.
따라서 높은 볼륨의 데이터가 트위터의 임의의 텍스트 제한에 의해 제한되지 않는 경우, Reddit는 이러한 연구를 위한 유일한 상시 업데이트되는 초대형 корпус입니다.
그러나 NLP 건강 연구자들이 관심을 가지는 일부 커뮤니티(예: r/depression)를 살펴보면, 부정적인 답변의 우세가 두드러집니다. 이러한 답변은 통계적 분석 시스템에 부정적인 답변을 유효한 것으로 간주하도록 할 수 있으며, 특히 높은 구독자 수와 제한된 관리자 리소스가 있는 포럼에서 더욱 그렇습니다.
따라서 챗봇 아키텍처에 도덕적 평가 프레임워크가 포함되어야 하는지, 또는 데이터의 더 비싼 큐레이션과 레이블링이 이러한 경향을 반대할 수 있는지에 대한 질문이 남습니다.
* 연구자의 논문, 이 기사에 링크된 것, 실수로 구글의 Meena 챗봇 링크를 블렌더 논문 링크로 인용합니다. 구글의 Meena는 새로운 논문에 포함되지 않습니다. 이 기사에서 사용된 올바른 블렌더 링크는 논문 저자들이 이메일로 제공했습니다. 저자들은 이 오류가 이후 버전의 논문에서 수정될 것이라고 말했습니다.
最初에 2022년 1월 18일에 게시되었습니다.













