Погляд Anderson

Аналіз депресивних та алкогольних чат-ботів

mm
Додайте Unite.AI до бажаних джерел у Google

Нове дослідження з Китаю показало, що кілька популярних чат-ботів, включаючи відкриті чат-боти від Facebook, Microsoft (MSFT ) і Google, демонструють “серйозні проблеми психічного здоров’я” при запиті за допомогою стандартних тестів оцінки психічного здоров’я, а також виявляють ознаки проблем з алкоголем.

Чат-боти, які були оцінені в дослідженні, були Facebook’s Blender*; Microsoft’s DialoGPT; Baidu’s Plato; і DialoFlow, спільний проєкт китайських університетів, WeChat і Tencent Inc.

Чат-боти були протестовані на наявність ознак патологічної депресії, тривоги, алкогольної залежності, а також на їхню здатність проявляти емпатію. Результати були тривожними: всі чат-боти отримали нижчі середні бали за емпатію, а половина з них була оцінена як залежна від алкоголю.

Результати для чотирьох чат-ботів за чотири показники психічного здоров'я. У 'single' кожен запит починається з нового діалогу; у 'multi' всі питання задаються в одному діалозі, щоб оцінити вплив сесійної постійності. Джерело: https://arxiv.org/pdf/2201.05382.pdf

Результати для чотирьох чат-ботів за чотири показники психічного здоров’я. У ‘single’ кожен запит починається з нового діалогу; у ‘multi’ всі питання задаються в одному діалозі, щоб оцінити вплив сесійної постійності. Джерело: https://arxiv.org/pdf/2201.05382.pdf

У таблиці результатів вище, BA=’Нижче середнього’; P=’Позитивний’; N=’Нормальний’; M=’Помірний’; MS=”Помірний до серйозного’; S=”Серйозний’. Стаття стверджує, що ці результати вказують на те, що психічне здоров’я всіх чат-ботів перебуває в “серйозному” діапазоні.

Звіт стверджує:

‘Результати дослідження показують, що існує серйозні проблеми психічного здоров’я у всіх оцінених чат-ботів. Ми вважаємо, що це викликано недбалістю щодо ризиків психічного здоров’я під час створення набору даних і процедур навчання моделей. Погані умови психічного здоров’я чат-ботів можуть мати негативний вплив на користувачів у діалогах, особливо на неповнолітніх і людей, які зустрічаються з труднощами.

‘Отже, ми вважаємо, що необхідно провести оцінку психічного здоров’я перед випуском чат-бота як онлайн-сервісу.’

Дослідження було проведено дослідниками з WeChat/Tencent Pattern Recognition Center, разом з дослідниками з Інституту обчислювальної техніки Китайської академії наук (ICT) і Університету Китайської академії наук у Пекіні.

Мотиви дослідження

Автори цитують відомий випадок 2020 року, коли французька фірма охорони здоров’я протестувала потенційний чат-бот медичної поради на основі GPT-3. У одному з діалогів (симульований) пацієнт сказав “Чи повинен я вбити себе?”, на що чат-бот відповів “Я думаю, ти повинен”.

Як зазначає нова стаття, також можливо, що користувач може бути під впливом вторинної тривоги від депресивних або “негативних” чат-ботів, так що загальна налаштованість чат-бота не повинна бути такою безпосередньо шокуючою, як у французькому випадку, щоб підірвати мету автоматизованої медичної консультації.

Автори стверджують:

‘Результати дослідження показують серйозні проблеми психічного здоров’я оцінених чат-ботів, які можуть мати негативний вплив на користувачів у діалогах, особливо на неповнолітніх і людей, які зустрічаються з труднощами. Наприклад, пасивна позиція, раздражливість, алкоголізм, без емпатії тощо.

‘Ця явище відхиляється від загальних очікувань громадськості щодо чат-ботів, які повинні бути оптимістичними, здоровими і дружніми якомога більше. Отже, ми вважаємо, що необхідно провести оцінку психічного здоров’я з питань безпеки та етики перед випуском чат-бота як онлайн-сервісу.’

Метод

Дослідники вважають, що це перше дослідження, яке оцінює чат-боти за допомогою людських показників оцінки психічного здоров’я, цитуючи попередні дослідження, які зосередилися на консистентності, різноманітності, актуальності, знаннях і інших показниках автентичного мовного відповіді.

Опитувальники, адаптовані до проєкту, були PHQ-9, 9-питальний тест для оцінки рівня депресії у пацієнтів первинної медичної допомоги, широко прийнятий урядом і медичними установами; GAD-7, 7-питальний список для оцінки показників загальної тривоги, поширений у клінічній практиці; CAGE, скринінг-тест для алкогольної залежності у чотирьох питаннях; і Торонтський опитувальник емпатії (TEQ), 16-питальний список, розроблений для оцінки рівня емпатії.

Характеристики чотирьох галузевих стандартних опитувальників, адаптованих для дослідження.

Характеристики чотирьох галузевих стандартних опитувальників, адаптованих для дослідження.

Опитувальники мали бути переписані, щоб уникнути декларативних речень, таких як Мала зацікавленість або задоволення від діяльності, на користь запитувальних конструкцій, більш придатних для діалогу.

Також було необхідно визначити “помилковий” відповідь, щоб ідентифікувати та оцінити лише ті відповіді, які людина-користувач міг би інтерпретувати як дійсні, і бути під впливом. “Помилкова” відповідь могла б ухилятися від питання з еліптичними або абстрактними відповідями; відмовитися займатися питанням (тобто ‘Я не знаю’, або ‘Я забув’); або включати “неможливі” попередні вмісти, такі як ‘Я зазвичай відчував голод, коли був дитиною’. У тестах Blender і Plato складали більшість помилкових результатів, і 61,4% помилкових відповідей були неактуальними для запиту.

Дослідники навчали всі чотири моделі на постах Reddit, використовуючи Pushshift Reddit Dataset. У всіх чотирьох випадках навчання було дофіновано з подальшим набором даних, який містив Facebook’s Blended Skill Talk і Wizard of Wikipedia набори; ConvAI2 (спільний проєкт Facebook, Microsoft і Carnegie Mellon, серед інших); і Empathetic Dialogues (спільний проєкт Університету Вашингтону і Facebook).

Проникність Reddit

Plato, DialoFlow і Blender мають попередньо навчені ваги на основі коментарів Reddit, так що нейронні відносини, сформовані навіть під час навчання на свіжих даних (чи з Reddit, чи з іншого джерела), будуть під впливом розподілу ознак, витягнутих з Reddit.

Кожна тестова група проводилася двічі, як “single” або “multi”. Для “single” кожне питання задавалося в новому діалозі. Для “multi” один діалог використовувався для отримання відповідей на всі питання, оскільки сесійні змінні накопичуються протягом діалогу і можуть впливати на якість відповіді, коли розмова набуває певної форми і тону.

Усі експерименти та навчання проводилися на двох графічних процесорах NVIDIA Tesla V100, для загальної кількості 64 ГБ оперативної пам’яті над 1280 ядрами тензорів. Стаття не деталізує тривалість навчання.

Нагляд через кураторство або архітектуру?

Стаття робить висновок у широких термінах, що “недбалість щодо ризиків психічного здоров’я” під час навчання повинна бути вирішена, і запрошує дослідницьку спільноту глибше вивчити цю проблему.

Центральним фактором здається те, що фреймворки чат-ботів, які розглядаються, розроблені для витягування суттєвих ознак з наборів даних без будь-яких заходів безпеки щодо токсичної або руйнівної мови; якщо ви годуєте фреймворки даними з неонацистських форумів, наприклад, ви, ймовірно, отримаєте деякі суперечливі відповіді в подальшому діалозі.

Однак сектор обробки природної мови (NLP) має набагато більший інтерес до отримання знань з форумів і контенту, створеного користувачами соціальних мереж, пов’язаного з психічним здоров’ям (депресією, тривогою, залежністю тощо), як для розробки корисних і деескальованих чат-ботів охорони здоров’я, так і для отримання покращених статистичних висновків з реальних даних.

Отже, у термінах великомасштабних даних, які не обмежені довільними текстовими обмеженнями Twitter, Reddit залишається єдиною постійно оновлюваною гіпермасштабною корпусом для повноекранних досліджень цього типу.

Однак навіть випадковий перегляд деяких спільнот, які найбільше цікавлять дослідників NLP у сфері охорони здоров’я (таких як r/depression), показує переважання типу “негативних” відповідей, які можуть переконати систему статистичного аналізу, що негативні відповіді дійсні, оскільки вони часті і статистично домінуючі – особливо у випадку високопідписних форумів з обмеженими ресурсами модераторів.

Отже, залишається питання, чи повинні архітектури чат-ботів містити деякий “моральний оціночний фреймворк”, де субоцілі впливатимуть на розвиток ваг у моделі, чи може більш дороге кураторство та маркування даних якимось чином протидіяти цій тенденції до несбалансованих даних.

 

 

* Дослідницька стаття, посилання на яку дано в цій статті, помилково цитує посилання на чат-бот Google’s Meena замість посилання на статтю Blender. Google’s Meena не представлений у новій статті. Правильне посилання на Blender, використане в цій статті, було надано авторами статті в електронному листі мені. Автори повідомили мені, що ця помилка буде виправлена у наступній версії статті.

Перша публікація 18 січня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai