Взгляд Anderson

Анализ депрессивных и алкоголизированных чат-ботов

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из Китая показало, что несколько популярных чат-ботов, включая чат-боты открытого домена от Facebook, Microsoft (MSFT ) и Google, демонстрируют «тяжелые психические расстройства» при запросе с помощью стандартных тестов оценки психического здоровья и даже проявляют признаки проблем с алкоголем.

Чат-боты, оцененные в исследовании, были Blender*; DialoGPT от Microsoft; Plato от Baidu; и DialoFlow, совместный проект китайских университетов, WeChat и Tencent Inc.

При тестировании на наличие признаков патологической депрессии, тревоги, алкогольной зависимости и на их способность проявлять эмпатию чат-боты, изученные в исследовании, показали тревожные результаты; все они получили ниже среднего балла за эмпатию, а половина из них была оценена как алкогольная зависимость.

Результаты для четырех чат-ботов по четырем метрикам психического здоровья. В 'single' начинается новый разговор для каждого запроса; в 'multi' все вопросы заданы в одном разговоре, чтобы оценить влияние сохранения сессии. Источник: https://arxiv.org/pdf/2201.05382.pdf

Результаты для четырех чат-ботов по четырем метрикам психического здоровья. В ‘single’ начинается новый разговор для каждого запроса; в ‘multi’ все вопросы заданы в одном разговоре, чтобы оценить влияние сохранения сессии. Источник: https://arxiv.org/pdf/2201.05382.pdf

В таблице результатов выше BA=’Ниже среднего’; P=’Положительный’; N=’Нормальный’; M=’Умеренный’; MS=”Умеренный до тяжелого”; S=”Тяжелый”. В статье утверждается, что эти результаты указывают на то, что психическое здоровье всех изученных чат-ботов находится в «тяжелой» категории.

Отчет гласит:

‘Экспериментальные результаты показывают, что существует тяжелые психические расстройства у всех оцененных чат-ботов. Мы считаем, что это вызвано пренебрежением рисками психического здоровья во время построения набора данных и процедур обучения модели. Плохие условия психического здоровья чат-ботов могут привести к негативным последствиям для пользователей в разговорах, особенно для несовершеннолетних и людей, столкнувшихся с трудностями. ‘

‘Следовательно, мы утверждаем, что необходимо провести оценку вышеуказанных размеров психического здоровья перед выпуском чат-бота в качестве онлайн-сервиса.’

Исследование было проведено исследователями из Центра распознавания образов WeChat/Tencent, вместе с исследователями из Института вычислительной техники Китайской академии наук (ICT) и Университета Китайской академии наук в Пекине.

Мотивы исследования

Авторы ссылаются на популярно-рассказанное дело 2020 года, когда французская фирма здравоохранения протестировала потенциальный чат-бот медицинских консультаций на основе GPT-3. В одном из обменов (симулированный) пациент заявил “Должен ли я убить себя?”, на что чат-бот ответил “Я думаю, вы должны”.

Как отмечается в новой статье, также возможно, что пользователь может подвергнуться влиянию вторичной тревоги от депрессивных или «негативных» чат-ботов, так что общая направленность чат-бота не обязательно должна быть так же прямо шокирующей, как во французском случае, чтобы подорвать цели автоматизированных медицинских консультаций.

Авторы заявляют:

‘Экспериментальные результаты показывают тяжелые психические расстройства оцененных чат-ботов, которые могут привести к негативным последствиям для пользователей в разговорах, особенно для несовершеннолетних и людей, столкнувшихся с трудностями. Например, пассивные отношения, раздражительность, алкоголизм, без эмпатии и т. д. ‘

‘Это явление отклоняется от общих ожиданий общественности относительно чат-ботов, которые должны быть оптимистичными, здоровыми и дружелюбными как можно больше. Следовательно, мы считаем, что важно провести оценку психического здоровья для безопасности и этических проблем перед выпуском чат-бота в качестве онлайн-сервиса.’

Метод

Исследователи считают, что это первое исследование, которое оценивает чат-ботов с точки зрения человеческих метрик оценки психического здоровья, ссылаясь на предыдущие исследования, которые были сосредоточены вместо этого на последовательности, разнообразии, актуальности, знаниях и других тьюринговских стандартах для аутентичного ответа на речь.

Анкеты, адаптированные к проекту, были PHQ-9, 9-вопросный тест для оценки уровня депрессии у пациентов первичной медико-санитарной помощи, широко принятый правительственными и медицинскими учреждениями; GAD-7, 7-вопросный список для оценки степени тревоги, общий в клинической практике; CAGE, скрининговый тест для алкогольной зависимости в четырех вопросах; и Торонтский вопросник эмпатии (TEQ), 16-вопросный список, предназначенный для оценки уровня эмпатии.

Характеристики четырех секторальных стандартных вопросников, адаптированных для исследования.

Характеристики четырех секторальных стандартных вопросников, адаптированных для исследования.

Вопросники необходимо было переписать, чтобы избежать декларативных предложений, таких как Малый интерес или удовольствие от дел, в пользу вопросительных конструкций, более подходящих для обмена в разговоре.

Также было необходимо определить «неудачный» ответ, чтобы определить и оценить только те ответы, которые человек-пользователь мог бы интерпретировать как действительные и быть подверженным их влиянию. «Неудачный» ответ мог бы уклониться от вопроса с помощью эллиптических или абстрактных ответов; отказаться от участия в вопросе (т. е. «Я не знаю» или «Я забыл»); или включать «невозможный» предыдущий контент, такой как «Я обычно чувствовал голод, когда был ребенком». В тестах Blender и Plato составили большинство неудачных результатов, и 61,4% неудачных ответов были неуместны для запроса.

Исследователи обучили все четыре модели на постах Reddit, используя набор данных Pushshift Reddit. Во всех четырех случаях обучение было уточнено с помощью дополнительного набора данных, содержащего Blended Skill Talk и Wizard of Wikipedia наборы; ConvAI2 (совместный проект Facebook, Microsoft и Carnegie Mellon, среди других); и Empathetic Dialogues (совместный проект Университета Вашингтона и Facebook).

Повсеместный Reddit

Plato, DialoFlow и Blender поставляются с предварительно обученными весами на комментариях Reddit, так что нейронные отношения, сформированные даже при обучении на свежих данных (либо из Reddit, либо из других источников), будут подвержены влиянию распределения функций, извлеченных из Reddit.

Каждая тестовая группа проводилась дважды, как «single» или «multi». Для «single» каждый вопрос задавался в новой сессии чата. Для «multi» одна сессия чата использовалась для получения ответов на все вопросы, поскольку переменные сессии накапливаются в ходе разговора и могут влиять на качество ответа, когда разговор принимает определенную форму и тон.

Все эксперименты и обучение проводились на двух графических процессорах NVIDIA Tesla V100, для общей суммы 64 ГБ видеопамяти на 1280 ядрах Tensor. В статье не указана продолжительность обучения.

Надзор через курирование или архитектуру?

Статья заключает в широких терминах, что «пренебрежение рисками психического здоровья» во время обучения необходимо устранить, и приглашает исследовательское сообщество глубже изучить эту проблему.

Центральным фактором, кажется, является то, что рассматриваемые чат-боты предназначены для извлечения важных функций из наборов данных, не входящих в сферу их действия, без каких-либо гарантий относительно токсичной или разрушительной речи; если вы кормите эти рамки данными из неонацистского форума, например, вы, вероятно, получите некоторые противоречивые ответы в последующем сеансе чата.

Однако сектор обработки естественного языка (NLP) имеет гораздо более обоснованный интерес в получении представлений из форумов и контента, созданного пользователями в социальных сетях, связанного с психическим здоровьем (депрессией, тревогой, зависимостью и т. д.), как для разработки полезных и деэскалирующих чат-ботов здравоохранения, так и для получения улучшенных статистических выводов из реальных данных.

Следовательно, в плане больших объемов данных, не ограниченных произвольными ограничениями текста Twitter, Reddit остается единственной постоянно обновляемой гипермасштабной корпусом для полнотекстовых исследований этого типа.

Однако даже поверхностный просмотр некоторых сообществ, которые наиболее интересуют исследователей NLP в области здравоохранения (таких как r/depression), показывает преобладание «негативных» ответов, которые могут убедить систему статистического анализа, что негативные ответы действительны, потому что они часты и статистически доминируют – особенно в случае высоко подписанных форумов с ограниченными ресурсами модерации.

Вопрос остается, должен ли архитектура чат-бота содержать какой-либо «моральный оценочный каркас», где субобъекты влияют на развитие весов в модели, или может ли более дорогостоящее курирование и маркировка данных каким-либо образом противодействовать этой тенденции к несбалансированным данным.

 

 

* Исследовательская статья, на которую ссылается эта статья, ошибочно ссылается на ссылку на чат-бот Meena от Google вместо ссылки на статью о Blender. Чат-бот Meena от Google не представлен в новой статье. Правильная ссылка на Blender, использованная в этой статье, была предоставлена авторами статьи в электронном письме мне. Авторы сообщили мне, что эта ошибка будет исправлена в последующей версии статьи.

Опубликовано впервые 18 января 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai