Взгляд Anderson
Понимание эмоций Twitch в анализе настроений

Растущее использование публики эмодзи, эмоций, эмоций, мемов, GIF-изображений и других невербальных способов общения на социальных медиа-платформах в последние годы все больше озадачивает усилия ученых по данным, чтобы понять глобальную социологическую картину; по крайней мере, в той степени, в которой мировые социологические тенденции можно определить из публичного дискурса.
Хотя обработка естественного языка (NLP) стала мощным инструментом в анализе настроений за последнее десятилетие, сектор имеет трудности не только в поддержании постоянно эволюционирующего лексикона сленга и лингвистических сокращений на нескольких языках, но также в попытках расшифровать значение изображений на социальных медиа-платформах, таких как Facebook и Twitter.
Поскольку ограниченное количество очень популярных социальных медиа-платформ являются единственным真正м гипермасштабным ресурсом для этого вида исследований, важно для сектора ИИ хотя бы попытаться поддерживать темп с ним.
В июле исследователи из Тайваня предложили новый метод для категоризации настроений пользователей на основе ‘реакций GIF’ в социальных медиа-threads (см. изображение ниже), используя базу данных из 30 000 твитов для разработки способа предсказать реакции на пост. Исследователи обнаружили, что изображения-ответы во многих отношениях легче оценить, поскольку они менее вероятно содержат сарказм, заметную проблему в анализе настроений.

Исследователи из Тайваня изучали использование анимированных реакций GIF в качестве ‘редуктивных индикаторов’ настроений в статье 2021 года.
Ранее в этом году исследователи из Бостонского университета обучили модели машинного обучения для предсказания изображений-мемов, которые, вероятно, станут вирусными в Twitter; и в августе британские исследователи изучили рост эмодзи по сравнению с эмоциями (есть разница) на социальных медиа-платформах, составив большой набор данных из 7 языков для анализа настроений Twitter.
Эмоции Twitch
Теперь исследователи из США разработали методологию машинного обучения для лучшего понимания, категоризации и измерения постоянно эволюционирующего псевдо-лексикона эмоций на популярной сети Twitch.
Эмоции – это неологизмы, используемые на Twitch для выражения эмоций, настроений или внутренних шуток. Поскольку они по определению являются новыми выражениями, задача для системы машинного обучения заключается не только в том, чтобы постоянно каталогизировать новые эмоции (которые могут быть использованы только один раз или быстро выйти из употребления), но и в том, чтобы получить лучшее понимание рамок, которые постоянно генерируют их; и разработать системы, способные распознавать эмоцию как ‘временно действительное’ слово или составную фразу, эмоциональная/политическая температура которой может потребоваться для оценки полностью из контекста.

Соседи эмоции ‘FeelsGoodMan’, значение которой может быть изменено неясными суффиксами. Источник: https://arxiv.org/pdf/2108.08411.pdf
Статья называется FeelsGoodMan: вывод семантики неологизмов Twitch и исходит от трех исследователей из Spiketrap, компании анализа социальных медиа в Сан-Франциско.
Приманка и переключение
Несмотря на свою новизну и часто короткую жизнь, эмоции Twitch часто перерабатывают культурный материал (включая старые эмоции) таким образом, что может направить рамки анализа настроений в неправильном направлении. Отслеживание сдвига значения эмоции, когда она эволюционирует, может даже показать полную инверсию или отрицание ее первоначального настроения или намерения.
Например, исследователи отмечают, что первоначальное правое неправильное использование эпонимического мема FeelsGoodMan почти полностью потеряло свое первоначальное политическое значение в контексте его использования на Twitch.
Использование фразы, вместе с изображением мультяшного лягушки из комикса 2005 года художника Мэтта Фьюри, стало правым мемом в 2010-х годах. Хотя Vox написал в 2017 году, что присвоение мема правыми выжило после того, как Фьюри отрекся от такого использования, исследователи из Сан-Франциско обнаружили иное*:
‘Мультяшная лягушка Фьюри была принята правыми постерами на различных онлайн-форумах, таких как 4chan, в начале 2010-х годов. С тех пор Фьюри проводил кампанию по возвращению значения своей персонажа, и эмоция увидела рост более мейнстримового неполитического использования и положительного использования на Twitch. Наши результаты на Twitch согласны, показывая, что “FeelsGoodMan” и его аналог “FeelsBadMan” в основном используются буквально.’
Трудности вниз по течению
Такой ‘приманка и переключение’ в отношении обобщенных ‘функций’ мема может препятствовать проектам исследования NLP, которые уже категоризировали его как ‘ненавистный’, ‘правый’ или ‘националистический [США]’, и которые сбросили эту информацию в долгосрочные открытые репозитории. Поздние проекты NLP могут не выбрать аудит старых данных; могут не иметь практического механизма для этого; и могут даже не быть осведомлены о необходимости.
В результате использования наборов данных Twitch 2017 года для формирования ‘алгоритма политической категоризации’ можно было бы сделать вывод, что на Twitch есть заметная правая активность, основанная на частоте эмоции FeelsGoodMan. Twitch может или не может быть полон правых влиятельных лиц, но, согласно исследователям новой статьи, это нельзя доказать лягушкой.
Политическое значение мема ‘Pepe’ кажется случайно выброшенным 140 миллионами пользователей Twitch (41% из которых моложе 24 лет), которые фактически переработали работу от оригинальных воров и раскрасили ее в свои собственные цвета, без какой-либо конкретной программы.
Метод и данные
Исследователи обнаружили, что помеченные данные эмоций Twitch ‘практически не существуют’, несмотря на вывод предыдущего исследования, что существует восемь миллионов общих эмоций, и 400 000 были присутствуют в одной неделе выхода Twitch в выбранной неделе этих исследователей.
Исследование 2017 года, посвященное прогнозированию эмоций на Twitch, ограничилось прогнозированием только верхних 30 эмоций Twitch, набрав всего 0,39 для прогнозирования эмоций.
Для решения этой проблемы исследователи из Сан-Франциско выбрали новый подход к старым данным, разделив их на 80/20 между обучением и тестированием, и применив ‘традиционные’ методы машинного обучения, которые не были использованы ранее для изучения данных Twitch. Эти методы включали Наивный Байес (NB), Случайный лес (RF), Машина опорных векторов (SVM, с линейными ядрами), и Логистическая регрессия.
Этот подход превзошел предыдущие базовые линии анализа настроений Twitch на 63,8%, и позволил исследователям впоследствии разработать рамку LOOVE (Learning Out Of Vocabulary Emotions), которая может выявить неологизмы и ‘обогатить’ существующие модели новыми определениями.

Архитектура рамки LOOVE (Learning Out Of Vocabulary Emotions), разработанной исследователями.
LOOVE облегчает обучение word-embeddings без надзора, и также позволяет периодически переобучать и дообучать, исключая необходимость в помеченных наборах данных, которые были бы логистически нецелесообразны, учитывая масштаб задачи и быструю эволюцию эмоций.
В рамках проекта исследователи обучили псевдо-словарь эмоций на непомеченном наборе данных Twitch, в результате чего было сгенерировано 444 714 вложений слов, эмоций, эмодзи и эмоций.
Кроме того, они дополнили лексикон VADER с лексиконом эмодзи/эмоций, и, помимо упомянутого набора данных EC, также использовали три других публичных набора данных для тернарной классификации настроений, из Twitter, Rotten Tomatoes и выборочного набора данных YELP.
Учитывая большое разнообразие методов и наборов данных, использованных в исследовании, результаты разнообразны, но исследователи утверждают, что их лучший базовый вариант превзошел ближайший предыдущий показатель на 7,36 процентных пунктов.
Исследователи считают, что продолжающаяся ценность проекта заключается в разработке рамки LOOVE, основанной на вложениях word-to-vector (W2V), обученных на более чем 313 миллионах сообщений чата Twitch с помощью K-Ближайших Соседей (KNN).
Авторы заключили:
‘Основной функцией, стоящей за рамкой, является псевдо-словарь эмоций, который можно использовать для вывода настроений неизвестных эмоций. Используя этот псевдо-словарь эмоций, мы создали таблицу настроений для 22 507 эмоций. Это первый случай понимания эмоций в таком масштабе.’
* Мой перевод внутренних цитат в гиперссылки.












