Взгляд Anderson

Реакционные GIF-изображения предлагают новый ключ к распознаванию эмоций в NLP

mm
Добавьте Unite.AI в избранные источники в Google

Новое исследование из Тайваня предлагает новый метод для распознавания эмоций в социальных сетях и языковых исследованиях – путем категоризации и маркировки анимированных GIF-изображений, которые публикуются в ответ на текстовые объявления.

Исследователи, возглавляемые Боазом Шмуэли из Национального университета Цинхуа в Тайване, использовали встроенную базу данных реакционных GIF-изображений Twitter как индекс для количественной оценки аффективного состояния ответа пользователя, исключая необходимость согласовывать множественные языковые ответы, проблему обнаружения сарказма или определения основной эмоциональной температуры из неоднозначных или чрезмерно кратких ответов.

Нажатие кнопки 'GIF' при составлении твита предлагает стандартный набор помеченных анимированных GIF-изображений, которые легче интерпретируются NLP, чем потенциально неоднозначное использование простого текста.

Нажатие кнопки ‘GIF’ при составлении твита предлагает стандартный набор помеченных анимированных GIF-изображений, которые потенциально легче интерпретируются NLP как ‘идентифицированные’ эмоции, чем простой текст.

Статья характеризует использование реакционных GIF-изображений как ‘новый тип метки, который еще не доступен в наборах данных эмоций NLP’, и отмечает, что существующие наборы данных либо используют дименсиональную модель эмоций, либо дискретную модель эмоций, ни одна из которых не предлагает такого рода информацию.

Анимированное GIF-изображение в ответ на пост пользователя. С учетом того, что GIF Twitter теперь закодирован в терминах аффективного состояния, неоднозначность намерения практически исключена в плане анализа настроений.

Анимированное GIF-изображение в ответ на пост пользователя. С учетом того, что GIF Twitter теперь закодирован в терминах аффективного состояния, неоднозначность намерения практически исключена. Источник: https://arxiv.org/pdf/2105.09967.pdf

Исследователи опубликовали набор данных из 30 000 саркастических твитов, содержащих реакционные GIF-изображения. Этот подход предлагает NLP различие, отсутствующее в других текущих исследованиях: метод различия воспринимаемой эмоции (эмоции, которые читатель идентифицирует из текста) и индуцированной эмоции (чувство, которое читатель испытывает в ответ на текст).

Реакционные GIF-изображения как редуктивные индикаторы

В плане поддерживающего ответа на пост, который делится тревожным эмоциональным состоянием, подходящее GIF-изображение полезно редукционистично и неоднозначно по намерению, когда оно опубликовано без сопровождающего текста (и это именно тот тип реакции, на который была сосредоточена исследование).

Например, реакции, такие как ‘Это жестоко, чувак’, ‘Это стыдно’ или ‘Ох’, содержат потенциальные неоднозначности намерения, от возможности определенного ‘клинического’ и неэмоционального отношения до возможности сарказма; но публикация одного из сотен GIF-изображений категории ‘объятия’ в Twitter оставляет меньше места для интерпретации:

Анализ подзначений реакции GIF-изображения

Тем не менее, внутри любой одной категории реакции, такой как ‘объятия’, есть многочисленные дополнительные индикаторы настроения или точки зрения, охватывающие множество жанров аффективного состояния, включая точку зрения романтических или семейных предположений о отношениях между реагирующим и оригинальным постером.

Изображение различных типов отношений в категории 'объятия' GIF-изображений Twitter. Использование различных жанров, тропов, изображений гендера и других факторов добавляет детализацию потенциальной интерпретируемости выбора GIF-изображения для этого настроения.

Изображение различных типов отношений в категории ‘объятия’ GIF-изображений Twitter. Использование различных жанров, тропов, изображений гендера и других факторов добавляет детализацию потенциальной интерпретируемости выбора GIF-изображения для этого настроения.

Набор данных ReactionGIF был получен из первых 100 GIF-изображений каждой доступной категории реакции в Twitter, в результате чего получилась база данных из 4300 анимированных изображений. Когда GIF-изображение появляется в более чем одной категории, категория с более высоким размещением в GUI имеет больший вес. Изображения, которые появляются в нескольких категориях, присваиваются фактор реакционной подобия – метрика, изобретенная для исследования.

Аффинности затем обнаруживаются с помощью иерархического кластерного анализа и средней связи.

Улучшение данных реакционных GIF-изображений

Набор данных был сгенерирован и помечен путем применения метода к 30 000 твитам. ‘Богатый аффективный сигнал’ категории реакции позволил исследователям улучшить набор данных дополнительными аффективными метками, основанными на кластерах положительных и отрицательных реакций, и добавить метки эмоций с помощью специальной схемы сопоставления реакций с эмоциями, основанной на большинстве вердиктов трех человеческих оценщиков на выборочных твитах.

Предыдущая работа из Yahoo и Университета Рочестера, которая занимается аннотацией GIF-изображений, не имеет этого слоя элицированного текста, ни реакционных категорий, но является чисто семантической.

Исследователи оценили набор данных по четырем подходам: RoBERTa, свёрточная нейронная сеть (CNN) GloVe, классификатор логистической регрессии и простой классификатор большинства классов. Вес убеждения для каждой категории возникает довольно четко в результатах, с одобрением, согласием и соболезнованием наиболее легко идентифицируемыми (и наиболее представленными), и извинением наиболее трудным для оценки, возможно, поскольку это включает возможность сарказма.

Модель RoBERTa сгенерировала наивысший протестированный средний рейтинг по всем трем методам оценки, которые состояли из прогнозирования аффективной реакции, прогнозирования индуцированного настроения и прогнозирования индуцированной эмоции.

Извлечение эмоций пользователя из реакционных GIF-изображений

Исследователи отмечают, что определение индуцированной эмоции является одной из наиболее сложных задач в анализе настроений и эмоций на основе NLP, и что использование реакционных GIF-изображений в качестве прокси предлагает возможность для последующих проектов собрать ‘большие объемы дешевых, естественно возникающих, высококачественных аффективных меток’.

Несмотря на сосредоточение внимания на очень конкретном локусе GIF-изображений, встроенных в пользовательский опыт Twitter, исследование утверждает, что этот метод может обобщаться на другие социальные платформы, а также на платформы мгновенного обмена сообщениями, и потенциально быть полезным в секторах, таких как распознавание эмоций и многомодальное обнаружение эмоций.

Популярность как ключевой индекс

Подход, кажется, опирается на определенный ‘вирусность’ для каждого GIF-изображения, такой как когда GIF-изображение фактически доступно через механизмы Twitter. Предположительно, новые пользовательские GIF-изображения не могут войти в эту экосистему, кроме как через увеличенную популярность и принятие в качестве мема.

Реакционные GIF-изображения восстановили использование примитивного анимированного формата GIF 1987 года за последние десять лет, после лет бесчестия как жора полосы пропускания (в основном использовался для раздражающих баннерных реклам) в эпоху Интернета V1 до широкополосного доступа.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai