Погляд Anderson

Реакційні GIF-образи пропонують новий ключ до розпізнавання емоцій у NLP

mm
Додайте Unite.AI до бажаних джерел у Google

Нові дослідження з Тайваню пропонують новий метод для природної мови обробки (NLP) для виконання аналізу настрою на соціальних медіа-форумах і мовних дослідницьких наборах даних – шляхом категоризації та маркування анімованих GIF-образів, які публікуються у відповідь на текстові оголошення.

Дослідники під керівництвом Боаза Шмуелі з Національного університету Цінхуа в Тайвані використали вбудовану базу даних реакційних GIF-образів Twitter як індекс для кількісної оцінки афективного стану відповіді користувача, усуваючи необхідність перемовин щодо多 мовних відповідей, вику виявлення сарказму, або визначення основної емоційної температури з двозначних або надто коротких відповідей.

Натисніть кнопку 'GIF' при створенні твіта Twitter, щоб побачити стандартний набір позначених анімованих GIF-образів, які легше для NLP інтерпретувати, ніж потенційно двозначне використання простого текстового мовлення.

Натисніть кнопку ‘GIF’ при створенні твіта Twitter, щоб побачити стандартний набір позначених анімованих GIF-образів, які потенційно легше для NLP розібрати в ‘ідентифіковані’ емоції, ніж просте текстове мовлення.

У статті використання реакційних GIF-образів таким чином характеризується як ‘новий тип мітки, який ще не доступний у наборах даних емоцій NLP’, і відзначає, що існуючі набори даних або використовують дименціональну модель емоцій, або дискретну модель емоцій, жодна з яких не пропонує такого роду розуміння.

Анімований GIF-відгук на публікацію користувача. З Twitter-постачальницьким GIF, тепер закодованим за афективним станом, двозначність наміру майже усунена щодо аналізу настрою.

Анімований GIF-відгук на публікацію користувача. З Twitter-постачальницьким GIF, тепер закодованим за афективним станом, двозначність наміру майже усунена. Джерело: https://arxiv.org/pdf/2105.09967.pdf

Дослідники опублікували набір даних з 30 000 саркастичних твітів, що містять реакційні GIF-відгуки. Цей підхід пропонує NLP розрізнення, яке відсутнє в інших літературах: метод розрізнення сприйманої емоції (емоції, які читач ідентифікує з тексту) від індукованої емоції (чуття, яке читач переживає як реакцію на текст).

Реакційні GIF-образи як редуктивні індикатори

Відносно підтримуючої реакції на публікацію, яка поділяється дистресовим емоційним станом, підходящий GIF корисно редукціоністський і недвозначний за наміром, коли публікується без супровідного тексту (і ці типи реакційних GIF-відгуків були предметом дослідження).

Наприклад, реакції, такі як ‘Це жорстоко, чувак’, ‘Це прикро’, або ‘Ах’ містять потенційні двозначності наміру, від можливості певної ‘клінічної’ та неушкодженої точки зору до можливості сарказму; але публікація одного з сотень ‘обіймів’-категорій GIF-образів Twitter залишає менше місця для інтерпретації:

Деталізація під-значень реакційного GIF-відгуку

Все ж таки, всередині будь-якої категорії реакції, наприклад ‘обійми’, існують численні додаткові індикатори настрою або точки зору, що охоплюють多 різні жанри афектованого стану, включаючи точку зору романтичних чи сімейних припущень відносин між реагуючою особою та оригінальним постером.

Зображення різних типів відносин у категорії 'обійми' GIF-образів Twitter. Використання різних жанрів, тропів, зображень статей та інших факторів додає деталізацію потенційної інтерпретації вибору GIF для цього настрою.

Зображення різних типів відносин у категорії ‘обійми’ GIF-образів Twitter. Використання різних жанрів, тропів, зображень статей та інших факторів додає деталізацію потенційної інтерпретації вибору GIF для цього настрою.

Набір даних ReactionGIF був отриманий з перших 100 GIF-образів кожної доступної реакційної категорії Twitter, що призвело до бази даних з 4300 анімованих зображень. Якщо GIF-образ з’являється в більш ніж одній категорії, категорія з вищим розміщенням у GUI має більшу вагу. Зображення, які з’являються в декількох категоріях, отримують фактор подібності реакції – метрику, винайдену для дослідження.

Афінності потім виявляються за допомогою ієрархічного кластеризування та середнього зв’язку.

Доповнення даних реакційних GIF-образів

Набір даних був згенерований і позначений шляхом застосування методу проти 30 000 твітів. ‘Багатий афективний сигнал’ реакційної категорії дозволив дослідникам доповнити набір даних додатковими афективними мітками, заснованими на позитивних і негативних кластерах реакційних категорій, і додати мітки емоцій з спеціальною схемою відображення реакцій на емоції, заснованою на більшості вердикту трьох людських оцінювачів на вибіркових твітах.

Попередня праця з Yahoo та Університету Рочестера, яка займається анотацією GIF-образів, не має цього шару викликаного тексту, ні реакційних категорій, але є чисто семантичною.

Дослідники оцінили набір даних за чотири підходи: RoBERTa, Конвольюційний Нейронний Мережа (CNN) GloVe, класифікатор логістичної регресії та простий класифікатор більшості класів. Вага переконання для кожної категорії виходить досить чітко в результатах, з схваленням, згодою та співчуттям найбільш легко ідентифікованими (і найбільш представленими), і вибаченням найбільш важким для оцінки, можливо, оскільки це включає можливість сарказму.

Модель RoBERTa згенерувала найвищу середню оцінку серед усіх трьох методів оцінки, які складалися з прогнозування афективної реакції, прогнозування індукованого настрою та прогнозування індукованої емоції.

Вилучення емоцій користувача з реакційних GIF-образів

Дослідники відзначають, що ідентифікація індукованої емоції є однією з найбільш складних завдань у аналіз настрою та емоцій NLP, і що використання реакційних GIF-образів як проксі пропонує можливість для пізніших проектів зібрати ‘велику кількість дешевих, природно-відбуваються, високоякісних афективних міток’.

Незважаючи на зосередження уваги на дуже конкретному лоці GIF-образів, вбудованих у досвід користувача Twitter, дослідження стверджує, що цей метод може узагальнитися на інші соціальні медіа-платформи, а також платформи миттєвого обміну повідомленнями, і потенційно бути корисним у секторах, таких як розпізнавання емоцій та багатомодальне виявлення емоцій.

Популярність як ключовий індекс

Підхід, здається, залежить від певої ‘вірусності’ для кожного GIF-образу, наприклад, коли GIF-образ фактично надається через власні механізми Twitter. Мабуть, нові користувальницькі GIF-образи не можуть увійти в цю екосистему, крім випадків, коли вони стають популярними та приймаються як мем.

Реакційні GIF-образи відновили використання анімованого формату GIF 1987 року за останні десять років, після років недовіри як пожирача смуги пропускання (головним чином використовувався для дратівливих банерів) у епоху Інтернету V1 до широкосмугового зв’язку.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai