Kąt Andersona
Reakcje GIF oferują nowy klucz do rozpoznawania emocji w NLP

Naukowcy z Tajwanu opracowali nową metodę dla Przetwarzania Języka Naturalnego (NLP), aby wykonywać analizę sentymentu na forach społecznościowych i w zbiorach danych językowych – poprzez kategoryzowanie i oznaczanie animowanych GIF-ów, które są publikowane w odpowiedzi na ogłoszenia tekstowe.
Naukowcy, pod przewodnictwem Boaza Shmueli z Narodowego Uniwersytetu Tsing Hua na Tajwanie, wykorzystali wbudowaną bazę danych reakcji GIF-ów Twittera jako wskaźnik, aby zmierzyć stan emocjonalny odpowiedzi użytkownika, unikając konieczności negocjowania wielu odpowiedzi językowych, wyzwania wykrywania sarkazmu lub identyfikacji podstawowej temperatury emocjonalnej z niejasnych lub zbyt krótkich odpowiedzi.

Kliknięcie przycisku ‘GIF’ podczas tworzenia postu na Twitterze oferuje standardowy zestaw oznaczonych animowanych GIF-ów, które są potencjalnie łatwiejsze do interpretacji przez NLP niż język plain-text.
Artykuł charakteryzuje użycie reakcji GIF-ów w ten sposób jako ‘nowy typ etykiety, nie dostępny dotąd w zbiorach danych emocji NLP’, i zauważa, że istniejące zbiory danych albo wykorzystują model wymiarowy emocji, albo model emocji dyskretnych, żaden z nich nie oferuje tego rodzaju spostrzeżeń.

Animowany GIF odpowiedzi na post użytkownika. Z kodowanymi GIF-ami Twittera w kategoriach stanu emocjonalnego, niejasność intencji jest niemal całkowicie usunięta.Źródło: https://arxiv.org/pdf/2105.09967.pdf
Naukowcy opublikowali zbiór danych 30 000 sarkastycznych tweetów zawierających reakcje GIF-ów. Podejście to oferuje NLP rozróżnienie, które jest nieobecne w innej literaturze: metodę rozróżniania postrzeganych emocji (emocji, które czytelnik identyfikuje z tekstu) od wywołanych emocji (uczucia, które czytelnik doświadcza jako reakcję na tekst).
Reakcje GIF jako wskaźniki redukcyjne
W kwestii wsparcia odpowiedzi na post, który udostępnia stan emocjonalny, odpowiedni GIF jest użytecznie redukcyjny i nieambivalentny w intencji, gdy opublikowany bez towarzyszącego tekstu (i tego typu reakcje GIF-ów koncentrowały się w badaniu).
Na przykład, reakcje takie jak ‘To jest brutalne, człowieku’, ‘To jest wstyd’, lub ‘Awww’ zawierają potencjalne niejasności intencji, od możliwości pewnego ‘klinicznego’ i niezainteresowanego punktu widzenia do możliwości sarkazmu; ale opublikowanie jednego z setek GIF-ów ‘uścisk’ Twittera pozostawia mniej miejsca na interpretację:

Wgłębianie się w podznaczenia reakcji GIF
Pomimo tego, w ramach jednej kategorii reakcji, takiej jak ‘uścisk’, istnieją liczne dodatkowe wskaźniki nastroju lub punktu widzenia, obejmujące wiele gatunków stanu emocjonalnego, w tym punktu widzenia romantycznego lub rodzinnych założeń relacji między odpowiedzią a oryginalnym postem.

Przedstawienie różnych typów relacji w dostępnej kategorii ‘uścisk’ GIF-ów Twittera. Użycie różnorodnych gatunków, tropów, przedstawień płci i innych czynników dodaje szczegółowości potencjalnej interpretowalności wyboru GIF-a dla tego sentymentu.
Zbiór danych ReactionGIF został pochodny z pierwszych 100 GIF-ów w każdej dostępnej kategorii reakcji na Twitterze, prowadząc do bazy 4300 animowanych obrazów. Gdzie GIF pojawia się w więcej niż jednej kategorii, kategoria z wyższym umiejscowieniem w GUI jest ważona wyżej. Obrazy, które pojawiają się w wielu kategoriach, są przypisane do czynnika podobieństwa reakcji – metryki wymyślonej dla badania.
Affinity są następnie odkrywane przy użyciu hierarchicznego klastryzowania i średniego połączenia.

Rozszerzanie danych reakcji GIF
Zbiór danych został wygenerowany i oznaczony przez zastosowanie metody przeciwko 30 000 tweetom. ‘Bogaty sygnał emocjonalny’ kategorii reakcji pozwolił naukowcom rozszerzyć zbiór danych o dodatkowe etykiety emocjonalne, oparte na pozytywnych i negatywnych klastryzowanych kategoriach reakcji, oraz dodać etykiety emocjonalne z dedykowanym schematem mapowania reakcji na emocje, opartym na większości werdyktu trzech ludzkich ewaluatorów na próbkach tweetów.
Poprzednie prace z Yahoo i Uniwersytetu Rochester, które dotyczą adnotacji GIF-ów, nie mają tej warstwy wywołanego tekstu, ani żadnych kategorii reakcji, ale są czysto semantyczne.
Naukowcy ocenili zbiór danych w czterech podejściach: RoBERTa, Sieć Neuronowa Własnościowa (CNN) GloVe, klasyfikator regresji logistycznej i prosty klasyfikator klasy większości. Waga przekonania dla każdej kategorii pojawia się dość wyraźnie w wynikach, z aprobatą, zgodą i współczuciem najłatwiejszymi do identyfikacji (i najbardziej reprezentowanymi), a przeprosinami najtrudniejszymi do oceny, być może dlatego, że obejmuje to możliwość sarkazmu.

Model RoBERTa wygenerował najwyższą średnią rankingową we wszystkich trzech metodach oceny, które składały się z przewidywania reakcji emocjonalnych, przewidywania sentymentu wywołanego i przewidywania emocji wywołanej.
Poznanie emocji użytkownika z reakcji GIF
Naukowcy zauważają, że identyfikacja emocji wywołanych jest jednym z najtrudniejszych zadań w analizie sentymentu i emocji opartej na NLP, i że użycie reakcji GIF-ów jako proxy oferuje możliwość dla późniejszych projektów, aby zebrać ‘duże ilości tanich, naturalnie występujących, wysokiej jakości etykiet emocjonalnych’.
Pomimo koncentrowania się na bardzo specyficznym locus GIF-ów osadzonych w doświadczeniu użytkownika Twittera, badanie twierdzi, że ta metoda może być ogólna dla innych platform społecznościowych, a także platform komunikacji natychmiastowej, i potencjalnie być użyteczna w sektorach takich jak rozpoznawanie emocji i wielomodalne wykrywanie emocji.
Popularność jako kluczowy wskaźnik
Podejście wydaje się polegać na pewnym ‘wirusowym’ charakterze dla każdego GIF-a, takim jak gdy GIF jest dostępny za pośrednictwem mechanizmów Twittera. Przypuszczalnie, nowe użytkowe GIF-y nie mogłyby wejść do tego ekosystemu, chyba że przez zwiększoną popularność i przyjęcie jako meme.
Reakcje GIF-ów odnowiły użycie pierwotnego formatu animowanego GIF z 1987 roku w ciągu ostatnich dziesięciu lat, po latach niełaski jako pożeracz pasma (głównie używany do irytujących reklam banerowych) w erze Internetu V1 przed szerokopasmowym.












