Kąt Andersona
Zrozumienie emotikonów Twitch w analizie sentymentu

Rozwój społeczny korzystania z emotikonów, emotikonek, emotes, memów, GIF-ów i innych niewerbalnych sposobów komunikacji na platformach społecznościowych w ostatnich latach coraz bardziej utrudniał wysiłki naukowców danych w zrozumieniu globalnego krajobrazu socjologicznego; przynajmniej w takim stopniu, w jakim światowe trendy socjologiczne mogą być poznane z publicznej dyskusji.
Chociaż Przetwarzanie Języka Naturalnego (NLP) stało się potężnym narzędziem w analizie sentymentu w ciągu ostatniej dekady, sektor ma trudności nie tylko z utrzymaniem się z ewoluującym słownictwem slangowym i skrótami językowymi w wielu językach, ale także z odczytaniem znaczenia obrazowych postów na platformach społecznościowych, takich jak Facebook i Twitter.
Ponieważ ograniczona liczba bardzo zaludnionych platform społecznościowych jest jedynym prawdziwie hiperskalowalnym zasobem dla tego rodzaju badań, jest niezwykle ważne, aby sektor AI próbował utrzymać tempo z nimi.
W lipcu, artykuł z Tajwanu zaproponował nową metodę klasyfikacji sentymentu użytkowników na podstawie ‘reakcji GIF’ opublikowanych w wątkach społecznościowych (patrz poniżej), wykorzystując bazę danych 30 000 tweetów do opracowania sposobu przewidywania reakcji na post. Artykuł stwierdził, że odpowiedzi oparte na obrazach są w wielu przypadkach łatwiejsze do oceny, ponieważ mniej prawdopodobne jest, że zawierają sarkazm, znaczący wyzwanie w analizie sentymentu.

Badacze z Tajwanu zbadali użycie animowanych reakcji GIF jako ‘redukcyjnych wskaźników’ sentymentu w artykule z 2021 roku.
Wcześniej w tym roku, badanie prowadzone przez Uniwersytet w Bostonie wytrenowało modele uczenia maszynowego do przewidywania obrazowych memów, które mogą stać się wirusowe na Twitterze; a w sierpniu, brytyjscy badacze zbadali wzrost emotikonów w porównaniu z emotikonek (istnieje różnica) na platformach społecznościowych, skompilując duży, 7-języczny zestaw danych o sentymencie Twittera.
Emotikony Twitch
Teraz, amerykańscy badacze opracowali metodę uczenia maszynowego, aby lepiej zrozumieć, sklasyfikować i zmierzyć nieustannie ewoluujące pseudo-słownictwo emotes na bardzo popularnej sieci Twitch.
Emotikony to neologizmy używane na Twitch, aby wyrazić emocje, nastrój lub żarty. Ponieważ są to nowe wyrażenia, wyzwaniem dla systemu uczenia maszynowego nie jest koniecznie nieustanne katalogowanie nowych emotes (które mogą być używane tylko raz lub wkrótce wyjdą z użycia), ale zdobycie lepszego zrozumienia ramy, która nieustannie generuje je; oraz rozwinięcie systemów zdolnych do rozpoznania emote jako ‘tymczasowo ważnego’ słowa lub frazy, której temperatura emocjonalna/polityczna może wymagać oceny wyłącznie z kontekstu.

Sąsiedzi emote ‘FeelsGoodMan’, którego znaczenie może być zmienione przez niejasne sufiksy. Źródło: https://arxiv.org/pdf/2108.08411.pdf
Artykuł pt. FeelsGoodMan: Inferowanie semantyki neologizmów Twitch, pochodzi od trzech badaczy z Spiketrap, firmy analitycznej mediów społecznościowych w San Francisco.
Potwierdzenie i podstęp
Pomimo nowości i często krótkiego życia, emotikony Twitch często recyklingują materiał kulturowy (w tym starsze emotikony) w sposób, który może skierować ramy sentymentu w złym kierunku. Śledzenie zmiany znaczenia emote, gdy ewoluuje, może nawet ujawnić całkowite odwrócenie lub negację jego pierwotnego sentymentu lub intencji.
Na przykład, badacze zauważają, że pierwotne nadużycie alt-right emote FeelsGoodMan ma prawie całkowicie straciło swoje pierwotne znaczenie polityczne w kontekście jego użycia na Twitch.
Użycie frazy, wraz z obrazem kreskówkowego żabiego z komiksu z 2005 roku autorstwa Matta Furie, stało się memem skrajnej prawicy w latach 2010. Chociaż Vox napisał w 2017 roku, że przywłaszczenie memu przez prawicę przetrwało oświadczenie Furie o odrzuceniu takiego użycia, kalifornijscy badacze stwierdzili coś przeciwnego*:
‘Kreskówkowy żab z Furie został przyjęty przez prawicowych użytkowników na różnych internetowych forach, takich jak 4chan, na początku lat 2010. Od tego czasu Furie prowadził kampanię, aby odzyskać znaczenie swojej postaci, a emote doświadczył wzrostu bardziej mainstreamowego użycia poza nienawiścią i pozytywnego użycia na Twitch. Nasze wyniki na Twitch potwierdzają to, pokazując, że “FeelsGoodMan” i jego odpowiednik “FeelsBadMan” są głównie używane dosłownie.’
Kłopoty na dalszym etapie
Ten rodzaj ‘potwierdzenia i podstępu’ dotyczący uogólnionych ‘cech’ memu może utrudnić projekty badawcze NLP, które już sklasyfikowały go jako ‘nienawistne’, ‘prawicowe’ lub ‘nacjonalistyczne [USA]’, i które umieściły te informacje w długoterminowych repozytoriach open source. Późniejsze projekty NLP mogą nie zdecydować się na audyt starszych danych; mogą nie mieć praktycznego mechanizmu, aby to zrobić; i mogą nie być even świadome potrzeby.
Wynikiem tego jest to, że używanie zestawów danych z 2017 roku opartych na Twitch do sformułowania ‘algorytmu klasyfikacji politycznej’ przypisałoby znaczącą działalność skrajnej prawicy na Twitch, opartą na częstotliwości emote FeelsGoodMan. Twitch może, albo nie, być pełen influencerów skrajnej prawicy, ale, według badaczy, nie można tego udowodnić za pomocą żaby.
Znaczenie polityczne memu ‘Pepe’ wydaje się być przypadkowo odrzucone przez 140 milionów użytkowników Twitch (41% z nich ma mniej niż 24 lata), którzy skutecznie odebrali pracę od pierwotnych złodziei i pomalowali ją na swoje kolory, bez żadnego szczególnego celu.
Metoda i dane
Badacze stwierdzili, że oznaczone dane emotes Twitch były ‘prawie nieistniejące’, pomimo wniosku poprzedniego badania, że istnieje osiem milionów emotes, i 400 000 było obecnych w jednym tygodniu danych Twitch w tygodniu wybranym przez tych wcześniejszych badaczy.
Badanie z 2017 roku dotyczące przewidywania emotes na Twitch ograniczyło się do przewidywania tylko 30 najlepszych emotes Twitch, uzyskując wynik 0,39 dla przewidywania emotes.
W celu rozwiązania problemu, kalifornijscy badacze zastosowali nowe podejście do starszych danych, dzieląc je w proporcji 80/20 między trening a testowanie, oraz stosując ‘tradycyjne’ metody uczenia maszynowego, które nie były wcześniej używane do badania danych Twitch. Metody te obejmowały Naiwny Bayes (NB), Losowy Las (RF), Maszynę Wektorową (SVM, z liniowymi jądrami), oraz Regresję Logistyczną.
Podejście to przewyższyło poprzednie wyniki sentymentu Twitch o 63,8%, oraz umożliwiło badaczom późniejsze opracowanie ramy LOOVE (Learning Out Of Vocabulary Emotions), która jest w stanie identyfikować neologizmy i ‘wzbogacać’ istniejące modele tymi nowymi definicjami.

Architektura ramy LOOVE (Learning Out Of Vocabulary Emotions) opracowanej przez badaczy.
LOOVE umożliwia nienadzorowane trenowanie osadzania słów, oraz umożliwia okresowe trenowanie ponowne i dostrajanie, eliminując potrzebę oznaczonych zestawów danych, co byłoby logistycznie niewykonalne, biorąc pod uwagę skalę zadania i szybkiej ewolucji emotes.
W ramach projektu, badacze wytrenowali ‘słownik emotes’ na nieoznaczonym zestawie danych Twitch, generując 444 714 osadzania słów, emotes, emotikonów i emotikonek.
Dalej, uzupełnili leksekon VADER z leksekonem emotikonów/emotikonek, oraz, poza wcześniej wspomnianym zestawem danych EC, wykorzystali trzy inne publicznie dostępne zestawy danych do klasyfikacji sentymentu z Twittera, Rotten Tomatoes i próbkowanego zestawu danych YELP.
Biorąc pod uwagę różnorodność metodologii i zestawów danych użytych w badaniu, wyniki są zróżnicowane, ale badacze twierdzą, że ich najlepszy wynik bazowy przewyższył najbliższy poprzedni wynik o 7,36 punktów procentowych.
Badacze uważają, że trwałą wartością projektu jest rozwój LOOVE, oparty na osadzaniach słów-wektorach (W2V) wytrenowanych na ponad 313 milionach wiadomości czatu Twitch z pomocą najbliższych sąsiadów (KNN).
Autorzy kończą:
‘Jedną z napędzających cech ramy jest słownik emotes, który może być użyty do wywnioskowania sentymentu dla nieznanych emotes. Używając tego słownika emotes, stworzyliśmy tabelę sentymentu dla 22 507 emotes. Jest to pierwszy przypadek zrozumienia emotes na tej skali.’
* Moja konwersja odniesień do hiperłączy.












