Andersonův úhel
Porozumění Twitch Emotikonám v Analýze Nálady

Věřejné rostoucí použití emotikon, emotes, meme, GIFů a dalších neverbálních způsobů komunikace na sociálních médiích v posledních letech stále více znesnadňuje úsilí datových vědců pochopit globální sociologický obraz; alespoň do té míry, do které lze globální sociologické trendy odvodit z veřejného diskurzu.
Ačkoli zpracování přirozeného jazyka (NLP) se v posledních deseti letech stalo mocným nástrojem v analýze nálady, tento sektor má potíže nejen s udržením kroků s věčně se vyvíjejícím lexikonem slangů a lingvistických zkratků napříč několika jazyky, ale také s pokusem o dešifrování významu obrazových příspěvků na sociálních médiích, jako jsou Facebook a Twitter.
Pokud je omezený počet vysoce lidnatých sociálních médií jediným skutečně hyperscale zdrojem pro tento druh výzkumu, je pro sektor umělé inteligence nezbytné alespoň se snažit udržet krok s ním.
V červenci byla představena nová metoda pro kategorizaci uživatelské nálady na základě ‘reakčních GIFů’ zveřejněných ve vláknách na sociálních médiích (viz obrázek níže), pomocí databáze 30 000 tweetů pro vývoj způsobu, jak předpovídat reakce na příspěvek. Studie zjistila, že obrazové odpovědi jsou mnoha způsoby snazší měřit, protože jsou méně pravděpodobně obsahovat sarkasmus, značnou výzvu v analýze nálady.

Výzkumníci z Tchaj-wanu studovali použití animovaných reakčních GIFů jako ‘redukčních indikátorů’ nálady ve studii z roku 2021.
Na začátku tohoto roku vedl výzkumný projekt na Bostonské univerzitě trénování modelů strojového učení pro předpověď obrazových meme, které jsou pravděpodobné, že se stanou virálními na Twitteru; a v srpnu prozkoumali britští výzkumníci růst emotikon ve srovnání s emotes (existuje rozdíl) na sociálních médiích, sestavili velkou sadu dat o sentimentu Twitteru v sedmi jazycích.
Twitch Emotikony
Nyní vyvinuli výzkumníci z USA metodologii strojového učení pro lepší pochopení, kategorizaci a měření neustále se vyvíjejícího pseudo-lexikonu emotes na velmi populární síti Twitch.
Emotikony jsou neologismy používané na Twitch pro vyjádření emocí, nálady nebo vtipů. Protože jsou definicí novými výrazy, výzvou pro systém strojového učení není nutně nekonečně katalogizovat nové emotes (které mohou být použity pouze jednou nebo jinak rychle vypadnout z užívání), ale získat lepší pochopení rámce, který neustále generuje; a vyvinout systémy schopné rozpoznat emote jako ‘dočasně platné’ slovo nebo slovní spojení, jehož emocionální/politický teplotní rozsah může být třeba zcela odvozen z kontextu.

Sousedi emote ‘FeelsGoodMan’, jehož význam může být změněn nezřetelnými příponami. Zdroj: https://arxiv.org/pdf/2108.08411.pdf
Studie se nazývá FeelsGoodMan: Odvozování sémantiky neologismů na Twitchi a pochází od tří výzkumníků ze společnosti Spiketrap, společnosti pro analýzu sociálních médií v San Francisku.
Lákadlo a výměna
Navzdory své novosti a často krátkému životu emotes na Twitch často recyklují kulturní materiál (včetně starších emotes) způsobem, který může vést rámce analýzy nálady ve špatném směru. Sledování posunu významu emote, jak se vyvíjí, může dokonce odhalit kompletní inverzi nebo negaci jeho původního sentimentu nebo záměru.
Například výzkumníci uvádějí, že původní alt-right zneužití eponymního FeelsGoodMan meme Pepe-the-frog téměř úplně ztratilo svůj původní politický odstín v kontextu jeho použití na Twitchi.
Použití fráze spolu s obrázkem karikatury žáby z komiksu z roku 2005 od umělce Matta Furieho se stalo far-right meme v roce 2010. Ačkoli Vox napsal v roce 2017, že pravá appropriace meme přežila Furieho prohlášení o odpojení od takového použití, výzkumníci ze San Franciska ve své nové studii zjistili jinak*:
‘Furieho karikatura žáby byla přijata pravicovými přispěvateli na různých online fórech, jako je 4chan, na počátku roku 2010. Od té doby Furie vedl kampaň za znovuzískání významu své postavy a emote zažil nárůst více mainstreamového nenávistného a pozitivního použití na Twitchi. Naši výsledky na Twitchi souhlasí, ukazují, že “FeelsGoodMan” a jeho protějšek “FeelsBadMan” jsou hlavně používány doslova.’
Potíže níže po proudu
Tento typ ‘lákadla a výměny’ ohledně obecných ‘funkcí’ meme může bránit projektům NLP, které již kategorizovaly jako ‘nenávistné’, ‘pravicové’ nebo ‘nacionalistické [US]’, a které již vložily tyto informace do dlouhodobých otevřených repozitářů. Pozdější projekty NLP nemusí zvolit audit starších dat; nemusí mít praktický mechanismus, jak to udělat; a nemusí být si dokonce vědomi potřeby.
Výsledkem je, že použití datasetů z roku 2017 založených na Twitchi pro formulaci ‘politické kategorizace’ by připsalo významnou pravicovou aktivitu na Twitchi na základě frekvence emote FeelsGoodMan. Twitch může nebo nemusí být plně pravicových influencerů, ale podle výzkumníků nové studie to nelze prokázat pomocí žáby.
Politický význam meme ‘Pepe’ parece být byl neformálně odstraněn 140 miliony uživateli Twitchi (41% z nich je mladších 24 let), kteří efektivní重新 ukradli práci a namalovali ji ve svých vlastních barvách, bez zvláštní agendy.
Metoda a data
Výzkumníci zjistili, že označená data emotes na Twitchi byla ‘virtuálně neexistující’, navzdory závěru předchozí studie, že existuje osm milionů celkových emotes, a 400 000 bylo přítomno v jednom týdnu výstupu Twitchu v týdnu zvoleném těmito předchozími výzkumníky.
Studie z roku 2017 zaměřená na předpověď emotes na Twitchi se omezila na předpověď pouze top 30 emotes na Twitchi, s výsledkem 0,39 pro předpověď emotes.
Řešením tohoto nedostatku byli sanfranciskští výzkumníci, kteří přijali nový přístup k starším datům, rozdělili je na 80/20 mezi trénink a testování a aplikovali ‘tradiční’ metody strojového učení, které nebyly dříve použity pro studium dat z Twitchi. Tyto metody zahrnovaly Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, s lineárními jádry), a Logistic Regression.
Tento přístup překonal předchozí benchmarky sentimentu na Twitchi o 63,8% a umožnil výzkumníkům následně vyvinout rámec LOOVE (Learning Out Of Vocabulary Emotions), který je schopen identifikovat neologismy a ‘obohatit’ existující modely o tyto nové definice.

Architektura rámce LOOVE (Learning Out Of Vocabulary Emotions) vyvinutého výzkumníky.
Rámec LOOVE usnadňuje nesupervizované trénování word embeddings a také umožňuje periodické přeškolování a jemné ladění, což eliminuje potřebu označených datasetů, které by byly logisticky nepraktické, zohledňující rozsah úkolu a rychlou evoluci emotes.
V rámci projektu trénovali výzkumníci emote ‘Pseudo-Dictionary’ na neoznačeném datasetu z Twitchi, generovali 444 714 embeddings slov, emotes, emotikonů a emoji.
Dále rozšířili VADER lexikon o lexikon emoji/emotikonů a kromě výše uvedeného datasetu EC také využili tři další veřejně dostupné datasety pro ternární klasifikaci sentimentu, z Twitteru, Rotten Tomatoes a vzorku datasetu YELP.
Vzhledem k velké rozmanitosti metod a datasetů použitých ve studii jsou výsledky různorodé, ale výzkumníci tvrdí, že jejich nejlepší případ překonal nejbližší předchozí metriku o 7,36 procentních bodů.
Výzkumníci se domnívají, že pokračující hodnota projektu spočívá ve vývoji rámce LOOVE, založeného na word-to-vector (W2V) embeddings trénovaných na více než 313 milionech zpráv z chatu Twitchi s pomocí K-Nearest Neighbor (KNN).
Autoři uzavírají:
‘Hlavní funkcí rámce je emote pseudo-slovník, který lze použít k odvození sentimentu pro neznámé emotes. Pomocí tohoto emote pseudo-slovníku jsme vytvořili sentimentovou tabulku pro 22 507 emotes. Jedná se o první případ pochopení emotes v tomto rozsahu.’
* Moje konverze inline citací na hypertextové odkazy.












