Andersons vinkel
Forståelse af Twitch Emotes i Sentiment Analyse

Offentlighedens voksende brug af emojis, emoticons, emotes, memes, GIF’er og andre non-verbale måder at kommunikere på sociale medieplatforme har i de seneste år mere og mere forvirret datavidenskabsfolkenees forsøg på at forstå det globale sociologiske landskab; i hvert fald, i den udstrækning, hvori verdensomspændende sociologiske tendenser kan afledes af offentlig diskurs.
Selv om Natural Language Processing (NLP) er blevet et kraftfuldt værktøj i sentimentanalyse over det sidste årti, har sektoren svært ved ikke kun at følge med en evolverende leksikon af slang og lingvistiske genveje på tværs af multiple sprog, men også i at forsøge at afkode betydningen af billede-baserede indlæg på sociale medieplatforme som Facebook og Twitter.
Da det begrænsede antal af højtbefolkede sociale medieplatforme er den eneste virkelig hyperskalaressource til denne type forskning, er det essentiel for AI-sektoren at i det mindste forsøge at holde trit med det.
I juli tilbød en rapport fra Taiwan en ny metode til at kategorisere brugerens sentiment baseret på ‘reaction GIF’er’ offentliggjort i sociale medie-tråde (se billedet nedenfor), ved at bruge en database af 30.000 tweets til at udvikle en måde at forudsige reaktioner på et indlæg. Rapporten fandt, at billede-baserede svar på mange måder er lettere at måle, da de er mindre sandsynlige for at indeholde sarkasme, en bemærkelsesværdig udfordring i sentimentanalyse.

Forskere fra Taiwan studerede brugen af animerede reaction GIF’er som ‘reducerende indikatorer’ af sentiment i en rapport fra 2021.
Tidligere på året ledte et forskningsforsøg fra Boston University træning af maskinlæringsmodeller til at forudsige billede-memes, der sandsynligvis vil gå viralt på Twitter; og i august undersøgte britiske forskere væksten af emojis i forhold til emoticons (der er en forskel) på sociale medie, ved at samle en stor skala 7-sprog-dataset af billed-sentiment på Twitter.
Twitch Emotes
Nu har amerikanske forskere udviklet en maskinlæringsmetodologi til bedre at forstå, kategorisere og måle det evolverende pseudo-leksikon af emotes på det meget populære Twitch-netværk.
Emotes er neologismer, der bruges på Twitch til at udtrykke følelse, humør eller in-jokes. Da de per definition er nye udtryk, er udfordringen for et maskinlæringsystem ikke nødvendigvis at katalogisere nye emotes (der kun kan bruges en gang eller også falde ud af brug hurtigt), men at opnå en bedre forståelse af rammen, der konstant genererer dem; og at udvikle systemer, der kan genkende en emote som et ‘midlertidigt gyldigt’ ord eller sammensat frase, hvis emotionel/politisk temperatur måske kun kan måles ud fra konteksten.

Naboer af ‘FeelsGoodMan’-emoten, hvis betydning kan ændres af obskure suffikser. Kilde: https://arxiv.org/pdf/2108.08411.pdf
Den rapport har titlen FeelsGoodMan: Inferring Semantics of Twitch Neologisms og kommer fra tre forskere ved Spiketrap, et sociale medie-analysefirma i San Francisco.
Bait and Switch
Trods deres nytænkning og ofte korte liv, genbruger Twitch-emotes ofte kulturelt materiale (herunder ældre emotes) på en måde, der kan føre sentimentanalyse-rammer i den forkerte retning. At spore ændringen i betydningen af en emote, da den udvikler sig, kan endda afsløre en fuldstændig inversion eller negation af dens oprindelige sentiment eller hensigt.
For eksempel bemærker forskerne, at den oprindelige alt-right misbrug af den omtalte FeelsGoodMan Pepe-the-frog-meme næsten fuldstændigt har mistet sin oprindelige politiske smag i sammenhængen med dens brug på Twitch.
Brugen af udtrykket, sammen med et billede af en tegneserie-frog fra en tegneserie fra 2005 af kunstneren Matt Furie, blev til en højre-orienteret meme i 2010’erne. Selv om Vox skrev i 2017, at højre-fløjens tilpasning af mimen havde overlevet Furies selv-erklærede afstandtagen fra en sådan brug, har de sanfrancisco-forskere bag den nye rapport fundet noget andet*:
‘Furies tegneserie-frog blev adopteret af højre-orienterede brugere på forskellige online-fora som 4chan i begyndelsen af 2010’erne. Siden da har Furie ført kampagne for at genskabe betydningen af sin karakter, og emoten har set en opblomstring i mere mainstream ikke-hadefuldt brug og positivt brug på Twitch. Vores resultater på Twitch er enige, og viser, at “FeelsGoodMan” og dets modstykke “FeelsBadMan” hovedsagelig bruges bogstaveligt.’
Trouble Downstream
Denne type ‘bait and switch’ med hensyn til de generelle ‘egenskaber’ af en meme kan hindre NLP-forskningsprojekter, der allerede har kategoriseret den som ‘hadeful’, ‘højre-orienteret’ eller ‘nationalistisk [US]’, og som har dumpet denne information i lange åbne kilde-repositorier. Senere NLP-projekter kan ikke vælge at gennemgå den ældre datas valuta; kan ikke have nogen praktisk mekanisme til at gøre det; og kan ikke engang være bekendt med behovet.
Det betyder, at brugen af 2017 Twitch-baserede datasæt til at formulere en ‘politisk kategorisering’-algoritme ville tilskrive bemærkelsesværdig højre-orienteret aktivitet på Twitch, baseret på hyppigheden af FeelsGoodMan-emoten. Twitch kan eller kan ikke være fuld af højre-orienterede påvirkere, men ifølge forskerne bag den nye rapport kan man ikke bevise det med froggen.
‘Pepe’-mimens politiske betydning synes at være blevet kasseret af Twitch’s 140 millioner brugere (41% af hvem er under 24), der har effektivt gensat værket fra de oprindelige tyve og malet det i deres egne farver, uden nogen særlig dagsorden.
Metode og Data
Forskere fandt, at markeret Twitch-emote-data var ‘virtuelt ikke-eksisterende’, trods afslutningen af en tidligere studie, at der er otte millioner samlede emotes, og 400.000 var til stede i den ene uge af Twitch-udsalg i den uge, der blev valgt af de tidligere forskere.
En 2017-studie, der behandlede emote-forudsigelse på Twitch, begrænsede sig til at forudsige kun de top 30 Twitch-emotes, og scorede kun 0,39 for emote-forudsigelse.
For at imødegå manglen tog de sanfrancisco-forskere en ny tilgang til den ældre data, ved at splitte den 80/20 mellem træning og test, og anvende ‘traditionelle’ maskinlæringsmetoder, som ikke tidligere var blevet brugt til at studere Twitch-data. Disse metoder inkluderede Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, med lineære kernel), og Logistic Regression.
Denne tilgang overgik tidligere Twitch-sentiment-baselines med 63,8%, og muliggjorde herefter, at forskerne kunne udvikle LOOVE (Learning Out Of Vocabulary Emotions)-rammen, som kan identificere neologismer og ‘berige’ eksisterende modeller med disse nye definitioner.

Arkitektur af LOOVE (Learning Out Of Vocabulary Emotions)-rammen udviklet af forskerne.
LOOVE muliggør usuperviseret træning af word-embeddings, og kan også tilpasse periodisk gen-træning og fin-justering, og eliminerer således behovet for markeret datasæt, som ville være logistisk umuligt, når man tager hensyn til opgavens skala og den hurtige udvikling af emotes.
I forbindelse med projektet trænede forskerne en emote-‘Pseudo-Dictionary’ på et umarkeret Twitch-datasæt, og genererede herefter 444.714 indlejring af ord, emotes, emojis og emoticons.
Yderligere supplerede de en VADER-ordliste med en emoji/emoticon-ordliste, og udover den ovennævnte EC-datasæt udnyttede de også tre andre offentligt tilgængelige datasæt til ternær sentiment-klassificering, fra Twitter, Rotten Tomatoes og et samplet YELP-datasæt.
Med hensyn til den store variation af metoder og datasæt, der blev brugt i studiet, er resultaterne varierede, men forskerne hævder, at deres bedste baseline overgik den nærmeste tidligere metrik med 7,36 procentpoint.
Forskere mener, at det fortsatte værdi af projektet er udviklingen af LOOVE, baseret på word-to-vector (W2V)-indlejring, trænet på over 313 millioner Twitch-chat-besked med hjælp af K-Nearest Neighbor (KNN).
Forfatterne konkluderer:
‘En drivende funktion bag rammen er en emote-pseudo-ordbog, som kan bruges til at aflede sentiment for ukendte emotes. Ved at bruge denne emote-pseudo-ordbog skabte vi en sentiment-tabel for 22.507 emotes. Dette er det første tilfælde af emote-forståelse på denne skala.’
* Min konvertering af inline-citationer til hyperlinks.












