Andersonin kulma
Twitch-emotejen tunteiden analyysi

Julkinen käyttää yhä enemmän emojisymboleja, emotikoneja, emoteja, meemejä, GIF-kuvia ja muita verbaalisia tapoja kommunikoida sosiaalisessa mediassa, mikä on viime vuosina yhä enemmän hämmennyttänyt data-analyytikkojen pyrkimyksiä ymmärtää maailmanlaajuista sosiologista maisemaa; ainakin siinä määrin, kuin maailmanlaajuiset sosiologiset trendit voidaan havaita julkisesta keskustelusta.
Vaikka luonnollisen kielen prosessointi (NLP) on viime vuosikymmenen aikana kehittynyt voimakkaaksi työkaluksi tunteiden analyysissä, alalla on vaikeuksia sekä pysytellä mukana jatkuvasti kehittyvässä slangin ja kielellisten lyhenteiden sanastossa useilla kielillä, että yrittää koodata kuvapohjaisia viestejä sosiaalisessa mediassa, kuten Facebookissa ja Twitterissä.
Koska sosiaalisen median alustoja on vain muutamia, jotka ovat todella hyperskaalaisia, on tärkeää, että tekoälyala pyrkii ainakin ylläpitämään vauhtia.
Heinäkuussa julkaistussa tutkimuksessa Taiwanista esiteltiin uusi menetelmä, jolla voidaan luokitella käyttäjien tunteita “reaktio-GIFien” perusteella sosiaalisen median ketjuissa (ks. kuva alla), käyttäen 30 000 twiittia kehittääkseen menetelmän, jolla voidaan ennustaa reaktioita viestiin. Tutkimuksessa todettiin, että kuvapohjaiset vastaukset ovat usein helpompia arvioida, koska niissä on vähemmän sarkasmia, joka on merkittävä haaste tunteiden analyysissä.

Tutkijat Taiwanista tutkivat animoituja reaktio-GIFejä “tunteiden osoittimina” 2021 tutkimuksessa.
Aikaisemmin tänä vuonna Bostonin yliopiston johtama tutkimus koulutti koneoppimismalleja ennustamaan kuvameemejä, jotka todennäköisesti leviävät Twitterissä; ja elokuussa brittiläiset tutkijat tutkivat emojien kasvua verrattuna emotikoneihin (on ero) sosiaalisessa mediassa, kokoamalla suuren, 7-kielisen Twitterin tunteiden datasetin.
Twitch-emoteet
Nyt Yhdysvaltain tutkijat ovat kehittäneet koneoppimismenettelyn, jolla voidaan paremmin ymmärtää, luokitella ja mitata jatkuvasti kehittyvää emotejen “välimuistia” Twitch-verkkopalvelussa.
Emoteet ovat uudissanoja, joita käytetään Twitchissä ilmaisemaan tunteita, mielialoja tai sisäpiirin vitsejä. Koska ne ovat määritelmän mukaan uusia ilmaisuja, haaste koneoppimisjärjestelmälle ei välttämättä ole loputtoman emotejen luettelon ylläpitäminen (joita voidaan käyttää vain kerran tai ne voivat nopeasti mennä pois käytöstä), vaan ymmärtää paremmin kehys, joka jatkuvasti luo niitä; ja kehittää järjestelmiä, jotka voivat tunnistaa emoteen “tilapäisesti voimassa olevaksi” sanaksi tai lauseeksi, jonka emotionaalinen tai poliittinen lämpötila voi vaatia kokonaan kontekstista johtuvan arvion.

FeelsGoodMan-emoteen lähimpien naapureiden merkitys voi muuttua epäselvillä etuliitteillä. Lähde: https://arxiv.org/pdf/2108.08411.pdf
Tutkimus tutkielman otsikko on FeelsGoodMan: Inferring Semantics of Twitch Neologisms, ja se on tehty kolmen tutkijan toimesta Spiketrapissa, sosiaalisen median analytiikkayrityksessä San Franciscossa.
Häränkauppa
Vaikka Twitch-emoteet ovat uusia ja usein lyhytaikaisia, ne kierrättävät usein kulttuurisia aineksia (mukaan lukien vanhoja emoteja) tavalla, joka voi johtaa tunteiden analyysikehyksen väärään suuntaan. Emoteen merkityksen muutoksen jäljittäminen sen kehityksen aikana voi jopa paljastaa täydellisen käänteen tai negaation sen alkuperäisestä tunteesta tai aikomuksesta.
Esimerkiksi tutkijat huomauttavat, että alkuperäinen oikeistorajainen väärinkäyttö FeelsGoodMan-Pepe-sammakko-memeä on lähes täysin menettänyt alkuperäisen poliittisen maun Twitchin käytössä.
Sanaa yhdessä vuonna 2005 ilmestyneen Matt Furien sarjakuvan hahmon kanssa käytettiin oikeistorajaisena meemänä 2010-luvulla. Vaikka Vox kirjoitti vuonna 2017, että oikeiston omaksuminen meemästä oli selvinnyt Furien itsensä irtautumisesta tällaisesta käytöstä, San Franciscon tutkijat ovat löytäneet toisin*:
‘Furien sarjakuvan sammakko otettiin oikeistorajaisilla foorumeilla, kuten 4chanissa, 2010-luvun alussa. Furie on kampanjoinut hahmonsa merkityksen palauttamiseksi, ja emote on kokenut lisääntyneen, enemmän valtavirtaa olevan, ei-vihamielisen ja positiivisen käytön Twitchissä. Tutkimuksemme Twitchissä osoittaa samaa: “FeelsGoodMan” ja sen vastine “FeelsBadMan” käytetään pääasiassa kirjaimellisesti.’
Hankalat seuraukset
Tällainen “häränkauppa” meemin yleisten “ominaisuuksien” suhteen voi estää NLP-tutkimushankkeita, jotka ovat jo luokitelleet sen “vihamieliseksi”, “oikeistorajaiseksi” tai “nationalistiseksi [US]”, ja jotka ovat hävittäneet tämän tiedon avoimiin lähdekoodirepositorioihin. Myöhemmät NLP-hankkeet eivät välttämättä valitse vanhan datan valuutan; eivät välttämättä ole käytännöllisiä mekanismeja tekemään niin; ja eivät välttämättä ole tietoisia tarpeesta.
Tuloksena on, että Twitchin perustuvien vuoden 2017 tietojoukkojen käyttäminen “poliittisen luokittelualgoritmin” muodostamiseen antaisi merkittävän oikeistorajaisen toiminnan Twitchissä FeelsGoodMan-emoteen frekvenssin perusteella. Twitch voi olla tai ei täynnä oikeistorajaisia vaikuttajia, mutta tutkijoiden mukaan sitä ei voida osoittaa sammakon perusteella.
“Pepe”-meemin poliittinen merkitys näyttää olevan hävinnyt Twitchin 140 miljoonan käyttäjän (41 % joista on alle 24-vuotiaita) toimesta, jotka ovat tehokkaasti “vallanneet” teoksen uudelleen ja maalanneet sen omilla väreillä ilman mitään erityistä aikomusta.
Menetelmä ja data
Tutkijat totesivat, että Twitch-emotejen datan merkintöjä oli “lähes olemattomia”, vaikka aiemman tutkimuksen johtopäätöksen mukaan on olemassa kahdeksan miljoonaa emotea yhteensä, ja 400 000 niistä oli yhden viikon aikana Twitchin tuotoksessa valitun viikon aikana.
Vuoden 2017 tutkimus, joka käsitteli emotejen ennustamista Twitchissä, rajoittui ennustamaan vain 30 suosituinta Twitch-emotea, ja se sai vain 0,39 emotejen ennustamisessa.
Tutkijat käyttivät uutta lähestymistapaa vanhaan dataan, jakoen sen 80/20:een koulutus- ja testausjoukkoihin, ja soveltaen “perinteisiä” koneoppimismenetelmiä, joita ei ollut aiemmin käytetty Twitchin datan tutkimiseen. Nämä menetelmät sisälsivät Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, lineaaristen ytimien kanssa), ja Logistic Regression.
Tämä lähestymistapa ylitti aiemmat Twitchin tunteiden vertailukohtia 63,8 %, ja mahdollisti tutkijoiden myöhemmän LOOVE (Learning Out Of Vocabulary Emotions) -kehyksen kehittämisen, joka pystyy tunnistamaan neologismeja ja “rikastamaan” olemassa olevia malleja näillä uusilla määrityksillä.

LOOVE (Learning Out Of Vocabulary Emotions) -kehyksen arkkitehtuuri, jonka tutkijat kehittivät.
LOOVE mahdollistaa sanasidonnaisten upotusten unsupervised koulutuksen, ja se myös mahdollistaa jaksollisen uudelleenkoulutuksen ja hienosäätöilyn, mikä poistaa tarpeen merkityille dataseteille, jotka olisivat loogisesti epäkäytännöllisiä, ottaen huomioon tehtävän laajuuden ja emotejen nopean kehityksen.
Tutkijat kouluttivat emotejen “välimuistin” merkitysten määrittämiseksi Twitchin merkitymättömästä datasetistä, ja loivat 444 714 sanan, emotejen, emojien ja emotikoneiden upotusta.
He laajensivat myös VADER-sanastoa emojien ja emotikoneiden sanastolla, ja käyttivät lisäksi kolmea muuta julkisesti saatavilla olevaa datasettiä ternary -tunteiden luokittelua varten, Twitteristä, Rotten Tomatoesista ja otoksesta YELP-datasetistä.
Tutkimuksen tulokset ovat moninaisia, mutta tutkijat toteavat, että heidän parhaan tapauksensa vertailukohta ylitti lähimpänä olevan aiemman mittarin 7,36 prosenttiyksiköllä.
Tutkijat katsovat, että hankkeen jatkuva arvo on LOOVE-kehyksen kehittäminen, joka perustuu sana-vektori (W2V) -upotusten koulutukseen yli 313 miljoonan Twitchin chat-viestin avulla K-Nearest Neighbor (KNN):n avulla.
Tutkijat toteavat:
‘Kehyksen keskeinen ominaisuus on emotejen välimuisti, jota voidaan käyttää tuntemattomien emotejen tunteiden määrittämiseen. Tämän emotejen välimuistin avulla loimme tunteiden taulukon 22 507 emoteelle. Tämä on ensimmäinen tapaus emotejen ymmärtämisestä tässä mittakaavassa.’
* Minun muunnokseni sisäisistä viittauksista hyperlinkkeihin.












