Unghiul lui Anderson
Înțelegerea Emoțiilor de pe Twitch în Analiza Sentimentului

Folosirea tot mai frecventă de către public a emoji-urilor, emoticon-urilor, emotes-urilor, memelor, GIF-urilor și a altor moduri non-verbale de comunicare pe platformele de social media a încurcat, în ultimii ani, eforturile oamenilor de știință pentru a înțelege peisajul sociologic global; cel puțin, în măsura în care tendințele sociologice mondiale pot fi descoperite din discursul public.
Deși Procesarea Limbajului Natural (NLP) a devenit un instrument puternic în analiza sentimentului în ultimul deceniu, sectorul are dificultăți nu numai în a ține pasul cu un lexicon în continuă evoluție de slang și scurtături lingvistice în multiple limbi, dar și în încercarea de a decoda sensul postărilor bazate pe imagini pe platformele de social media, cum ar fi Facebook și Twitter.
Deoarece numărul limitat de platforme de social media foarte populate sunt singurele resurse cu adevărat hiperscalabile pentru acest tip de cercetare, este esențial pentru sectorul AI să încerce să mențină ritmul.
În iulie, un studiu din Taiwan a oferit o nouă metodă de a categoriza sentimentul utilizatorilor pe baza ‘reaction GIF-urilor’ postate în firele de discuții de pe social media (vezi imaginea de mai jos), folosind o bază de date de 30.000 de tweet-uri pentru a dezvolta o modalitate de a prezice reacțiile la un post. Studiul a constatat că răspunsurile bazate pe imagini sunt, în multe feluri, mai ușor de evaluat, deoarece sunt mai puțin probabil să conțină sarcasm, o provocare notabilă în analiza sentimentului.

Cercetătorii din Taiwan au studiat utilizarea GIF-urilor de reacție animate ca ‘indicatori reducționiști’ ai sentimentului într-un studiu din 2021.
Mai devreme în acest an, un efort de cercetare condus de Universitatea Boston a antrenat modele de învățare automată pentru a prezice imagini de meme care sunt probabil să devină virale pe Twitter; și în august, cercetătorii britanici au examinat creșterea emoji-urilor în comparație cu emoticon-urile (există o diferență) pe social media, compilând un set de date de scară largă de 7 limbi de sentiment pe Twitter.
Emote-uri de pe Twitch
Acum, cercetătorii americani au dezvoltat o metodologie de învățare automată pentru a înțelege, a categoriza și a măsura pseudo-lexiconul în continuă evoluție de emote-uri de pe rețeaua foarte populară Twitch.
Emote-urile sunt neologisme folosite pe Twitch pentru a exprima emoții, stări de spirit sau glume interne. Deoarece sunt, prin definiție, expresii noi, provocarea pentru un sistem de învățare automată nu este neapărat să catalogheze în mod continuu noi emote-uri (care pot fi folosite o singură dată sau pot dispărea rapid), ci să obțină o înțelegere mai bună a cadrului care generează în mod continuu emote-uri; și să dezvolte sisteme capabile să recunoască un emote ca un ‘cuvânt sau frază temporar validă’ a cărui temperatură emoțională sau politică poate necesita să fie evaluată în întregime din context.

Vecinii emote-ului ‘FeelsGoodMan’, a cărui sens poate fi alterat de sufixe obscure. Sursă: https://arxiv.org/pdf/2108.08411.pdf
Studiul poartă titlul FeelsGoodMan: Inferarea Semanticii Neologismelor de pe Twitch și provine de la trei cercetători de la Spiketrap, o companie de analiză a social media din San Francisco.
Bait și Switch
În ciuda noutății și a vieții lor adesea scurte, emote-urile de pe Twitch reciclează frecvent material cultural (inclusiv emote-uri mai vechi) într-un mod care poate îndrepta cadrul de analiză a sentimentului în direcția greșită. Urmărirea schimbării sensului unui emote pe măsură ce evoluează poate chiar dezvălui o inversare sau negare completă a sentimentului sau intenției sale originale.
De exemplu, cercetătorii notează că utilizarea inițială a emote-ului FeelsGoodMan de către extrema dreaptă a fost în mare măsură pierdută în contextul său de utilizare pe Twitch.
Utilizarea frazei, împreună cu o imagine a unui broască țestoasă dintr-o bandă desenată din 2005 de artistul Matt Furie, a devenit un meme al extremei drepte în anii 2010. Deși Vox a scris în 2017 că însușirea de către dreapta a meme-ului a supraviețuit disociării lui Furie de o astfel de utilizare, cercetătorii din San Francisco din spatele noului studiu au constatat altceva*:
‘Broasca țestoasă a lui Furie a fost adoptată de postatori de dreapta de pe diverse forumuri online, cum ar fi 4chan, la începutul anilor 2010. De atunci, Furie a făcut campanie pentru a-și reînsuși sensul personajului său, iar emote-ul a cunoscut o creștere a utilizării sale în contexte mai mainstream și pozitive pe Twitch. Rezultatele noastre pe Twitch sunt de acord, arătând că “FeelsGoodMan” și contrapartea sa “FeelsBadMan” sunt utilizate în principal în mod literal.’
Probleme în aval
Acest tip de ‘bait și switch’ cu privire la caracteristicile generalizate ale unui meme poate împiedica proiectele de cercetare NLP care au catalogat deja meme-ul ca ‘urât’, ‘de dreapta’ sau ‘naționalist [SUA]’, și care au dumpat aceste informații în depozite deschise pe termen lung. Proiectele NLP ulterioare nu pot alege să auditeze valabilitatea datelor mai vechi; nu pot avea niciun mecanism practic de a face acest lucru; și nu pot fi conștiente de nevoia de a face acest lucru.
Rezultatul este că utilizarea seturilor de date de pe Twitch din 2017 pentru a formula un algoritm de ‘categorizare politică’ ar atribui o activitate semnificativă de dreapta pe Twitch, pe baza frecvenței emote-ului FeelsGoodMan. Twitch poate sau nu poate fi plin de influenceri de dreapta, dar, conform cercetătorilor noului studiu, nu poți dovedi acest lucru prin intermediul broscoi.
Semnificația politică a meme-ului ‘Pepe’ pare să fi fost abandonată în mod casual de cei 140 de milioane de utilizatori ai Twitch (41% dintre aceștia au sub 24 de ani), care au reînsușit în mod eficient opera de la hoții originali și au pictat-o în culorile lor, fără nicio agendă particulară.
Metodă și date
Cercetătorii au constatat că datele etichetate de emote-uri de pe Twitch erau ‘virtual inexistente’, în ciuda concluziei unui studiu anterior că există opt milioane de emote-uri totale, și 400.000 erau prezente într-o singură săptămână de ieșiri pe Twitch în săptămâna aleasă de cercetătorii anteriori.
Un studiu din 2017 care aborda predicția emote-urilor pe Twitch s-a limitat la predicția doar a primelor 30 de emote-uri de pe Twitch, obținând un scor de 0,39 pentru predicția emote-urilor.
Pentru a aborda lipsa de date, cercetătorii din San Francisco au adoptat o abordare nouă a datelor mai vechi, împărțindu-le în 80/20 între antrenare și testare, și aplicând ‘metode tradiționale’ de învățare automată, care nu fuseseră utilizate anterior pentru a studia datele de pe Twitch. Aceste metode au inclus Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, cu kernel liniar), și Regressie Logistică.
Acestă abordare a depășit liniile de bază anterioare de sentiment de pe Twitch cu 63,8%, și a permis cercetătorilor să dezvolte ulterior cadrul LOOVE (Learning Out Of Vocabulary Emotions), care este capabil să identifice neologisme și să ‘îmbogățească’ modelele existente cu aceste definiții noi.

Arhitectura cadrului LOOVE (Learning Out Of Vocabulary Emotions) dezvoltat de cercetători.
Cadrul LOOVE facilitează antrenarea nesupravegheată a încorporărilor de cuvinte, și permite, de asemenea, reantrenarea periodică și reglarea fină, eliminând nevoia de seturi de date etichetate, care ar fi logistic impracticabile, având în vedere scala sarcinii și evoluția rapidă a emote-urilor.
În cadrul proiectului, cercetătorii au antrenat un ‘pseudo-dicționar’ de emote-uri pe un set de date nelabelate de pe Twitch, generând, în acest proces, 444.714 de încorporări de cuvinte, emote-uri, emoji-uri și emoticon-uri.
Mai mult, ei au completat un lexicon VADER cu un lexicon de emoji-uri și emoticon-uri, și, pe lângă setul de date EC menționat anterior, au exploatat și alte trei seturi de date publice disponibile pentru clasificarea sentimentului ternar, de pe Twitter, Rotten Tomatoes și un set de date YELP eșantionat.
Având în vedere varietatea mare de metodologii și seturi de date utilizate în studiu, rezultatele sunt variate, dar cercetătorii afirmă că cel mai bun caz de bază a depășit metrica anterioară cu 7,36 puncte procentuale.
Cercetătorii consideră că valoarea continuă a proiectului este dezvoltarea cadrului LOOVE, bazat pe încorporări de cuvinte la vector (W2V) antrenate pe peste 313 milioane de mesaje de chat de pe Twitch, cu ajutorul K-Nearest Neighbor (KNN).
Autorii concluzionează:
‘O caracteristică principală a cadrului este un pseudo-dicționar de emote-uri, care poate fi utilizat pentru a deriva sentimentul pentru emote-uri necunoscute. Utilizând acest pseudo-dicționar de emote-uri, am creat o tabelă de sentiment pentru 22.507 emote-uri. Acesta este primul caz de înțelegere a emote-urilor la această scară.’
* Conversia mea a citatelor inline în legături.












