Angle d’Anderson

Comprendre les émotes Twitch dans l’analyse des sentiments

mm
Ajouter Unite.AI à vos sources préférées sur Google

L’utilisation croissante par le public d’émoticônes, d’émotes, de mèmes, de GIF et d’autres moyens non verbaux de communication sur les plateformes de médias sociaux a, ces dernières années, de plus en plus déconcerté les efforts des scientifiques de données pour comprendre le paysage sociologique mondial; du moins, dans la mesure où les tendances sociologiques mondiales peuvent être discernées à partir du discours public.

Bien que le traitement automatique des langues naturelles (NLP) soit devenu un outil puissant dans l’analyse des sentiments au cours de la dernière décennie, le secteur a du mal à suivre non seulement un lexique en constante évolution de l’argot et des raccourcis linguistiques dans plusieurs langues, mais également à tenter de décoder le sens des pubs basées sur des images sur les plateformes de médias sociaux telles que Facebook et Twitter.

Étant donné que le nombre limité de plateformes de médias sociaux très peuplées sont la seule ressource hyperscale pour ce type de recherche, il est essentiel pour le secteur de l’IA de tenter au moins de maintenir le rythme.

En juillet, un article de Taïwan a proposé une nouvelle méthode pour catégoriser les sentiments des utilisateurs en fonction des ‘GIF de réaction’ publiés sur les fils de discussion des médias sociaux (voir l’image ci-dessous), en utilisant une base de données de 30 000 tweets pour développer un moyen de prédire les réactions à un message. L’article a constaté que les réponses basées sur des images sont souvent plus faciles à évaluer, car elles sont moins susceptibles de contenir du sarcasme, un défi notable dans l’analyse des sentiments.

Les chercheurs de Taïwan ont étudié l’utilisation de GIF de réaction animés en tant qu’indicateurs ‘réducteurs’ de sentiment dans un article de 2021.

Plus tôt cette année, un effort de recherche mené par l’Université de Boston a formé des modèles d’apprentissage automatique pour prédire les mèmes d’images susceptibles de devenir viraux sur Twitter; et en août, des chercheurs britanniques ont examiné la croissance des émoticônes par rapport aux émoticones (il y a une différence) sur les médias sociaux, en compilant un grand ensemble de données à 7 langues de sentiment de Twitter basé sur des images.

Émotes Twitch

Maintenant, des chercheurs américains ont développé une méthodologie d’apprentissage automatique pour mieux comprendre, catégoriser et mesurer le pseudo-lexique en constante évolution des émotes sur le réseau Twitch très populaire.

Les émotes sont des néologismes utilisés sur Twitch pour exprimer une émotion, un humeur ou des blagues internes. Puisqu’il s’agit par définition de nouvelles expressions, le défi pour un système d’apprentissage automatique n’est pas nécessairement de cataloguer sans cesse de nouveaux émotes (qui peuvent n’être utilisés qu’une seule fois, ou tomber rapidement en désuétude), mais de mieux comprendre le cadre qui génère sans cesse de nouvelles expressions; et de développer des systèmes capables de reconnaître un émote comme un ‘mot temporairement valide’ ou une phrase composée dont la température émotionnelle/politique peut nécessiter d’être évaluée entièrement à partir du contexte.

Neighbors of the 'FeelsGoodMan' emote, whose meaning can be altered by obscure suffixes. Source: https://arxiv.org/pdf/2108.08411.pdf

Neighbors of the ‘FeelsGoodMan’ emote, whose meaning can be altered by obscure suffixes. Source: https://arxiv.org/pdf/2108.08411.pdf

L’article s’intitule FeelsGoodMan: Inferring Semantics of Twitch Neologisms, et provient de trois chercheurs de Spiketrap, une société d’analyse de médias sociaux à San Francisco.

Appât et commutateur

Malgré leur caractère novateur et leur vie souvent brève, les émotes Twitch recyclent fréquemment du matériel culturel (y compris les anciens émotes) d’une manière qui peut détourner les cadres d’analyse des sentiments dans la mauvaise direction. Traiter le changement de signification d’un émote à mesure qu’il évolue peut même révéler une inversion ou une négation complète de son sentiment ou de son intention d’origine.

Par exemple, les chercheurs notent que l’utilisation originale de l’émote FeelsGoodMan par l’extrême droite a presque complètement perdu sa saveur politique d’origine dans le contexte de son utilisation sur Twitch.

L’utilisation de la phrase, avec une image d’un grenouille dessinée par l’artiste Matt Furie en 2005, est devenue un mème de l’extrême droite dans les années 2010. Bien que Vox ait écrit en 2017 que l’adoption du mème par la droite avait survécu à la désassociation de Furie avec une telle utilisation, les chercheurs de San Francisco derrière l’article ont trouvé autre chose*:

‘Le grenouille dessiné par Furie a été adopté par les affiches de droite sur divers forums en ligne comme 4chan au début des années 2010. Depuis, Furie a fait campagne pour reprendre le sens de son personnage, et l’émote a connu un regain d’utilisation plus mainstream et positive sur Twitch. Nos résultats sur Twitch sont d’accord, montrant que “FeelsGoodMan” et son homologue “FeelsBadMan” sont principalement utilisés de manière littérale.’

Problèmes en aval

Ce type de ‘appât et commutateur’ concernant les ‘caractéristiques’ généralisées d’un mème peut entraver les projets de recherche en NLP qui ont déjà catégorisé le mème comme ‘haineux’, ‘de droite’ ou ‘nationaliste [US]’, et qui ont versé ces informations dans des référentiels open source à long terme. Les projets NLP ultérieurs peuvent ne pas choisir de vérifier la validité des anciennes données; peuvent ne pas avoir de mécanisme pratique pour le faire; et peuvent ne pas même être conscients du besoin.

La conséquence de cela est que l’utilisation de jeux de données de 2017 basés sur Twitch pour formuler un ‘algorithme de catégorisation politique’ attribuerait une activité de droite notable sur Twitch, sur la base de la fréquence de l’émote FeelsGoodMan. Twitch peut ou non être rempli d’influenceurs de droite, mais, selon les chercheurs de l’article, vous ne pouvez pas le prouver avec le grenouille.

La signification politique du mème ‘Pepe’ semble avoir été abandonnée de manière décontractée par les 140 millions d’utilisateurs de Twitch (41 % d’entre eux ont moins de 24 ans), qui ont effectivement repris l’œuvre des voleurs d’origine et l’ont peinte avec leurs propres couleurs, sans aucun agenda particulier.

Méthode et données

Les chercheurs ont constaté que les données étiquetées d’émotes Twitch étaient ‘virtuellement inexistantes’, malgré la conclusion d’une étude antérieure selon laquelle il y a huit millions d’émotes au total, et 400 000 étaient présents dans la seule semaine de sortie de Twitch choisie par ces chercheurs antérieurs.

Une étude de 2017 portant sur la prédiction d’émotes sur Twitch s’est limitée à prédire les 30 premiers émotes Twitch, avec un score de seulement 0,39 pour la prédiction d’émotes.

Pour répondre à ce déficit, les chercheurs de San Francisco ont adopté une nouvelle approche des anciennes données, en les divisant 80/20 entre formation et test, et en appliquant des méthodes d’apprentissage automatique ‘traditionnelles’, qui n’avaient pas été utilisées auparavant pour étudier les données de Twitch. Ces méthodes comprenaient Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, avec des noyaux linéaires), et Régression logistique.

Cette approche a surpassé les lignes de base de sentiment précédentes sur Twitch de 63,8 %, et a permis aux chercheurs de développer par la suite le cadre LOOVE (Learning Out Of Vocabulary Emotions), qui est capable d’identifier les néologismes et d’enrichir les modèles existants avec ces nouvelles définitions.

Architecture of the LOOVE (Learning Out Of Vocabulary Emotions) framework developed by the researchers.

Architecture of the LOOVE (Learning Out Of Vocabulary Emotions) framework developed by the researchers.

LOOVE facilite la formation non supervisée d’incrustations de mots, et permet également une rééducation périodique et un affinage, ce qui élimine le besoin de jeux de données étiquetés, qui serait logistiquement impraticable, compte tenu de l’ampleur de la tâche et de l’évolution rapide des émotes.

Dans le cadre du projet, les chercheurs ont formé un ‘dictionnaire’ d’émotes sur un jeu de données non étiqueté de Twitch, en générant 444 714 incrustations de mots, d’émotes, d’émoticônes et d’émoticônes.

En outre, ils ont augmenté un lexique VADER avec un lexique d’émoticônes/émoticônes, et en plus du jeu de données EC mentionné, ils ont également exploité trois autres jeux de données publics pour la classification de sentiment ternaire, de Twitter, Rotten Tomatoes et un jeu de données YELP échantillonné.

Compte tenu de la grande variété de méthodes et de jeux de données utilisés dans l’étude, les résultats sont variés, mais les chercheurs affirment que leur ligne de base la plus solide a surpassé la métrique précédente la plus proche de 7,36 points de pourcentage.

Les chercheurs considèrent que la valeur continue du projet est le développement de LOOVE, basé sur des incrustations de mots-à-vec (W2V) formées sur plus de 313 millions de messages de chat Twitch avec l’aide de K-Nearest Neighbor (KNN).

Les auteurs concluent:

‘Un facteur clé derrière le cadre est un dictionnaire d’émotes qui peut être utilisé pour dériver le sentiment pour les émotes inconnus. En utilisant ce dictionnaire d’émotes, nous avons créé un tableau de sentiments pour 22 507 émotes. Il s’agit du premier cas de compréhension d’émotes à cette échelle.’

 

* Ma conversion des citations en ligne en hyperliens.

Écrivain en apprentissage automatique, spécialiste de domaine en synthèse d'images humaines. Ancien responsable du contenu de recherche chez Metaphysic.ai, jusqu'à sa dissolution dans Brahma.ai de DNEG.
Portfolio site : martinanderson.ai
Contact : martin@martinanderson.ai