Ângulo de Anderson
Compreendendo Emotes do Twitch na Análise de Sentimento

O uso crescente do público de emojis, emoticons, emotes, memes, GIFs e outras formas não verbais de comunicação em plataformas de mídia social tem, nos últimos anos, cada vez mais confundido os esforços dos cientistas de dados para entender o cenário sociológico global; pelo menos, na medida em que as tendências sociológicas mundiais podem ser discernidas do discurso público.
Embora o Processamento de Linguagem Natural (NLP) tenha se tornado uma ferramenta poderosa na análise de sentimento nos últimos dez anos, o setor tem dificuldade não apenas em acompanhar um lexicon em constante evolução de gírias e atalhos linguísticos em várias línguas, mas também em tentar decodificar o significado de posts baseados em imagens em plataformas de mídia social, como Facebook e Twitter.
Desde que o número limitado de plataformas de mídia social altamente populares são o único recurso verdadeiramente hiperscale para este tipo de pesquisa, é essencial para o setor de IA tentar manter o ritmo.
Em julho, um artigo de Taiwan ofereceu um novo método para categorizar o sentimento do usuário com base em ‘GIFs de reação’ publicados em threads de mídia social (veja a imagem abaixo), usando um banco de dados de 30.000 tweets para desenvolver uma forma de prever reações a uma postagem. O artigo descobriu que respostas baseadas em imagens são, em muitos aspectos, mais fáceis de medir, pois são menos propensas a conter sarcasmo, um desafio notável na análise de sentimento.

Pesquisadores de Taiwan estudaram o uso de GIFs de reação animados como ‘indicadores redutivos’ de sentimento em um artigo de 2021.
No início deste ano, um esforço de pesquisa liderado pela Universidade de Boston treinou modelos de aprendizado de máquina para prever memes de imagem que provavelmente se tornarão virais no Twitter; e em agosto, pesquisadores britânicos examinaram o crescimento de emojis em comparação com emoticons (há uma diferença) em mídia social, compilando um conjunto de dados em larga escala de 7 línguas de sentimento de Twitter em imagens.
Emotes do Twitch
Agora, pesquisadores americanos desenvolveram uma metodologia de aprendizado de máquina para melhor entender, categorizar e medir o pseudo-lexicon em constante evolução de emotes na rede Twitch.
Emotes são neologismos usados no Twitch para expressar emoção, humor ou piadas internas. Como são, por definição, expressões novas, o desafio para um sistema de aprendizado de máquina não é necessariamente catalogar novos emotes (que podem ser usados apenas uma vez, ou cair em desuso rapidamente), mas ganhar uma melhor compreensão do quadro que gera constantemente esses emotes; e desenvolver sistemas capazes de reconhecer um emote como uma ‘palavra ou frase composta temporariamente válida’ cuja temperatura emocional/política pode precisar ser avaliada inteiramente pelo contexto.

Vizinhos do emote ‘FeelsGoodMan’, cujo significado pode ser alterado por sufixos obscuros. Fonte: https://arxiv.org/pdf/2108.08411.pdf
O artigo é intitulado FeelsGoodMan: Inferindo Semântica de Neologismos do Twitch, e vem de três pesquisadores da Spiketrap, uma empresa de análise de mídia social em São Francisco.
Isca e Troca
Apesar de sua novidade e vida frequentemente breve, emotes do Twitch frequentemente reciclam material cultural (incluindo emotes mais antigos) de uma maneira que pode direcionar frameworks de análise de sentimento no caminho errado. Rastrear a mudança no significado de um emote à medida que evolui pode até revelar uma inversão ou negação completa de seu sentimento ou intenção original.
Por exemplo, os pesquisadores observam que o uso original do meme FeelsGoodMan Pepe-the-frog, que se tornou um meme de extrema-direita, perdeu quase completamente seu sabor político original no contexto de seu uso no Twitch.
O uso da frase, junto com uma imagem de um sapo de desenho animado de 2005 do artista Matt Furie, se tornou um meme de extrema-direita na década de 2010. Embora o Vox tenha escrito em 2017 que a apropriação do meme pela direita havia sobrevivido à desassociação de Furie com tal uso, os pesquisadores de São Francisco por trás do novo artigo descobriram o contrário*:
‘O sapo de desenho animado de Furie foi adotado por postadores de direita em fóruns online como o 4chan no início da década de 2010. Desde então, Furie fez campanha para reivindicar o significado de seu personagem, e o emote viu um aumento no uso mais mainstream e positivo no Twitch. Nossos resultados no Twitch concordam, mostrando que “FeelsGoodMan” e seu contraparte “FeelsBadMan” estão sendo usados principalmente de forma literal.’
Problemas Downstream
Esse tipo de ‘isca e troca’ em relação às características geralmente aceitas de um meme pode impedir projetos de pesquisa de NLP que já categorizaram como ‘odioso’, ‘de direita’ ou ‘nacionalista [EUA]’, e que jogaram essas informações em repositórios de código aberto de longo prazo. Projetos de NLP posteriores podem não escolher auditar a moeda do dados mais antigos; podem não ter mecanismo prático para fazê-lo; e podem nem sequer estar cientes da necessidade.
A consequência disso é que usar conjuntos de dados do Twitch de 2017 para formular um algoritmo de ‘categorização política’ atribuiria atividade de extrema-direita notável no Twitch, com base na frequência do emote FeelsGoodMan. O Twitch pode ou não estar cheio de influenciadores de extrema-direita, mas, de acordo com os pesquisadores do novo artigo, você não pode prová-lo pelo sapo.
O significado político do meme ‘Pepe’ parece ter sido casualmente descartado pelos 140 milhões de usuários do Twitch (41% dos quais têm menos de 24 anos), que efetivamente roubaram o trabalho dos ladrões originais e o pintaram com suas próprias cores, sem qualquer agenda particular.
Método e Dados
Os pesquisadores descobriram que dados de emotes do Twitch rotulados eram ‘virtualmente inexistente’, apesar da conclusão de um estudo anterior de que há oito milhões de emotes totais, e 400.000 estavam presentes em uma semana de saída do Twitch escolhida por aqueles pesquisadores anteriores.
Um estudo de 2017 que abordou a previsão de emotes no Twitch limitou-se a prever apenas os 30 principais emotes do Twitch, marcando apenas 0,39 para previsão de emotes.
Para abordar a falta, os pesquisadores de São Francisco adotaram uma nova abordagem para os dados mais antigos, dividindo-os 80/20 entre treinamento e teste, e aplicando métodos ‘tradicionais’ de aprendizado de máquina, que não haviam sido usados anteriormente para estudar dados do Twitch. Esses métodos incluíam Naive Bayes (NB), Random Forest (RF), Support Vector Machine (SVM, com kernels lineares), e Regressão Logística.
Essa abordagem superou as linhas de base anteriores de sentimento do Twitch em 63,8%, e permitiu que os pesquisadores desenvolvessem subsequentemente o quadro LOOVE (Learning Out Of Vocabulary Emotions), que é capaz de identificar neologismos e ‘enriquecer’ modelos existentes com essas novas definições.

Arquitetura do quadro LOOVE (Learning Out Of Vocabulary Emotions) desenvolvido pelos pesquisadores.
LOOVE facilita o treinamento não supervisionado de embeddings de palavras, e também acomoda o treinamento periódico e o ajuste fino, eliminando a necessidade de conjuntos de dados rotulados, o que seria logisticamente impraticável, considerando a escala da tarefa e a evolução rápida dos emotes.
Em serviço do projeto, os pesquisadores treinaram um ‘Dicionário Pseudo-Emote’ em um conjunto de dados não rotulado do Twitch, gerando 444.714 embeddings de palavras, emotes, emojis e emoticons.
Além disso, eles aumentaram um léxico VADER com um léxico de emoji/emoticon, e, além do conjunto de dados EC mencionado, também exploraram três outros conjuntos de dados públicos para classificação de sentimento ternária, do Twitter, Rotten Tomatoes e um conjunto de dados amostrado do YELP.
Dada a grande variedade de metodologias e conjuntos de dados usados no estudo, os resultados são variados, mas os pesquisadores afirmam que sua linha de base mais forte superou a métrica anterior mais próxima em 7,36 pontos percentuais.
Os pesquisadores consideram que o valor contínuo do projeto é o desenvolvimento do LOOVE, baseado em embeddings de palavra-para-vetor (W2V) treinados em mais de 313 milhões de mensagens de bate-papo do Twitch com a ajuda do K-Nearest Neighbor (KNN).
Os autores concluem:
‘Uma característica impulsionadora por trás do quadro é um dicionário pseudo-emote que pode ser usado para derivar sentimento para emotes desconhecidos. Usando esse dicionário pseudo-emote, criamos uma tabela de sentimento para 22.507 emotes. Este é o primeiro caso de compreensão de emotes nessa escala.’
* Minha conversão de citações em linha para hiperlinks.












