Andersonの視点
Twitch Emotes を感情分析で理解する

最近、一般の人々がソーシャルメディアプラットフォームで絵文字、顔文字、エモート、メーム、GIFなどの非言語的な方法でコミュニケーションを行うことが増えており、データサイエンティストが世界的な社会的傾向を理解することを困難にしている。少なくとも、パブリックディスカッションから推測できる世界的な社会的傾向を理解することを困難にしている。
自然言語処理(NLP)は、過去10年間で感情分析の強力なツールとなりましたが、スラングや言語的ショートカットの不断に進化するレクサコンを跟随することは難しく、FacebookやTwitterなどのソーシャルメディアプラットフォームで投稿される画像ベースの投稿の意味を解読することも難しい。
このような研究のための唯一の真正なハイパースケールリソースは、人口の多いソーシャルメディアプラットフォームの限られた数であるため、AIセクターは少なくともそれに追随しようとすることが不可欠である。
7月、台湾の研究者は、ソーシャルメディアスレッドに投稿された「リアクションGIF」に基づいてユーザーの感情を分類する新しい方法を提供した(以下の画像を参照)。30,000ツイートのデータベースを使用して、投稿への反応を予測する方法を開発した。この研究では、画像ベースのレスポンスは、嘲笑が含まれる可能性が低いため、感情を測定することが容易であることが示された。

台湾の研究者は、2021年の研究で、アニメーションリアクションGIFを「感情の簡略化された指標」として使用した。
今年の初め、ボストン大学が主導する研究では、ツイッターでウイルス的に広がる画像メームを予測するためにマシンラーニングモデルをトレーニングした。8月、イギリスの研究者は、ソーシャルメディアでの絵文字と顔文字の使用の違いを調査し、大規模な7言語のツイッター感情データセットをまとめた。
Twitch Emotes
現在、米国の研究者は、Twitchネットワークで使用される不断に進化するエモートの疑似レクサコンをよりよく理解、分類、測定するためのマシンラーニング方法論を開発した。
エモートは、Twitchで感情、気分、またはインサイドジョークを表現するために使用される新語である。定義上、新しい表現であるため、マシンラーニングシステムの課題は、エモートを無限にカタログ化することではなく、エモートを生成するフレームワークをよりよく理解し、エモートを「一時的に有効な」単語または複合語句として認識するシステムを開発することである。エモートの感情的/政治的な温度は、完全にコンテキストから推測する必要がある。

FeelsGoodManエモートの隣接要素の意味は、不明なサフィックスによって変更される可能性がある。ソース:https://arxiv.org/pdf/2108.08411.pdf
この研究は、Spiketrapというサンフランシスコのソーシャルメディア分析会社の3人の研究者によって行われた。研究のタイトルは「FeelsGoodMan:Twitchの新語の意味を推測する」である。
Bait and Switch
Twitchエモートは、文化的な素材(古いエモートを含む)を頻繁にリサイクルし、感情分析フレームワークを誤った方向に導くことがある。エモートの意味の変化を追跡することで、元の感情や意図の完全な逆転や否定が明らかになることがある。
例えば、研究者は、元々のオルタナ右派による「FeelsGoodMan」ペペ・ザ・フロッグ・メームの誤用は、Twitchでの使用ではほぼ完全に政治的な風味を失ったと指摘している。
このフレーズは、2005年の漫画本の作者マット・フーリーのカートゥーン・フロッグの画像とともに使用され、2010年代には極右のメームとなった。ヴォックスは2017年に、右派によるメームの採用はフーリーの自らのメームからの離脱にもかかわらず存続したと書いているが、サンフランシスコの研究者はそうではないと発見した。
Trouble Downstream
このような「バイト・アンド・スイッチ」のようなメームの一般的な特徴は、すでにメームを「憎悪」、「右翼」、または「国家主義的」と分類しているNLP研究プロジェクトを妨げることがある。後続のNLPプロジェクトは、古いデータの通貨を監査することを選択しない可能性があり、実用的にはそうする方法がない可能性があり、必要性を認識していない可能性もある。
結果として、2017年のTwitchベースのデータセットを使用して「政治的分類」アルゴリズムを開発すると、Twitchでの「FeelsGoodMan」エモートの頻度に基づいて、Twitchには注目すべきオルタナ右派の活動があると推測される。しかし、Twitchがオルタナ右派のインフルエンサーで満ちているかどうかはわからないが、研究者によると、それはカエルによって証明できない。
「ペペ」メームの政治的な重要性は、Twitchの1億4000万人のユーザー(41%が24歳未満)によって、元の泥棒から作品を盗み、独自の色を付けたように思われる。
Method and Data
研究者は、ラベル付けされたTwitchエモートデータが「ほぼ存在しない」と結論付けた。以前の研究では、8万万のエモートがあり、400,000が1週間のTwitch出力に存在していた。
2017年の研究では、Twitchでのエモート予測を扱い、上位30のTwitchエモートのみを予測し、エモート予測で0.39のスコアを達成した。
この不足に対処するために、サンフランシスコの研究者は古いデータに新しいアプローチを取り、トレーニングとテストのために80/20で分割し、従来のマシンラーニング方法を適用した。これらの方法には、Naive Bayes(NB)、Random Forest(RF)、Support Vector Machine(SVM、線形カーネルを使用)、Logistic Regressionが含まれた。
このアプローチは、以前のTwitch感情分析のベースラインを63.8%上回り、研究者がLOOVE(Learning Out Of Vocabulary Emotions)フレームワークを開発することを可能にした。LOOVEは、新しい定義で既存のモデルを「豊富化」できるネオロジズムを識別することができる。

研究者によって開発されたLOOVE(Learning Out Of Vocabulary Emotions)フレームワークのアーキテクチャ
LOOVEは、単語の埋め込みの非監視トレーニングを容易にし、定期的な再トレーニングとファインチューニングにも対応し、エモートのスケールと急速な進化を考慮すると、ラベル付けされたデータセットの必要性を排除する。
プロジェクトのために、研究者はラベル付けされていないTwitchデータセットでエモートの「疑似辞書」をトレーニングし、444,714の単語、エモート、絵文字、顔文字の埋め込みを生成した。
さらに、研究者はVADERレクサコンを絵文字/顔文字レクサコンで拡張し、ECデータセットに加えて、ツイッター、ロッテントマト、サンプルYELPデータセットからの3つの公開データセットを利用して、三値感情分類を行った。
使用された方法とデータセットの多様性により、結果は多様であるが、研究者は、ベストケースのベースラインが前のメトリックよりも7.36ポイント上回ったと主張している。
研究者は、プロジェクトの継続的な価値は、313百万以上のTwitchチャットメッセージでトレーニングされたワード・ツー・ベクター(W2V)埋め込みに基づくLOOVEの開発であると考える。K-Nearest Neighbor(KNN)の助けを借りて。
著者は以下のように結論付ける:
「フレームワークの主な特徴は、未知のエモートの感情を導き出すために使用できるエモート疑似辞書である。エモート疑似辞書を使用して、22,507のエモートの感情表を生成した。これは、この規模でのエモート理解の最初のケースである。」












