Andersonの視点

マシンラーニングを用いた禁止されたソーシャルメディアコメントの再同定

mm
Unite.AI を Google の優先ソースに追加

ジョンズ・ホプキンス大学の研究者は、以前のアカウントが停止された可能性のあるオンラインコメント投稿者を同定するためのディープメトリックアプローチを開発しました。このアプローチは、NLP研究者Aleem Khanが主導する新しい論文で発表されました。

このアプローチでは、入力データを自動的に注釈付けたり手動で注釈付けたりする必要はなく、以前の試みの結果を上回ります。さらに、テキストが少量しか利用できない場合や、テキストがトレーニング時のデータセットに存在しない場合でも効果的です。

システムは、300万件以上のコメントを含む大規模なデータセットでトレーニングされた、異なるサイズの埋め込みを使用するためのシンプルなデータ増強スキーマを提供します。

ジョンズ・ホプキンス大学の再同定システムのモデルアーキテクチャ

ジョンズ・ホプキンス大学の再同定システムのモデルアーキテクチャ

フレームワークは、Redditの使用データに基づいて、テキストコンテンツ、サブレディットの配置、公開時間を考慮します。これらの3つの要素は、1次元の畳み込みと線形投影を含むさまざまな埋め込み方法で組み合わせられ、注意メカニズムとマックスプーリング層で支援されます。

システムはテキストドメインに焦点を当てていますが、研究者は、アルゴリズムが高レベルの頻度発生に基づいているため、映像や画像の分析に応用できる可能性があると主張しています。

トピックドリフトの回避

このような研究が陥りがちな落とし穴の1つは、異なるアカウントからの投稿間で特定のトピックまたはテーマの再発生に過度の重きを置くことです。ユーザーは確かに繰り返しまたは反復的に特定の考え方で書くかもしれませんが、トピックは時間の経過とともに進化し、変化する可能性があり、そのためアイデンティティの鍵としての価値が低下します。著者は、この潜在的な落とし穴を「間違った理由で正しい」と表現しています。

トレーニング方法

システムは、2018年にBaiduとNVIDIA (NVDA ) によって提案された混合精度トレーニングを使用します。これにより、16ビット浮動小数点値を使用することで、メモリ要件が半分になります。データは2つのV100 GPUでトレーニングされ、平均トレーニング時間は72時間でした。

スキーマでは、簡素化されたテキストエンコーディングが使用され、畳み込みエンコーダは2〜4サブワードに制限されます。通常、このようなフレームワークの平均サブワード数は5ですが、研究者は、この簡素化がランキングパフォーマンスに影響を与えず、実際にはサブワード数を5に増やすとランキング精度が低下することを発見しました。

データセット

研究者は、2020年のPushshift Reddit Corpusデータセットから、300万件のReddit投稿を含むデータセットを導出しました。このデータセットは、100〜1000件の投稿を行ったユーザーの投稿を収集し、2015年7月から2016年6月までの間に投稿されたものです。

ジョンズ・ホプキンス大学の再同定プロジェクトの導出データセットの統計

ジョンズ・ホプキンス大学の再同定プロジェクトの導出データセットの統計

結果

以下の画像は、ランキング精度が1時間間隔でテストされたときの累積改善を示しています。6時間後、システムは関連する以前の取り組みのベースライン成果を上回りました。

削除研究では、研究者は、サブレディット機能をワークフローから削除してもランキング精度にほとんど影響がないことを発見しました。これは、システムが非常に効果的に一般化できることを示唆しています。

投稿頻度を再同定シグネチャとして

これは、テキストコンテンツと公開日時のみが利用できる他のコメントまたは公開システムにフレームワークを転用できることを示唆しています。投稿頻度は、実際のテキストコンテンツに加えて、有用な補助的な指標となります。

研究者は、単一のサブレディット内の同じ推定を実行することは、サブレディット自体がトピックプロキシとして機能するため、より大きな課題となることを指摘しています。追加のスキーマが必要になる可能性があります。

研究の発展

この研究は、ほとんどの監督付き学習イニシアチブとは異なり、ディスクリートでロバストな特徴を使用しているため、データのボリュームが増加するにつれてシステムのパフォーマンスが著しく向上します。

研究者は、公開時間の分析に更に細かいアプローチを採用することで、システムを発展させることに興味があります。ロボットスパマー(自動またはその他)の予測可能なスケジュールは、このアプローチによって同定可能であり、悪意のあるユーザーを対象とした研究からロボットコンテンツをより効果的に除去したり、自動コンテンツを同定するのを支援したりできるようになります。

機械学習のライターであり、ヒューマンイメージシンセシスのドメインスペシャリスト。Metaphysic.aiの研究コンテンツ責任者を務めていたが、DNEGのBrahma.aiへの統合により解散した。
Portfolio site: martinanderson.ai
Contact:martin@martinanderson.ai