Sudut Anderson

Mengidentifikasi Komentator Media Sosial yang Diblokir dengan Mesin Pembelajaran

mm
Tambahkan Unite.AI ke sumber pilihan Anda di Google

Peneliti dari Universitas John Hopkins telah mengembangkan pendekatan Deep Metric untuk mengidentifikasi komentator online yang mungkin telah memiliki akun sebelumnya yang dibekukan, atau mungkin menggunakan beberapa akun untuk astroturf atau memanipulasi kepercayaan komunitas online seperti Reddit dan Twitter.

Pendekatan ini, yang dipresentasikan dalam makalah baru yang dipimpin oleh Peneliti NLP Aleem Khan, tidak memerlukan bahwa data input harus diannotate secara otomatis atau manual, dan meningkatkan hasil dari upaya sebelumnya bahkan ketika hanya sampel teks kecil yang tersedia, dan ketika teks tidak hadir dalam dataset saat pelatihan.

Sistem ini menawarkan skema augmentasi data sederhana, dengan embedding berbagai ukuran yang dilatih pada dataset volume tinggi yang berisi lebih dari 300 juta komentar yang mencakup sejuta akun pengguna yang berbeda.

Arsitektur model sistem identifikasi kembali John Hopkins, di mana komponen penting adalah 1) konten teks, 2) fitur sub-Reddit dan 3) waktu publikasi/tanggal. Sumber: https://arxiv.org/pdf/2105.07263.pdf

Arsitektur model sistem identifikasi kembali John Hopkins, di mana komponen penting adalah 1) konten teks, 2) fitur sub-Reddit dan 3) waktu publikasi/tanggal. Sumber: https://arxiv.org/pdf/2105.07263.pdf

Kerangka kerja ini, yang berbasis pada data penggunaan Reddit, mempertimbangkan konten teks, penempatan sub-Reddit, dan waktu publikasi. Ketiga faktor ini digabungkan dengan metode embedding yang beragam, termasuk konvolusi satu dimensi dan proyeksi linier, dan dibantu oleh mekanisme perhatian dan lapisan max pooling.

Meskipun sistem ini berkonsentrasi pada domain teks, peneliti berpendapat bahwa pendekatannya dapat diterjemahkan ke analisis video atau gambar, karena algoritma yang dihasilkan beroperasi pada frekuensi kejadian pada tingkat tinggi, meskipun dengan berbagai panjang input untuk titik data pelatihan.

Menghindari ‘Topic-Drift’

Perangkap yang penelitian ini dapat jatuh, dan yang penulis telah secara eksplisit alamatkan dalam desain sistem, adalah meletakkan penekanan berlebihan pada kejadian kembali topik atau tema tertentu di seluruh postingan dari akun yang berbeda.

Meskipun pengguna mungkin menulis berulang atau iteratif dalam strand pemikiran tertentu, topik tersebut kemungkinan akan berkembang dan ‘mengalir’ seiring waktu, melemahkan nilainya sebagai kunci identitas. Penulis menggambarkan perangkap potensial ini sebagai ‘benar karena alasan yang salah’ – sebuah jebakan yang sebelumnya dipelajari di John Hopkins.

Metodologi Pelatihan

Sistem ini menggunakan pelatihan presisi campuran, sebuah inovasi yang dipresentasikan pada 2018 oleh Baidu dan NVIDIA (NVDA ), yang memotong kebutuhan memori menjadi setengah dengan menggunakan float presisi setengah: nilai titik mengambang 16-bit sebagai gantinya nilai 32-bit. Data ini dilatih pada dua V100 GPU, dengan waktu pelatihan rata-rata sekitar 72 jam.

Skema ini menggunakan pengkodean teks sederhana, dengan encoder konvolusi yang terbatas pada 2-4 subkata. Meskipun panjang rata-rata untuk kerangka kerja ini adalah maksimal lima subkata, peneliti menemukan bahwa ekonomi ini tidak hanya tidak memiliki dampak pada kinerja peringkat, tetapi bahwa meningkatkan subkata menjadi maksimal lima sebenarnya merusak akurasi peringkat.

Dataset

Peneliti menghasilkan dataset 300 juta posting Reddit dari dataset Pushshift Reddit Corpus 2020, yang disebut Million User Dataset (MUD).

Dataset ini terdiri dari semua posting oleh penulis Reddit yang menerbitkan 100-1000 posting antara Juli 2015 dan Juni 2016. Pengambilan sampel sepanjang waktu dengan cara ini menyediakan panjang sejarah yang memadai untuk studi ini, dan menurunkan dampak posting spam sporadis yang tidak dalam cakupan tujuan penelitian.

Statistik pada dataset yang dihasilkan untuk proyek identifikasi kembali John Hopkins.

Statistik pada dataset yang dihasilkan untuk proyek identifikasi kembali John Hopkins.

Hasil

Gambar di bawah menunjukkan perbaikan kumulatif hasil ketika akurasi peringkat diuji pada interval satu jam selama pelatihan. Setelah enam jam, sistem ini mengungguli pencapaian baseline dari inisiatif sebelumnya yang terkait.

Dalam studi ablasion, peneliti menemukan bahwa menghapus fitur sub-Reddit dari alur kerja memiliki dampak yang mengejutkan sedikit pada akurasi peringkat, menunjukkan bahwa sistem ini generalisasi sangat efektif, dengan alat fitur yang kuat.

Frekuensi Posting sebagai Tanda Identifikasi Kembali

Hal ini juga menunjukkan bahwa kerangka kerja ini sangat dapat dipindahkan ke sistem komentar atau penerbitan lain di mana hanya konten teks dan tanggal/waktu publikasi yang tersedia – dan, pada dasarnya, bahwa frekuensi temporal posting itu sendiri merupakan indikator kolateral yang berharga untuk konten teks yang sebenarnya.

Peneliti mencatat bahwa mencoba melakukan estimasi yang sama dalam konten sub-Reddit tunggal menimbulkan tantangan yang lebih besar, karena sub-Reddit itu sendiri berfungsi sebagai proksi topik, dan skema tambahan akan diperlukan untuk memenuhi peran ini.

Studi ini tetap dapat mencapai hasil yang menjanjikan dalam batasan ini, dengan satu catatan bahwa sistem ini bekerja lebih baik pada volume tinggi, dan mungkin memiliki kesulitan yang lebih besar dalam mengidentifikasi kembali pengguna di mana volume posting rendah.

Mengembangkan Karya

Berbeda dengan banyak inisiatif pembelajaran terawasi, fitur dalam skema identifikasi kembali Hopkins ini diskrit dan cukup kuat sehingga kinerja sistem ini meningkat secara signifikan ketika volume data meningkat.

Peneliti mengekspresikan minat untuk mengembangkan sistem ini dengan mengadopsi pendekatan yang lebih granular untuk analisis waktu publikasi, karena jadwal yang sering dapat diprediksi dari spamer otomatik (atau lainnya) rentan terhadap identifikasi dengan pendekatan seperti itu, dan ini akan memungkinkan untuk lebih efektif menghilangkan konten robot dari studi yang utamanya ditujukan pada pengguna yang menjengkelkan, atau untuk membantu mengidentifikasi konten otomatis.

Penulis tentang pembelajaran mesin, spesialis domain sintesis gambar manusia. Mantan kepala konten penelitian di Metaphysic.ai, hingga pembubarannya ke dalam Brahma.ai DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai