Погляд Anderson
Реідентифікація заборонених коментаторів у соціальних мережах за допомогою машинного навчання

Дослідники з університету Джонса Хопкінса розробили підхід Deep Metric для ідентифікації онлайн-коментаторів, які раніше мали заборонені облікові записи або використовували кілька облікових записів для астротурфінгу чи іншого маніпулювання добросовісними онлайн-спільнотами, такими як Reddit і Twitter.
Цей підхід, представлений у новій роботі під керівництвом дослідника NLP Aleem Khan, не вимагає автоматичної або ручної анотації вхідних даних і покращує результати попередніх спроб навіть у випадках, коли доступні лише невеликі вибірки тексту, і коли текст не був присутній у наборі даних під час навчання.
Система пропонує просту схему збільшення даних, з вкладеннями різного розміру, навченими на високовOLUME наборі даних, що містить понад 300 мільйонів коментарів, покриваючи мільйон різних облікових записів користувачів.

Архітектура моделі системи реідентифікації Джонса Хопкінса, де основними компонентами є 1) текстовий вміст, 2) функція суб-Reddit і 3) час публікації/дата. Джерело: https://arxiv.org/pdf/2105.07263.pdf
Фреймворк, заснований на даних використання Reddit, розглядає текстовий вміст, розміщення суб-Reddit і час публікації. Три фактори поєднуються з різними методами вкладення, включаючи одновимірні конволюції та лінійні проекції, і підтримуються механізмом уваги та шаром максимального пулінгу.
Хоча система зосереджена на текстовому домені, дослідники стверджують, що її підхід можна застосувати до аналізу відео чи зображень, оскільки виведений алгоритм працює з частотними випадками на високому рівні, незважаючи на різноманітність довжин вхідних даних для навчальних даних.
Уникнення ‘дрифту теми’
Одна з пасток, у яку може потрапити дослідження цього типу, і яку автори виразно розглянули при розробці системи, полягає у надмірному акценті на повторенні певних тем або мотивів у постах з різних облікових записів.
Хоча користувач може дійсно писати повторно або ітеративно в певній нитці думок, тема ймовірно еволюціонує і “дрифтує” з часом, знижуючи її цінність як ключ до ідентичності. Автори характеризують цю потенційну пастку як “бути правим за неправильними причинами” – пастку, яку раніше вивчали в університеті Джонса Хопкінса.
Методологія навчання
Система використовує мікс-прецизійне навчання, інновацію, представлену у 2018 році компаніями Baidu і NVIDIA (NVDA ), яка зменшує вимоги до пам’яті вдвічі шляхом використання півточкових дробів: 16-розрядних дробових значень замість 32-розрядних значень. Дані були навчені на двох V100 GPU, з середнім часом навчання 72 години.
Схема використовує спрощене текстове кодування, з конволюційними кодувальниками, обмеженими 2-4 субсловами. Хоча середня довжина для фреймворків цього типу становить максимум п’ять субслів, дослідники виявили, що ця економія не тільки не мала жодного впливу на продуктивність ранжування, але й що збільшення субслів до максимальної кількості п’яти фактично погіршувало точність ранжування.
Набір даних
Дослідники вивели набір даних з 300 мільйонів постів Reddit з набору даних Pushshift Reddit Corpus 2020 року, званого Набором даних мільйона користувачів (MUD).
Набір даних складається з усіх постів авторів Reddit, які опублікували 100-1000 постів між липня 2015 року і червня 2016 року. Вибірка даних за часом забезпечує достатню довжину історії для дослідження і знижує вплив спорадичних спам-постів, які не входять у сферу інтересів дослідження.

Статистика виведеного набору даних для проекту реідентифікації Джонса Хопкінса.
Результати
Нижче показано накопичення покращення результатів під час тестування точності ранжування з інтервалом у один годину під час навчання. Після шести годин система перевершує базові досягнення попередніх ініціатив.

У дослідженні видалення дослідники виявили, що видалення функції суб-Reddit з робочого процесу мало несподівано мало впливу на точність ранжування, що свідчить про те, що система загалом дуже ефективно узагальнює, з міцним інструментарієм функцій.
Частота публікації як сигнатура реідентифікації
Це також вказує на те, що фреймворк дуже добре переноситься на інші системи коментування чи публікації, де доступний лише текстовий вміст і час/дата публікації – і, по суті, що тимчасова частота публікації сама по собі є цінним додатковим індикатором до фактичного текстового вмісту.
Дослідники відзначають, що спроба виконати таку ж оцінку всередині вмісту одного суб-Reddit становить більшу складність, оскільки сам суб-Reddit служить проксі-темою, і додаткова схема, ймовірно, буде потрібна для виконання цієї ролі.
Дослідження все ж таки змогло досягти перспективних результатів у цих обмеженнях, з єдиною застереженням, що система працює краще при високих об’ємах і може мати підвищену складність у реідентифікації користувачів, де об’єм публікацій низький.
Розробка роботи
На відміну від багатьох ініціатив навчання з учителем, функції у схемі реідентифікації Хопкінса є дискретними і досить міцними, щоб продуктивність системи значно покращувалася при збільшенні обсягу даних.
Дослідники висловлюють інтерес до розвитку системи шляхом прийняття більш детального підходу до аналізу часу публікації, оскільки часто передбачувані графіки спамерів (автоматизованих чи ні) сприйнятливі до ідентифікації таким підходом, і це дозволить або більш ефективно усунути роботизований вміст з дослідження, спрямованого в основному на докучливих користувачів, або допомогти в ідентифікації автоматизованого вмісту, оскільки часто передбачувані графіки спамерів (автоматизованих чи ні) сприйнятливі до ідентифікації таким підходом, і це дозволить або більш ефективно усунути роботизований вміст з дослідження, спрямованого в основному на докучливих користувачів, або допомогти в ідентифікації автоматизованого вмісту на часи, оскільки часто передбачувані графіки спамерів (автоматизованих чи ні) сприйнятливі до ідентифікації таким підходом, і це дозволить або більш ефективно усунути роботизований вміст з дослідження, спрямованого в основному на докучливих користувачів, або допомогти в ідентифікації автоматизованого вмісту.












