Взгляд Anderson

Переидентификация забаненных комментаторов социальных сетей с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи из Университета Джонса Хопкинса разработали подход на основе глубоких метрик для идентификации онлайн-комментаторов, которые могут иметь предыдущие заблокированные аккаунты или использовать несколько аккаунтов для астротурфинга или манипулирования добросовестностью онлайн-сообществ, таких как Reddit и Twitter.

Подход, представленный в новой статье, возглавляемой исследователем NLP Aleem Khan, не требует, чтобы входные данные были автоматически или вручную аннотированы, и улучшает результаты предыдущих попыток даже в случаях, когда доступны только небольшие образцы текста, и когда текст не присутствовал в наборе данных во время обучения.

Система предлагает простую схему aumentации данных, с вложениями разного размера, обученными на высокообъемном наборе данных, содержащем более 300 миллионов комментариев, охватывающих миллион разных учетных записей пользователей.

Архитектура модели системы реидентификации Джонса Хопкинса, где основными компонентами являются 1) текстовый контент, 2) функция sub-Reddit и 3) время/дата публикации. Источник: https://arxiv.org/pdf/2105.07263.pdf

Архитектура модели системы реидентификации Джонса Хопкинса, где основными компонентами являются 1) текстовый контент, 2) функция sub-Reddit и 3) время/дата публикации. Источник: https://arxiv.org/pdf/2105.07263.pdf

Фреймворк, основанный на данных Reddit, учитывает текстовый контент, размещение sub-Reddit и время публикации. Три фактора объединены с различными методами вложения, включая одномерные свертки и линейные проекции, и помогают механизму внимания и слою максимального пулинга.

Хотя система концентрируется на текстовом домене, исследователи утверждают, что ее подход можно перевести на анализ видео или изображений, поскольку полученный алгоритм работает с частотными вхождениями на высоком уровне, несмотря на разнообразие входных длин для точек обучения.

Избежание ‘дрифта темы’

Одна из ловушек, в которую может попасть исследование этого типа, и которую авторы специально рассмотрели при разработке системы, заключается в том, чтобы поставить чрезмерный акцент на повторении определенных тем или мотивов в постах из разных аккаунтов.

Хотя пользователь может действительно писать повторно или итеративно в определенной теме, тема, скорее всего, будет эволюционировать и «дрифтовать» со временем, снижая свою ценность как ключ к идентичности. Авторы характеризуют эту потенциальную ловушку как «быть правым по неправильным причинам» – ловушку, ранее изученную в Университете Джонса Хопкинса.

Методология обучения

Система использует обучение с смешанной точностью, инновацию, представленную в 2018 году компаниями Baidu и NVIDIA (NVDA ), которая снижает требования к памяти вдвое, используя полупточные числа с плавающей запятой: 16-разрядные числа с плавающей запятой вместо 32-разрядных значений. Данные были обучены на двух V100 GPU, со средним временем обучения 72 часа.

Схема использует упрощенную текстовую кодировку, с свертками, ограниченными 2-4 субсловами. Хотя средняя длина для фреймворков этого типа составляет максимум пять субслов, исследователи обнаружили, что эта экономия не только не повлияла на производительность рейтинга, но и что увеличение субслов до максимума пяти фактически снизило точность рейтинга.

Набор данных

Исследователи получили набор данных из 300 миллионов постов Reddit из набора данных Pushshift Reddit Corpus 2020 года, называемый Набором данных миллиона пользователей (MUD).

Набор данных состоит из всех постов авторов Reddit, которые опубликовали 100-1000 постов между июлем 2015 года и июнем 2016 года. Выборка во времени таким образом обеспечивает достаточную длину истории для исследования и снижает влияние спорадических спам-постов, которые не входят в сферу интересов исследования.

Статистика полученного набора данных для проекта реидентификации Джонса Хопкинса.

Статистика полученного набора данных для проекта реидентификации Джонса Хопкинса.

Результаты

Ниже показано кумулятивное улучшение результатов при тестировании точности рейтинга на интервалах в один час во время обучения. После шести часов система превосходит базовые достижения связанных предыдущих инициатив.

В исследовании удаления исследователи обнаружили, что удаление функции sub-Reddit из рабочего процесса имело удивительно мало влияния на точность рейтинга, что говорит о том, что система обобщается очень эффективно, с прочным инструментарием функций.

Частота публикации в качестве сигнатуры реидентификации

Это также указывает на то, что фреймворк высоко переносим на другие системы комментирования или публикации, где доступны только текстовый контент и дата/время публикации – и, по сути, что временная частота публикации сама по себе является ценной сопутствующей индикатором фактического текстового контента.

Исследователи отмечают, что попытка выполнить ту же оценку в рамках одного sub-Reddit представляет собой более значительную задачу, поскольку сам sub-Reddit служит прокси-темой, и, вероятно, потребуется дополнительная схема для выполнения этой роли.

Исследование, тем не менее, смогло достичь перспективных результатов в рамках этих ограничений, с единственной оговоркой, что система работает лучше при высоких объемах и может иметь повышенную сложность при реидентификации пользователей, где объем публикаций низок.

Разработка работы

В отличие от многих инициатив обучения с учителем, функции в схеме реидентификации Хопкинса являются дискретными и прочными enough, что производительность системы улучшается заметно по мере увеличения объема данных.

Исследователи выражают интерес к развитию системы, принимая более детальный подход к анализу времени публикации, поскольку часто предсказуемые графики спамеров (автоматизированных или нет) подвержены идентификации таким подходом, и это сделало бы возможным либо более эффективно исключить роботизированный контент из исследования, в первую очередь направленного на досаждение пользователям, либо помочь в выявлении автоматизированного контента.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai