Взгляд Anderson

Определение Crowdturfers в Instagram с помощью машинного обучения

mm
Добавьте Unite.AI в избранные источники в Google

Исследователи в Италии и Иране утверждают, что разработали первую систему машинного обучения, способную распознавать “crowdturfing” (подделку лайков и комментариев) на платформе Instagram. Crowdturfers – это реальные люди, которые выполняют услуги по “строительству профиля” для платформ, которые продают такие услуги оптом.

Новый метод утверждает, что точность системы составляет около 95%, и использует полуавтоматическое обучение в системах обработки естественного языка (NLP).

Авторы утверждают, что, насколько им известно, их система представляет собой первую систему обнаружения crowdturfing, которая может надежно обнаруживать неавтоматические аккаунты, занимающиеся фальшивым, платным взаимодействием и накруткой.

Чтобы добиться этого, авторы купили 1293 профиля crowdturfing у 11 поставщиков crowdturfing, чтобы получить данные для обучения своей системы. Поскольку Instagram имеет эффективные меры против ботов, исследователи отмечают, что те, кто стремится использовать огромную базу пользователей платформы для коммерческих целей, обратились к оплате настоящих инфлюенсеров для “стратегического взаимодействия” с “клиентскими” аккаунтами, в основном путем обмена комментариями или через активность, связанную с комментариями к постам.

После обучения модели авторы запустили ее для анализа профилей взаимодействия 20 “мега-инфлюенсеров”, каждый из которых имеет более 1 миллиона подписчиков, и пришли к выводу, что “более 20% их взаимодействия было искусственным”.

Статья называется “Мы все в шоу Трумана? Обнаружение crowdturfing в Instagram через самообучение” и написана пятью исследователями из Университета Падуи в Италии и Университета Имама Резы в Иране.

Нарушение условий использования Instagram

В отличие от Twitter, который пользуется популярностью среди исследователей социальных сетей благодаря своей приверженности помощи в исследованиях, Instagram не только не предоставляет API или обновленные дампы данных, чтобы помочь исследователям, но и запрещает машинное просмотр в своих Условиях использования. Поэтому первая задача исследователей была получить освобождение от своего руководящего Институционального рецензирующего совета, обоснованного предыдущими работами, которые использовали подобный подход для изучения “подпольной деятельности”.

Услуги crowdturfing были куплены для новых аккаунтов Instagram, созданных исследователями для своих целей, все из которых были удалены после эксперимента, исключая участие “законных” пользователей. Ни аккаунты инфлюенсеров, изучаемые, ни услуги платформ crowdturfing не названы.

Еще одной этической проблемой было то, что исследователи не могли запросить согласие инфлюенсеров, изучаемых, из-за эффекта Хоторна (т.е. это могло изменить поведение инфлюенсеров), и это освобождение также было предоставлено IRB.

Наконец, поскольку Instagram позволяет “мануальное сбора” данных, исследователи нашли компромисс в нарушении условий использования, установив свои автоматические инструменты сбора данных на “человеческую скорость”, что потребовало фазы сбора данных в течение пяти месяцев.

Люди на продажу

Исследователи купили 100 “фальшивых подписчиков” у каждого из 11 (безымянных) поставщиков.

Статья гласит*:

‘Все поставщики, которых мы выбрали, гарантируют доставку подписчиков, которые взаимодействуют с целевыми профилями, лайкая и комментируя их посты, чтобы повысить их уровень взаимодействия.

‘Эти профили crowdturfing идентифицируются как высококачественные подписчики и обычно стоят дороже, чем “базовые” фальшивые профили. Надежность этих поставщиков подтверждается известными [отзывными] платформами, такими как TrustPilot.’

Из статьи, статистика по (анонимным) поставщикам crowdturfing, каждая из которых является рынком для 'коррумпированных' реальных аккаунтов инфлюенсеров. Эта таблица содержит информацию, сообщаемую поставщиками и полученную исследователями в результате анализа 100 профилей, купленных у каждого источника. Источник: https://arxiv.org/pdf/2206.12904.pdf

Из статьи, статистика по (анонимным) поставщикам crowdturfing, каждая из которых является рынком для ‘коррумпированных’ реальных аккаунтов инфлюенсеров. Источник: https://arxiv.org/pdf/2206.12904.pdf

Средняя стоимость покупки инфлюенсера в Instagram, отмечают авторы, не очень высока, примерно 3 доллара за 100 “высококачественных” подписчиков. Авторы отмечают:

‘Большинство поставщиков доставляют подписчиков в течение нескольких часов. Они предлагают защиту от потери, что означает, что количество подписчиков, купленных клиентом, либо останется стабильным во времени, либо новые подписчики будут доставлены для возмещения потерянных.’

Исследователи сообщают, что некоторые из их новых аккаунтов Instagram потеряли 15-20% подписчиков crowdturfing после месяца, но в некоторых случаях они получили больше, чем ожидали. Для самого дорогого поставщика crowdturfing (CT-10, в таблице выше) было потеряно только три подписчика после месяца.

Статья отмечает, что соотношение подписчиков и подписок становится более “аутентичным”, чем больше вы платите поставщику crowdturfing, с вторым по дороговизне поставщиком, предлагающим соотношение, очень близкое к базовому пользователю.

Одной из характеристик аккаунта crowdturfing в Instagram является то, что его профиль редко устанавливается в “частный” режим (этот факт позволил извлечь данные из купленных фальшивых подписчиков, поскольку большинство анализов были сосредоточены на профилях и связанных комментариях), хотя это не должно рассматриваться как надежный “сигнал” в этом отношении.

‘Люди, присоединяющиеся к этим платформам, заинтересованы в генерации минимального количества постов, которые делают их надежными, за исключением нескольких случаев (CT-4, CT-10). Профили низкого качества показывают очень высокий дисбаланс в подписчиках и подписках, и среднее количество постов близко к 0, намного ниже, чем у профилей crowdturfing.’

Данные

Исследователи собрали данные через реализацию фреймворка браузер-автоматизации Selenium. Результатом является набор данных, включающий информацию о профилях из 1293 аккаунтов crowdturfing и 1307 не-crowdturfing пользователей.

Эта, признанная исследователями, низкая величина выборки сделала возможным установку Selenium на “человеческую скорость” в течение разумного периода времени. Кроме того, авторы отмечают, что представительная/интерпретативная сила полуавтоматических методов обучения хорошо подходит для небольших наборов данных. После экспериментов с полностью контролируемой моделью исследователи приходят к выводу:

‘Результаты в полуавтоматическом режиме не отличаются существенно от результатов в полностью контролируемом режиме. Это говорит о том, что профили crowdturfing имеют очень похожие характеристики, и что алгоритм может сходиться через небольшое количество размеченных данных.’

Авторы собрали все доступные данные из исходного кода страниц профилей “компрометированных” пользователей, включая детали, обычно скрытые при отображении, такие как элемент #videos.

Затем они предварительно обработали данные, удалив признаки с нулевой или низкой дисперсией, и, наконец, преобразовали любые категориальные или нечисловые данные в строго числовые или булевые признаки.

Характеристики окончательного набора данных.

Характеристики окончательного набора данных.

Метод и исследования

Помимо Selenium, технологии, использованные в экспериментах, включают: версию SpaCy, реализованную с помощью трансформерного конвейера; классификатор самообучения из scikit learn; и фреймворк Instaloader.

В новой статье нет обычной секции “результаты”, поскольку она занимается целью (т.е. автоматическим выводом коррумпированных аккаунтов Instagram), которая отклоняется от центральной области интереса на сегодняшний день (т.е. автоматическим выводом автоматических ботов на Instagram), что означает, что нет прямого предыдущего исследования, с которым можно сравнить ее.

Исследователи применили широкий спектр методов к доступным пользователям, купленным (которых они чувствуют себя комфортно, описывая как “фальшивых”, а не просто “не-crowdturfing”, поскольку эти настоящие аккаунты занимаются неорганическим, платным взаимодействием), на различных связанных с NLP технологиях.

Среди изучаемых аспектов были анализ языка (который в мире crowdturfing почти всегда переходит на английский язык, хотя платформы crowdturfing также предлагают геолокализованных неанглоязычных подписчиков); подсчет комментариев (где фальшивые пользователи очень близко придерживаются частоты реальных пользователей, опасаясь обнаружения); и анализ общих слов:

Облака слов от фальшивых и реальных пользователей.

Облака слов от фальшивых и реальных пользователей.

Статья отмечает, что распространенность слова “доктор” (см. изображение выше) в фальшивых аккаунтах, кажется, связана с конкретной внутренней кампанией:

‘“Доктор” [появился] в 1069 отдельных комментариях. Изучая дальше аккаунты, спамящие это слово, мы обнаружили небольшую часть того, что, кажется, является ботнетом, целью которого является спам “аккаунтов врачей Instagram”. Все эти профили врачей имеют ссылку WhatsApp Business, которая, при нажатии, начинает чат с сообщением для завершения.’

Насколько исследователи могут судить, это странное артефакт может быть остатком большого ботнета, с которым они столкнулись, ища активность реальных пользователей Instagram.

Всего исследователи собрали 603 007 комментариев из постов у 248 388 уникальных пользователей Instagram, из которых, по оценкам авторов, 55 719 были аккаунтами crowdturfing.

Статья отмечает с интересом доминирование женских тем в собранных данных. Используя GPU-PDMM (технику, разработанную для обязательного короткого поста в Twitter) для извлечения 12 830 подходящих комментариев из доступного корпуса 121 822 комментариев, алгоритм обнаружил, что, рассматривая контент от 12 мужчин и 8 женщин, большинство комментариев связано с женскими темами.

Топ-10 тем, извлеченных из фальшивых комментариев в одном из экспериментов исследователей.

Топ-10 тем, извлеченных из фальшивых комментариев в одном из экспериментов исследователей.

Исследователи приходят к выводу:

‘[Хотя] Instagram и исследовательское сообщество сосредоточились на обнаружении ботов и автоматических аккаунтов, мы считаем, что должны быть проведены больше исследований на тему crowdturfing, которое негативно влияет на маркетинг инфлюенсеров, платформу Instagram и большинство ее пользователей.’

* URL TrustPilot, процитированный исследователями, опущен.

Опубликовано впервые 28 июня 2022 года.

Писатель о машинном обучении, специалист в области синтеза человеческого изображения. Бывший руководитель исследовательского контента в Metaphysic.ai, до его распада в DNEG's Brahma.ai.
Портфолио: martinanderson.ai
Контакт: martin@martinanderson.ai