Погляд Anderson

Визначення Crowdturfers Instagram за допомогою машинного навчання

mm
Додайте Unite.AI до бажаних джерел у Google

Дослідники в Італії та Ірані стверджують, що створили першу систему машинного навчання, здатну розпізнавати діяльність “crowdturfing” (людей, а не автоматизованих облікових записів інфлюенсерів) на платформі Instagram. Crowdturfers – це реальні люди, які виконують послуги “будування профілю” для платформ, які продають таку діяльність оптом.

Нова методика стверджує про точність близько 95% і використовує напівнагляді навчання в системах обробки природної мови (NLP).

Автори стверджують, що, на їхню думку, їхня система представляє першу систему виявлення crowdturfing (CT), яка може надійно визначати облікові записи, які не є ботами і займаються фальшивим, платним підвищенням рейтингу профілю.

Для цього автори придбали 1293 профілі crowdturfing у 11 постачальників платформ CT, щоб отримати дані для навчання свого детектора CT. Оскільки в Instagram є ефективні засоби боротьби з ботами, дослідники відзначають, що ті, хто хоче використати величезну базу користувачів платформи для комерційних цілей, звернулися до платних інфлюенсерів для “стратегічного взаємодії” з “клієнтськими” обліковими записами, в основному шляхом коментарів або діяльності, пов’язаної з коментарями до публікацій.

Після навчання моделі автори випустили її для аналізу профілів взаємодії 20 “мега-інфлюенсерів”, кожний з яких мав понад 1 мільйон підписників, і дійшли висновку, що “більше 20% їхньої взаємодії було штучним”.

Документ документ називається “Чи всі ми в шоу Трумена? Виявлення Crowdturfing в Instagram через самонавчання” і походить від п’яти дослідників університету Падуї в Італії та університету Імама Рези в Ірані.

Перебор правила Instagram

На відміну від Twitter, який користується популярністю серед дослідників соціальних медіа через свою допомогу в дослідженнях, Instagram не тільки не надає API або оновлених дампів даних для допомоги дослідникам, але й забороняє машинне просування в своїх Умовах обслуговування. Тому першим завданням дослідників було отримання винятку від їхнього керівного Інституційного оглядового борду, виправданого попередніми працями, які використовували подібний підхід для дослідження “підземної діяльності”.

Послуги crowdturfing були придбані для нових облікових записів Instagram, створених дослідниками для своїх цілей, всі з яких були видалені після експерименту, що виключило участь “легітимних” користувачів. Не були названі облікові записи інфлюенсерів, які були вивчені, а також послуги платформ CT.

Іншим етичним бар’єром було те, що дослідники не могли запросити згоду інфлюенсерів, яких вивчали, через ефект Готорна (тобто це могло змінити поведінку інфлюенсерів), і ця виняток також була надана ІРБ.

Нарешті, оскільки Instagram дозволяє “ручного збору” даних, дослідники знайшли компроміс щодо порушення своїх умов обслуговування, встановивши свої автоматизовані інструменти збору даних на “людську швидкість”, що потребувало фази збору даних протягом п’яти місяців.

Люди на продаж

Дослідники придбали 100 “фальшивих підписників” у кожної з 11 (безіменних) постачальників.

Документ зазначає*:

‘Всі постачальники, яких ми обрали, гарантували доставку підписників, які взаємодіють з цільовими профілями, лайкаючи та коментуючи їхні публікації для підвищення їхнього рейтингу.

‘Ці профілі CT ідентифікуються як високоякісні підписники та зазвичай коштують більше, ніж “базові” фальшиві профілі. Надійність цих постачальників підтверджується відомими [оглядами] платформами, такими як TrustPilot.’

З документа, статистика про (анонімних) постачальників платформ CT, кожна з яких є ринком для «зіпсованих» реальних облікових записів інфлюенсерів. Ця таблиця містить інформацію, заявлену постачальниками та отриману дослідниками через аналіз 100 профілів, придбаних з кожного джерела. Джерело: https://arxiv.org/pdf/2206.12904.pdf

З документа, статистика про (анонімних) постачальників платформ CT, кожна з яких є ринком для «зіпсованих» реальних облікових записів інфлюенсерів. Ця таблиця містить інформацію, заявлену постачальниками та отриману дослідниками через аналіз 100 профілів, придбаних з кожного джерела. Джерело: https://arxiv.org/pdf/2206.12904.pdf

Середня вартість придбання інфлюенсера в Instagram, як зазначається в документі, не дуже висока, близько 3 доларів за 100 “високоякісних” підписників. Автори зазначають:

‘Більшість постачальників доставляють підписників протягом декількох годин. Вони пропонують захист від втрат, тобто кількість підписників, яку клієнт придбав, або залишається стабільною з часом, або нові підписники доставляються для відновлення втрачених.’

Дослідники повідомляють, що деякі з їхніх нових облікових записів Instagram втратили 15-20% підписників CT після одного місяця, але в деяких випадках вони отримали більше, ніж очікували. Для найбільш дорогого постачальника CT (CT-10, у таблиці вище) було втрачено тільки три підписники після одного місяця.

Документ зазначає, що співвідношення підписників/підписок стає більш “автентичним”, чим більше ви платите постачальнику CT, причому другий за вартістю постачальник пропонує співвідношення, яке дуже близьке до базового рівня стандартного користувача.

Однією з характеристик облікового запису CT є те, що його профіль рідко встановлюється на “приватний” (це дозволило витягнути дані з придбаних фальшивих підписників, оскільки більшість аналізів центрувалися на профілях та пов’язаних коментарях), хоча це не повинно розглядатися як надійний “сигнал” в цьому відношенні.

‘Люди, які вступають до цих платформ, цікавляться створенням мінімальної кількості публікацій, які роблять їх надійними, крім кількох випадків (CT-4, CT-10). Низькоякісні профілі показують дуже високу дисбаланс підписників та підписок, а середня кількість публікацій близька до 0, що значно нижче, ніж у профілів CT.’

Дані

Дослідники зібрали дані через реалізацію браузер-автоматизуючого фреймворка Selenium. Результируючий набір даних включає інформацію про профіль з 1293 облікових записів CT та 1307 не-CT користувачів.

Це, безумовно, низька кількість вибірки, що зробило можливим встановлення Selenium на “людську швидкість” протягом раціонального періоду часу. Крім того, автори зазначають, що представницька/інтерпретативна сила напівнагляді навчання технік добре підходить для менших наборів даних. Провівши експеримент, для ретельності, з повністю нагляді моделлю, дослідники дійшли висновку:

‘Результати в напівнагляді режимі не відрізняються суттєво від тих, які були б у повністю нагляді режимі. Це свідчить про те, що профілі CT мають дуже схожі характеристики, і що алгоритм може збігатися через невелику кількість позначених даних.’

Автори зібрали всі доступні дані з вихідного коду сторінок профілів “компрометованих” користувачів, включаючи деталі, які зазвичай приховані при відображенні, такі як елемент #відео.

Потім вони попередньо обробили дані ознак, видаливши ті, які мали нульову або низьку дисперсію, і, нарешті, перетворили будь-які категорійні або нечислові дані на строго числові або булеві ознаки.

Характеристики остаточного набору даних.

Характеристики остаточного набору даних.

Метод і дослідження

Крім Selenium, технології, використані в експериментах, включають: версію SpaCy, реалізовану з трансформаторним потоком; класифікатор самонавчання scikit learn self-training classifier; і фреймворк Instaloader.

У новому документі немає звичайного розділу “результати”, оскільки він займається об’єктом (тобто автоматичним висновком корумпованих облікових записів Instagram), який відхиляється від центральної точки інтересу на сьогодні (тобто автоматичним висновком автоматизованих бот-активностей на Instagram), тобто немає подібної попередньої роботи, з якою можна було б порівняти його.

Дослідники застосовували широкий спектр методів до придбаних користувачів (яких вони вважають за “фальшивих” rather ніж просто “не-CT”, оскільки ці справжні облікові записи займаються неорганічною, платною взаємодією), по всьому ряду технологій, пов’язаних з NLP.

Серед вивчених аспектів були аналіз мови (який у світі CT майже завжди за замовчуванням англійською, хоча платформи CT також пропонують геолокалізацію неанглійських підписників); кількість коментарів (де фальшиві користувачі дуже близькі до частоти реальних користувачів, через страх перед виявленням); і аналіз загальних слів:

Хмари слів фальшивих та реальних користувачів.

Хмари слів фальшивих та реальних користувачів.

Документ зазначає, що поширеність слова “доктор” (див. зображення вище) у фальшивих облікових записах, здається, пов’язана з внутрішньою кампанією:

‘«Доктор» [з’явився] у 1069 різних коментарях. Після подальшого дослідження облікових записів, які розсилали [це] слово, ми виявили невелику частину того, що схоже на ботнет, метою якого є розсилка «докторів Instagram». Усі ці профілі лікарів мають посилання на WhatsApp бізнес, яке, після кліку, починає чат з повідомленням про завершення.’

Наскільки дослідники можуть висновити, ця дивна артефакт може бути залишком великого ботнету, який вони наткнулися під час пошуку діяльності реальних користувачів Instagram.

Всього дослідники зібрали 603 007 коментарів з публікацій по всьому 248 388 унікальним користувачам Instagram, з яких, на думку авторів, 55 719 були обліковими записами crowdturfing.

Документ зазначає з інтересом домінування жіночих тем у зібраних даних. Після використання GPU-PDMM (техніки, розробленої для обов’язково коротких публікацій у Twitter) для витягування 12 830 підходящих коментарів з доступного корпусу 121 822 коментарів, алгоритм виявив, що у розгляді змісту 12 чоловіків та 8 жінок більшість коментарів стосуються жіночих тем.

Топ-10 тем, витягнутих з фальшивих коментарів в одному з експериментів дослідників.

Топ-10 тем, витягнутих з фальшивих коментарів в одному з експериментів дослідників.

Дослідники висновують:

‘[Хоча] Instagram і дослідницька спільнота зосередилися на виявленні ботів та автоматизованих облікових записів, ми вважаємо, що необхідно провести більше досліджень щодо діяльності CT, яка негативно впливає на маркетинг інфлюенсерів, платформу Instagram та більшість її користувачів.’

 

* Посилання на TrustPilot, зазначене дослідниками, опущено.

Перше опубліковано 28 червня 2022 року.

Письменник про машинне навчання, спеціаліст у галузі синтезу людських зображень. Колишній керівник дослідницького контенту в Metaphysic.ai, до його розформування в DNEG's Brahma.ai.
Портфоліо сайт: martinanderson.ai
Контакт: martin@martinanderson.ai