Погляд Anderson
Штучна ідентифікація дилерів наркотиків в Instagram з точністю майже 95%

Дослідники в США створили багатофункціональну систему машинного навчання, яка здатна ідентифікувати облікові записи та публікації дилерів наркотиків в Instagram, аналізуючи різноманітний контент, включаючи зображення.
Дослідження дослідження, яке називається Ідентифікація незаконних дилерів наркотиків в Instagram з великомасштабним багатофункціональним об’єднанням даних, є спільною роботою трьох дослідників Західної Вірджинської університету та одного дослідника Університету Кейс-Вестерн-Резерв.
Для реалізації проекту дослідники створили базу даних під назвою Ідентифікація дилерів наркотиків в Instagram (IDDIG), яка містить 4000 облікових записів користувачів, з яких 1400 облікових записів належать дилерам наркотиків, а решта використовується як контрольна група для тестування процесу ідентифікації.

Фреймворк багатофункціональної системи виявлення дилерів наркотиків. Модель включає опубліковані зображення, коментарі, а також інформацію з домашніх сторінок та біографічних текстів, опублікованих на домашній сторінці. Джерело: https://arxiv.org/pdf/2108.08301.pdf
Перші тести методу показали майже 95% точність ідентифікації дилерів наркотиків в Instagram, а фреймворк також дозволив створити проект виявлення спільнот на основі хештегів, призначений для виявлення змінюваних індикаторів діяльності, пов’язаної з продажем незаконних наркотиків, з використанням географічних факторів та ідентифікації конкретних типів наркотиків.
Оскільки база даних, розроблена для проекту, вимагала ручного маркування, фреймворк включає зручну систему анотації, яка використовує систему класифікації на основі Bidirectional Encoder Representations from Transformers (BERT) від Google, а також класифікацію зображень на основі ResNet.
Виявлення дилерів у розмовах, пов’язаних з наркотиками
Рекреаційні наркотики обговорюються в широкому числі контекстів на соціальних платформах, таких як Instagram. Багато тих, хто публікує, є споживачами, а не дилерами. В залежності від законодавства в їхньому регіоні та можливості отримання рецептурних ліків навіть у регіонах, які відрізняються законодавством щодо наркотиків, вони також можуть бути легальними споживачами.

Зображення, пов’язані з наркотиками, які були додані до бази даних проекту.
Крім того, поведінка дилерів наркотиків в Instagram не завжди явна; часто дилери рекламують свої товари через коментарі та хештеги, а не через публікації зображень, які загалом були б легше ідентифікувати як контент, пов’язаний з наркотиками, як для людської, так і для машинної системи нагляду. Тому хештеги та активність у коментарях були включені як ідентифікатори в новій системі.
Крім аналізу тексту на основі BERT та дослідження зображень на основі ResNet, робота включає багатофункціональне об’єднання даних на рівні функцій, як запропоновано в статті 2016 року IEEE статті Дискримінантний аналіз кореляції: реальний час рівня функцій для багатофункціонального біометричного розпізнавання.
Хештеги як насіння для бази даних
Механізм веб-скрепінгу проекту починає свій шлях до ідентифікації облікових записів дилерів наркотиків, відстежуючи шлях 200 хештегів, пов’язаних з наркотиками, ідентифікованих експертами-доменами, за допомогою хештег-пошукового API.
Зображення в публікаціях, які використовують ці хештеги, потім класифікуються за допомогою бінарної моделі класифікації VGG-16. Зображення, які корелюють із відомими зображеннями наркотиків, потім зберігаються в системі, а публікація конвертується в об’єкт JSON для подальшого використання.
Фреймворк потім розширюється до пов’язаних коментарів та інформації (як тексту, так і зображень) на домашній сторінці користувачів, які брали участь у хештегах, і чиї публікації були позначені як пов’язані з наркотиками. Таким чином було отримано 10 000 потенційних публікацій та 23 034 домашніх сторінок користувачів, які були включені до набору даних.
Оскільки хештеги, пов’язані з наркотиками, постійно еволюціонують, щоб уникнути виявлення законом та уваги органів влади, будь-які нові хештеги в позначених публікаціях, які не були частиною початкової колекції хештегів, відзначаються та реєструються для майбутнього використання.
Після маркування в веб-інтерфейсі (див. зображення вище) багатофункціональне об’єднання даних повинно враховувати той факт, що не всі публікації будуть містити всі чотири можливі типи даних. Тому алгоритм здатний терпіти дев’ять з шістнадцяти підпунктів серед чотирьох типів даних, використовуючи конкатенацію та об’єднані функції, де відсутні елементи будуть відповідати нулю в розрахунках.
NetworkX
Набір даних нарешті використовується за допомогою пакету мови Python NetworkX, запропонованого в 2008 році лабораторією Лос-Аламос в штаті Нью-Мексико. NetworkX широко використовувався в великомасштабних операціях, включаючи графи з більш ніж 10 мільйонами вузлів.
Відносячи хештеги в наборі даних до одного поста, дослідникам вдалося створити неорієнтований граф, пов’язаний з наркотиками, для аналізу в NetworkX.
Набір даних IDDIG був протестований за різними протоколами, включаючи багатофункціональне об’єднання даних, багатожернове об’єднання даних та об’єднання на основі квадруплів, і досягнув результатів точності до 95% щодо ідентифікації публікацій та користувачів, пов’язаних з наркотиками, у порівнянні з методами ідентифікації з участю людини.

Також було можливим створити “сонячні діаграми”, які розкривають широкі індикатори географічного розподілу діяльності, пов’язаної з наркотиками, в Instagram, та інші можливі майбутні напрямки дослідження в подібних проектах.















