Andersons hoek

AI Identificeert Instagram Drugshandelaars Met Bijna 95% Accuratesse

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Onderzoekers in de VS hebben een multimodale machine learning-systeem ontwikkeld dat in staat is om de accounts en berichten van drugshandelaars op Instagram te identificeren, door het analyseren van verschillende soorten inhoud, waaronder afbeeldingen.

Het onderzoek, getiteld Identificeren van Illegale Drugshandelaars op Instagram met Grote-schaal Multimodale Data-fusie, is een samenwerking tussen drie onderzoekers van de West Virginia University en één van de Case Western Reserve University.

Om het project te faciliteren, hebben de onderzoekers een database gemaakt genaamd Identificeren van Drugshandelaars op Instagram (IDDIG), met 4000 gebruikersaccounts, waarvan 1.400 accounts van drugshandelaars en de rest als controlegroep om het identificatieproces te testen.

Het kader van het multimodale dealer-detectiesysteem. Het model omvat gepubliceerde afbeeldingen, gepubliceerde comments, evenals informatie van homepage-afbeeldingen en biografie-teksten op de homepage.

Het kader van het multimodale dealer-detectiesysteem. Het model omvat gepubliceerde afbeeldingen, gepubliceerde comments, evenals informatie van homepage-afbeeldingen en biografie-teksten op de homepage. Source: https://arxiv.org/pdf/2108.08301.pdf

De initiële testen van de techniek rapporteren een nauwkeurigheid van bijna 95% bij het identificeren van Instagram-gebaseerde drugshandelaars, en het kader heeft ook geleid tot een hashtag-gebaseerd community-detectieproject om veranderingen in activiteiten gerelateerd aan de verkoop van illegale drugs te ontdekken, met behulp van geografische factoren en identificatie van specifieke drugstypen.

Aangezien de database die voor het project is ontwikkeld handmatige labeling vereist, bevat het kader een gebruikersvriendelijk annotatiesysteem, dat een classificatiesysteem gebruikt op basis van Google’s Bidirectional Encoder Representations from Transformers (BERT), evenals ResNet-gebaseerde afbeeldingsclassificatie.

Het web-gebaseerde annotatiesysteem (met extra indicaties van de auteurs van het artikel) voor IDDIG.

Het web-gebaseerde annotatiesysteem (met extra indicaties van de auteurs van het artikel) voor IDDIG.

Drugshandelaars Identificeren in Drug-gerelateerde Conversaties

Recreatieve drugs worden besproken in een breed aantal contexten op sociale media-platforms zoals Instagram. Veel van degenen die posten zijn consumenten in plaats van verkopers. Afhankelijk van de regelgeving in hun lokale omgeving en de mogelijkheid van voorschriftmedicijnen, zelfs in lokale omgevingen die verschillen in hun drugswetgeving, kunnen ze ook wettige consumenten zijn.

Drug-gerelateerde afbeeldingen die in de database van het project zijn opgenomen.

Drug-gerelateerde afbeeldingen die in de database van het project zijn opgenomen.

Bovendien is het gedrag van drugshandelaars op Instagram niet altijd expliciet; vaak adverteren de handelaars via comments en hashtags in plaats van multimediale berichten, die in het algemeen gemakkelijker te identificeren zouden zijn als ‘drugshandel’-inhoud, zowel voor menselijke als machine-oversichtsystemen. Daarom zijn hashtags en comment-activiteit opgenomen als identificerende assets in het nieuwe systeem.

Meerdere patronen van de drugshandel op Instagram-berichten.

Meerdere patronen van de drugshandel op Instagram-berichten.

In aanvulling op BERT-gebaseerde tekstanalyse en ResNet-gebaseerde afbeeldingsonderzoek, omvat het werk feature-niveau multimodale data-fusie, zoals voorgesteld in de 2016 IEEE publicatie Discriminant Correlatie-analyse: Real-Time Feature Level Fusie voor Multimodale Biometrische Herkenning.

Hashtags als Zaden voor een Database

Het web-scraper-mechanisme van het project begint zijn reis naar de identificatie van drugshandel-accounts door het traceren van het pad van 200 drug-gerelateerde hashtags die zijn geïdentificeerd door domein-experts, met behulp van de hashtag-zoek-API.

Afbeeldingen in berichten die de hashtags gebruiken, worden vervolgens geclassificeerd met een VGG-16-gebaseerd binaal classificatiemodel. Afbeeldingen die correleren met bekende drug-afbeeldingen worden vervolgens opgeslagen in het systeem, en het bericht wordt omgezet in een JSON-object voor later gebruik.

Het kader breidt zich vervolgens uit naar gerelateerde comments en informatie (zowel tekst als afbeeldingen) op de homepage van posters die hebben deelgenomen aan de hashtag, en wiens inhoud is gemarkeerd als drug-gerelateerd. Op deze manier werden 10.000 potentiële berichten en 23.034 gebruikershomepages in de dataset opgenomen.

Aangezien drug-gerelateerde hashtags constant evolueren om patroondetectie en de aandacht van de autoriteiten te vermijden, worden nieuwe hashtags in het gemarkeerde bericht die niet deel uitmaken van de oorspronkelijke hashtag-collectie, genoteerd en opgeslagen voor toekomstig gebruik.

Na het labelen in de web-gebaseerde interface (zie afbeelding hierboven), moet de multimodale data-fusie rekening houden met het feit dat niet alle berichten alle vier mogelijke soorten data zullen bevatten. Daarom kan het algoritme negen van de zestien sub-punten onder de vier datatypen tolereren, met behulp van concatenatie en gefuseerde functies, waarbij ontbrekende elementen overeenkomen met nul in de berekening.

NetworkX

De dataset wordt uiteindelijk gebruikt via het NetworkX Python-taalpakket dat in 2008 is voorgesteld door het Los Alamos National Laboratory in New Mexico. NetworkX is uitgebreid gebruikt in grote operaties, waaronder grafieken met meer dan 10 miljoen knooppunten.

Door de hashtags in de dataset te behandelen alsof ze in één bericht waren opgenomen, was het mogelijk voor de onderzoekers om een ongerichte drug-gerelateerde grafiek voor NetworkX te genereren.

De IDDIG-dataset is getest op een verscheidenheid aan protocollen, waaronder Multimodale Data-fusie, Multibron-data-fusie en Quadruple-gebaseerde Fusie, en heeft nauwkeurigheidsresultaten behaald van maximaal 95% in termen van het identificeren van drug-gerelateerde berichten en gebruikers, in vergelijking met mens-in-de-lus-methoden van identificatie.

Het was ook mogelijk om ‘sunburst-plots’ te genereren die brede indicatoren onthullen voor de geografische dispositie van drug-gerelateerde activiteit op Instagram, en andere mogelijke toekomstige onderzoekslijnen in soortgelijke projecten.

Schrijver over machine learning, domeinspecialist in humane beeldsynthese. Voormalig hoofd van onderzoeksinhoud bij Metaphysic.ai, tot de opheffing ervan in DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai