Andersons vinkel
AI Identifiserer Instagram-narkotikahandlere Med Nesten 95% Nøyaktighet

Forskere i USA har utviklet et multimodalt maskinlæringsystem som kan identifisere kontoer og innlegg fra narkotikahandlere på Instagram, ved å analysere en rekke innhold, inkludert bildeinnhold.
Forskningen, med tittelen Identifisering av ulovlige narkotikahandlere på Instagram med stor skala multimodal datafusjon, er et samarbeid mellom tre forskere fra West Virginia University og en fra Case Western Reserve University.
For å gjennomføre prosjektet, skapte forskerne en database kalt Identifisering av narkotikahandlere på Instagram (IDDIG), med 4000 brukerkontoer, hvorav 1 400 var kontoer til narkotikahandlere, og resten som en kontrollgruppe for å teste identifiseringsprosessen.

Rammeverket for det multimodale dealer-detectionsystemet. Modellen inkluderer innleggte bilder, innleggte kommentarer, samt informasjon fra hjemmesidebilder og biografitekster postet på hjemmesiden. Kilde: https://arxiv.org/pdf/2108.08301.pdf
Initial testing av teknikken rapporterer nesten 95% nøyaktighet i identifisering av Instagram-baserte narkotikahandlere, og rammeverket har også ledet til et hashtag-basert samfunnsdetectionsprosjekt designet for å oppdage endringer i aktivitet relatert til salg av ulovlige narkotika, ved å bruke geografiske faktorer og identifisering av spesifikke narkotikatyper.
Siden databasen som ble utviklet for prosjektet krevde manuell merking, har rammeverket en brukervennlig annotasjonssystem, som bruker en klassifiseringsystem basert på Google’s Bidirectional Encoder Representations from Transformers (BERT), samt ResNet-basert bildeklassifisering.
Å Spore Narkotikahandlerne I Narkotika-relaterte Samtaler
Rekreasjonsnarkotika diskuteres i en rekke sammenhenger på sosiale medieplattformer som Instagram. Mange av dem som poster er forbrukere snarere enn selgere. Avhengig av reguleringene i deres lokalitet, og muligheten for reseptmedisin selv i lokaliteter som skiller seg i deres narkotikalovgivning, kan de også være lovlige forbrukere.

Narkotika-relaterte bilder som ble brukt i prosjektets database.
I tillegg er narkotikahandleres atferd på Instagram ikke alltid eksplisitt; ofte annonserer handlerne via kommentarer og hashtagger i stedet for multimediaposter, som ville være lettere å identifisere som ‘narkotikahandelsinnhold’ for både menneskelig og maskinoversiktssystemer. Derfor har hashtagger og kommentaraktivitet blitt inkludert som identifiseringsressurser i det nye systemet.
I tillegg til BERT-basert tekstanalyse og ResNet-basert bildeundersøkelse, inkluderer arbeidet feature-nivå multimodal datafusjon, som foreslått i 2016 IEEE paperet Discriminant Correlation Analysis: Real-Time Feature Level Fusion for Multimodal Biometric Recognition.
Hashtagger Som Frø For En Database
Prosjektets web-skraping-mekanisme starter sin reise mot identifisering av narkotikahandlekontoer ved å spore banen til 200 narkotika-relaterte hashtagger identifisert av domeneeksperter, ved å bruke hashtag-søke-API-et.
Bilder i innlegg som bruker hashtaggerne blir deretter klassifisert ved hjelp av en VGG-16-basert binær klassifiseringsmodell. Bilder som korrelerer med kjente narkotikabilder blir deretter lagret i systemet, og innlegget konvertert til et JSON-objekt for senere henting.
Rammeverket utvider deretter til relaterte kommentarer og informasjon (både tekst og bilder) på hjemmesiden til brukere som har deltatt i hashtaggerne, og hvis innhold har blitt flagget som narkotika-relatert. På denne måten ble 10 000 potensielle innlegg og 23 034 brukerhjemmesider inntatt i datasettet.
Siden narkotika-relaterte hashtagger utvikler seg konstant for å unngå mønsterdeteksjon og oppmerksomheten fra myndighetene, blir nye hashtagger i det flaggede innlegget som ikke var en del av hashtagg-samlingen notert og registrert for fremtidig bruk.
Etter merking i det web-baserte grensesnittet (se bilde over), må multimodal datafusjon tilpasse seg det faktum at ikke alle innlegg vil inneholde alle fire mulige datatyper. Derfor kan algoritmen tolerere ni av totalt 16 underpunkter blant de fire datatypene, ved å bruke konkatenering og fusjonerte funksjoner, hvor manglende elementer vil korrespondere til null i beregningen.
NetworkX
Datasettet blir til slutt brukt via NetworkX Python-språk-pakken foreslått i 2008 av Los Alamos National Laboratory i New Mexico. NetworkX har blitt brukt omfattende i store operasjoner, inkludert grafiske modeller med over 10 millioner noder.
Ved å behandle hashtaggerne i datasettet som om de hadde blitt inkludert i ett innlegg, var det mulig for forskerne å generere en urettede narkotika-relatert graf for NetworkX å analysere.
IDDIG-datasettet ble testet over en rekke protokoller, inkludert multimodal datafusjon, flerkilde-datafusjon og kvadruppelbasert fusjon, og oppnådde nøyaktighetsresultater på opptil 95% i forhold til å identifisere narkotika-relaterte innlegg og brukere, i sammenligning med menneske-i-løkken metoder for identifisering.

Det var mulig å generere ‘sunburst-plott’ som avdekket brede indikatorer for geografisk disposisjon av narkotika-relatert aktivitet på Instagram, og andre mulige fremtidige undersøkelseslinjer i lignende prosjekter.















