Andersonin kulma
Tekoäly tunnistaa Instagramin huumekauppiaat lähes 95 prosentin tarkkuudella

Tutkijat Yhdysvalloissa ovat kehittäneet monimodaalisen koneoppimisjärjestelmän, joka pystyy tunnistamaan huumekauppiaiden tilejä ja postauksia Instagramissa analysoimalla erilaisia sisältöjä, mukaan lukien kuvamateriaalia.
Tutkimus, jonka otsikko on Identifying Illicit Drug Dealers on Instagram with Large-scale Multimodal Data Fusion, on yhteistyöhön perustuva tutkimus kolmen tutkijan välillä West Virginia Universitysta ja yhden tutkijan välillä Case Western Reserve Universitysta.
Hankkeen tukemiseksi tutkijat loivat tietokannan nimeltä Identifying Drug Dealers on Instagram (IDDIG), joka sisältää 4000 käyttäjätiliä, joista 1 400 on huumekauppiaiden tilejä, ja loput toimivat vertailuryhmänä tunnistusprosessin testaamiseksi.

Monimodaalisen kauppiaan tunnistusjärjestelmän rakenne. Malli sisältää postatut kuvat, postatut kommentit sekä kotisivukuvat ja biografiatekstit, jotka on julkaistu kotisivuilla. Lähde: https://arxiv.org/pdf/2108.08301.pdf
Menetelmän alustavat testit osoittavat lähes 95 prosentin tarkkuuden huumekauppiaiden tunnistamisessa Instagramissa, ja rakenne on myös johtanut hashtag-pohjaiseen yhteisöjen tunnistamishankkeeseen, jonka tavoitteena on löytää muuttuvia merkintöjä, jotka liittyvät laittoman huumeiden myyntiin, maantieteellisten tekijöiden ja tietynlaisten huumeiden tunnistamisen kautta.
Koska hankkeen tietokanta vaati manuaalista merkintää, rakenne sisältää helppokäyttöisen merkintäjärjestelmän, joka perustuu Googleen Bidirectional Encoder Representations from Transformers (BERT) -järjestelmään sekä ResNet-pohjaiseen kuvaluokitteluun.

IDDIG-järjestelmän web-pohjainen merkintäjärjestelmä (johon on lisätty merkinnät tutkimuksen kirjoittajilta).
Huumekauppiaiden tunnistaminen huumeisiin liittyvissä keskusteluissa
Vapaa-ajan huumeita käsitellään laajasti eri yhteyksissä sosiaalisen median alustoilla, kuten Instagramissa. Monet niistä, jotka postaavat, ovat kuluttajia eivätkä myyjiä. Riippuen paikallisten sääntöjen mukaan ja mahdollisuuksista saada reseptilääkkeitä, he voivat myös olla laillisia kuluttajia.

Huumeisiin liittyvät kuvat, jotka on otettu hankkeen tietokantaan.
Lisäksi huumekauppiaiden käyttäytyminen Instagramissa ei aina ole selvästi näkyvää; usein kauppiaat mainostavat kommentteja ja hashtagien kautta eikä multimedia-postauksia, jotka yleensä olisivat helpommin tunnistettavissa “huumeiden myyntiin” liittyviksi sisällöiksi sekä ihmisille että koneille. Siksi hashtagit ja kommenttitoiminta on otettu mukaan tunnistusominaisuuksina uudessa järjestelmässä.
Lisäksi BERT-pohjaisen tekstin analyysin ja ResNet-pohjaisen kuvatutkimuksen, työ sisältää ominaisuustason monimodaalisen datafusion, kuten ehdotettiin vuoden 2016 IEEE artikkelissa Discriminant Correlation Analysis: Real-Time Feature Level Fusion for Multimodal Biometric Recognition.
Hashtagit siementenä tietokantaan
Hankkeen web-kaavinta-mekanismi aloittaa matkansa huumekauppiaiden tilejen tunnistamiseksi jäljittämällä 200 huumeisiin liittyvää hashtagia, jotka on tunnistettu alan asiantuntijoiden toimesta, käyttäen hashtag-hakua API:aa.
Kuvat postauksissa, jotka käyttävät näitä hashtagia, luokitellaan VGG-16-pohjaisen binäärisen luokittelumallin avulla. Kuvat, jotka liittyvät tunnettuihin huumeisiin liittyviin kuvamateriaaleihin, tallennetaan järjestelmään, ja postaus muunnetaan JSON-objektiksi myöhempää hakua varten.
Rakenne laajenee sitten liittyviin kommentteihin ja tietoihin (sekä teksti- että kuvamateriaaliin) postaajien kotisivuilla, jotka ovat osallistuneet hashtagiin ja joiden sisältö on merkitty huumeisiin liittyväksi. Tällä tavoin 10 000 potentiaalista postausta ja 23 034 käyttäjän kotisivua otettiin tietokantaan.
Koska huumeisiin liittyvät hashtagit kehittyvät jatkuvasti välttääkseen mallien tunnistamisen ja viranomaisten huomion, kaikki uudet hashtagit, jotka eivät ole osa alkuperäistä hashtag-kokoelmaa, merkitään ja tallennetaan tulevia käyttötarkoituksia varten.
Tietokannan merkintä web-käyttöliittymässä (ks. kuva yllä), monimodaalisen datafusion on sopeutettava siihen, että ei kaikki postaukset sisällä kaikkia neljää mahdollista tietotyyppiä. Siksi algoritmi pystyy sietämään yhdeksän kaikkiaan 16 alakohdasta neljän tietotyypin kesken, käyttäen yhdistämistä ja fuusioiduista ominaisuuksista, missä puuttuvat elementit vastaavat nollaa laskelmissa.
NetworkX
Tietokantaa käytetään lopulta NetworkX Python-kielen paketti, joka on ehdotettu vuonna 2008 Los Alamosin kansallisen laboratorion toimesta New Mexicossa. NetworkX on käytetty laajasti suurissa operaatioissa, mukaan lukien graafeja, joissa on yli 10 miljoonaa solmua.
Käsitellessään hashtagia tietokannassa samalla tavalla kuin ne olisivat sisällytetty yhteen postaukseen, tutkijat pystyivät luomaan suunnattoman huumeisiin liittyvän graafin NetworkX:lle analysoitavaksi.
IDDIG-tietokanta testattiin useilla eri protokollilla, mukaan lukien monimodaalinen datafusion, monilähtöinen datafusion ja nelinkertaisen fusion, ja saavutti jopa 95 prosentin tarkkuuden huumeisiin liittyvien postausten ja käyttäjien tunnistamisessa verrattuna ihmisten toimintaan perustuviin tunnistusmenetelmiin.

IDDIG-tietokannasta pystyttiin myös luomaan “sunburst-kaaviot”, jotka paljastavat laajat osoittimet maantieteelliselle huumeiden myyntitoiminnalle Instagramissa ja muille mahdollisille tuleville tutkimuskohteille samankaltaisissa hankkeissa.














