Andersonin kulma
Sosiaalisen median estettyjen kommentoijien uudelleentunnistaminen koneoppimisen avulla

Johns Hopkinsin yliopiston tutkijat ovat kehittäneet syvän mittauslähestymistavan verkkojulkaisujen tunnistamiseen, joilla voi olla aikaisemmin keskeytettyjä tilejä tai joita voidaan käyttää useiden tiliten kautta astroturfia tai muuta verkkoyleisöjen hyvän uskon manipulointia, kuten Redditissä ja Twitterissä.
Lähestymistapa, joka esitetään uudessa tutkimusraportissa, jota johti NLP-tutkija Aleem Khan, ei vaadi, että syötetiedot on merkitty automaattisesti tai manuaalisesti, ja se parantaa aikaisempien yritysten tuloksia jopa silloin, kun vain pieniä tekstien otoksia on saatavilla, ja kun tekstiä ei ollut koulutusajassa.
Järjestelmä tarjoaa yksinkertaisen datan laajennusskeeman, jossa eri kokoisilla upotuksilla koulutetaan suuren tilavuuden datasettiä, joka sisältää yli 300 miljoonaa kommenttia yli miljoonasta eri käyttäjätilistä.

Johns Hopkinsin uudelleentunnistusjärjestelmän mallirakenne, jossa olennaiset osat ovat 1) tekstisisältö, 2) sub-Reddit-ominaisuus ja 3) julkaisuaika/päivämäärä. Lähde: https://arxiv.org/pdf/2105.07263.pdf
Runko perustuu Redditin käyttödataan ja ottaa huomioon tekstisisällön, sub-Reddit-sijoittelun ja julkaisuajan. Nämä kolme tekijää yhdistetään moninaisilla upotusmenetelmillä, mukaan lukien yhdenulotteiset konvoluutiot ja lineaariset projektiot, ja ne tukeutuvat huomioimekanismiin ja maksimipoolauskerrokseen.
Vaikka järjestelmä keskittyy tekstidomeeniin, tutkijat väittävät, että sen lähestymistapa voidaan kääntää videoiden tai kuvien analyysiin, koska johdettu algoritmi toimii taajuuksien esiintymisillä korkealla tasolla, riippumatta koulutusdata-pisteiden syötteiden pituudesta.
Estämällä ‘aiheen siirtymisen’
Yksi ansa, johon tämänkaltaista tutkimusta voidaan ajautua, ja jonka kirjoittajat ovat nimenomaisesti käsitelleet järjestelmän suunnittelussa, on asettaa liian suuri paino aiheiden tai teemojen toistumiselle eri tiliten postauksissa.
Vaikka käyttäjä voi kirjoittaa toistuvasti tai iteratiivisesti tietyn ajatussuoran mukaisesti, aihe on todennäköisesti kehittyy ja “liukuu” ajan myötä, mikä alentaa sen arvoa tunnisteena. Kirjoittajat kuvaavat tämän mahdollisen ansan “oikeaksi väärästä syystä” – loukkaus, jota on aiemmin tutkittu Johns Hopkinsissa.
Koulutusmenetelmä
Järjestelmä käyttää sekoitettua tarkkuutta, innovaatiota, jonka Baidu ja NVIDIA (NVDA ) esittivät vuonna 2018, joka puolittaa muistivaatimukset käyttämällä puolitarkkuuden liukulukuja: 16-bittisiä liukulukuja 32-bittisten sijaan. Dataa koulutettiin kahdella V100-grafiikkaprosessorilla, ja keskimääräinen koulutusaika oli 72 tuntia.
Skeema käyttää yksinkertaista tekstikoodausta, jossa konvoluutio-kooderit rajoitetaan 2-4 alasanaksi. Vaikka tällaisille kehyksille tyypillinen maksimipituus on viisi alasanaa, tutkijat totesivat, että tämä taloudellisuus ei vaikuttanut suorituskykyyn, ja että alasanoiden lisääminen viiteen todella heikensi suorituskykyä.
Tietojoukko
Tutkijat loivat tietojoukon 300 miljoonasta Reddit-kommentista vuoden 2020 Pushshift Reddit -korpuksesta, jota kutsutaan Miljoona käyttäjän tietojoukoksi (MUD).
Tietojoukko koostuu kaikista Reddit-kirjoittajien postauksista, jotka julkaisivat 100-1000 postausta heinäkuun 2015 ja kesäkuun 2016 välisenä aikana. Näytteiden ottaminen ajassa tarjoaa riittävän pituisen historiatiedon tutkimukselle ja vähentää satunnaisen roskapostin vaikutusta, joka ei kuulu tutkimuksen tavoitteiden piiriin.

Tilastotietoja Johns Hopkinsin uudelleentunnistusprojektin johdannaisesta tietojoukosta.
Tulokset
Alla oleva kuva näyttää kertyvän parantumisen tuloksia, kun suorituskykyä testataan yhden tunnin välein koulutuksen aikana. Kuuden tunnin jälkeen järjestelmä ylittää vertailukelpoiset edistysaskeleet aiemmissa aloitteissa.

Poistotutkimuksessa tutkijat totesivat, että sub-Reddit-ominaisuuden poistaminen työnkulusta vaikutti yllättävän vähän suorituskykyyn, mikä osoittaa, että järjestelmä yleistyy erittäin tehokkaasti ja on vankkaa ominaisuusvälinettä.
Julkaisujen tiheys uudelleentunnistimena
Tämä osoittaa myös, että kehys on erittäin siirrettävissä muihin kommentti- tai julkaisujärjestelmiin, joissa on vain tekstisisältö ja julkaisupäivämäärä saatavilla – ja että julkaisujen taajuuksien itse arvo on arvokas apuohjain todelliselle tekstisisällölle.
Tutkijat toteavat, että yrittäminen saman arvioinnin tekemistä yhden sub-Redditin sisällä asettaa suuremman haasteen, koska sub-Reddit toimii aiheen välittäjänä, ja lisäksi tarvitaan erillinen skeema tämän roolin täyttämiseksi.
Tutkimus pystyi kuitenkin saavuttamaan lupaavia tuloksia näissä rajoituksissa, ainoastaan huomautuksella, että järjestelmä toimii paremmin suurilla volyymeilla ja voi kohtailla lisää vaikeuksia uudelleentunnistamisessa, kun postausvolyymi on alhainen.
Työn kehittäminen
Toisin kuin monissa valvotussa oppimisessa, Johns Hopkinsin uudelleentunnistusskeeman ominaisuudet ovat diskreettiä ja riittävän vankkaa, jotta järjestelmän suorituskyky paranee merkittävästi, kun datan määrä kasvaa.
Tutkijat ilmoittavat kiinnostuksensa kehittää järjestelmää omaksamalla tarkemman lähestymistavan julkaisuaikojen analyysiin, koska usein ennustettavissa olevat aikataulut robotisoituneille roskapostittajille (joko automaattisesti tai muutoin) ovat alttiita tunnistamiselle tällä lähestymistavalla, ja tämä mahdollistaisi joko robottilleen poistamisen tutkimuksesta, joka on ensisijaisesti suunnattu häiriköivien käyttäjien tutkimiseen, tai auttaa automaattisen sisällön tunnistamisessa.












