Andersons vinkel
Återidentifiering av bannlysta sociala mediekommentatorer med maskinlärande

Forskare från John Hopkins University har utvecklat en Deep Metric-ansats för att identifiera onlinekommentatorer som kan ha haft tidigare konton som har suspenderats eller som använder flera konton för att astroturfa eller på annat sätt manipulera den goda tron hos online-samhällen som Reddit och Twitter.
Tillvägagångssättet, som presenteras i en ny artikel ledd av NLP-forskaren Aleem Khan, kräver inte att indata måste annoteras automatiskt eller manuellt, och förbättrar resultaten från tidigare försök även där endast små textprover är tillgängliga, och där texten inte fanns i datamängden under utbildningstiden.
Systemet erbjuder ett enkelt dataaugmenteringschema, med inbäddningar av olika storlekar som tränats på en stor datamängd som innehåller över 300 miljoner kommentarer som täcker en miljon olika användarkonton.

Modellarkitekturen för John Hopkins återidentifieringssystem, där de viktigaste komponenterna är 1) textinnehåll, 2) en sub-Reddit-funktion och 3) publiceringsdatum/tid. Källa: https://arxiv.org/pdf/2105.07263.pdf
Ramverket, som baseras på Reddit-användningsdata, tar hänsyn till textinnehåll, sub-Reddit-placering och publiceringsdatum. De tre faktorerna kombineras med olika inbäddningsmetoder, inklusive en-dimensionella konvolutioner och linjära projiceringar, och assisteras av en uppmärksamhetsmekanism och en maxpoolningsskikt.
Fastän systemet koncentrerar sig på textdomänen, hävdar forskarna att dess tillvägagångssätt kan översättas till analys av video eller bilder, eftersom den härledda algoritmen opererar på frekvensförekomster på en hög nivå, trots en mängd olika inmatningslängder för utbildningsdatapunkterna.
Undvikande av ‘Ämnesdrift’
En fälla som forskning av denna natur kan falla i, och som författarna uttryckligen har behandlat i systemets design, är att lägga för stor vikt vid återkomsten av särskilda ämnen eller teman över inlägg från olika konton.
Fastän en användare kan skriva upprepat eller iterativt i en viss tankesträng, är ämnet troligen att utvecklas och “driva” över tid, vilket minskar dess användbarhet som en nyckel till identitet. Författarna karakteriserar denna potentiella fälla som “att vara rätt av fel skäl” – en fälla som tidigare studeras vid John Hopkins.
Träningsmetodik
Systemet använder blandad precisionsträning, en innovation som presenterades 2018 av Baidu och NVIDIA (NVDA ), som halverar minneskraven genom att använda halvprecisionsflyttal: 16-bitars flyttal i stället för 32-bitars värden. Datat tränades på två V100-GPU:er, med en genomsnittlig utbildningstid på 72 timmar.
Schemat använder förenklad textkodning, med konvolutionskodare begränsade till 2-4 subord. Fastän den genomsnittliga längden för ramverk av denna natur är en maximal subordslängd på fem, fann forskarna att denna enkelhet inte bara inte hade någon inverkan på rangordningsprestanda, utan att en ökning av suborden till en maximal subordslängd på fem faktiskt försämrade rangordningsnoggrannheten.
Datamängden
Forskarna härleddes en datamängd på 300 miljoner Reddit-inlägg från 2020 Pushshift Reddit Corpus-datamängd, som kallas Million User Dataset (MUD).
Datamängden består av alla inlägg av Reddit-författare som publicerade 100-1000 inlägg mellan juli 2015 och juni 2016. Urval över tid på detta sätt ger en tillräcklig historiklängd för studien och minskar inverkan av sporadiska spam-inlägg som inte ligger inom ramen för forskningens mål.

Statistik på den härledda datamängden för John Hopkins återidentifieringsprojekt.
Resultat
Bilden nedan visar den kumulativa förbättringen av resultaten när rangordningsnoggrannheten testas i ett timintervall under utbildning. Efter sex timmar presterar systemet bättre än de tidigare initiativens baslinje-prestationer.

I en ablationsstudie fann forskarna att borttagning av sub-Reddit-funktionen från arbetsflödet hade förvånansvärt liten inverkan på rangordningsnoggrannheten, vilket tyder på att systemet generaliserar mycket effektivt, med robusta funktioner.
Inläggsfrekvens som en återidentifieringssignatur
Detta indikerar också att ramverket är högt överförbart till andra kommenterings- eller publiceringssystem där endast textinnehåll och datum/tid för publicering är tillgängliga – och i princip att den temporala frekvensen för inlägg i sig är en värdefull biprodukt till det faktiska textinnehållet.
Forskarna noterar att försöket att utföra samma uppskattning inom innehållet i en enda sub-Reddit utgör en större utmaning, eftersom sub-Reddit i sig fungerar som en ämnesproxy, och ett ytterligare schema skulle troligen krävas för att fylla denna roll.
Studien kunde ändå uppnå lovande resultat inom dessa begränsningar, med den enda reservationen att systemet fungerar bättre vid höga volymer och kan ha ökad svårighet att återidentifiera användare där inläggsvolymen är låg.
Utveckling av arbetet
I kontrast till många övervakade inlärningsinitiativ är funktionerna i Hopkins återidentifieringsschema diskreta och robusta nog att systemets prestanda förbättras märkbart när datavolymen ökar.
Forskarna uttrycker intresse för att utveckla systemet genom att anta en mer granulär ansats för analys av publiceringsdatum, eftersom de ofta förutsägbara schemana för rote-spammare (automatiserade eller annorlunda) är känsliga för identifiering med en sådan ansats, och detta skulle göra det möjligt att antingen mer effektivt eliminera robotinnehåll från en studie som i huvudsak riktar sig till besvärliga användare, eller att hjälpa till att identifiera automatiserat innehåll.












