Andersons vinkel
Oppdage “profesjonelle” skadelige nettanmeldelser med maskinlæring

Et nytt forskningssamarbeid mellom Kina og USA tilbyr en måte å oppdage skadelige nettanmeldelser som er designet for å undergrave konkurrenter eller å fasilitere utpressing, ved å utnytte signaturatferden til slike anmeldere.
Systemet, tittelen skadelig brukeroppsporingsmodell (MMD), bruker Metric Learning, en teknikk vanlig brukt i datavisualisering og anbefalingsystemer, sammen med et rekurrerende neuralt nettverk (RNN), for å identifisere og merke utdata fra slike anmeldere, som artikkelen navngir profesjonelle skadelige brukere (PMUer).
Flott! 1 stjerne
De fleste nettanmeldelser gir to former for brukerfeedback: en stjernerangering (eller en rangering på 10) og en tekstbasert anmeldelse, og i et typisk tilfelle vil disse være logisk sammenhengende (dvs. en dårlig anmeldelse vil være ledsaget av en lav rangering).
PMUer, derimot, undergraver vanligvis denne logikken, enten ved å etterlate en dårlig tekstanmeldelse med en høy rangering, eller en lav rangering ledsaget av en god anmeldelse.
Dette tillater brukerens anmeldelse å forårsake omdømmesskade uten å utløse de relativt enkle filtere som er utplassert av nettbutikker for å identifisere og håndtere utdata fra skadelige anmeldere. Hvis et filter basert på naturlig språkbehandling (NLP) identifiserer invective i tekstinnholdet i en anmeldelse, blir denne “flaggen” effektivt kansellert av den høye stjernerangeringen (eller desimalsk rangering) som PMUen også tildelte, og gjør dermed det skadelige innholdet “nøytralt” fra et statistisk synspunkt.

Et eksempel på hvordan en skadelig anmeldelse kan blandes sammen, statistisk, med ekte anmeldelser, sett fra et samarbeidende filteringsystem som prøver å identifisere slik atferd. Kilde: https://arxiv.org/pdf/2205.09673.pdf
Den nye artikkelen bemerker at hensikten med en PMU ofte er å utpresse penger fra nettbutikker i bytte mot å endre negative anmeldelser, og/eller et løfte om å ikke poste flere negative anmeldelser. I noen tilfeller er aktørene ad hoc-personer som søker rabatter, selv om det ofte er tilfeldig ansatt av offerets konkurrenter.
Kamuflasje av negative anmeldelser
Den nåværende generasjonen av automatiserte detektorer for slike anmeldelser bruker samarbeidende filtrering eller en innholdsbasert modell, og søker etter klare og ubestridte “outliers” – anmeldelser som er uniformt negative over begge tilbakemeldingsmetoder, og som avviker betydelig fra den generelle trenden for anmeldelsessentiment og rangering.
Den andre klassiske signatur som slike filtre fokuserer på er en høy publiseringsfrekvens, mens en PMU vil publisere strategisk og bare av og til (siden hver anmeldelse kan representere enten en individuell kommisjon eller en fase i en lengre strategi designet for å kamuflere “frekvens”-metrikken).
Derfor har de nye artikkelenes forskere integrert den merkelige polariteten til profesjonelle skadelige anmeldelser i en dedikert system, resulterende i en algoritme som er nesten på par med evnen til en menneskelig anmelder til å “lukt en rotte” på dispariteten mellom rangeringen og anmeldelsestekstinnholdet.

Den konseptuelle arkitekturen for MMD, bestående av to sentrale moduler: Skadelig brukerprofileringsmodell (MUP) og Oppmerksomhetsmetrisk læring (MLC, i grått).
Sammenligning med tidligere tilnærminger
Ettersom MMD er, ifølge forfatterne, det første systemet som prøver å identifisere PMUer basert på deres schizofrene poststil, finnes det ingen direkte tidligere arbeid som kan sammenlignes med det. Derfor satte forskerne sin system mot en rekke komponentalgoritmer som tradisjonelle automatiserte filtre ofte avhenger av, inkludert K-means++-klustering; den verdige Statistisk outlier-oppdaging (SOD); Hysad; Semi-sad; CNN-sad; og Slanderenes brukeroppdagingssystem (SDRS).

Testet mot merket datasett fra Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] og Yelp, er MMD i stand til å identifisere profesjonelle nettfordrivere med den høyeste nøyaktighetsraten, ifølge forfatterne. Fed skrift representerer MMD, mens asterisken (*) indikerer beste resultat. I dette tilfelle ble MMD bare slått i to oppgaver, av en standalone-teknologi (MUP) som allerede er inkorporert i det, men som ikke er standardverktøyet for oppgaven i hånden.

I dette tilfelle ble MMD satt mot umerkede datasett fra Taobao og Jindong, noe som gjorde det til en uovervåket læringoppgave. Igjen ble MMD bare forbedret av en av sine egne konstituerende teknologier, høyt tilpasset for oppgaven for testformålet.
Forskerne observerer:
‘[På] alle fire datasett, overgår vår foreslåtte modell MMD (MLC+MUP) alle baseline-modellene i forhold til F-score. Merk at MMD er en kombinasjon av MLC og MUP, som sikrer dens overlegenhet over overvåket og uovervåket modeller i alminnelighet.’
Artikkelen foreslår også at MMD kan fungere som en nyttig forbehandlingmetode for tradisjonelle automatiske filtersystemer, og gir eksperimentelle resultater på en rekke datasett, inkludert Brukerbasert samarbeidende filtrering (UBCF), Varebasert samarbeidende filtrering (IBCF), Matrisefaktorisering (MF-eALS), Bayesisk personlig rangering (MF-BPR), og Neuralt samarbeidende filtrering (NCF).
I forhold til Treffratio (HR) og Normalisert kumulativ gevinst (NDCG) i resultater fra disse testene, sier forfatterne:
‘Blant alle fire datasett, forbedrer MMD anbefalingsmodellene betydelig i forhold til HR og NDCG. Spesifikt kan MMD forbedre ytelsen til HR med 28,7% i gjennomsnitt og NDCG med 17,3% i gjennomsnitt.
‘Ved å slette profesjonelle skadelige brukere, kan MMD forbedre kvaliteten på datasettene. Uten disse profesjonelle skadelige brukernes falske [tilbakemeldinger], blir datasettene mer [intuitive].’
Den artikkelen er tittelen Detect Professional Malicious User with Metric Learning in Recommender Systems, og kommer fra forskere ved Institutt for datateknologi ved Jilin Universitet; Key Lab of Intelligent Information Processing of Chinese Academy of Science i Beijing; og Handelshøyskolen ved Rutgers i New Jersey.
Data og tilnærminger
Oppdaging av PMUer er en multimodal utfordring, siden to ikke-ekvivalente parametre (en numerisk verdi stjernerangering/ desimalsk rangering og en tekstbasert anmeldelse) må vurderes. Forfatterne av den nye artikkelen hevder at ingen tidligere arbeid har møtt denne utfordringen.
MMD bruker en Hierarkisk dobbelt-oppmerksomhetsrekurrerende neuralt nettverk (HDAN) for å assimilere anmeldelseinnholdet i en sentimentscore.

Prosjektion av en anmeldelse inn i en sentimentscore med HDAN, som bidrar med ord- og setningsinnkapsling for å få en sentimentscore.
HDAN bruker oppmerksomhetsmekanismer for å tildele vekter til hvert ord, og til hver setning. I bildet over, sier forfatterne, skal ordet svakere tydelig tildeles større vekt enn konkurranseord i anmeldelsen.
I prosjektet tok HDAN rangeringene for produkter over fire datasett som bakgrunnssannhet. Datasettene var Amazon.com; Yelp for RecSys (2013); og to “virkelige” (i motsetning til eksperimentelle) datasett, fra Taobao og Jindong.
MMD utnytter Metric Learning, som prøver å estimere en nøyaktig avstand mellom enheter for å karakterisere den totale gruppen av relasjoner i dataene.
MMD begynner med en one-hot-koding for å velge bruker og vare, via en latent faktormodell (LFM), som får en basisrangeringsscore. I mellomtiden projiserer HDAN anmeldelseinnholdet inn i sentimentscoren som hjelpe-data.
Resultatene blir deretter prosessert inn i en Skadelig brukerprofileringsmodell (MUP), som utgangssender sentimentsgapvektoren – forskjellen mellom rangeringen og den estimerte sentimentscoren til anmeldelsens tekstinnhold. På denne måten kan PMUer for første gang kategoriseres og merkes.

Oppmerksomhetsbasert metricsk læring for klustering.












