Andersons vinkel
Upptäcka “Professionella” Skadliga Online-recensioner med Maskinlärande

En ny forskningssamarbete mellan Kina och USA erbjuder ett sätt att upptäcka skadliga e-handelsrecensioner som är utformade för att undergräva konkurrenter eller för att underlätta utpressning, genom att utnyttja beteendemönstret för sådana recensenter.
Systemet, med titeln skadlig användardetektionsmodell (MMD), använder Metric Learning, en teknik vanligt använd inom datorseende och recommendersystem, tillsammans med ett rekurrent neuronnät (RNN), för att identifiera och märka utdata från sådana recensenter, som artikeln benämner Professionella Skadliga Användare (PMU).
Stort! 1 stjärna
De flesta online-e-handelsrecensioner tillhandahåller två former av användarfeedback: en stjärnrankning (eller en rankning på 10) och en textbaserad recension, och i ett typiskt fall kommer dessa att motsvara varandra logiskt (dvs. en dålig recension kommer att åtföljas av en låg rankning).
PMU, däremot, subverterar ofta denna logik genom att antingen lämna en dålig textrecension med en hög rankning eller en låg rankning åtföljd av en bra recension.
Detta tillåter användarens recension att orsaka rykteskada utan att utlösa de relativt enkla filter som e-handelswebbplatser använder för att identifiera och hantera utdata från skadliga negativa recensenter. Om ett filter baserat på Natural Language Processing (NLP) identifierar invektiv i texten i en recension, kommer detta “flagg” att effektivt återkallas av den höga stjärn- eller decimalrankning som PMU också tilldelat, vilket i princip gör det skadliga innehållet “neutralt” ur ett statistiskt perspektiv.

Ett exempel på hur en skadlig recension kan blandas, statistiskt, med äkta recensioner, ur ett samarbetsfilter som försöker identifiera ett sådant beteende. Källa: https://arxiv.org/pdf/2205.09673.pdf
Den nya artikeln noterar att avsikten med en PMU ofta är att utpressa pengar från online-återförsäljare i utbyte mot ändring av negativa recensioner och/eller ett löfte att inte publicera fler negativa recensioner. I vissa fall är aktörerna ad hoc-personer som söker rabatter, även om det ofta är så att PMU anlitas av offrens konkurrenter.
Cloaking Negativa Recensioner
Den nuvarande generationen av automatiserade detektorer för sådana recensioner använder samarbetsfilter eller en innehållsbaserad modell och letar efter tydliga och entydiga “utbrytare” – recensioner som är enhetligt negativa över båda feedbackmetoderna och som avviker betydligt från den allmänna trenden för recensionssentiment och rankning.
Den andra klassiska signatur som sådana filter fokuserar på är en hög publiceringsfrekvens, medan en PMU kommer att publicera strategiskt och endast ibland (eftersom varje recension kan representera antingen en individuell provision eller ett skede i en längre strategi som är utformad för att dölja “frekvensmätningen”).
Därför har forskarna i den nya artikeln integrerat den underliga polariteten hos professionella skadliga recensioner i ett dedikerat system, vilket resulterar i en algoritm som är nästan lika bra som en mänsklig recensents förmåga att “känna lukten av en råtta” vid diskrepansen mellan rankningen och recensionstextens innehåll.

Den konceptuella arkitekturen för MMD, som består av två centrala moduler: Malicious User Profiling (MUP) och Attention Metric Learning (MLC, i grått).
Jämförelse med Tidigare Tillvägagångssätt
Eftersom MMD, enligt författarna, är det första systemet som försöker identifiera PMU baserat på deras schizofrena publiceringsstil, finns det inga direkta tidigare arbeten att jämföra med. Därför ställde forskarna sitt system mot ett antal komponentalgoritmer som traditionella automatiserade filter ofta förlitar sig på, inklusive K-means++-kluster; den ärevördiga Statistisk Outlier Detection (SOD); Hysad; Semi-sad; CNN-sad; och Slanderous user Detection Recommender System (SDRS).

Testad mot märkta dataset från Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] och Yelp, kan MMD identifiera professionella online-detraktorer med den högsta träffsäkerheten, hävdar författarna. Fetstil representerar MMD, medan asterisken (*) indikerar den bästa prestationen. I det här fallet besegrades MMD endast i två uppgifter av en fristående teknik (MUP) som redan är integrerad i det, men som inte är standardutrustad för den aktuella uppgiften.

I det här fallet ställdes MMD mot omarkerade dataset från Taobao och Jindong, vilket i princip gjorde det till en uppgift för ostrukturerad inlärning. Återigen förbättrades MMD endast av en av sina egna beståndsdelar, som anpassats för uppgiften i testets syfte.
Forskarna observerar:
‘[På] alla fyra dataset, överträffar vår föreslagna modell MMD (MLC+MUP) alla baslinjerna i termer av F-poäng. Notera att MMD är en kombination av MLC och MUP, vilket säkerställer dess överlägsenhet över övervakade och oövervakade modeller i allmänhet.’
Artikeln föreslår också att MMD kan tjäna som en användbar förbehandlingsmetod för traditionella automatiserade filtersystem och tillhandahåller experimentella resultat på ett antal dataset, inklusive User-baserad samarbetsfiltering (UBCF), Objektbaserad samarbetsfiltering (IBCF), Matrisfaktorisering (MF-eALS), Bayesisk personlig rankning (MF-BPR) och Neuralt samarbetsfilter (NCF).
I termer av Träffkvote (HR) och Normaliserad diskret kumulativ vinst (NDCG) i resultaten av dessa testade tillägg, hävdar författarna:
‘Bland alla fyra dataset, förbättrar MMD rekommendationsmodellerna betydligt i termer av HR och NDCG. Specifikt kan MMD förbättra prestandan för HR med 28,7% i genomsnitt och HDCG med 17,3% i genomsnitt.
‘Genom att ta bort professionella skadliga användare, kan MMD förbättra kvaliteten på dataset. Utan dessa professionella skadliga användares falska [feedback], blir dataset mer [intuitivt].’
Den artikeln heter Upptäck Professionella Skadliga Användare med Metric Learning i Rekommendersystem och kommer från forskare vid Institutionen för datavetenskap och teknik vid Jilin University; Key Lab of Intelligent Information Processing of Chinese Academy of Science i Beijing; och School of Business vid Rutgers i New Jersey.
Data och Tillvägagångssätt
Att upptäcka PMU är en multimodal utmaning, eftersom två icke-ekvivalenta parametrar (en numerisk-värderad stjärn-/decimalrankning och en textbaserad recension) måste beaktas. Författarna till den nya artikeln hävdar att inget tidigare arbete har mött denna utmaning.
MMD använder ett Hierarkiskt Dubbel-Attention rekurrent Neuronnät (HDAN) för att assimilera recensionens innehåll i en sentimentspoäng.

Projicera en recension till en sentimentspoäng med HDAN, som bidrar med ordinbäddning och meningsinbäddning för att få en sentimentspoäng.
HDAN använder uppmärksamhetsmekanismer för att tilldela vikt till varje ord och till varje mening. I bilden ovan, hävdar författarna, bör ordet sämre tydligt tilldelas större vikt än konkurrerande ord i recensionen.
För projektet, tog HDAN rankningarna för produkter över fyra dataset som grundfakta. Dataseten var Amazon.com; Yelp för RecSys (2013); och två “riktiga” (snarare än experimentella) dataset, från Taobao och Jindong.
MMD använder Metric Learning, som försöker uppskatta en exakt avstånd mellan enheter för att karakterisera den övergripande gruppen av relationer i data.
MMD börjar med en one-hot-kodning för att välja användare och artikel, via en Latent Factor Model (LFM), som erhåller en basrankningspoäng. Samtidigt projicerar HDAN recensionens innehåll till sentimentspoängen som adjungerad data.
Resultaten bearbetas sedan till en Malicious User Profiling (MUP)-modell, som utmatar sentimentsgapvektorn – diskrepansen mellan rankningen och den uppskattade sentimentspoängen för recensionens textinnehåll. På detta sätt kan PMU för första gången kategoriseras och märkas.

Uppmärksamhetsbaserad Metric Learning för kluster.












