Andersons hoek
Het detecteren van ‘professionele’ kwaadwillige online beoordelingen met Machine Learning

Een nieuwe onderzoeks samenwerking tussen China en de VS biedt een manier om kwaadwillige e-commerce beoordelingen te detecteren die zijn ontworpen om concurrenten te ondermijnen of om afpersing te faciliteren, door het gebruik van de handtekeninggedrag van dergelijke beoordelaars.
Het systeem, getiteld kwaadwillige gebruiker detectie model (MMD), maakt gebruik van Metric Learning, een techniek die vaak wordt gebruikt in computer visie en recommender systemen, samen met een Recurrent Neural Network (RNN), om de uitvoer van dergelijke beoordelaars te identificeren en te labelen, die in het artikel Professionele Kwaadwillige Gebruikers (PMU’s) worden genoemd.
Geweldig! 1 ster
De meeste online e-commerce beoordelingen bieden twee vormen van gebruikersfeedback: een sterrenrating (of een rating uit 10) en een tekstuele beoordeling, en in een typisch geval zullen deze logischerwijs overeenkomen (d.w.z. een slechte beoordeling zal worden gevolgd door een lage rating).
PMU’s subverteren deze logica echter door een slechte tekstuele beoordeling te laten zien met een hoge rating, of een lage rating met een goede beoordeling.
Dit stelt de gebruiker in staat om reputatieschade aan te richten zonder de relatief eenvoudige filters te activeren die door e-commerce sites worden gebruikt om de uitvoer van kwaadwillige negatieve beoordelaars te identificeren en aan te pakken. Als een filter op basis van Natural Language Processing (NLP) invectieven in de tekst van een beoordeling identificeert, wordt deze ‘flag’ effectief geannuleerd door de hoge sterrenrating (of decimale rating) die de PMU ook heeft toegewezen, waardoor de kwaadwillige inhoud ‘neutraal’ wordt vanuit een statistisch oogpunt.

Een voorbeeld van hoe een kwaadwillige beoordeling statistisch kan worden gemengd met echte beoordelingen, vanuit het oogpunt van een collaboratief filter systeem dat probeert dergelijk gedrag te identificeren. Bron: https://arxiv.org/pdf/2205.09673.pdf
Het nieuwe artikel merkt op dat de bedoeling van een PMU vaak is om geld af te persen van online retailers in ruil voor het wijzigen van negatieve beoordelingen en/of een belofte om geen verdere negatieve beoordelingen te plaatsen. In sommige gevallen zijn de actoren ad hoc individuen die korting zoeken, hoewel de PMU vaak casual wordt ingehuurd door de concurrenten van het slachtoffer.
Cloaking Negative Reviews
De huidige generatie van geautomatiseerde detectors voor dergelijke beoordelingen gebruikt Collaborative Filtering of een content-based model, en zoekt naar duidelijke en ondubbelzinnige ‘outliers’ – beoordelingen die uniform negatief zijn over beide feedbackmethoden en die aanzienlijk afwijken van de algemene trend van beoordelingssentiment en rating.
De andere klassieke handtekening die deze filters gebruiken is een hoge publicatiefrequentie, terwijl een PMU strategisch en slechts af en toe publiceert (aangezien elke beoordeling een individuele commissie kan vertegenwoordigen of een stap in een langere strategie kan zijn die is ontworpen om de ‘frequentie’ metric te verhullen).
Daarom hebben de onderzoekers van het nieuwe artikel de vreemde polariteit van professionele kwaadwillige beoordelingen geïntegreerd in een speciaal systeem, wat resulteert in een algoritme dat bijna gelijk is aan de mogelijkheid van een menselijke beoordelaar om ‘een rat te ruiken’ in de dispariteit tussen de rating en de tekstinhoud van de beoordeling.

De conceptuele architectuur voor MMD, bestaande uit twee centrale modules: Malicious User Profiling (MUP) en Attention Metric Learning (MLC, in grijs).
Vergelijking met eerdere benaderingen
Aangezien MMD, zoals de auteurs stellen, het eerste systeem is dat probeert om PMU’s te identificeren op basis van hun schizofrene publicatiestijl, zijn er geen directe eerdere werken om het mee te vergelijken. Daarom hebben de onderzoekers hun systeem getest tegen een aantal componentalgoritmen waarop traditionele geautomatiseerde filters vaak afhankelijk zijn, waaronder K-means++ Clustering; de vermaarde Statistic Outlier Detection (SOD); Hysad; Semi-sad; CNN-sad; en Slanderous user Detection Recommender System (SDRS).

Getest tegen gelabelde datasets van Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] en Yelp, kan MMD professionele online detractors identificeren met de hoogste nauwkeurigheid, zoals de auteurs claimen. Vetgedrukt vertegenwoordigt MMD, terwijl de asterisk (*) de beste prestatie aangeeft. In dit geval werd MMD alleen verslagen in twee taken door een standalone technologie (MUP) die al in MMD is geïntegreerd, maar die niet standaard is geconfigureerd voor de taak in kwestie.

In dit geval werd MMD getest tegen ongelabelde datasets van Taobao en Jindong, waardoor het effectief een ongezien leeropdracht werd. Opnieuw werd MMD alleen overtroffen door een van zijn eigen constituerende technologieën, die sterk was aangepast voor de taak voor het doel van het testen.
De onderzoekers observeren:
‘[Op] alle vier datasets, presteert ons voorgestelde model MMD (MLC+MUP) beter dan alle baselines in termen van F-score. Let op dat MMD een combinatie is van MLC en MUP, wat zijn superioriteit over gecontroleerde en ongecontroleerde modellen in het algemeen garandeert.’
Het artikel suggereert ook dat MMD kan dienen als een nuttige voorbewerkingsmethode voor traditionele geautomatiseerde filtersystemen en biedt experimentele resultaten op een aantal datasets, waaronder User-based collaborative Filtering (UBCF), Item-based collaborative Filtering (IBCF), Matrix Factorization (MF-eALS), Bayesian personalized ranking (MF-BPR), en Neural Collaborative Filtering (NCF).
In termen van Hit Ratio (HR) en Normalized Discounted Cumulative Gain (NDCG) in de resultaten van deze geteste uitbreidingen, stellen de auteurs:
‘Bij alle vier datasets, verbetert MMD de aanbevelingsmodellen aanzienlijk in termen van HR en NDCG. Specifiek kan MMD de prestatie van HR verbeteren met 28,7% gemiddeld en NDCG met 17,3% gemiddeld.
‘Door professionele kwaadwillige gebruikers te verwijderen, kan MMD de kwaliteit van datasets verbeteren. Zonder deze professionele kwaadwillige gebruikers’ nep [feedback], wordt de dataset intuïtiever.’
Het artikel is getiteld Detect Professional Malicious User with Metric Learning in Recommender Systems, en komt van onderzoekers aan de afdeling Computerwetenschappen en Technologie van de Jilin Universiteit; het Key Lab van Intelligent Information Processing van de Chinese Academie van Wetenschappen in Beijing; en de School of Business van Rutgers in New Jersey.
Gegevens en benadering
Het detecteren van PMU’s is een multimodale uitdaging, aangezien twee niet-equivalente parameters (een numerieke waarde ster/decimale rating en een tekstuele beoordeling) moeten worden overwogen. De auteurs van het nieuwe artikel beweren dat geen enkel eerder werk deze uitdaging heeft aangepakt.
MMD gebruikt een Hierarchical Dual-Attention recurrent Neural network (HDAN) om de beoordelingsinhoud te assimileren in een sentiment score.

Een beoordeling projecteren in een sentiment score met HDAN, die woordembedding en zinembedding bijdraagt om een sentiment score te verkrijgen.
HDAN gebruikt aandachtsmechanismen om gewichten toe te kennen aan elk woord en aan elke zin. In de afbeelding hierboven, stellen de auteurs, zou het woord arm duidelijk een groter gewicht moeten krijgen dan concurrerende woorden in de beoordeling.
Voor het project nam HDAN de ratings voor producten over vier datasets als grondwaarheid. De datasets waren Amazon.com; Yelp voor RecSys (2013); en twee ‘echte wereld’ (in plaats van experimentele) datasets, van Taobao en Jindong.
MMD maakt gebruik van Metric Learning, dat probeert om een nauwkeurige afstand tussen entiteiten te schatten om de algehele groep van relaties in de gegevens te karakteriseren.
MMD begint met een one-hot encoding om de gebruiker en het item te selecteren, via een Latent Factor Model (LFM), dat een basisrating score verkrijgt. Ondertussen projecteert HDAN de beoordelingsinhoud in de sentiment score als aanvullende gegevens.
De resultaten worden vervolgens verwerkt in een Malicious User Profiling (MUP) model, dat de sentiment gap vector uitvoert – de dispariteit tussen de rating en de geschatte sentiment score van de tekstinhoud van de beoordeling. Op deze manier kunnen PMU’s voor het eerst worden gecategoriseerd en gelabeld.

Aandachtsgebaseerde Metric Learning voor clustering.












