Anderson의 관점
악의적인 온라인 리뷰를 머신 러닝으로检测 – Detecting ‘Professional’ Malicious Online Reviews with Machine Learning

중국과 미국의 새로운 연구 협력은 경쟁자를 훼손하거나 협박하기 위해 설계된 악의적인 전자상거래 리뷰를 감지하는 방법을 제공하며, 이러한 리뷰어의 서명 행동을 활용합니다.
시스템, 악의적인 사용자 감지 모델(MMD)이라고 불리는 것은, Metric Learning을 사용하여, 컴퓨터 비전과 추천 시스템에서 일반적으로 사용되는 기술을 사용하며, 또한 순환 신경망(RNN)을 사용하여 이러한 리뷰어의 출력을 식별하고 레이블을 지정합니다. 이 논문에서는 이러한 리뷰어를 전문 악의적인 사용자(PMU)라고 명명합니다.
훌륭한 리뷰! 1 개의 별
온라인 전자상거래 리뷰는 일반적으로 두 가지 형태의 사용자 피드백을 제공합니다. 별 평점(또는 10점 중)과 텍스트 기반 리뷰입니다. 일반적으로 이러한 리뷰는 논리적으로 일치합니다(즉, 나쁜 리뷰는 낮은 평점과 함께 제공됩니다).
그러나 PMU는 이러한 논리를 무시하여 나쁜 텍스트 리뷰와 높은 평점을 남길 수 있습니다. 또는 낮은 평점과 좋은 리뷰를 남길 수 있습니다.
이로 인해 사용자의 리뷰는 필터링 시스템이 악의적인 리뷰어의 출력을 식별하고 처리하는 것을 방해하면서도 평판을 손상시킬 수 있습니다. 자연어 처리(NLP) 기반 필터가 리뷰 텍스트에서 비방을 식별하면, 높은 별 평점으로 인해 이 악의적인 콘텐츠가 통계적으로 중립화됩니다.

협업 필터링 시스템의 관점에서 악의적인 리뷰가 통계적으로 정당한 리뷰와 섞이는 방법의 예입니다. 출처: https://arxiv.org/pdf/2205.09673.pdf
새로운 논문은 PMU의 목적이 종종 온라인 소매업체로부터 돈을 갈취하기 위해 부정적인 리뷰를 수정하거나 추가로 게시하지 않도록 협상하는 것이라고 지적합니다. 경우에 따라서는 이러한 행위자는 ad hoc 개인들입니다. 그러나 종종 PMU는 피해자의 경쟁사에 의해 고용됩니다.
부정적인 리뷰를 감추는 것
현재의 자동 감지기는 협업 필터링 또는 콘텐츠 기반 모델을 사용하여 명확하고 모호하지 않은 아웃라이어를 찾고 있습니다. 이러한 아웃라이어는 두 가지 피드백 방법 모두에서 균일하게 부정적이며 일반적인 리뷰 감정과 평점에서 현저히 벗어납니다.
또한 이러한 필터는 높은 게시 빈도를 기준으로 합니다. 그러나 PMU는 전략적으로 그리고 때때로 게시합니다(각 리뷰는 개별 위임 또는 더 긴 전략의 일부일 수 있으므로 ‘빈도’ 지표를 흐리게 합니다).
따라서 새로운 논문의 연구자들은 전문적인 악의적인 리뷰의 이상한 극성을 전용 시스템에 통합하여 알고리즘을 개발했습니다. 이는 인간 리뷰어가 리뷰 텍스트 콘텐츠와 평점 간의 불일치를 감지하는 능력과 거의 같습니다.

MMD의 개념적 아키텍처: Malicious User Profiling (MUP)와 Attention Metric Learning (MLC, 회색)의 두 개의 중앙 모듈로 구성됩니다.
이전 접근 방식과 비교
MMD는 이전에 PMU를 식별하기 위해 시도된 시스템이 없기 때문에, 이전의 직접적인 비교는 없습니다. 따라서 연구자들은 MMD를 전통적인 자동 필터링 시스템에서 종종 사용되는 여러 구성 요소 알고리즘과 비교했습니다. 이러한 알고리즘에는 K-means++ 클러스터링,Statistic Outlier Detection (SOD), Hysad, Semi-sad, CNN-sad, 및 Slanderous user Detection Recommender System (SDRS)이 포함됩니다.

Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] 과 Yelp의 레이블이 지정된 데이터셋에 대해 테스트된 MMD는 가장 높은 정확도로 전문적인 온라인 악의적인 사용자를 식별할 수 있습니다.

이 경우 MMD는 태obao와 징동의 레이블이 지정되지 않은 데이터셋에 대해 테스트되었습니다.
연구자들은 다음과 같이 관찰합니다:
‘모든 네 가지 데이터셋에서, 우리의 제안된 모델 MMD (MLC+MUP)는 F-점수 측면에서 모든 기준을 초과합니다. MMD는 MLC와 MUP의 조합으로, 일반적으로 지도 학습 및 비지도 학습 모델보다 우수함을 보장합니다.’
이 논문은 또한 MMD가 전통적인 자동 필터링 시스템의 유용한 전처리 방법으로 사용될 수 있으며, 여러 데이터셋에 대한 실험 결과를 제공합니다. 이러한 데이터셋에는 사용자 기반 협업 필터링(UBCF), 아이템 기반 협업 필터링(IBCF), 행렬 분해(MF-eALS), 베이즈 개인화 순위(MF-BPR), 및 신경 협업 필터링(NCF)이 포함됩니다.
이러한 증강의 결과에서, 히트 비율(HR) 및 정규화된 할인 누적 이득(NDCG)에 대해, 연구자들은 다음과 같이 말합니다:
‘모든 네 가지 데이터셋에서, MMD는 추천 모델의 성능을 크게 향상시킵니다. 특히, MMD는 평균적으로 HR의 성능을 28.7% 향상시키고, NDCG의 성능을 17.3% 향상시킵니다. ‘
‘전문적인 악의적인 사용자를 삭제함으로써, MMD는 데이터셋의 품질을 향상시킬 수 있습니다. 이러한 전문적인 악의적인 사용자의 가짜 피드백 없이, 데이터셋은 더 직관적이 됩니다.’
이 논문은 추천 시스템에서 Metric Learning을 사용하여 전문적인 악의적인 사용자 감지라는 제목을 가지고 있으며, 吉林大学의 컴퓨터 과학 및 기술부, 중국 과학 아카데미의 지능 정보 처리 키 연구실, 및 뉴저지의 러트거스 대학교의 비즈니스 학교의 연구자들에 의해 작성되었습니다.
데이터 및 접근 방식
PMU를 감지하는 것은 다중 모달 챌린지입니다. 두 개의 비동등한 매개변수(숫자 값 평점 및 텍스트 기반 리뷰)를 고려해야 하기 때문입니다. 새로운 논문의 저자들은 이전에 이러한 챌린지를 해결한 연구가 없다고 주장합니다.
MMD는 계층적 이중 주의 순환 신경망(HDAN)을 사용하여 리뷰 콘텐츠를 감정 점수로 통합합니다.
HDAN은 각 단어와 각 문장에 가중치를 할당하는 주의 메커니즘을 사용합니다. 위의 이미지에서, 저자들은 poorer라는 단어가 다른 단어보다 더 큰 가중치를 할당되어야 한다고 말합니다.
프로젝트에서, HDAN은 네 개의 데이터셋에서 제품 평점을 기준으로 사용했습니다. 데이터셋은 Amazon.com, Yelp for RecSys(2013), 및 두 개의 ‘실세계’ 데이터셋(태obao와 징동)으로 구성되었습니다.
MMD는 Metric Learning을 사용하여 데이터의 관계 그룹을 특성화하기 위해 엔티티 간의 정확한 거리를 추정합니다.
MMD는 사용자와 아이템을 선택하기 위해 원핫 인코딩을 시작합니다. 이는 잠재 요인 모델(LFM)을 통해 기본 평점 점수를 얻습니다.同时, HDAN은 리뷰 콘텐츠를 감정 점수로 투영합니다.
결과는 Malicious User Profiling (MUP) 모델로 처리되어 감정 격차 벡터를 출력합니다. 이는 평점과 리뷰 텍스트 콘텐츠의 추정된 감정 점수 간의 불일치입니다. 이러한 방식으로, PMU를 분류하고 레이블을 지정할 수 있습니다.

클러스터링을 위한 주의 기반 Metric Learning
Metric Learning for Clustering (MLC)은 이러한 출력 레이블을 사용하여 사용자 리뷰가 악의적인지 여부의 확률을 계산하는 기준을 설정합니다.
인간 테스트
양적 결과 외에도, 연구자들은 사용자 연구를 수행하여 20명의 학생들에게 리뷰 콘텐츠와 별 평점만을 기반으로 악의적인 리뷰를 식별하도록 요청했습니다. 참가자들은 리뷰를 ‘0’(정상 리뷰어) 또는 ‘1’(전문적인 악의적인 사용자)로 평가했습니다.
50/50의 정상 리뷰와 악의적인 리뷰 분할에서, 참가자들은 평균적으로 24개의 真陽性와 24개의 真陰性 사용자를 레이블링했습니다. 비교적으로, MMD는 평균적으로 23개의 真陽性와 24개의 真陰性 사용자를 레이블링했습니다. 이는 거의 인간 수준의 식별 능력에 도달하며, 기준을 초과합니다.

학생 대 MMD.
저자들은 다음과 같이 결론을 내립니다:
‘본질적으로, MMD는 전문적인 악의적인 사용자를 탐지하는 데 사용될 수 있는 일반적인 솔루션입니다. 또한 이미지, 비디오 또는 사운드와 같은 더 많은 데이터를 사용하여 제목과 콘텐츠 간의 감정 격차를 감지하는 데 사용될 수 있습니다. 이는 다양한 응용 프로그램에서 다른 마스킹 전략에 대응하는 밝은 미래를 가지고 있습니다.’
2022년 5월 20일에 처음 게시되었습니다.













