زاوية Anderson
كشف المراجعات المخادعة على الإنترنت باستخدام التعلم الآلي

تقدم أبحاث جديدة مشتركة بين الصين والولايات المتحدة وسيلة لاكتشاف المراجعات المخادعة على منصات التجارة الإلكترونية المصممة لتخريب المنافسين أو تسهيل الابتزاز، من خلال الاستفادة من السلوك المميز لمثل هؤلاء المراجعين.
النظام، الذي يُطلق عليه نموذج الكشف عن المستخدمين الخبيثين (MMD)، يستخدم التعلم العددي، وهو تقنية مستخدمة بشكل شائع في رؤية الكمبيوتر ونظم التوصية، إلى جانب شبكة عصبونية متكررة (RNN)، لتحديد وتسمية مخرجات مثل هؤلاء المراجعين، والتي تسميها الورقة المستخدمون الخبيثون المحترفون (PMUs).
جيد! 1 نجمة
توفر معظم مراجعات التجارة الإلكترونية على الإنترنت شكلين من ملاحظات المستخدم: تصنيف نجمي (أو تصنيف من 10) ومراجعة نصية، وفي الحالة النموذجية، سيتم対応 هذين بشكل منطقي (أي أن المراجعة السيئة ستكون مصحوبة بتصنيف منخفض).
然而، يستخدم PMUs عادةً منطقًا معاكسًا، من خلال ترك مراجعة نصية سيئة مع تصنيف عالٍ، أو تصنيف سيئ مصحوبًا بمراجعة جيدة.
هذا يسمح للمراجعة للمستخدم أن تسبب ضررًا بسمعة الشركة دون أن يؤدي إلى تنبيه المرشحات البسيطة التي تم نشرها بواسطة مواقع التجارة الإلكترونية لتحديد ومعالجة مخرجات المراجعين الخبيثين السلبيين. إذا تم تحديد الشتائم في نص المراجعة بواسطة مرشح يستند إلى معالجة اللغة الطبيعية (NLP)، فإن هذا “العلم” يتم إلغاؤه بشكل فعال بواسطة التصنيف النجمي العالي (أو العشري) الذي قام PMU بتعيينه أيضًا، مما يجعل المحتوى الخبيث “معتدلًا” من وجهة نظر إحصائية.

مثال على كيفية أن يتم دمج المراجعة الخبيثة بشكل إحصائي مع المراجعات الحقيقية، من وجهة نظر نظام تصفية تعاوني يحاول تحديد مثل هذا السلوك. مصدر: https://arxiv.org/pdf/2205.09673.pdf
تلاحظ الورقة الجديدة أن نية PMU غالبًا ما تكون استخراج المال من تجار التجزئة عبر الإنترنت في مقابل تعديل المراجعات السلبية و / أو وعد بنشر مراجعات سلبية أخرى. في بعض الحالات، يتم توظيف PMU من قبل أفراد يبحثون عن خصومات، على الرغم من أن PMU يتم توظيفه بشكل متكرر من قبل منافسي الضحية.
تخفي المراجعات السلبية
تستخدم جيل الحالي من الكاشفات الآلية لهذه المراجعات تصفية تعاوني أو نظام قائم على المحتوى، ويتطلعون إلى العثور على مخالفات واضحة ودون غموض – مراجعات تكون سلبية بشكل موحد عبر كلا نهج الملاحظة، وتختلف بشكل ملحوظ عن اتجاه عام مشاعر المراجعة وتصنيفها.
العلامة الأخرى الكلاسيكية التي تركز عليها هذه المرشحات هي تكرار النشر العالي، في حين أن PMU سينشر بشكل استراتيجي وoccasionally فقط (حيث قد تمثل كل مراجعة عمولة فردية أو مرحلة في استراتيجية أطول مصممة لإضفاء غموض على “مقياس التكرار”).
لذلك، قام باحثو الورقة الجديدة بدمج القطبية الغريبة للمراجعات الخبيثة المحترفة في نظام مخصص، مما أدى إلى خوارزمية تقترب من قدرة المراجع البشري على “شم رائحة الفأر” في التناقض بين التصنيف والمحتوى النصي للمراجعة.

الهيكل المفاهيمي لـ MMD، والذي يتكون من两个 وحدات مركزية: تعريف المستخدم الخبيث (MUP) وتعلم العددي المترابط (MLC، باللون الرمادي).
مقارنة بالمناهج السابقة
منذ أن MMD هو، كما يذكر المؤلفون، أول نظام يحاول تحديد PMUs بناءً على أسلوب نشرهم المتناقض، لا توجد أعمال سابقة مباشرة يمكن مقارنتها بها. لذلك، قام الباحثون بوضع نظامهم ضد عدد من الخوارزميات المكونة التي تعتمد عليها المرشحات الآلية التقليدية، بما في ذلك تصنيف K-means ++؛ كشف الشذوذ الإحصائي القديم SOD؛ Hysad؛ Semi-sad؛ CNN-sad؛ و نظام التوصية لكشف المستخدمين الخبيثين (SDRS).

تم اختبار MMD ضد مجموعات بيانات مخطوطة من Amazon [securities_stock_price_tag symbol="amzn" exchange="nasdaq"] وYelp، ويمكنه تحديد المنافسين عبر الإنترنت المحترفين بأعلى معدل دقة، وفقًا للمؤلفين. التمثيل الغامق يظهر MMD، بينما يشير النجم (*) إلى الأداء الأفضل. في هذه الحالة، تم تجاوز MMD في مهمتين فقط، بواسطة تكنولوجيا مستقلة (MUP) التي تم دمجها بالفعل فيه، ولكنها ليست مجهزة افتراضيًا للمهمة المحددة.

في هذه الحالة، تم اختبار MMD ضد مجموعات بيانات غير مخطوطة من Taobao وJindong، مما جعله بمثابة مهمة تعلم غير مُشرَّة. مرة أخرى، تم تجاوز MMD فقط من قبل واحدة من تقنياته المكونة، والتي تم تعديلها بشكل كبير لمهمة الاختبار.
يلاحظ الباحثون:
‘في جميع مجموعات البيانات الأربع، يتفوق نموذجنا المقترح MMD (MLC + MUP) على جميع الأسس فيما يتعلق بمقياس F. لاحظ أن MMD هو مزيج من MLC و MUP، مما يضمن تفوقه على النماذج الخاضعة للإشراف والغير خاضعة للإشراف بشكل عام.’
كما تشير الورقة إلى أن MMD يمكن أن يخدم كوسيلة مُسبقة مفيدة لأنظمة المرشحات الآلية التقليدية، ويوفر نتائج تجريبية على عدد من مجموعات البيانات، بما في ذلك التصفية التعاونية المستندة إلى المستخدم (UBCF)، التصفية التعاونية المستندة إلى العنصر (IBCF)، تحليل العوامل (MF-eALS)، الترتيب الشخصي البيزي (MF-BPR)، و التصفية التعاونية العصبونية (NCF).
فيما يتعلق بنسبة الضربة (HR) و الربح التراكمي المنخفض (NDCG) في نتائج هذه الإضافات المُختبرة، يذكر المؤلفون:
‘من بين جميع مجموعات البيانات الأربع، يحسن MMD من أداء نماذج التوصية بشكل كبير من حيث HR و NDCG. على وجه التحديد، يمكن لـ MMD تحسين أداء HR بنسبة 28.7٪ في المتوسط و NDCG بنسبة 17.3٪ في المتوسط. ‘
‘من خلال حذف المستخدمين الخبيثين المحترفين، يمكن لـ MMD تحسين جودة مجموعات البيانات. بدون هذه المراجعات الخبيثة الزائفة، تصبح مجموعة البيانات أكثر [دقة].’
الورقة الورقة بعنوان كشف المستخدمين الخبيثين المحترفين باستخدام التعلم العددي في أنظمة التوصية، وهي من باحثين في قسم علوم الحاسوب والتكنولوجيا في جامعة جيلين؛ مختبر المعالجة الذكية للغة الصينية في الأكاديمية الصينية للعلوم في بكين؛ وكلية الأعمال في جامعة روتجرز في نيو جيرسي.
البيانات والمنهج
كشف PMUs هو تحدي متعدد الوسائط، حيث يجب مراعاة两个 معامل غير متكافئ (تصنيف قيمي رقمي ومراجعة نصية). يؤكد مؤلفو الورقة الجديدة أن لا عمل سابق قد تعامل مع هذا التحدي.
يستخدم MMD شبكة عصبونية متكررة ثنائية الاتجاه مع انتباه مزدوج (HDAN) لدمج محتوى المراجعة في درجة مشاعر.

إسقاط المراجعة على درجة مشاعر مع HDAN، والتي تساهم في تحويل الكلمات وتحويل الجمل للحصول على درجة مشاعر.
يستخدم HDAN آليات الانتباه لتخصيص أوزان لكل كلمة، ولكل جملة. في الصورة أعلاه، يذكر المؤلفون أن كلمة الأسوأ يجب أن تُخصص وزنًا أكبر بشكل واضح من الكلمات المتنافسة في المراجعة.
للمشروع، أخذ HDAN التصنيفات للمنتجات عبر أربع مجموعات بيانات كحقيقة موضوعية. كانت مجموعات البيانات Amazon.com؛ Yelp ل RecSys (2013)؛ ومجموعتي بيانات “عالمية” (بدلاً من تجريبية)، من Taobao وJindong.
يستفيد MMD من التعلم العددي، الذي يحاول تقدير مسافة دقيقة بين الكيانات من أجل وصف مجموعة العلاقات العامة في البيانات.
يبدأ MMD ب ترميز واحد ساخن لتحديد المستخدم والعنصر، عبر نموذج عامل 潜 في (LFM)، الذي يحصل على درجة تصنيف أساسية. وفي الوقت نفسه، يساهم HDAN في إسقاط محتوى المراجعة في درجة المشاعر كبيانات مضافة.
ثم يتم معالجة النتائج في نموذج تعريف المستخدم الخبيث (MUP)، الذي يخرج متجه الفجوة العاطفية – الفارق بين التصنيف ودرجة المشاعر المقدرة لمحتوى نص المراجعة. بهذه الطريقة، يمكن تصنيف PMUs وتسميتها لأول مرة.

التعلم العددي القائم على الانتباه للتركيب.












