زاوية Anderson

إعادة تحديد المعلقين المحظورين على وسائل التواصل الاجتماعي باستخدام التعلم الآلي

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

قام باحثون من جامعة جون هوبكينز بتطوير نهج عميق لتحديد المعلقين عبر الإنترنت الذين قد تم تعليق حساباتهم السابقة ، أو قد يستخدمون حسابات متعددة للتحايل أو التلاعب بصدق المجتمعات عبر الإنترنت مثل Reddit و Twitter.

يقدم النهج ، الذي قدمته ورقة جديدة بقيادة باحث اللغة الطبيعية أليم خان ، لا يتطلب أن تكون البيانات المدخلة مُحَددة تلقائيًا أو يدوياً ، ويحسن على نتائج المحاولات السابقة حتى عند توفر عينات صغيرة من النص ، وعندما لم يكن النص موجودًا في مجموعة البيانات أثناء التدريب.

يقدم النظام مخططًا بسيطًا لتعزيز البيانات ، مع تعبئة بمقاسات مختلفة مدربة على مجموعة بيانات كبيرة الحجم تحتوي على أكثر من 300 مليون تعليق تغطي مليون حساب مستخدم مختلف.

هندسة نظام تحديد الهوية في جون هوبكينز ، حيث المكونات الأساسية هي 1) المحتوى النصي ، 2) ميزة Sub-Reddit و 3) تاريخ ونشر التاريخ.

هندسة نظام تحديد الهوية في جون هوبكينز ، حيث المكونات الأساسية هي 1) المحتوى النصي ، 2) ميزة Sub-Reddit و 3) تاريخ ونشر التاريخ. مصدر: https://arxiv.org/pdf/2105.07263.pdf

يعتمد الإطار ، الذي يعتمد على بيانات استخدام Reddit ، على المحتوى النصي وميزة Sub-Reddit وتاريخ النشر. يتم الجمع بين هذه العوامل الثلاثة مع طرق تعبئة متنوعة ، بما في ذلك التعبئة الخطية والتعيينات الخطية ، ومساعدة آلية الانتباه وطبقة التجميع الأقصى.

على الرغم من أن النظام يركز على مجال النص ، يعتقد الباحثون أن نهجهم يمكن ترجمته إلى تحليل الفيديو أو الصور ، لأن الخوارزمية المشتقة تعمل على تكرارات التردد على مستوى عالٍ ، على الرغم من اختلاف أطوال مدخلات بيانات التدريب.

تجنب الانجراف عن الموضوع

فخ واحد يمكن أن تقع فيه أبحاث هذا النوع ، والتي قد تعالجها المؤلفون صراحة في تصميم النظام ، هو وضع تركيز زائد على تكرار المواضيع أو الأفكار عبر منشورات حسابات مختلفة.

على الرغم من أن المستخدم قد يكتب بشكل متكرر أو متكرر في سلسلة فكرية معينة ، من المحتمل أن تتطور الموضوع وتتغير مع مرور الوقت ، مما يقلل من قيمتها ك مفتاح للهوية. يصف المؤلفون هذا الفخ المحتمل بأنه “صحيح للأسباب الخاطئة” – وهو حفرة سابقة تم دراستها في جون هوبكينز.

منهجية التدريب

يستخدم النظام تدريب الدقة المختلطة ، وهو ابتكار قدمته Baidu و NVIDIA (NVDA ) في عام 2018 ، والذي يقلل من متطلبات الذاكرة بنسبة نصفها من خلال استخدام أرقام النقطة العائمة بدقة نصفها: 16 بت بدلاً من 32 بت. تم تدريب البيانات على جهازين V100 GPU ، مع متوسط وقت التدريب يبلغ 72 ساعة.

مجموعة البيانات

استمد الباحثون مجموعة بيانات تضم 300 مليون تعليق على Reddit من مجموعة Pushshift Reddit Corpus لعام 2020 ، تسمى مجموعة بيانات مليون مستخدم.

تتكون المجموعة من جميع المنشورات التي نشرها مؤلفو Reddit الذين نشروا 100-1000 منشور بين يوليو 2015 و يونيو 2016. يوفر العينة بمرور الوقت طولًا كافيًا للتاريخ لدراسة ، ويقلل من تأثير منشورات البريد العشوائي التي لا تقع ضمن نطاق أهداف البحث.

إحصائيات حول المجموعة المشتقة لمشروع تحديد الهوية في جون هوبكينز.

إحصائيات حول المجموعة المشتقة لمشروع تحديد الهوية في جون هوبكينز.

النتائج

تظهر الصورة أدناه تحسن تراكمي للنتائج أثناء اختبار دقة التصنيف عند فترات زمنية مدتها ساعة واحدة في التدريب. بعد ست ساعات ، يتجاوز النظام إنجازات المبادرات السابقة المرتبطة.

تكرار النشر كتوقيع إعادة التعريف

هذا يشير أيضًا إلى أن الإطار قابل للنقل بدرجة عالية إلى أنظمة التعليق أو النشر الأخرى حيث يكون المحتوى النصي وتاريخ النشر فقط متاحين – وب本质 ، أن تكرار النشر هو مؤشر قيم إلى المحتوى النصي الفعلي.

يشير الباحثون إلى أن محاولة إجراء نفس التقدير داخل محتوى subreddit واحد ت đạiحض تحديًا أكبر ، لأن subreddit نفسه يخدم كوكيل موضوع ، وسيحتاج مخطط إضافي لملء هذا الدور.

تطوير العمل

على عكس العديد من مبادرات التعلم الإشرافي ، تكون الميزات في مخطط تحديد الهوية في هوبكينز منفصلة وقوية بدرجة كافية بحيث تحسن أداء النظام بشكل ملحوظ مع زيادة حجم البيانات.

يعبر الباحثون عن اهتمامهم بتطوير النظام من خلال اعتماد نهج أكثر دقة لتحليل أوقات النشر ، لأن الجداول الزمنية المتوقعة للمخادعين الآليين (الآليين أو غيرهم) قابلة للتعرف من خلال هذا النهج ، وهذا سيجعل من الممكن إما القضاء بشكل أكثر فعالية على المحتوى الروبوتي من دراسة تهدف في الأساس إلى المستخدمين المزعجين ، أو المساعدة في تحديد المحتوى الآلي.

كاتب في التعلم الآلي، متخصص في مجال合成 الصور البشرية. سابقًا رئيس محتوى البحث في Metaphysic.ai، حتى انحلت في DNEG's Brahma.ai.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai