زاوية Anderson
حل CAPTCHAs باستخدام التعلم الآلي لتمكين بحث الويب المظلم

مشروع بحث أكاديمي مشترك من الولايات المتحدة الأمريكية قد طور طريقة لتحقيق CAPTCHA ،据报 يتفوق على حلول التعلم الآلي المماثلة الحالية باستخدام الشبكات المعارضة التوليدية (GANs) لفك تشفير التحديات المرئية المعقدة.
اختبار النظام الجديد ضد أفضل الإطارات الحالية ، وجد الباحثون أن طريقةهم تحقق أكثر من 94.4٪ نجاح في مجموعة بيانات العالم الحقيقي المحددة بعناية ، وأثبتت khả năng “إliminating human involvement” عند التنقل في سوق Dark Net الناشئة المحمي جيدًا بواسطة CAPTCHA ، وحل التحديات CAPTCHA تلقائيًا في ثلاث محاولات كحد أقصى.
يُدعي المؤلفون أن نهجهم يمثل اختراقًا للباحثين في مجال الأمن السيبراني ، الذين كانوا يتحملون تقليديًا تكاليف توفير البشر في الدائرة لتحليل CAPTCHAs يدويًا ، وعادةً عبر منصات التمويل الجماعي مثل Amazon Mechanical Turk (AMT).
إذا كان النظام يمكن أن يثبت مرونته وقوته ، فقد يفتح أيضًا الطريق أمام أنظمة الرقابة الآلية الأكثر تطورًا ، ولتحليل و فهرسة شبكات TOR. قد يسمح ذلك بالتحليلات الكبيرة الحجم ، بالإضافة إلى تطوير نهج وأساليب أمنية جديدة ، والتي تم حجرها حتى الآن بواسطة جدران CAPTCHA.
الورقة الورقة بعنوان Counteracting Dark Web Text-Based CAPTCHA with Generative Adversarial Learning for Proactive Cyber Threat Intelligence ، ويأتي من باحثين في جامعة أريزونا ، وجامعة جنوب فلوريدا ، وجامعة جورجيا.
الآثار
منذ أن النظام – الذي يسمى Dark Web-GAN (DW-GAN ، متاح على GitHub) – يبدو أنه أكثر أداءً من سابقه ، هناك إمكانية لاستخدامه كطريقة عامة للتغلب على CAPTCHA (عادةً أقل صعوبة) على الويب العادي ، إما في هذا التنفيذ المحدد ، أو بناءً على المبادئ العامة التي تحددها الورقة الجديدة. ومع ذلك ، بسبب التخزين المحدود في GitHub ، من الضروري الاتصال بالكاتب الرئيسي نينغ زانغ للحصول على البيانات المرتبطة بالإطار.
نظرًا لأن DW-GAN لديه “مهمة إيجابية” لتحليل CAPTCHAs (مثل TOR نفسه في الأصل له مهمة إيجابية لحماية الاتصالات العسكرية ، وفيما بعد الصحفيين) ، ونظرًا لأن CAPTCHAs هي كل من الدفاع الشرعي (غالبًا ما يستخدمها عملاق CDN الشهير CloudFlare) وأداة مفضلة لسوق Dark Web غير المشروع ، يمكن القول إن النهج هو “تقنيات مستوى”.
يقر المؤلفون بأن DW-GAN له استخدامات أوسع نطاقًا:
‘[في حين] أن هذه الدراسة تركز بشكل رئيسي على CAPTCHA للويب المظلم كمسألة أكثر تحديًا ، فإن الطريقة المقترحة في هذه الدراسة من المتوقع أن تكون قابلة للتطبيق على أنواع CAPTCHA الأخرى دون فقدان العمومية.’
من المفترض أن DW-GAN ، أو نظام مشابه ، سوف يحتاج إلى أن يصبح منتشرًا على نطاق واسع وواضحًا لتحفيز أسواق الويب المظلم على البحث عن حلول أقل قابلية للآلة ، أو على الأقل لتطوير تكوين CAPTCHA بشكل دوري ، سيناريو “الحرب الباردة”.
الدافعات
كما لاحظت الورقة ، الويب المظلم هو المصدر الرئيسي للمخابرات المتعلقة بالهجمات الإلكترونية ، والتي تُقدر بتكلفة 10 تريليونات دولار أمريكي للاقتصاد العالمي بحلول عام 2025. لذلك ، تبقى شبكات البصل بيئة آمنة نسبيًا للمجتمعات غير المشروعة للويب المظلم ، والتي يمكنها طرد الغزاة bằng طرق مختلفة ، بما في ذلك انتهاء الجلسة ، والكوكيز ، وتحقق هوية المستخدم.

نوعان من CAPTCHA ، كلاهما يستخدم خلفيات معتمة وكتابة مائلة لجعلها أقل قابلية للآلة.
然而 ، يلاحظ المؤلفون ، لا يوجد أي من هذه العوائق كبير مثل حزمة CAPTCHAs التي تنتشر في تجربة التصفح في “مجتمع حساس”:
‘في حين يمكن تجاوز معظم هذه الإجراءات بفعالية من خلال تنفيذ إجراءات مضادة آلية في برنامج زاحف ، فإن CAPTCHA هو أكثر العوائق المضادة للزحف في الويب المظلم التي لا يمكن تجاوزها بسهولة بسبب القدرات الإدراكية العالية التي لا تملكها أدوات التأمل غالبًا.’
CAPTCHAs النصية ليست الخيار الوحيد المتاح ؛ هناك متغيرات ، مألوفة للكثير منا ، التي تتحدي المستخدم لتحليل الفيديو ، والصوت ، وخاصة الصور. ومع ذلك ، كما يلاحظ المؤلفون ، CAPTCHA النصية هي التحدي المفضل لسوق Dark Web ، وبداية طبيعية لجعل شبكات TOR أكثر قابلية للتحليل الآلي.
الهندسة المعمارية
على الرغم من أن النهج السابق من جامعة نورث وست في الصين استخدم الشبكات المعارضة التوليدية لاستخراج أنماط الميزة من منصات CAPTCHA ، يلاحظ مؤلفو الورقة الجديدة أن هذه الطريقة تعتمد على تفسير صورة مصفوفة ، بدلاً من فحص أعمق للحروف المعترف بها في التحدي ؛ وأن فعالية DW-GAN لا تتأثر بطول الكلمات غير المعقولة (والأرقام) التي توجد عادةً في CAPTCHAs للويب المظلم.
DW-GAN يستخدم خط أنابيب من أربعة مراحل: أولاً يتم التقاط الصورة ، ثم يتم تغذيتها إلى وحدة تنقية الخلفية التي تستخدم GAN تم تدريبه على عينات CAPTCHA المُحَدَّدَة ، وبالتالي قادرة على تمييز الحروف من الخلفية المضطربة التي تقع عليها. يتم بعد ذلك تنقية الحروف المُستَخرَجَة من أي ضوضاء متبقية بعد استخراج GAN.
بعد ذلك ، يتم إجراء التجزئة على النص المُستَخرَج ، ثم يتم كسرها إلى ما يبدو أن تكون الحروف المكونة ، باستخدام خوارزميات الكشف عن الحواف.

تجزئة الحروف تعزل مجموعة البكسل وتحاول التعرف مع تتبع الحدود.
أخيرًا ، يتم تقديم مقاطع الحروف “المُخمَنَة” إلى التعرف على الحروف عبر شبكة عصبية متلافة (CNN).

في بعض الأحيان ، يمكن أن تتداخل الحروف ، وهي تكرار متعمد مصمم لخداع الأنظمة الآلية. DW-GAN يستخدم بالتالي التجزئة القائمة على الفاصل الزمني لتعزيز وتجزئة الحدود ، مما يفصل بشكل فعال الحروف. منذ أن تكون الكلمات عادةً غير منطقية ، لا يوجد سياق سمантиكي للمساعدة في هذه العملية.

النتائج
تم اختبار DW-GAN ضد صور CAPTCHA من ثلاث مجموعات بيانات مختلفة للويب المظلم ، بالإضافة إلى مصنع CAPTCHA شائع. تشمل الأسواق المظلمة التي جاءت منها الصور متجرين للبطاقات ، Rescator-1 و Rescator-2 ، ومجموعة جديدة من سوق Yellow Brick الناشئة (التي تم الإبلاغ عنها لاحقًا أنها اختفت في أعقاب إغلاق DarkMarket).

صور CAPTCHA من ثلاث مجموعات بيانات ، بالإضافة إلى مصنع CAPTCHA مفتوح المصدر.
وفقًا للمؤلفين ، تمت توصية البيانات المستخدمة في الاختبار من قبل خبراء استخبارات التهديدات السيبرانية (CTI) بناءً على انتشارهم الواسع عبر أسواق الويب المظلم.
شمل الاختبار لكل مجموعة بيانات تطوير عنكبوت مواجه لTOR لجمع 500 صورة CAPTCHA ، والتي تم بعد ذلك وضع علامات عليها وتنظيمها من قبل مستشارين CTI.
تم تصميم ثلاث تجارب. الأولى قيمت أداء DW-GAN العام لتحليل CAPTCHA مقابل أساليب SOTA القياسية. كانت الأساليب المنافسة CNN على مستوى الصورة مع المعالجة المسبقة ، التي تشمل تحويل الصور إلى الألوان الرمادية ، وتنظيمها ، وتمويهها الغاوسي ، وهي جهد أكاديمي مشترك من إيران والمملكة المتحدة ؛ CNN على مستوى الحرف مع التجزئة القائمة على الفاصل الزمني ؛ و CNN على مستوى الصورة ، من جامعة أكسفورد في المملكة المتحدة.

نتائج DW-GAN للتجربة الأولى ، مقارنة بالنهج السابقة.
وجد الباحثون أن DW-GAN كان قادرًا على تحسين النتائج السابقة على مدار الطريق (انظر الجدول أعلاه).
كانت التجربة الثانية دراسة إزالة ، حيث يتم إزالة أو تعطيل مكونات الإطار النشط لاستبعاد إمكانية أن العوامل الخارجية أو الثانوية تؤثر على النتائج.

نتائج دراسة الإزالة.
هناك أيضًا ، وجد المؤلفون أن تعطيل أقسام رئيسية من الهندسة المعمارية خفض أداء DW-GAN في معظم الحالات (انظر الجدول أعلاه).
كانت التجربة الثالثة اختبارًا غير متصل بالإنترنت قارن فعالية DW-GAN مقابل طريقة قائمة على الصورة وطريقتين على مستوى الحرف ، من أجل تحديد مدى تأثير تقييم الحرف في DW-GAN في الحالات التي يكون فيها كلمة CAPTCHA الغير منطقية طولًا عشوائيًا (بدلاً من طول محدد مسبقًا). في هذه الحالات ، تتراوح طول CAPTCHA بين 4 إلى 7 حروف.
للتجربة الثالثة ، استخدم المؤلفون مجموعة تدريب من 50,000 صورة CAPTCHA ، مع 5,000 محجوزة للاختبار في تقسيم 90/10 نمطي.
هناك أيضًا ، DW-GAN تفوق النهج السابقة:

اختبار مباشر على سوق Dark Net
أخيرًا ، تم نشر DW-GAN على سوق Yellow Brick Dark Net (التي كانت حية في ذلك الوقت). للاختبار ، تم تطوير متصفح الويب TOR الذي دمج DW-GAN في قدراته على التصفح ، وقام بتحليل التحديات CAPTCHA تلقائيًا.
في هذا السيناريو ، تم تقديم CAPTCHA إلى الزاحف الآلي لكل 15 طلب HTTP ، في المتوسط. تمكن الزاحف من فهرسة 1,831 عنصرًا غير قانونيًا للبيع في Yellow Brick ، بما في ذلك 1,223 منتجًا متعلقًا بالمخدرات (بما في ذلك الأفيون والكوكايين) ، و 44 حزمة اختراق ، و 9 مسحوق وثائق مزورة. في المجموع ، تمكن النظام من تحديد 286 عنصرًا متعلقًا بالأمن السيبراني ، بما في ذلك 102 بطاقة ائتمان مسروقة و 131 سجل دخول حساب مسروق. في جميع الحالات ، تمكن DW-GAN من كسر CAPTCHA في ثلاث محاولات أو أقل ، وتمت معالجة 76 دقيقة لتحليل CAPTCHAs التي تحمي جميع المنتجات. لم يكن هناك حاجة لتدخل البشر ، ولم تحدث أي حالات فشل في النقاط النهائية.
يلاحظ المؤلفون ظهور تحديات تقدم مستوى أعلى من التعقيد من CAPTCHAs النصية ، بما في ذلك بعضها يبدو أنه مستوحى من اختبارات تورينج ، ويشير إلى أن DW-GAN يمكن تحسينه لاستيعاب هذه الاتجاهات الجديدة 随着 شعبية.
*اختبار تورينج العام الآلي للتمييز بين الكمبيوتر والإنسان
نشر لأول مرة في 11 يناير 2022.













