زاوية Anderson
أداة تعليم الصور المعتمدة على المتصفح لبيانات رؤية الكمبيوتر

قام باحثون من فنلندا بتطوير أداة تعليم الصور المعتمدة على المتصفح بهدف تحسين سهولة وسرعة عمليات تعليم الصور المتعبة لبيانات رؤية الكمبيوتر. يتم تثبيت الأداة الجديدة كملحق للعديد من محركات المتصفح الشهيرة، وتمكّن المستخدمين من “تعليم الصور أثناء التصفح بحرية”، بدلاً من الحاجة إلى وضع جلسة تعليم في سياق إعداد مخصص، أو تشغيل رمز العميل والظروف الخاصة الأخرى.
سميت الأداة الجديدة BRIMA (أداة تعليم الصور المعتمدة على المتصفح فقط منخفضة التكلفة)، وقد تم تطويرها في جامعة يوفاسكولا. إنها تُزيل الحاجة إلى جمع البيانات وتجميعها في المجلدات المحلية أو عن بُعد، ويمكن تعيينها لاستخراج البيانات المفيدة من المعلمات المتاحة على أي منصة عامة.

BRIMA في العمل. مصدر: https://arxiv.org/pdf/2107.06351.pdf
بهذه الطريقة، تُزيل BRIMA الحواجز المحتملة التي قد تظهر عند حظر الأنظمة الآلية لتحليل الويب عبر نطاقات IP أو الطرق الأخرى، وتمكّن من جمع البيانات – وهي حالة من المتوقع أن تصبح أكثر شيوعًا مع زيادة التركيز على حماية IP، كما هو الحال مع أداة Microsoft لتحليل الشفرة، Copilot.
由于 BRIMA مُصممة فقط لتعليم الصور بواسطة الإنسان، فإن استخدامها أقل احتمالاً لتحفيز الحواجز الأخرى، مثل تحديات CAPTCHA أو الأنظمة الآلية الأخرى المُصممة لمنع خوارزميات جمع البيانات.
قدرات جمع البيانات التكيفية
تم تطبيق BRIMA عبر ملحق Firefox أو ملحق Chrome على نظام Windows أو نظام OSX أو Linux، ويمكن تعيينه لاستهلاك البيانات الهامة بناءً على النقاط التي قد تختارها المنصة لجعلها ظاهرة. على سبيل المثال، عند تعليم الصور في Google Street View، يمكن للنظام أن يأخذ في الاعتبار اتجاه ووجهة العدسة، وسجّل الموقع الجغرافي الدقيق للكائن المحدد في ظل الانتباه المستخدم.

تم اختبار BRIMA في سبتمبر 2020 من قبل مبتكريها، خلال التعاون على مبادرة جماعية لإنشاء مجموعة بيانات لاكتشاف الكائنات في كاميرات المراقبة (الكاميرات المثبتة في الأماكن العامة أو المرئية من الأماكن العامة).
يتكون النظام من تثبيت جانب العميل خفيف الوزن في شكل ملحق المتصفح، وجانب الخادم الذي يستقبل ويعالج بيانات التعليم. تم كتابة تطبيقات المرجع لجانب الخادم بلغات Python وPHP مع Flask وSwagger/OpenAPI، لكن الباحثين يؤكدون أن архيتECTURE المعالجة المركزية يمكن بسهولة نقلها إلى لغات وتكوينات أخرى.
يتواصل الملحق والخادم عبر طلبات API RESTful وHTTP/XHR، مع إرسال بيانات العميل إلى المنزل في تنسيق JSON متوافق مع MS COCO. هذا يعني أن البيانات قابلة للاستخدام فورًا مع مجموعة متنوعة من إطارات الكشف عن الكائنات الشهيرة، بما في ذلك خلفيات متنوعة لTensorFlow، مثل Detectron2 من Facebook ، وCenterMask2.
أدوات مخصصة للمشروع
على الرغم من الطبيعة العامة لBRIMA، يمكن تعيينه في تكوينات جمع بيانات مخصصة للغاية، بما في ذلك فرض قوائم منسدلة ومعلومات سياقية أخرى متعلقة بمجال معين. في الصورة أدناه، نرى أن قائمة منسدلة متعلقة بمعلومات الكاميرا قد تم كتابتها في BRIMA، بحيث يمكن لمجموعة من معلمي الصور تقديم معلومات مفصلة وملائمة للمشروع.

يمكن تعيين هذه الأدوات الإضافية محليًا. يحتوي الملحق أيضًا على تثبيت سهل وقصاصات لوحة المفاتيح القابلة للتخصيص، إلى جانب عناصر واجهة المستخدم الملونة.
يبني العمل على عدد من المحاولات في السنوات الأخيرة لتحسين سهولة تعليم الصور لبيانات الويب أو البيانات العامة. أداة PhotoStuff، التي تدعمها DARPA، تقدم تعليمًا عبر الويب عبر بوابة ويب مخصصة، ويمكن تشغيلها على الويب السيميائي أو كتطبيق مستقل؛ في عام 2004، اقترحت جامعة كاليفورنيا في بيركلي تعليم الصور على هاتف الكاميرا، الذي اعتمد بشكل كبير على البيانات الوصفية بسبب قيود تغطية الشبكة وقيود العرض في تلك الفترة؛ كما اقترح مشروع LabelMe في معهد ماساتشوستس للتكنولوجيا في عام 2005، الذي اعتمد على أدوات MATLAB؛
منذ إطلاقها في عام 2015، اكتسبت إطار LabelImg مفتوح المصدر باللغة Python/QT شعبية في جهود التعليم الجماعي، مع تثبيت محلي مخصص. ومع ذلك، يلاحظ باحثو BRIMA أن LabelImg تركز على معايير PascalVOC وYOLO، ولا يدعم تنسيق MS COCO JSON، ويتجنب أدوات التخطيط المتعددة الزوايا لصالح مناطق الالتقاط المستطيلة البسيطة (التي ستتطلب التجزئة اللاحقة).












