نماذج ومنصات الذكاء الاصطناعي
SEER: إنجاز في نماذج الرؤية الحاسوبية ذات الإشراف الذاتي

في العقد الماضي ، شهدت الذكاء الاصطناعي والتعلم الآلي تقدمًا كبيرًا. اليوم ، فهي أكثر دقة و كفاءة وقدرة من أي وقت مضى. يمكن للنماذج الحديثة من الذكاء الاصطناعي والتعلم الآلي التعرف بسهولة ودقة على الأشياء في الصور أو ملفات الفيديو. بالإضافة إلى ذلك ، يمكنها توليد نصوص وخطاب يتوافق مع الذكاء البشري.
تعتمد نماذج الذكاء الاصطناعي والتعلم الآلي اليوم بشكل كبير على التدريب على مجموعات بيانات مخططة تعلمها كيفية تفسير كتلة نصية ، أو تحديد الأشياء في صورة أو إطار فيديو ، وغيرها من المهام.
على الرغم من قدراتها ، فإن نماذج الذكاء الاصطناعي والتعلم الآلي ليست مثالية ، ويعمل العلماء على بناء نماذج قادرة على التعلم من المعلومات التي يتم تقديمها لها ، وليس بالضرورة الاعتماد على بيانات مخططة أو معلمة. هذا النهج يُعرف باسم التعلم الذاتي الإشراف ، وهو أحد أكثر الطرق فعالية لبناء نماذج التعلم الآلي والذكاء الاصطناعي التي لديها ” الحدس ” أو المعرفة الخلفية لحل المشكلات التي تتجاوز قدرات نماذج الذكاء الاصطناعي الحالية.
لقد أظهر التعلم الذاتي الإشراف نتائجه في معالجة اللغة الطبيعية ، حيث سمح للمطورين بتدريب نماذج كبيرة يمكنها العمل مع كمية هائلة من البيانات ، وأدى إلى عدة إنجازات في مجالات الاستدلال اللغوي ، والترجمة الآلية ، والإجابة على الأسئلة.
يهدف نموذج SEER من فيسبوك إلى تعظيم قدرات التعلم الذاتي الإشراف في مجال الرؤية الحاسوبية. SEER أو SElf SupERvised هو نموذج للرؤية الحاسوبية ذات الإشراف الذاتي يحتوي على أكثر من مليار معامل ، وقادر على العثور على أنماط أو تعلم حتى من مجموعة عشوائية من الصور الموجودة على الإنترنت دون تعليمات أو علامات مناسبة. (META )
الحاجة إلى التعلم الذاتي الإشراف في الرؤية الحاسوبية
التعليم أو تعليم البيانات هو مرحلة ما قبل المعالجة في تطوير نماذج التعلم الآلي والذكاء الاصطناعي. يتمثل عملية تعليم البيانات في تحديد البيانات الخام مثل الصور أو إطارات الفيديو ، ثم إضافة علامات على البيانات لتحديد سياق البيانات للنموذج. تسمح هذه العلامات للنموذج بإجراء تنبؤات دقيقة على البيانات.
أحد أكبر العوائق التي تواجه المطورين عند العمل على نماذج الرؤية الحاسوبية هو العثور على بيانات مخططة عالية الجودة. تعتمد نماذج الرؤية الحاسوبية اليوم على هذه البيانات المخططة لتعلم الأنماط التي تمكنها من التعرف على الأشياء في الصورة.
يعرض تعليم البيانات واستخدامه في نموذج الرؤية الحاسوبية التحديات التالية:
إدارة جودة المجموعة البيانية المستمرة
من المحتمل أن يكون أكبر عائق أمام المطورين هو الحصول على مجموعة بيانات عالية الجودة بشكل مستمر ، لأن مجموعة بيانات عالية الجودة مع علامات واضحة وصور واضحة تؤدي إلى تعلم أفضل ونموذج أكثر دقة. ومع ذلك ، فإن الحصول على مجموعة بيانات عالية الجودة بشكل مستمر له تحدياته الخاصة.
إدارة القوى العاملة
غالبًا ما يأتي تعليم البيانات مع مشاكل إدارة القوى العاملة ، chủ yếu لأن عددًا كبيرًا من العمال مطلوب لمعالجة وتصنيف كميات كبيرة من البيانات غير المهيكلة وغير المعلّمة ، مع ضمان الجودة. لذلك ، من الضروري للمطورين أن يجدوا توازنًا بين الجودة والكمية عند تعليم البيانات.
القيود المالية
من المحتمل أن يكون أكبر عائق هو القيود المالية المرافقة لتعليم البيانات ، وغالبًا ما يكون تكلفة تعليم البيانات نسبة كبيرة من التكلفة الإجمالية للمشروع.
كما يمكن رؤية ذلك ، فإن تعليم البيانات هو عائق كبير في تطوير نماذج الرؤية الحاسوبية المتقدمة ، خاصة عند تطوير نماذج معقدة تتعامل مع كمية كبيرة من بيانات التدريب. هذا هو السبب في أن ngành الرؤية الحاسوبية تحتاج إلى التعلم الذاتي الإشراف لتطوير نماذج متقدمة وقادرة على التعامل مع مهام تتجاوز قدرات نماذج الرؤية الحاسوبية الحالية.
مع ذلك ، هناك بالفعل العديد من نماذج التعلم الذاتي الإشراف التي أدت أداء جيدًا في بيئة خاضعة للرقابة ، وخاصة على مجموعة بيانات ImageNet. على الرغم من أن هذه النماذج قد تؤدي أداء جيدًا ، إلا أنها لا ت满ي الشرط الأساسي للتعلم الذاتي الإشراف في الرؤية الحاسوبية: التعلم من أي مجموعة بيانات غير محددة أو صورة عشوائية ، وليس فقط من مجموعة بيانات محددة جيدًا. عند تنفيذه بشكل مثالي ، يمكن للتعلم الذاتي الإشراف المساعدة في تطوير نماذج الرؤية الحاسوبية أكثر دقة وقدرة واقتصادية.
SEER أو SElf-supERvised Model: مقدمة
تشير الاتجاهات الحديثة في ngành الذكاء الاصطناعي والتعلم الآلي إلى أن نهجات ما قبل التدريب مثل النصف إشرافي والضعيف الإشرافي والتعلم الذاتي الإشراف يمكن أن تحسن الأداء بشكل كبير لمعظم نماذج التعلم العميق لمهام التنقل.
هناك两个 عوامل رئيسيان ساهموا بشكل كبير في تحسين أداء هذه النماذج العميقة.
التدريب على مجموعات بيانات ضخمة
التدريب على مجموعات بيانات ضخمة يؤدي عادةً إلى دقة وأداء أفضل ، لأنه يخضع النموذج لمجموعة واسعة من البيانات. تسمح مجموعة البيانات الكبيرة للنموذج بفهم الأنماط في البيانات بشكل أفضل ، وينتج عن ذلك أداء أفضل في السيناريوهات الحقيقية.
من بين أفضل النماذج أداءً نماذج مثل GPT-3 و Wav2vec 2.0 ، والتي يتم تدريبها على مجموعات بيانات ضخمة. يستخدم نموذج GPT-3 لغة ما قبل التدريب مع أكثر من 300 مليار كلمة ، بينما يستخدم نموذج Wav2vec 2.0 لتعرف الكلام مجموعة بيانات مع أكثر من 53 ألف ساعة من بيانات الصوت.
نماذج ذات سعة كبيرة
النماذج التي تحتوي على عدد أكبر من المعاملات غالبًا ما تؤدي نتائج دقيقة ، لأن عدد المعاملات الأكبر يسمح للنموذج بالتركيز على الأشياء في البيانات التي هي فقط ضرورية ، بدلاً من التركيز على التداخل أو الضوضاء في البيانات.
لقد حاول المطورون في الماضي تدريب نماذج التعلم الذاتي الإشراف على بيانات غير مخططة أو غير منضبطة مع مجموعات بيانات أصغر تحتوي على بضع ملايين صورة فقط. لكن هل يمكن أن تؤدي نماذج التعلم الذاتي الإشراف نتائج دقيقة عند تدريبها على كمية كبيرة من البيانات غير المعلّمة وغير المنضبطة؟ هذا هو السؤال الذي يهدف نموذج SEER إلى الإجابة عليه.
نموذج SEER هو إطار للتعلم العميق يهدف إلى تسجيل الصور المتاحة على الإنترنت بشكل مستقل عن مجموعات بيانات مخططة أو معلمة. يسمح إطار SEER للمطورين بتدريب نماذج التعلم الآلي الكبيرة والمعقدة على بيانات عشوائية بدون إشراف ، أي أن النموذج يتحليل البيانات ويتعلم الأنماط أو المعلومات بنفسه بدون أي إدخال يدوي.
الهدف النهائي لنموذج SEER هو المساعدة في تطوير استراتيجيات للتدريب قبل الإشراف التي تستخدم بيانات غير مخططة لتوفير أداء رائع في التعلم النقال. بالإضافة إلى ذلك ، يهدف نموذج SEER إلى إنشاء أنظمة يمكنها التعلم المستمر من تدفق لا نهاية له من البيانات بطريقة إشرافية ذاتية.
يتم تدريب إطار SEER على نماذج ذات سعة عالية على مليارات الصور العشوائية وغير المحددة المستخرجة من الإنترنت. لا تعتمد النماذج المدربة على هذه الصور على بيانات التعريف أو العلامات لتدريب النموذج أو تصفية البيانات. في الآونة الأخيرة ، أظهر التعلم الذاتي الإشراف إمكانات كبيرة ، حيث أدت نماذج مدربة على بيانات غير مخططة إلى نتائج أفضل عند مقارنتها بنماذج مدربة مسبقًا بموجب الإشراف لمهام التنقل.
إطار SEER و RegNet: ما هو الصلة؟
لتحليل نموذج SEER ، يركز على هيكل RegNet مع أكثر من 700 مليون معامل يتوافق مع هدف SEER من التعلم الذاتي الإشراف على بيانات غير مخططة لسببين رئيسيين:
- يقدمون توازنًا مثاليًا بين الأداء والكفاءة.
- هم مرنون للغاية ، ويمكنهم التكيف مع عدد من المعاملات.

إطار SEER: أعمال سابقة من مجالات مختلفة
يهدف إطار SEER إلى استكشاف حدود تدريب هيكل نماذج كبير في مجموعات بيانات غير مخططة أو غير معلمة باستخدام التعلم الذاتي الإشراف ، ويتطلع النموذج إلى الإلهام من الأعمال السابقة في المجال.
التدريب المسبق غير المخطر للسمات البصرية
لقد تم تطبيق التعلم الذاتي الإشراف في الرؤية الحاسوبية منذ بعض الوقت الآن باستخدام أساليب مثل التنкодر ، والتمييز على مستوى المثال ، أو التجميع. في الآونة الأخيرة ، أظهرت الأساليب التي تستخدم التعلم بالتعارض أن التدريب المسبق للنماذج باستخدام التعلم غير المخطر يمكن أن يؤدي إلى نتائج أفضل من النهج الإشرافي الموجه.
النقطة الرئيسية التي يمكن استخلاصها من التعلم غير المخطر للسمات البصرية هي أن 只要 كنت تتدرّب على بيانات منضبطة ، لا تحتاج إلى علامات مخططة. يهدف نموذج SEER إلى استكشاف ما إذا كان النموذج يمكن أن يتعلم تمثيلات دقيقة عندما يتم تدريب هيكل نماذج كبير على كمية كبيرة من الصور غير المخططة وغير المعلّمة.
تعلم السمات البصرية على نطاق واسع
استفادت النماذج السابقة من التدريب المسبق للنماذج على مجموعات بيانات كبيرة معلمة ضعيفًا أو مخططًا أو شبه مخطط على ملايين الصور المخططة. بالإضافة إلى ذلك ، أظهر تحليل النماذج أن التدريب المسبق للنموذج على مليارات الصور غالبًا ما يؤدي إلى دقة أفضل عند مقارنته بتدريب النموذج من الصفر.
علاوة على ذلك ، يعتمد التدريب على نطاق واسع عادةً على خطوات تصفية البيانات لجعل الصور تتوافق مع المفاهيم المستهدفة. تستخدم خطوات التصفية هذه إما تنبؤات من مصنّف مخطط مسبقًا أو تستخدم الهاش تاغات التي غالبًا ما تكون متوافقة مع فئات ImageNet. يعمل نموذج SEER بشكل مختلف ، لأنه يهدف إلى تعلم السمات في أي صورة عشوائية ، وبالتالي فإن بيانات التدريب لنموذج SEER لا يتم تخطيطها لتتوافق مع مجموعة محددة من السمات أو المفاهيم.
توسيع الهياكل لتعرف الصور
النماذج تنتفع عادةً من التدريب على هياكل كبيرة على بيانات ذات جودة أفضل ، مما يؤدي إلى سمات بصرية أفضل. من الضروري تدريب هياكل كبيرة عند التدريب المسبق على مجموعة بيانات كبيرة ، لأن نموذجًا محدود السعة سوف يعتمد عادةً.
من المهم أيضًا توسيع الهياكل عند التدريب المسبق بالتعلم بالتعارض ، لأن النموذج يجب أن يتعلم كيفية التمييز بين مثيلات مجموعة البيانات حتى يتمكن من تعلم تمثيلات بصرية أفضل.
SEER: الأساليب والمكونات المستخدمة
يستخدم إطار SEER مجموعة متنوعة من الأساليب والمكونات لتدريب النموذج على تعلم التمثيلات البصرية. بعض الأساليب والمكونات الرئيسية المستخدمة في إطار SEER هي: RegNet و SwAV. دعونا نناقش الأساليب والمكونات المستخدمة في إطار SEER بشكل موجز.
التدريب المسبق الذاتي الإشراف مع SwAV
يتم تدريب إطار SEER مسبقًا مع SwAV ، وهو نهج للتعلم الذاتي الإشراف عبر الإنترنت. SwAV هو نهج تجميع عبر الإنترنت يُستخدم لتدريب إطار الشبكات التلافيفية بدون علامات.
يعمل إطار SwAV عن طريق تدريب التضمين الذي ينتج تعيينات المجموعة بشكل متسق بين وجهات نظر مختلفة لنفس الصورة. ثم يتعلم النظام تمثيلات دلالية عن طريق استخراج مجموعات لا تتغير مع تعديلات البيانات.
في الممارسة ، يقارن إطار SwAV بين سمات وجهات نظر مختلفة للصورة من خلال استخدام تعييناتها المستقلة للمجموعة. إذا كانت هذه التعيينات تلتقط نفس السمات أو السمات الشبيهة ، فمن الممكن التنبؤ بتعيين صورة واحدة باستخدام تمثيل ميزة صورة أخرى.
يتم تدريب أوزان البروتوتايب والشبكة التلافيفية لتحقيق الحد الأدنى من الخسارة لكل مثال. خسارة التنبؤ بالتجمع هي أساسًا التباين بين التباين الناعم لمنتج نقطة الميزة والتعيينات التجميع.

RegNetY: عائلة نماذج كفاءة مقياس
توسيع سعة النموذج وبياناته يتطلب هياكل كفاءة ليس فقط من حيث الذاكرة ، ولكن أيضًا من حيث وقت التشغيل ، و RegNets هي عائلة من النماذج مصممة خصيصًا لهذا الغرض.
تُحدد عائلة هيكل RegNet بمساحة تصميم للشبكات التلافيفية مع 4 مراحل ، حيث تحتوي كل مرحلة على سلسلة من الكتلة المتطابقة مع الحفاظ على هيكل الكتلة الثابتة ، بشكل رئيسي الكتلة الزائدة.
يركز إطار SEER على هيكل RegNetY ويضيف التقسيم والتحفيز إلى هيكل RegNets القياسي في محاولة لتحسين أدائه. بالإضافة إلى ذلك ، يحتوي نموذج RegNetY على 5 معاملات تساعد في البحث عن مثيلات جيدة مع عدد معاملات ثابت.
هيكل RegNetY 256GF: يركز نموذج SEER بشكل رئيسي على هيكل RegNetY 256GF في عائلة RegNetY ، ويستخدم معاملاته قاعدة التوسيع للهياكل RegNets. يتم وصف المعاملات كما يلي.

يحتوي هيكل RegNetY 256GF على 4 مراحل مع أوسع المراحل (528، 1056، 2904، 7392) وأعماق المراحل (2، 7، 17، 1) التي تصل إلى أكثر من 696 مليون معامل. عند التدريب على 512 جهاز كمبيوتر V100 32GB من NVIDIA ، يستغرق كل تكرار حوالي 6125 مللي ثانية ل حجم批ة 8704 صورة. التدريب على مجموعة بيانات تضم أكثر من مليار صورة ، مع حجم批ة 8704 صورة على أكثر من 512 جهاز ، يتطلب 114890 تكرارًا ، و يستغرق التدريب حوالي 8 أيام.
التحسين والتدريب على نطاق واسع
يقترح نموذج SEER عدة تعديلات لتدريب الأساليب الذاتية الإشرافية لتطبيق هذه الأساليب وتكيفها مع نطاق كبير. هذه الأساليب هي:
- جدول معدل التعلم.
- تقليل استهلاك الذاكرة لكل وحدة معالجة رسومات.
- تحسين سرعة التدريب.
- بيانات التدريب المسبق على نطاق واسع.
دعونا نناقشها بشكل موجز.
جدول معدل التعلم
يستكشف نموذج SEER إمكانية استخدام جدولين لمعدل التعلم: جدول معدل التعلم الموجي ، و جدول معدل التعلم الثابت.
يُستخدم جدول معدل التعلم الموجي لتحديد النماذج بشكل عادل ، لأنه يتكيف مع عدد التحديثات. ومع ذلك ، لا يتكيف جدول معدل التعلم الموجي مع التدريب على نطاق واسع بشكل رئيسي ، لأنه يُعد الصور بشكل مختلف بناءً على وقت رؤيته أثناء التدريب ، ويستخدم التحديثات الكاملة لجدولة المواعيد.
يحافظ جدول معدل التعلم الثابت على معدل التعلم الثابت حتى يصبح الخسارة غير متناقصة ، ثم يتم تقسيم معدل التعلم إلى 2. تظهر التحليلات أن جدول معدل التعلم الثابت يعمل بشكل أفضل ، لأنه يتيح مزيدًا من المرونة في جعل التدريب أكثر مرونة. ومع ذلك ، نظرًا لأن النموذج يتدرب فقط على مليار صورة ، يستخدم جدول معدل التعلم الموجي لتدريب نموذجه الأكبر ، RegNet 256GF.
تقليل استهلاك الذاكرة لكل وحدة معالجة رسومات
يهدف النموذج أيضًا إلى تقليل كمية وحدة معالجة الرسومات المطلوبة أثناء التدريب من خلال استخدام الدقة الم مختلطة وCheckpointing بالترتيب.
يستخدم النموذج مكتبة NVIDIA Apex Library’s O1 Optimization level لأداء العمليات مثل التلافيف وال GEMMs بدقة 16 بت. يستخدم النموذج أيضًا تطبيق PyTorch’s Gradient Checkpointing الذي يبادل الحسابات مقابل الذاكرة.
علاوة على ذلك ، يتخلص النموذج من أي تنشيطات متوسطة يتم إجراؤها أثناء المرحلة الأمامية ، وأثناء المرحلة الخلفية ، يتم إعادة حساب هذه التنشيطات.
تحسين سرعة التدريب
استخدام الدقة الم مختلطة لتحسين استخدام الذاكرة له فوائد إضافية ، حيث يستفيد المسرع من حجم FP16 المنقص مقارنةً بـ FP32.
يتم تحسين سرعة التدريب من خلال تزامن BatchNorm الطبقة عبر وحدات معالجة الرسومات لإنشاء مجموعات العملية بدلاً من استخدام التزامن العالمي الذي يأخذ عادةً وقتًا أطول.
أخيرًا ، يقوم محمل البيانات المستخدم في نموذج SEER بتحميل المزيد من دفعات التدريب ، مما يؤدي إلى كمية أكبر من البيانات التي يتم تمريرها مقارنةً بمحمل البيانات في PyTorch.
بيانات التدريب المسبق على نطاق واسع
يستخدم نموذج SEER أكثر من مليار صورة خلال التدريب المسبق ، ويفكر في محمل بيانات ي chọn الصور العشوائية مباشرةً من الإنترنت و Instagram.
نظرًا لأن نموذج SEER يتدرب على هذه الصور في البرية وعلى الإنترنت ، فإنه لا يطبق أي معالجة مسبقة على هذه الصور ولا يخضعها لعمليات مثل الإزالة المزدوجة أو تصفية الهاش تاغ.
من الجدير بالذكر أن مجموعة البيانات ليست ثابتة ، والصور في مجموعة البيانات يتم تحديثها كل ثلاثة أشهر. ومع ذلك ، لا يؤثر تحديث مجموعة البيانات على أداء النموذج.
تنفيذ نموذج SEER
يتم تدريب نموذج SEER مسبقًا على RegNetY 256GF مع SwAV باستخدام ستة محاصيل لكل صورة ، مع كل صورة لها دقة 2×224 + 4×96.
خلال مرحلة التدريب المسبق ، يستخدم النموذج 3 طبقات من MLP أو الشبكة العصبية متعددة الطبقات مع رؤوس الإسقاط بأبعاد 10444×8192 و 8192×8192 و 8192×256.
بدلاً من استخدام طبقات BatchNorm في الرأس ، يستخدم نموذج SEER 16 ألف بروتوتايب مع معامل التماثل t مضبوط على 0.1. يتم تعيين معامل الت 정규ة Sinkhorn إلى 0.05 ، ويتم تنفيذ 10 تكرارات من الخوارزمية.
يتم مزامنة إحصاءات BatchNorm عبر وحدات معالجة الرسومات ، ويتم إنشاء مجموعات العملية مع حجم 64 للتزامن.
علاوة على ذلك ، يستخدم النموذج محسّن LARS أو Layer-wise Adaptive Rate Scaling ، وتراجع الوزن 10-5 ، وتنشيط النقاط ، وتحسين الدقة الم مختلطة.
يتم تدريب النموذج باستخدام التدرج العشوائي مع حجم批ة 8192 صورة عشوائية موزعة على 512 وحدة معالجة رسومات من NVIDIA ، مما يؤدي إلى 16 صورة لكل وحدة معالجة رسومات.
يتم زيادة معدل التعلم بشكل خطي من 0.15 إلى 9.6 خلال أول 8000 تحديث تدريبي. بعد الدفعة الساخنة ، يتبع النموذج جدول معدل التعلم الموجي الذي يتناقص إلى قيمة نهائية من 0.0096.
بشكل عام ، يتدرب نموذج SEER على أكثر من مليار صورة خلال 122000 تكرار.
نتائج إطار SEER
تتم دراسة جودة السمات التي تم توليدها بواسطة نهج التدريب المسبق الذاتي الإشراف و تحليلها على مجموعة متنوعة من البنود والمهام التنقل.
ضبط النماذج المسبقة التدريب الكبيرة
يتم قياس جودة النماذج المسبقة التدريب على بيانات عشوائية عن طريق نقلها إلى مجموعة بيانات ImageNet لتصنيف الأشياء.
إعدادات التجارب
يتم تدريب نموذج RegNetY 256GF مسبقًا على أكثر من مليار صورة عشوائية و عامة على Instagram مع SwAV.
يتم بعد ذلك ضبط النماذج لتصنيف الصور على مجموعة بيانات ImageNet التي تستخدم أكثر من 1.28 مليون صورة تدريبية مع علامات مناسبة ، و مجموعة تأكيد مع أكثر من 50 ألف صورة للتقويم.
يتم تطبيق نفس تقنيات تعديل البيانات كما في SwAV ، وضبط لمدة 35 دورة مع محسّن SGD أو التدرج العشوائي مع حجم批ة 256 ، ومعدل تعلم 0.0125 يتم تقليله بعامل 10 بعد 30 دورة ، وزمون 0.9 ، وتراجع الوزن 10-4.
يتم الإبلاغ عن دقة أعلى 1 على مجموعة التأكيد باستخدام المحاصيل المركزية من 224×224.
مقارنة مع نهجات التدريب المسبق الذاتي الإشراف الأخرى
في الجدول التالي ، يتم مقارنة أكبر نموذج مسبق التدريب في RegNetY-256GF مع نماذج مسبقة التدريب الحالية التي تستخدم نهج التعلم الذاتي الإشراف.

كما يمكن رؤية ذلك ، يعود نموذج SEER إلى دقة أعلى 1 بنسبة 84.2٪ على ImageNet ، ويفاجئ SimCLRv2 ، أفضل نموذج مسبق التدريب الحالي ، بنسبة 1٪.
علاوة على ذلك ، يقارن الشكل التالي إطار SEER مع نماذج ذات سعة مختلفة.

يتم مقارنة نموذج SEER مع نماذج RegNet و ViT ذات هياكل شبكية مختلفة.
تأثير سعة النموذج
لسعة النموذج تأثير كبير على أداء التدريب المسبق ، والشكل التالي يقارن ذلك مع التأثير عند التدريب من الصفر.

يمكن رؤية ذلك بوضوح أن نموذج SEER يؤدي أداءً أفضل من النماذج المدربة من الصفر.
التعلم منخفض الشوط
التعلم منخفض الشوط يشير إلى تقييم أداء نموذج SEER في إعداد منخفض الشوط ، أي استخدام جزء فقط من البيانات الكلية عند أداء مهام التنقل.
إعدادات التجارب
يستخدم إطار SEER مجموعتي بيانات للتعلم منخفض الشوط ، وهما Places205 و ImageNet.
نتائج على مجموعة بيانات Place205
الرسم التالي يظهر تأثير التدريب المسبق للنموذج على أجزاء مختلفة من مجموعة بيانات Place205.

يمكن رؤية ذلك بوضوح أن نموذج SEER يؤدي أداءً أفضل من النماذج المدربة من الصفر.
نتائج على ImageNet

يتم مقارنة نهج نموذج SEER مع نهجات التدريب المسبق الذاتي الإشراف والشبه إشرافي على التعلم منخفض الشوط.
تأثير سعة النموذج
الشكل التالي يناقش تأثير سعة النموذج على التعلم منخفض الشوط عند 1٪ و 10٪ و 100٪ من مجموعة بيانات ImageNet.

يمكن رؤية ذلك بوضوح أن زيادة سعة النموذج يمكن أن تحسن دقة النموذج عند انخفاض الوصول إلى الصور والعلامات في مجموعة البيانات.
نقل إلى بنود أخرى
为了 تقييم نموذج SEER بشكل أكبر وتحليل أدائه ، يتم نقل السمات المسبقة التدريب إلى مهام تنقل أخرى.
التقييم الخطي لتصنيف الصور

يتم مقارنة السمات من نموذج SEER المسبق التدريب مع نماذج أخرى.
الكشف والتقسيم
يتم مقارنة السمات المسبقة التدريب على الكشف والتقسيم.

يتم تدريب نموذج Mask-RCNN على مجموعة بيانات COCO مع نماذج RegNetY-64GF و RegNetY-128GF كمكونات.
مقارنة مع التدريب المسبق الضعيف الإشراف
غالبًا ما تحتوي الصور المتاحة على الإنترنت على وصف أو نص بديل أو وصفات أو موقع جغرافي يمكن أن يوفر ميزة خلال التدريب المسبق.
أظهرت الأعمال السابقة أن التنبؤ ب مجموعة مخططة من الهاش تاغات يمكن أن يحسن جودة السمات البصرية الناتجة.
然而 ، هذا النهج يحتاج إلى تصفية الصور ، ويعمل بشكل أفضل فقط عندما يكون هناك بيانات نصية متاحة.

يمكن رؤية ذلك بوضوح أن نموذج SEER يؤدي أداءً مشابهًا للنماذج التي تستخدم البيانات النصية خلال التدريب المسبق.
دراسات الحذف
تتم دراسة الحذف لتحليل تأثير مكون معين على أداء النموذج الإجمالي.
تأثير هيكل النموذج
لهيكل النموذج تأثير كبير على أداء النموذج ، خاصة عند توسيع النموذج أو تعديل مواصفات بيانات التدريب المسبق.
الرسم التالي يناقش تأثير تغيير الهيكل على جودة السمات المسبقة التدريب عند تقييمها خطيًا على مجموعة بيانات ImageNet.

يمكن رؤية ذلك بوضوح أن هيكل RegNet يؤدي أداءً أفضل من الهياكل الأخرى.
توسيع بيانات التدريب المسبق
هناك两个 سبب رئيسي لتحسين جودة السمات البصرية التي يتعلمها النموذج عند تدريبه على مجموعة بيانات أكبر:
زيادة عدد الصور الفريدة

الرسم التالي يقارن بين هيكلين مختلفين ، RegNet8 و RegNet16 ، لهما نفس عدد المعاملات ، ولكن يتم تدريبهما على عدد مختلف من الصور الفريدة.
يمكن رؤية ذلك بوضوح أن النموذج يؤدي أداءً أفضل عندما يتم تدريبه على عدد أكبر من الصور الفريدة.
المزيد من المعاملات
الرسم التالي يظهر أداء النموذج عند تدريبه على مليار صورة باستخدام هيكل RegNet-128GF.

يمكن رؤية ذلك بوضوح أن أداء النموذج يزيد بشكل مستمر مع زيادة عدد المعاملات.
الرؤية الحاسوبية الذاتية الإشراف في العالم الحقيقي
حتى الآن ، لقد ناقشنا كيف يعمل التعلم الذاتي الإشراف ونموذج SEER للرؤية الحاسوبية في النظرية.
دعونا ننظر الآن إلى كيفية عمل الرؤية الحاسوبية الذاتية الإشراف في السيناريوهات الحقيقية ، ولماذا نموذج SEER هو مستقبل الرؤية الحاسوبية الذاتية الإشراف.
نموذج SEER يتنافس مع العمل المنجز في ngành معالجة اللغة الطبيعية ، حيث يستخدم نماذج متقدمة من الدولة الفنية تريليونات من مجموعات البيانات ومعاملات ، ومترافقة مع تريليونات من الكلمات النصية خلال التدريب المسبق للنموذج.
أداء النماذج على مهام التنقل يزيد عادةً مع زيادة عدد البيانات المدخلة للتدريب ، وهذا صحيح أيضًا لمهام الرؤية الحاسوبية.
然而 ، استخدام تقنيات التعلم الذاتي الإشراف لمعالجة اللغة الطبيعية يختلف عن استخدام التعلم الذاتي الإشراف للرؤية الحاسوبية.
علاوة على ذلك ، الصور لها وجهات نظر مختلفة ، حتى لو كانت الصور لها نفس الكائن ، فإن المفاهيم قد تختلف بشكل كبير.
توسيع النموذج بنجاح بحيث يعمل بكفاءة مع بيانات الصور عالية الأبعاد والمعقدة يتطلب مكونين:
- شبكة عصبية تلافيفية كافية لتعلم المفاهيم البصرية من مجموعة بيانات صور كبيرة.
- خوارزمية يمكنها تعلم الأنماط من كمية كبيرة من الصور بدون علامات أو بيانات وصفية.
يهدف نموذج SEER إلى تطبيق هذه المكونات على ngành الرؤية الحاسوبية.
يستخدم نموذج SEER هيكل RegNet الذي يمكن أن يوسع تريليونات من المعاملات ويمكن تحسينه وفقًا لاحتياجات الذاكرة ووقت التشغيل.
علاوة على ذلك ، يقلل نموذج SEER من وقت التدريب بمقدار 6 أضعاف.
الختام: مستقبل إشرافي ذاتي
التعلم الذاتي الإشراف كان موضوعًا هامًا في ngành الذكاء الاصطناعي والتعلم الآلي لبعض الوقت الآن ، لأنه يسمح للنماذج بالتعلم مباشرةً من كمية كبيرة من البيانات المتاحة عشوائيًا على الإنترنت ، بدلاً من الاعتماد على مجموعات بيانات مخططة و معلمة بعناية.
التعلم الذاتي الإشراف هو مفهوم حيوي لمستقبل الذكاء الاصطناعي والتعلم الآلي ، لأنه له القدرة على تمكين المطورين من إنشاء نماذج تعلم الآلة تتوافق جيدًا مع السيناريوهات الحقيقية ، ولديها العديد من التطبيقات بدلاً من هدف معين.
نموذج SEER يأخذ الخطوة الأولى في تحويل ngành الرؤية الحاسوبية ، وتقليل اعتمادنا على مجموعات البيانات المخططة.
يهدف نموذج SEER إلى القضاء على الحاجة إلى تعليم مجموعات البيانات التي سوف تسمح للمطورين بالعمل مع كميات كبيرة ومتنوعة من البيانات.
تنفيذ نموذج SEER مفيد بشكل خاص للمطورين الذين يعملون على نماذج تتعامل مع مجالات لها صور ومعلومات محدودة مثل ngành الطب.
علاوة على ذلك ، سوف يسمح إلغاء العلامات البشرية للمطورين بإنشاء و نشر النماذج بشكل أسرع ، مما سوف يسمح لهم بالاستجابة لأوضاع متغيرة بسرعة وبدقة.












