نماذج ومنصات الذكاء الاصطناعي

YOLOv7: أكثر خوارزمية كشف الكائنات المتقدمة

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

سيتم تسجيل 6 يوليو 2022 كتاريخ هام في تاريخ الذكاء الاصطناعي لأن هذا اليوم شهد إطلاق YOLOv7. منذ إطلاقه ، أصبح YOLOv7 الموضوع الأكثر سخونة في مجتمع مطوري الرؤية الحاسوبية ، وأسباب وجيهة.

قبل وقت قصير من نشر ورقة YOLOv7 ، ظهرت كأسرع وأدق نموذج للكشف عن الكائنات في الوقت الفعلي. ولكن كيف يتفوق YOLOv7 على سابقيها؟ ما الذي يجعل YOLOv7 فعالًا للغاية في أداء مهام الرؤية الحاسوبية؟

في هذه المقالة ، سنحاول تحليل نموذج YOLOv7 ، ومحاولة العثور على الإجابة عن سبب أصبحت YOLOv7 معيارًا في الصناعة. ولكن قبل أن نستطيع الإجابة على ذلك ، يجب أن نلقي نظرة على التاريخ المختصر للكشف عن الكائنات.

ما هو الكشف عن الكائنات؟

الكشف عن الكائنات هو فرع في الرؤية الحاسوبية الذي يحدد موقع الكائنات في صورة أو ملف فيديو. الكشف عن الكائنات هو الحجر الأساسي للعديد من التطبيقات ، بما في ذلك السيارات ذاتية القيادة ، والمراقبة الخاضعة للمراقبة ، والروبوتات.

يمكن تصنيف نموذج الكشف عن الكائنات إلى فئتين مختلفتين ، كاشفات اللقطة الواحدة ، و كاشفات اللقطة المتعددة.

الكشف عن الكائنات في الوقت الفعلي

من أجل فهم كيفية عمل YOLOv7 ، من الضروري فهم هدف YOLOv7 الرئيسي ، “الكشف عن الكائنات في الوقت الفعلي”. الكشف عن الكائنات في الوقت الفعلي هو مكون رئيسي في الرؤية الحاسوبية الحديثة. نماذج الكشف عن الكائنات في الوقت الفعلي تحاول تحديد ومواقع الكائنات ذات الصلة في الوقت الفعلي.

نماذج الكشف عن الكائنات في الوقت الفعلي هي أساسًا خطوة إلى الأمام من نماذج الكشف عن الصور التقليدية. في حين أن الأولى تستخدم لتعقب الكائنات في ملفات الفيديو ، فإن الثانية تحدد وتحدد الكائنات داخل إطار ثابت مثل الصورة.

نتيجة لذلك ، نماذج الكشف عن الكائنات في الوقت الفعلي فعالة للغاية لتحليل الفيديو ، والمركبات ذاتية القيادة ، وعد الكائنات ، وتعقب الكائنات المتعددة ، وغيرها.

ما هو YOLO؟

YOLO أو “انظر مرة واحدة” هو عائلة من نماذج الكشف عن الكائنات في الوقت الفعلي. تم تقديم مفهوم YOLO لأول مرة في عام 2016 بواسطة جوزيف ريدمون ، وكان حديث المدينة على الفور لأنه كان أسرع وأكثر دقة من الخوارزميات السابقة للكشف عن الكائنات.

المفهوم الأساسي الذي يقترحه خوارزمية YOLO هو استخدام شبكة عصبونية من النهاية إلى النهاية باستخدام صناديق الحدود واحتمالات الفئة لصنع التنبؤات في الوقت الفعلي. كان YOLO مختلفًا عن نموذج الكشف عن الكائنات السابق في أنه اقترح نهجًا مختلفًا للكشف عن الكائنات من خلال إعادة توجيه المصنفات.

الخوارزمية YOLO أكثر كفاءة من سابقيها لأنها تقلل من عدد العمليات الحسابية المطلوبة.

كيف يعمل YOLO؟

هناك ثلاث خطوات تشرح كيف يعمل خوارزمية YOLO.

إعادة صياغة الكشف عن الكائنات كمسألة انحدار واحدة

خوارزمية YOLO تحاول إعادة صياغة الكشف عن الكائنات كمسألة انحدار واحدة ، بما في ذلك بكسلات الصورة ، و احتمالات الفئة ، و إحداثيات صندوق الحدود. وبالتالي ، يجب على الخوارزمية النظر إلى الصورة مرة واحدة فقط لتنبؤ وتحديد الكائنات المستهدفة في الصور.

الاستدلال العالمي للصورة

علاوة على ذلك ، عندما تقوم خوارزمية YOLO بالتنبؤ ، فإنها تُستدل بالصورة على مستوى العالمي. وهي تختلف عن تقنيات اقتراح المنطقة والتقنيات الانزلاقية لأن خوارزمية YOLO ترى الصورة الكاملة أثناء التدريب والاختبار على مجموعة البيانات ، ويمكنها التشفير المعلومات السياقية حول الفئات وكيف تظهر.

قبل YOLO ، كان Fast R-CNN أحد أكثر الخوارزميات شعبية للكشف عن الكائنات ، والذي لم يكن قادرًا على رؤية السياق الأوسع في الصورة لأنه كان يخطئ في توجيه باتشات الخلفية في صورة ككائن.

تعميم تمثيل الكائنات

أخيرًا ، تحاول خوارزمية YOLO أيضًا تعميم تمثيل الكائنات في الصورة. وبالتالي ، عندما تم تشغيل خوارزمية YOLO على مجموعة بيانات مع صور طبيعية واختبار النتائج ، تفوقت YOLO على نماذج R-CNN الحالية بفارق كبير.

YOLOv7: ما الجديد؟

الآن بعد أن لدينا فهمًا أساسيًا لما هي نماذج الكشف عن الكائنات في الوقت الفعلي ، وما هي خوارزمية YOLO ، حان الوقت لمناقشة خوارزمية YOLOv7.

تحسين عملية التدريب

خوارزمية YOLOv7 لا تحاول فقط تحسين هيكل النموذج ، ولكنها تهدف أيضًا إلى تحسين عملية التدريب. تهدف إلى استخدام وحدات التحسين وأساليب تحسين دقة الكشف عن الكائنات ، وتقوية التكلفة التدريبية ، مع الحفاظ على تكلفة التدخل.

تخصيص التسمية الخفيف إلى الدقيق

تخطط خوارزمية YOLOv7 لاستخدام تخصيص تسمية خفيف إلى دقيق جديد بدلاً من التسمية الديناميكية التقليدية.

إعادة تحديد النموذج

تُستخدم إعادة تحديد النموذج في الكشف عن الكائنات ، وغالبًا ما تُستخدم مع بعض القضايا أثناء التدريب.

تمديد وتكثيف التماثل

تُقدم خوارزمية YOLOv7 أيضًا أساليب التمديد والتماثل المركب لاستخدام المعاملات والتحسينات بشكل فعال للكشف عن الكائنات في الوقت الفعلي.

YOLOv7: الأعمال المرتبطة

الكشف عن الكائنات في الوقت الفعلي

YOLO هو حاليًا معيار الصناعة ، وينشر معظم كاشفي الكائنات في الوقت الفعلي خوارزمية YOLO ، و FCOS (كاشف الكائنات الكامل ذو المرحلة الواحدة).

  • هيكل شبكة أقوى وأسرع.
  • طريقة دمج الميزات الفعالة.
  • طريقة الكشف عن الكائنات الدقيقة.
  • دالة خسارة قوية.
  • طريقة تخصيص تسمية فعالة.
  • طريقة تدريب فعالة.

خوارزمية YOLOv7 لا تستخدم التعلم الذاتي والتنقيب ، والتي غالبًا ما تتطلب كميات كبيرة من البيانات.

إعادة تحديد النموذج

تُعتبر تقنيات إعادة تحديد النموذج تقنية تجميعية تدمج وحدات حسابية متعددة في مرحلة التدخل.

تماثل النموذج

تُستخدم تماثل النموذج في تغيير حجم نموذج موجود ليتناسب مع أجهزة حاسوب مختلفة.

الرسم البياني المذكور أعلاه ي比較 بين شبكات التجميع الفعالة الممتدة (E-ELAN) للنماذج المختلفة.

هيكل YOLOv7

يستخدم نموذج YOLOv7 نماذج YOLOv4 و YOLO-R و YOLOv4 المقياس كقاعدة.

شبكة التجميع الفعالة الممتدة أو E-ELAN

E-ELAN هو الحجر الأساسي لنموذج YOLOv7 ، وهو مشتق من نماذج موجودة على كفاءة الشبكة ، وخاصة ELAN.

تماثل النموذج للنماذج القائمة على الارتباط

تماثل النموذج يساعد في ضبط سمات النماذج لتوليد نماذج بمقاييس مختلفة لتلبية سرعات التدخل المختلفة.

حقيبة قابلة للتدريب من المجان

تُسمى حقيبة المجان مجموعة من الأساليب أو التقنيات التي يمكن أن تغير استراتيجية التدريب أو التكلفة.

التحويل المعاد تحديده للمحاور

تستخدم خوارزمية YOLOv7 مسارات تدفق التدرج لتحديد كيفية الجمع المثالي بين شبكة و المحاور المعاد تحديدها.

خشن للمساعد و دقيق للرئيس

تُسمى الإشراف العميق فرعًا في علوم الحاسوب غالبًا ما يجد تطبيقه في عملية تدريب الشبكات العميقة.

موجه رئيس التسمية

تُستخدم استراتيجية موجه رئيس التسمية لحسابات التسمية على أساس نتائج تنبؤ الرأس الرئيسي والصورة الأرضية.

موجه رئيس التسمية الخفيف إلى الدقيق

تُستخدم استراتيجية موجه رئيس التسمية الخفيف إلى الدقيق لحساب التسمية على أساس نتائج تنبؤ الرأس الرئيسي والصورة الأرضية.

حقيبة قابلة للتدريب أخرى من المجان

تستخدم خوارزمية YOLOv7 حقيبة قابلة للتدريب أخرى من المجان ، على الرغم من أنها لم تُقترح في الأصل.

  • التطبيع في تكنولوجيا Conv-Bn-Activation: تُستخدم هذه الاستراتيجية لربط طبقة التحرير مباشرة بطبقة التطبيع.
  • المعرفة الضمنية في YOLOR: تجمع خوارزمية YOLOv7 هذه الاستراتيجية مع خريطة الميزات التConvolutional.
  • نموذج EMA: يُستخدم نموذج EMA كمرجع نهائي في YOLOv7 ، على الرغم من أنه يستخدم في الأصل في طريقة المعلم المتوسط.

YOLOv7: التجارب

إعداد التجربة

تستخدم خوارزمية YOLOv7 مجموعة بيانات Microsoft (MSFT ) COCO للتدريب والتحقق من صحة نموذج الكشف عن الكائنات.

الأسس

تستخدم خوارزمية YOLOv7 نماذج YOLO السابقة و خوارزمية YOLOR كأساس.

مقارنة مع نماذج الكشف عن الكائنات الأخرى

دراسة الاستبعاد: طريقة التماثل المركب المقترحة

النموذج المعاد تحديده المقترح

为了验证 عمومية نموذجها المعاد تحديده ، تستخدم خوارزمية YOLOv7 نموذجها على نماذج قائمة على الارتباط و نماذج متكررة.

فقد خسارة مساعد للرأس المساعد

تُقارن خوارزمية YOLOv7 بين تخصيص التسمية المستقل للرأس المساعد و الرأس الرئيسي.

نتائج YOLOv7

بناءً على التجارب المذكورة أعلاه ، هنا نتائج أداء YOLOv7 مقارنة بنماذج الكشف عن الكائنات الأخرى.

الخلاصة

YOLO أو “انظر مرة واحدة” هو معيار الصناعة لنموذج الكشف عن الكائنات في الوقت الفعلي.

خوارزمية YOLOv7 هي أحدث إضافة في عائلة YOLO ، وأقوى خوارزمية YOLO حتى الآن.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.