نماذج ومنصات الذكاء الاصطناعي

EfficientViT: تحويلات رؤية كفية وفعالة لتحليل الرؤية بالكمبيوتر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

نظرًا لقدراتها العالية في النموذج، تمتلك نماذج تحويلات الرؤية نجاحًا كبيرًا في الآونة الأخيرة. على الرغم من أدائها، تتميز نماذج تحويلات الرؤية بضعف رئيسي: يأتي قوتها الحاسوبية الرائعة بتكلفة حاسوبية عالية، وهو السبب في أن تحويلات الرؤية ليست الخيار الأول للتطبيقات في الوقت الفعلي. لمواجهة هذه القضية، أطلق فريق من المطورين EfficientViT، وهي عائلة من تحويلات الرؤية السريعة.

عند العمل على EfficientViT، لاحظ المطورون أن سرعة نماذج التحويل الحالية غالبًا ما تقيد بعمليات الذاكرة غير الفعالة، خاصة الوظائف العنصرية والتحويل الشبكي في MHSA أو شبكة الانتباه الذاتي متعددة الرؤوس. لمواجهة هذه العمليات غير الفعالة للذاكرة، عمل مطورو EfficientViT على بناء كتلة جديدة باستخدام تخطيط ساندويتش، أي أن نموذج EfficientViT يستخدم شبكة انتباه ذاتي متعددة الرؤوس واحدة بين طبقات الشبكة العصبية الأمامية الفعالة التي تساعد في تحسين كفاءة الذاكرة، وتعزيز الاتصالات القناة بشكل عام. بالإضافة إلى ذلك، يكتشف النموذج أن خرائط الانتباه غالبًا ما تتمتع بتشابهات عالية عبر الرؤوس مما يؤدي إلى التكرار الحسابي. لمواجهة مشكلة التكرار، يقدم نموذج EfficientViT وحدة انتباه مجموعة متسلسلة تغذي رؤوس الانتباه بتقسيمات مختلفة من الميزة الكاملة. الطريقة لا تساعد فقط في توفير التكاليف الحاسوبية، بل تعزز أيضًا تنوع الانتباه في النموذج.

تظهر التجارب الشاملة التي أجريت على نموذج EfficientViT عبر سيناريوهات مختلفة أن EfficientViT يتفوق على النماذج الفعالة الحالية لتحليل الرؤية بالكمبيوتر مع تحقيق توازن جيد بين الدقة والسرعة. لذا دعونا نغوص أكثر في نموذج EfficientViT.

مقدمة في تحويلات الرؤية وEfficientViT

تظل تحويلات الرؤية واحدة من الإطارات الأكثر شعبية في صناعة الرؤية بالكمبيوتر لأنها توفر أداءً متفوقًا وقدرات حاسوبية عالية. ومع ذلك، مع تحسين الدقة والأداء لنموذج تحويل الرؤية، تزداد التكاليف التشغيلية والتحميل الحاسوبي أيضًا. على سبيل المثال، تستخدم النماذج الحالية المعروفة بتوفير أداء الدولة الفنية على مجموعات بيانات ImageNet مثل SwinV2 وV-MoE 3B و14.7B 매개변ر على التوالي. حجم هذه النماذج الكبير جنبًا إلى جنب مع التكاليف الحاسوبية والمتطلبات يجعلها غير مناسبة بشكل عملي للأجهزة والتطبيقات في الوقت الفعلي.

يهدف نموذج EfficientNet إلى استكشاف كيفية تعزيز أداء نماذج تحويل الرؤية، واكتشاف المبادئ التي ت лежит وراء تصميم هياكل الإطار القائمة على التحويل الفعال. يعتمد نموذج EfficientViT على إطارات تحويل رؤية موجودة مثل Swim وDeiT، ويفحص ثلاثة عوامل أساسية تؤثر على سرعة التداخل للنماذج، بما في ذلك التكرار الحسابي ووصول الذاكرة واستخدام المعامل. بالإضافة إلى ذلك، يلاحظ النموذج أن سرعة نماذج تحويل الرؤية مقيدة بالذاكرة، مما يعني أن الاستخدام الكامل للقدرة الحاسوبية في وحدات المعالجة المركزية / وحدات معالجة الرسومات مقيد أو محظور بسبب تأخير الوصول إلى الذاكرة، مما يؤدي إلى تأثير سلبي على سرعة تشغيل التحويلات. الوظائف العنصرية والتحويل الشبكي في MHSA أو شبكة الانتباه الذاتي متعددة الرؤوس هي أكثر العمليات غير فعالة للذاكرة.

يتمثل النموذج في التهجين النهائي للاكتشافات أثناء العمل البحثي لنموذج EfficientViT. يتميز النموذج بكتلة جديدة ذات تخطيط ساندويتش يستخدم فيها طبقة MHSA واحدة بين طبقات الشبكة العصبية الأمامية. هذا النهج لا يقلل فقط من وقت تنفيذ العمليات المقيدة بالذاكرة في MHSA، بل يجعل العملية بأكملها أكثر كفاءة للذاكرة من خلال السماح بوجود طبقات الشبكة العصبية الأمامية أكثر لتعزيز الاتصالات بين القنوات المختلفة. كما يستخدم النموذج وحدة انتباه مجموعة متسلسلة جديدة تهدف إلى جعل الحسابات أكثر فعالية من خلال تقليل التكرار الحسابي ليس فقط في رؤوس الانتباه، ولكن أيضًا زيادة عمق الشبكة مما يؤدي إلى زيادة سعة النموذج.

كما يمكن رؤيته في الصورة أعلاه، يؤدي إطار EfficientViT بشكل أفضل من نماذج CNN وViT الحالية من حيث الدقة والسرعة. ولكن كيف تمكنت إطار EfficientViT من تفوق بعض الإطارات الحالية؟

EfficientViT: تحسين كفاءة تحويلات الرؤية

يهدف نموذج EfficientViT إلى تحسين كفاءة نماذج تحويل الرؤية الحالية من ثلاثة وجهات نظر:

  1. التكرار الحسابي.
  2. وصول الذاكرة.
  3. استخدام المعامل.

يهدف النموذج إلى معرفة كيف تؤثر المعاملات السابقة على كفاءة نماذج تحويل الرؤية، وكيفية حلها لتحقيق نتائج أفضل بكفاءة أفضل.

وصول الذاكرة والكفاءة

تعتبر واحدة من العوامل الأساسية التي تؤثر على سرعة النموذج هي التأخير الناجم عن الوصول إلى الذاكرة. كما يمكن رؤيته في الصورة أدناه، فإن العديد من المشغلين في التحويل، بما في ذلك الإضافة العنصرية والتعديل والتحويل الشبكي المتكرر، هي عمليات غير فعالة للذاكرة لأنها تتطلب الوصول إلى وحدات الذاكرة المختلفة، وهو عملية تستغرق وقتًا.

على الرغم من وجود بعض الطرق الحالية التي يمكن أن تسهل حسابات الانتباه الذاتي القياسي مثل التقريب منخفض الرتبة والانتباه النادر، إلا أنها غالبًا ما توفر تسريعًا محدودًا وتدهور الدقة.

من ناحية أخرى، يهدف إطار EfficientViT إلى تقليل تكلفة الوصول إلى الذاكرة من خلال تقليل عدد الطبقات غير الفعالة للذاكرة في الإطار. يقلل النموذج من حجم DeiT-T وSwin-T إلى شبكات فرعية صغيرة مع سرعة تداخل أعلى بنسبة 1.25 و1.5، ويقارن أداء هذه الشبكات الفرعية مع نسبة طبقات MHSA. كما يمكن رؤيته في الصورة أدناه، عندما يتم تطبيق هذا النهج، يزيد من دقة طبقات MHSA بنسبة 20-40٪.

كفاءة الحساب

تتمثل طبقات MHSA في تعبئة تسلسل الإدخال إلى مساحات فرعية متعددة أو رؤوس، وتمثل خرائط الانتباه بشكل فردي، وهي طريقة معروفة بأنها تزيد الأداء. ومع ذلك، فإن خرائط الانتباه ليست رخيصة حسابيًا، وللتحقيق في التكاليف الحسابية، يبحث نموذج EfficientViT في كيفية تقليل الانتباه المتكرر في نماذج ViT الصغيرة.

لمحفز الرؤوس لتعلم أنماط مختلفة، يطبق النموذج حلًا直ًا حيث يتم تغذية كل رأس فقط بجزء من الميزة الكاملة، وهي تقنية تشبه فكرة التجميع.

كفاءة المعامل

تعتمد نماذج ViT المتوسطة على استراتيجيات التصميم مثل استخدام عرض متساوي للمشاريع، وضبط نسبة التوسيع إلى 4 في الشبكة العصبية الأمامية، وزيادة الرؤوس عبر المراحل من تحويلات NLP. تحتاج هذه المكونات إلى إعادة تصميم بعناية لتحقيق الوحدات الخفيفة.

يظهر الصورة أعلاه أن المراحل الأولى من الإطار تحافظ على أكثر الأبعاد، في حين أن المراحل الأخيرة تحافظ على أقل الأبعاد. قد يعني ذلك أن تكوين قناة نمطي يضاعف القناة بعد كل مرحلة أو يستخدم قنوات متساوية لجميع الكتل، قد يؤدي إلى تكرار كبير في المراحل الأخيرة.

تحويل الرؤية الفعالة: الهيكل

بناءً على الاستنتاجات التي تم الحصول عليها خلال التحليل السابق، عمل المطورون على إنشاء نموذج هرمي جديد يوفّر سرعات تداخل سريعة، نموذج EfficientViT. دعونا نلقي نظرة أكثر تفصيلًا على هيكل إطار EfficientViT.

مكونات إطار EfficientViT

تمثل الكتلة الأساسية لشبكة تحويل الرؤية الأكثر كفاءة في الشكل التالي.

يتكون الإطار من وحدة انتباه مجموعة متسلسلة، وتصميم ساندويتش فعال للذاكرة، و استراتيجية إعادة تخصيص المعامل التي تركز على تحسين كفاءة النموذج من حيث الحساب والذاكرة والمعامل على التوالي.

تخطيط الساندويتش

يستخدم النموذج تخطيط ساندويتش جديد لإنشاء كتلة ذاكرة أكثر فعالية وفعالية للهيكل. يستخدم تخطيط الساندويتش طبقات انتباه ذاتية أقل مقيدة بالذاكرة، ويستخدم شبكات أمامية أكثر كفاءة للذاكرة لاتصالات القناة.

انتباه المجموعة المتسلسلة

تعتبر واحدة من المشاكل الرئيسية مع طبقات MHSA هي التكرار في رؤوس الانتباه، مما يجعل الحسابات أقل فعالية. لمواجهة هذه القضية، يقدم نموذج EfficientViT وحدة انتباه مجموعة متسلسلة لتحويلات الرؤية، وهي وحدة انتباه جديدة تأخذ الإلهام من التجميع في شبكات CNN الفعالة.

إعادة تخصيص المعامل

为了 تحسين كفاءة المعامل، ي重新 تخصيص النموذج المعامل في الشبكة عن طريق توسيع عرض قناة المكونات الحيوية، وضغط عرض قناة المكونات الأقل أهمية.

يُظهر نظرة عامة على إطار EfficientViT في الصورة أعلاه، حيث تظهر الأجزاء:

  1. هيكل EfficientViT،
  2. كتلة تخطيط الساندويتش،
  3. انتباه المجموعة المتسلسلة.

 

EfficientViT: هياكل الشبكة

يُظهر الصورة أعلاه هيكل شبكة EfficientViT. يقدم النموذج تضمين باتش متداخل [20,80] يدمج 16×16 باتشات في أبعاد توكن C1، مما يعزز قدرة النموذج على التعلم البصري منخفض المستوى.

عائلة EfficientViT

تتكون عائلة EfficientViT من 6 نماذج ذات أعماق وewidths مختلفة، ويتم تخصيص عدد رؤوس معين لكل مرحلة.

EfficientViT: تنفيذ النموذج والنتائج

تم تدريب نموذج EfficientViT ب批 كبير من 2,048، تم بناؤه باستخدام Timm وPyTorch، وتم تدريبه من البداية لمدة 300 دورة باستخدام 8 وحدات معالجة رسومات Nvidia V100، ويستخدم جدولاً للتعلم الكوزيني، ومُحسّن AdamW، وأجريت تجربة التصنيف على ImageNet-1K.

النتائج على ImageNet

لتحليل أداء EfficientViT، يتم مقارنته بنماذج ViT وCNN الحالية على مجموعة بيانات ImageNet.

المقارنة مع CNN الفعالة وViTs الفعالة

يتم مقارنة أداء EfficientViT مع CNN الفعالة مثل EfficientNet وCNN الفانيليا مثل MobileNets.

يُظهر الصورة أعلاه مقارنة أداء EfficientViT مع نماذج ViT الكبيرة على مجموعة بيانات ImageNet-1K.

التصنيف البصري المتدفق

يتم تطبيق EfficientViT على مهام متدفقة مختلفة لدراسة قدرات النموذج على التعلم المتدفق، ويُظهر الصورة التالية نتائج التجربة.

كشف الكائنات

لتحليل قدرة EfficientViT على كشف الكائنات، يتم مقارنته مع نماذج فعالة على مهمة كشف الكائنات على COCO، ويُظهر الصورة التالية نتائج المقارنة.

أفكار ختامية

في هذه المقالة، تحدثنا عن EfficientViT، وهي عائلة من نماذج تحويل الرؤية السريعة التي تستخدم انتباه المجموعة المتسلسلة وتوفر عمليات ذاكرة فعالة. أظهرت التجارب الشاملة التي أجريت لتحليل أداء EfficientViT نتائج واعدة، حيث يتفوق نموذج EfficientViT على نماذج CNN وViT الحالية في معظم الحالات.

كونال كيجريوال مهندس خلفية متخصص في بايثون، PostgreSQL، Redis، والبنية التحتية السحابية على GCP و AWS. لديه ثلاث سنوات من الخبرة في بناء وتوسيع الأنظمة الإنتاجية، وهو يكتب عن بنية تحتية الذكاء الاصطناعي، الأنظمة الموزعة، والهندسة المعمارية وراء نشر أعباء العمل لتعلم الآلة.