نماذج ومنصات الذكاء الاصطناعي

YOLO-World: كشف الأجسام في الوقت الفعلي مع قاموس مفتوح

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

كشف الأجسام كان تحديًا أساسيًا في صناعة الرؤية الحاسوبية، مع تطبيقات في الروبوتات، وفهم الصور، والمركبات المستقلة، والتعرف على الصور. في السنوات الأخيرة، ساهمت الأعمال الرائدة في مجال الذكاء الاصطناعي، ولا سيما من خلال الشبكات العصبية العميقة، بشكل كبير في تقدم كشف الأجسام. ومع ذلك، هذه النماذج لها قاموس ثابت، محدود بالكشف عن الأجسام داخل 80 فئة من مجموعة بيانات COCO. هذا القصور يأتي من عملية التدريب، حيث يتم تدريب كاشفات الأجسام على التعرف فقط على فئات محددة، وبالتالي يحد من تطبيقها.

للتغلب على هذا، نقدم YOLO-World، وهو نهج مبتكر يهدف إلى تعزيز إطار YOLO (You Only Look Once) بقدرات الكشف عن القاموس المفتوح. يتم تحقيق هذا من خلال التدريب المسبق للإطار على مجموعات بيانات كبيرة وتنفيذ نهج نمذجة اللغة والرؤية. على وجه التحديد، يستخدم YOLO-World شبكة RepVL-PAN القابلة لإعادة PARAMETER و خسارة التباين بين النص والصورة لتعزيز التفاعل بين المعلومات اللغوية والبصرية. من خلال RepVL-PAN و خسارة التباين بين النص والصورة، يمكن لـ YOLO-World كشف دقيق وفعال عن مجموعة واسعة من الأجسام في إعدادات الصفر، مع أداء ملحوظ في مهام الكشف عن الأجسام والتقسيم المفتوح.

تهدف هذه المقالة إلى تقديم فهم شامل للأسس الفنية ل YOLO-World، وهيكل النموذج، وعملية التدريب، و سيناريوهات التطبيق. دعونا نغوص في الموضوع.

YOLO-World: كشف الأجسام في الوقت الفعلي مع قاموس مفتوح

YOLO أو You Only Look Once هو أحد أكثر الطرق شعبية للكشف عن الأجسام الحديثة في صناعة الرؤية الحاسوبية. وهو معروف بسرعته و كفاءته الرائعة، وقد غير ظهور آلية YOLO طريقة تفسير الآلات و كشف الأجسام داخل الصور و الفيديوهات في الوقت الفعلي. تطبق الإطارات التقليدية للكشف عن الأجسام نهجًا من خطوتين للكشف عن الأجسام: في الخطوة الأولى، تقترح الإطار مناطق قد تحتوي على الجسم، و في الخطوة التالية، تصنف الإطار الجسم. من ناحية أخرى، يدمج إطار YOLO هذه الخطوتين في نموذج شبكة عصبية واحد، وهو نهج يسمح للإطار بالنظر إلى الصورة مرة واحدة فقط للتنبؤ بالجسم وموقعه داخل الصورة، و من هنا جاءت التسمية YOLO أو You Only Look Once.

علاوة على ذلك، يعالج إطار YOLO كشف الأجسام على أنه مشكلة انحدار، و يتنبأ بالاحتمالات الطبقية و الصندوق الحاوي مباشرة من الصورة الكاملة في نظرة واحدة، و يزيد ذلك من سرعة عملية الكشف، و يعزز أيضًا قدرة النموذج على تعميم البيانات المعقدة و المتنوعة، مما يجعله خيارًا مناسبًا للتطبيقات التي تعمل في الوقت الفعلي مثل القيادة المستقلة، و كشف السرعة، أو التعرف على لوحة الترخيص. بالإضافة إلى ذلك، ساهم التقدم الكبير في الشبكات العصبية العميقة في السنوات القليلة الماضية بشكل كبير في تطوير إطارات كشف الأجسام، ولكن نجاح إطارات كشف الأجسام لا يزال محدودًا لأنها قادرة على كشف الأجسام فقط مع قاموس محدود.

يتحرك إطار YOLO-World لتحقيق كشف الأجسام الفعال مع قاموس مفتوح، و يبحث في إمكانية نهج التدريب المسبق على نطاق كبير لتعزيز كفاءة كاشفات YOLO التقليدية للكشف عن الأجسام مع قاموس مفتوح. على عكس الأعمال السابقة في كشف الأجسام، يظهر إطار YOLO-World كفاءة ملحوظة مع سرعات استدلال عالية، و يمكن تطبيقها بسهولة على التطبيقات المتدفقة.

يتبع نموذج YOLO-World هيكل YOLO التقليدي، و يشفر النصوص المدخلة باستخدام قدرات مشفر CLIP النصي المسبق التدريب. بالإضافة إلى ذلك، يتضمن إطار YOLO-World مكونًا RepVL-PAN في هيكله لربط ميزات الصورة و النص لتعزيز التمثيلات البصرية و اللغوية. خلال مرحلة الاستدلال، يزيل الإطار مشفر النص، و يعيد PARAMETER التضمين النصي إلى أوزان RepVL-PAN، مما يؤدي إلى تطبيق فعال.

كما يتضمن إطار YOLO-World تعلم التباين بين النص و الصورة في إطاره لدراسة أساليب التدريب المسبق المفتوح للكشف عن الأجسام التقليدية. يوحّد نهج التباين بين النص و الصورة بيانات الصورة و النص و بيانات التأطير و بيانات الكشف في أزواج نصية و منطقة. بناءً على ذلك، يظهر إطار YOLO-World المسبق التدريب على أزواج نصية و منطقة قدرات ملحوظة للكشف عن الأجسام المفتوح و الكبير.

YOLO-World : الطريقة و الهيكل

أزواج النص و المنطقة

تقليدًا، يتم تدريب إطارات كشف الأجسام، بما في ذلك عائلة YOLO من كاشفات الأجسام، باستخدام تعليمات المثيل التي تحتوي على تسميات الفئات و الصندوق الحاوي. في المقابل، يعيد إطار YOLO-World صياغة تعليمات المثيل على أنها أزواج نصية و منطقة حيث يمكن أن يكون النص وصف الجسم أو عبارات اسمية أو اسم الفئة. ومن الجدير بالذكر أن إطار YOLO-World يتبنى كل من النصوص و الصور كمدخلات و خرجات صندوق متوقع مع تضمين الكائنات.

هيكل النموذج

في جوهره، يتكون نموذج YOLO-World من مشفر نصي و كاشف YOLO و مكون RepVL-PAN، كما هو موضح في الصورة التالية.

对于 نص مدخل، يشفر مكون مشفر النص النص إلى تضمين نصي، يليها استخراج ميزات متعددة المقاييس من الصورة المدخلة بواسطة كاشفات الصورة في مكون كاشف YOLO. ثم يستغل مكون RepVL-PAN اندماج التباين بين التضمين النصي و ميزات الصورة لتعزيز تمثيلات النص و الصورة.

كاشف YOLO

يتم بناء نموذج YOLO-World على إطار YOLOv8 الحالي الذي يحتوي على مكون Darknet كمدخل صورة، و رأس لتمثيل الكائن و انحدار الصندوق الحاوي، و شبكة PAN أو Path Aggression للهرم المتعدد المقاييس.

مشفر النص

对于 نص معين، يستخرج نموذج YOLO-World التضمين النصي المقابل بالاعتماد على مشفر CLIP Transformer النصي المسبق التدريب مع عدد معين من الأسماء و بعد التضمين. السبب الرئيسي لاستخدام إطار YOLO-World لمشفر CLIP النصي هو أنه يقدم أداء بصرية و لغوية أفضل للربط بين النصوص و الأجسام المرئية، و يتفوق بشكل كبير على مشفرات اللغة النصية التقليدية.

رأس التباين النصي

رأس منفصل هو مكون يستخدمه نماذج كشف الأجسام السابقة، و يعتمد إطار YOLO-World على رأس منفصل مع تحويلات متوالية مزدوجة لانحدار تضمين الكائن و الصندوق الحاوي لعدد معين من الأجسام. يستخدم إطار YOLO-World رأس التباين النصي لتحقيق تشابه بين الكائن و النص باستخدام نهج L2 و تضمين النص. بالإضافة إلى ذلك، يستخدم نموذج YOLO-World أيضًا نهج التحويل التأفيري مع عامل تحويل و معامل تحجيم قابل للتعلم، و يعزز نهج L2 و التحويل التأفيري استقرار النموذج خلال تدريب النص و المنطقة.

تدريب القاموس عبر الإنترنت

خلال مرحلة التدريب، يبني نموذج YOLO-World قاموسًا عبر الإنترنت لكل عينة موزاييكية تتكون من 4 صور. ينموذج جميع الأسماء الإيجابية الموجودة في الصور الموزاييكية، و ينموذج بعض الأسماء السلبية بشكل عشوائي من مجموعة البيانات المقابلة. يتكون القاموس لكل عينة من أقصى n أسماء، مع القيمة الافتراضية هي 80.

استدلال القاموس دون اتصال

خلال مرحلة الاستدلال، يقدم نموذج YOLO-World استراتيجية كشف ثم اكتشاف مع قاموس دون اتصال لتعزيز كفاءة النموذج. يحدد المستخدم أولاً سلسلة من الدلائل المخصصة التي قد تتضمن فئات أو حتى عناوين. ثم يحصل نموذج YOLO-World على تضمين قاموس دون اتصال عن طريق استخدام مشفر النص لتشفير الدلائل. وبالتالي، يساعد قاموس دون اتصال للنموذج على تجنب الحسابات لكل مدخل، و يسمح للنموذج بالتعديل القاموس بسهولة وفقًا للمتطلبات.

شبكة RepVL-PAN القابلة لإعادة PARAMETER

تُظهر الصورة التالية هيكل شبكة RepVL-PAN المقترحة التي تتبع المسارات من الأعلى إلى الأسفل و من الأسفل إلى الأعلى لتأسيس هرم الميزات المتعددة المقاييس.

لتعزيز التفاعل بين ميزات النص و الصورة، يقترح نموذج YOLO-World انتباه التجميع و طبقة CSPLayer الموجهة بالنص مع الهدف النهائي لتحسين التمثيلات البصرية و اللغوية للكشف عن الأجسام المفتوح. خلال مرحلة الاستدلال، يعيد نموذج YOLO-World PARAMETER تضمين قاموس دون اتصال إلى أوزان الطبقات الخطية أو التجميعية للنشر الفعال.

خطط التدريب المسبق

يتبع نموذج YOLO-World两个 نهج تدريب مسبق رئيسيين: التعلم من خسارة التباين بين النص و الصورة و التسمية الزائفة مع بيانات الصورة و النص.对于 نهج التدريب المسبق الرئيسي، يخرج النموذج تنبؤات الكائن مع تعليمات للنص و عينات الموزاييك. يطابق إطار YOLO-World التنبؤات مع تعليمات الحقيقة الأرضية باتباع و الاستفادة من تعيين التسمية المحدد للمهمة، و يعين التنبؤات الإيجابية الفردية مع فهرس النص الذي يخدم كتسمية التصنيف.

YOLO-World : النتائج

بمجرد أن يتم تدريب نموذج YOLO-World، يتم تقييمه مباشرة على مجموعة بيانات LVIS في إعداد الصفر، و تتكون مجموعة بيانات LVIS من أكثر من 1200 فئة، و التي تتجاوز بشكل كبير مجموعات البيانات المستخدمة في الاختبارات السابقة لأداء الكشف عن الأجسام الكبير.

كما يمكن ملاحظة أن إطار YOLO-World يتفوق على معظم الإطارات الحالية من حيث سرعات الاستدلال و الأداء في إعداد الصفر، حتى مع إطارات مثل Grounding DINO و GLIP و GLIPv2 التي تتضمن更多 البيانات. و بشكل عام، تظهر النتائج أن نماذج كشف الأجسام الصغيرة مثل YOLO-World-S مع 13 مليون معامل فقط يمكن استخدامها للتدريب المسبق على مهام اللغة و الرؤية مع قدرات الكشف عن الأجسام المفتوح.

أفكار ختامية

في هذه المقالة، تحدثنا عن YOLO-World، وهو نهج مبتكر يهدف إلى تعزيز قدرات إطار YOLO أو You Only Look Once للكشف عن الأجسام مع قاموس مفتوح من خلال التدريب المسبق على مجموعات بيانات كبيرة و تنفيذ نهج نمذجة اللغة و الرؤية. و بالتحديد، يقترح إطار YOLO-World تنفيذ شبكة RepVL-PAN القابلة لإعادة PARAMETER و خسارة التباين بين النص و الصورة لتعزيز التفاعل بين المعلومات اللغوية و البصرية. و من خلال RepVL-PAN و خسارة التباين بين النص و الصورة، يمكن لـ YOLO-World كشف دقيق و فعال عن مجموعة واسعة من الأجسام في إعدادات الصفر.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.