نماذج ومنصات الذكاء الاصطناعي

تعليم التوجيه البصري لتحقيق فهم على مستوى البكسل مع Osprey

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

مع التحسين الأخير لطرق تعليم التوجيه البصري ، أظهرت نماذج اللغة الكبيرة متعددة الوسائط قدرات رائعة في فهم اللغة والرؤية. هذه القدرات تجعلها حجر الزاوية لبناء مساعدين بصريين حديثين. النماذج الحديثة ، بما في ذلك MiniGPT-4 و LLaVA و InstructBLIP وغيرها ، تظهر مهارات رائعة في التفكير البصري واتباع التعليمات. على الرغم من أن معظمها يعتمد على أزواج الصور والنصوص للتعرف على الصور على مستوى الصورة ، إلا أنها تعمل بشكل جيد في هذا المجال. ومع ذلك ، فإن اعتمادها على فهم الصور على مستوى الصندوق ومستوى الصورة هو السبب الرئيسي لعدم تمكن نماذج اللغة الكبيرة متعددة الوسائط من تكرار أدائها في مهام التوجيه البصري الدقيق على مستوى البكسل. بالإضافة إلى ذلك ، فإن عدم توفر بيانات التوجيه القائمة على Masks للتدريب يطرح تحديات في تعزيز نماذج اللغة الكبيرة متعددة الوسائط.

Osprey هو طريقة تدريب تعليمية قائم على Masks والنص مع الهدف الأساسي لتوسيع نماذج اللغة الكبيرة متعددة الوسائط. إنه يدمج مناطق Masks دقيقة في تعليمات اللغة لتحقيق فهم بصري على مستوى البكسل. لتحقيق ذلك ، يقوم إطار Osprey بإنشاء مجموعة بيانات قائم على Masks ومناطق النص مع أكثر من 700 ألف نموذج. إنه ي.inject تمثيل البكسل في نماذج اللغة الكبيرة لتصميم نموذج اللغة والرؤية. ومن الملاحظ أن إطار Osprey يعتمد نموذج CLIP القائم على(Convolutional) كمدخل رؤية في هيكله. كما أنه يدمج مستخرج بصري قائم على Masks في هيكله. هذا يسمح بالاستخراج الدقيق لميزات البصريات من المدخلات عالية الدقة.

في هذه المقالة ، سنناقش إطار Osprey ونغوص sâu في هيكله. سنستكشف أيضًا مجموعة البيانات المنظمة للمناطق والنصوص مع أكثر من 700 ألف نموذج ومقارنة أدائها في مهام فهم المنطقة المختلفة. لذا ، دعونا نبدأ.

Osprey: فهم البكسل مع تعليم التوجيه البصري

نماذج اللغة الكبيرة متعددة الوسائط مثل MiniGPT-4 و Otter و Qwen-LV و InstructBLIP هي الرائدة في تطوير المساعدين البصريين العامين ، وهي مشهورة بمهاراتها المتعددة والرؤية التوليدية الاستثنائية. ومع ذلك ، تعاني نماذج اللغة الكبيرة متعددة الوسائط من تحدي رئيسي حيث تقدم نتائج غير مرضية في مهام فهم الصور الدقيق مثل التعليق وتصنيف المنطقة والتفكير. السبب الرئيسي للاداء الضعيف في مهام فهم الصور الدقيق هو عدم وجود محاذاة على مستوى المنطقة. النماذج الحديثة مثل GPT4RoI و Shikra تهدف إلى تمكين فهم المنطقة في نماذج اللغة والرؤية من خلال معالجة المناطق المحددة بواسطة الصندوق ومعالجة ميزات الفضاء على مستوى الكائن.

على الرغم من أن النهج لتمكين فهم المنطقة قد يحسن الأداء ، إلا أن استخدام الصندوق الخفيف كمدخل المنطقة مباشرة قد يؤدي إلى إدخال ميزات خلفية غير ذات صلة مما يؤدي إلى عدم محاذاة دقيقة للأزواج النصية والمناطق البصرية للتعليم البصري على نماذج اللغة الكبيرة. خلال عملية الاستدلال ، قد لا يكون المدخل المحدد بواسطة الصندوق قادرًا على الكشف عن الكائن وتقديم تمثيل دقيق ، مما قد يؤدي إلى انحراف семантиكي كما هو موضح في الصورة التالية.

في المقابل ، استخدام Masks دقيقة بدلاً من الصندوق الخفيف كمدخل المنطقة قد يكون قادرًا على تمثيل الكائنات بدقة أكبر. النموذج الحديث مثل SAM أو Segment Anything Model يتدرب على مليارات Masks عالية الجودة ويظهر جودة فصل استثنائية على الكائنات الصفرية ويدعم استخدام النقاط أو الصندوق البسيط كأوامر. ومع ذلك ، لا يمكن لنموذج SAM توليد تسميات семантиكية أساسية ، ولا يمكنه تقديم تعليقات وصفية مفصلة وسمات. ونتيجة لذلك ، تفتقر النماذج الحالية إلى معلومات متعددة الوسائط دقيقة ، وتمتلك فهمًا محدودًا للمشاهد في العالم الحقيقي.

لمواجهة التحديات التي تواجهها نماذج اللغة الكبيرة متعددة الوسائط الحالية ، يهدف Osprey ، وهو طريقة تدريب تعليمية قائم على Masks والنص ، إلى توسيع قدرات نماذج اللغة الكبيرة متعددة الوسائط لفهم دقيق على مستوى البكسل. إنه يدمج مناطق Masks دقيقة في تعليمات اللغة لتحقيق فهم بصري على مستوى البكسل. يتبنى إطار Osprey نموذج CLIP قائم على(Convolutional) كمدخل رؤية في هيكله ، ويدمج مستخرج بصري قائم على Masks. هذا يسمح بالاستخراج الدقيق لميزات البصريات من المدخلات عالية الدقة.

باستخدام قدرات تعليم التوجيه البصري ، يسمح إطار Osprey بمهارات جديدة ما وراء فهم الصور على مستوى الصورة والصندوق. إنه يمكن توليد семантиات دقيقة باستخدام Masks غير متجانسة من SAMs. بالإضافة إلى ذلك ، يظهر Osprey قدرات استثنائية عبر مهام تصنيف الكائنات المرجعية ، والتعرف على المفردات المفتوحة ، والتعليق على مستوى المنطقة ، ووصف المنطقة المفصلة.

Osprey: منهجية وهيكل

الرسم التالي يظهر نظرة عامة على هيكل إطار Osprey المكون من نموذج لغة كبير ، ومستخرج بصري قائم على Masks ، ومدخل رؤية على مستوى الصورة.

对于 صورة معينة ، يقوم الإطار بتحويل اللغة والمناطق Masks المرجعية إلى تمثيلات قبل إرسالها إلى نموذج اللغة الكبيرة لتحقيق فهم دقيق семантиكي.

مدخل رؤية CLIP قائم على Convolutional

مدخل الرؤية المستخدم في معظم نماذج اللغة الكبيرة متعددة الوسائط هو نموذج CLIP قائم على ViT. ونتيجة لذلك ، يتبنى الإطار دقة صورة تبلغ 224×224 بكسل أو 336×336 بكسل. ومع ذلك ، استخدام نموذج CLIP قائم على ViT يجعل من الصعب على النموذج تحقيق فهم دقيق للصور على مستوى البكسل ، وهو مشكلة تزداد مع المناطق الصغيرة. بالإضافة إلى ذلك ، يمنع الحمل الحسابي المرتبط بهيكل ViT إمكانية زيادة دقة الصورة.

لمواجهة هذا التحدي ، يتبنى إطار Osprey نموذج CLIP قائم على Convolutional كمدخل رؤية في هيكله. وقد أظهرت نماذج CLIP قائم على Convolutional Neural Networks قدرات عامة رائعة عبر مدخلات مختلفة عند مقارنتها بنماذج CLIP قائم على Transformer. استخدام نموذج CLIP قائم على Convolutional يسمح بالاستدلال السريع والتدريب الفعال دون المساس بأداء النموذج. بالإضافة إلى ذلك ، يمكن لنموذج CLIP قائم على Convolutional توليد خرائط ميزات متعددة الحجم التي يستخدمها الإطار مباشرة لاستخراج الميزات في كل منطقة كائن.

مستخرج بصري قائم على Masks

على عكس النماذج القائمة على المنطقة التي تستخدم الصندوق الخفيف كمدخل ، يستخدم إطار Osprey مناطق Masks دقيقة لتحقيق تمثيلات الكائنات. يستخدم نموذج Osprey مستخرج بصري قائم على Masks لتقديم ميزات البصريات على مستوى البكسل في كل منطقة.

لتحقيق ذلك ، يستخدم Osprey ميزات الصورة متعددة المستويات التي يولدها مدخل الرؤية لتبني عملية pooling Masks ، و对于 كل ميزة على مستوى فردي ، يجمع Osprey جميع الميزات التي تقع داخل منطقة Masks. ثم يقوم النموذج بتشفير الميزات عبر الطبقات المختلفة من خلال تمرير كل ميزة خلال طبقة مشروع خطي التي تولد تمثيلات على مستوى المنطقة ، ويتحد الميزات المتعددة المستويات من خلال الجمع. ثم يستخدم Osprey طبقة MLP لتوليد رمز البصريات Masks. بالإضافة إلى ذلك ، يحافظ Osprey على الهندسة المكانية للمنطقة الكائن من خلال تشفير العلاقة الموضعية على مستوى البكسل من خلال تنفيذ Masks ثنائي.

تجزئة نموذج اللغة الكبيرة

كما ذكرنا سابقًا ، يستخلص النموذج تمثيلات الصورة على مستوى الصورة من خلال تغذية الصورة إلى مدخل رؤية مسبق التدريب.对于 المعلومات النصية ، يستخدم النموذج أولاً مقسمات نموذج اللغة الكبيرة المسبقة التدريب لتجزئة تسلسلات النص ، ثم يقوم بتشفير هذه التسلسلات النصية المجزأة إلى تمثيلات نصية.

Osprey: عملية التدريب ثلاثية المراحل

يتبع إطار Osprey عملية تدريب ثلاثية المراحل ، حيث يتم إشراف كل مرحلة من مراحل التدريب بواسطة خسارة تنبؤ التوكين التالية.

المرحلة 1: تدريب محاذاة الصورة والنص

في المرحلة الأولى ، يتبع إطار Osprey مدخل رؤية CLIP قائم على Convolutional لتدريب الميزات على مستوى الصورة وملحق اللغة لتدريب النموذج على محاذاة الميزات الصورية والنصية.

المرحلة 2: تدريب مسبق للمحاذاة النصية للمasks

في المرحلة الثانية ، يتحمل Osprey الأوزان المُدرَجة في المرحلة الأولى ، ويستخدم مكون مستخرج بصري قائم على Masks لتقديم ميزات المنطقة على مستوى البكسل.

المرحلة 3: تعديل دقيق من النهاية إلى النهاية

في المرحلة الثالثة والأخيرة ، يثبت النموذج أوزان مدخل الرؤية ، ويعيد تعديل نموذج اللغة الكبيرة ، ومستخرج الميزات على مستوى Masks ، وملحق الصورة على مستوى الصورة في هيكله.

Osprey: نتائج تجريبية

لتحقيق تقييم أدائه ، أجريت مجموعة واسعة من التجارب لتحقيق قدرات النموذج في التصنيف والتعرف على مستوى البكسل والوصف المعقد.

التقطيع المفتوح

الهدف الرئيسي من التقطيع المفتوح هو توليد تمثيلات Masks للمناطق وتصنيفها بشكل صريح.

تصنيف الكائنات المرجعية

في مهمة تصنيف الكائنات المرجعية ، يُطلب من النموذج تصنيف الكائن في منطقة معينة من الصورة.

وصف المنطقة المفصلة

في مهمة وصف المنطقة المفصلة ، يقوم النموذج بتقييم أدائه على مهارات الوصف المفصلة التابعة للتعليمات.

التعليق على مستوى المنطقة

يتمتع إطار Osprey بأداء استثنائي في مهام التعليق على مستوى المنطقة.

أفكار ختامية

في هذه المقالة ، ناقشنا Osprey ، وهو طريقة تدريب تعليمية قائم على Masks والنص بهدف رئيسي لتوسيع نماذج اللغة الكبيرة متعددة الوسائط لتحقيق فهم دقيق على مستوى البكسل. لتحقيق هدفه ، يتبنى إطار Osprey مجموعة بيانات قائم على Masks ومناطق النص مع أكثر من 700 ألف نموذج ، ويقدم تمثيل البكسل إلى نموذج اللغة الكبيرة لتصميم نموذج اللغة والرؤية. يهدف إطار Osprey إلى تعزيز نماذج اللغة الكبيرة متعددة الوسائط لفهم دقيق على مستوى البكسل بشكل كبير ، وبتطبيق نموذج CLIP قائم على Convolutional ومستخرج بصري قائم على Masks ، يكتسب Osprey القدرة على فهم الصور على مستوى المنطقة وعلى مستوى الكائن.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.