نماذج ومنصات الذكاء الاصطناعي

DiffSeg : تقنية تقسيم غير خاضعة للإشراف باستخدام الانسياب المستقر

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

أحد التحديات الأساسية في نماذج الرؤية الحاسوبية هي توليد أقنعة تقسيم عالية الجودة. وقد أتاحت التقدمات الحديثة في التدريب الخاضع للإشراف على نطاق كبير تمكين تقسيم الصور بدون إشراف عبر أنماط صور مختلفة. بالإضافة إلى ذلك ، فإن التدريب غير الخاضع للإشراف قد بسط عملية التقسيم دون الحاجة إلى تعليمات شاملة. على الرغم من هذه التطورات ، لا يزال بناء إطار عمل للرؤية الحاسوبية قادر على تقسيم أي شيء في إعداد بدون إشراف بدون تعليمات معقدة. يتضمن التقسيم الدلالي ، وهو مفهوم أساسي في نماذج الرؤية الحاسوبية ، تقسيم الصورة إلى مناطق أصغر ذات معاني موحدة. وتوفر هذه التقنية الأساس للعديد من المهام الجانبية ، مثل التصوير الطبي ، وتحرير الصور ، والقيادة الذاتية ، وغيرها.

لتحسين تطوير نماذج الرؤية الحاسوبية ، من المهم أن لا تقتصر عملية تقسيم الصور على مجموعة بيانات محددة ذات فئات محدودة. بدلاً من ذلك ، يجب أن تعمل كمهام أساسية مرنة لتنفيذ تطبيقات مختلفة. ومع ذلك ، فإن تكلفة جمع التسميات على أساس بكسل يُشكل تحديًا كبيرًا ، مما يحد من تقدم أساليب التقسيم بدون إشراف والخاضعة للإشراف التي لا تتطلب تعليمات ولا تملك معرفة مسبقة بالهدف. سيتم مناقشة كيف يمكن للطبقات ذات الانتباه الذاتي في نماذج الانسياب المستقر تسهيل إنشاء نموذج قادر على تقسيم أي مدخل في إعداد بدون إشراف ، حتى بدون تعليمات مناسبة. وتفهم هذه الطبقات ذات الانتباه الذاتي بشكل طبيعي مفاهيم الكائنات التي يتعلمها نموذج الانسياب المستقر المسبق.

DiffSeg : خوارزمية تقسيم بدون إشراف محسنة

يتضمن التقسيم الدلالي عملية تقسيم الصورة إلى أقسام مختلفة ، مع مشاركة كل قسم معاني متشابهة. وتشكل هذه التقنية الأساس للعديد من المهام الجانبية. تقليدًا ، اعتمدت مهام الرؤية الحاسوبية بدون إشراف على التقسيم الدلالي الخاضع للإشراف ، باستخدام مجموعات بيانات كبيرة ذات فئات تم تعليمها وتسميتها. ومع ذلك ، لا يزال تنفيذ التقسيم الدلالي بدون إشراف في إعداد بدون إشراف تحديًا. بينما تكون الأساليب التقليدية الخاضعة للإشراف فعالة ، غالبًا ما تكون التكلفة التسميلية لكل بكسل باهظة الثمن ، مما يبرز الحاجة إلى تطوير أساليب تقسيم بدون إشراف في إعداد أقل تقييدًا بدون إشراف ، حيث لا يتطلب النموذج بيانات تم تعليمها ولا معرفة مسبقة بالبيانات.

للتغلب على هذا القيد ، تقدم DiffSeg استراتيجية ما بعد المعالجة الجديدة ، مستفيدة من قدرات إطار عمل الانسياب المستقر لإنشاء نموذج تقسيم عام يمكنه تنفيذ نقل بدون إشراف على أي صورة. وقد أثبتت إطارات الانسياب المستقر فعاليتها في توليد صور عالية الدقة بناءً على شروط الإشارات. بالنسبة للصور المولدة ، يمكن لهذه الإطارات توليد أقنعة تقسيم باستخدام نصوص الإشارات المقابلة ، والتي تتضمن عادةً كائنات الخلفية السائدة فقط.

على العكس من ذلك ، DiffSeg هو نهج ما بعد المعالجة المبتكر الذي يولد أقنعة تقسيم باستخدام تензورات الانتباه من الطبقات ذات الانتباه الذاتي في نموذج الانسياب. يتكون خوارزمية DiffSeg من ثلاثة مكونات رئيسية: دمج الانتباه التكراري ، وتراكم الانتباه ، وضغط الحد الأقصى.

يحافظ DiffSeg على المعلومات البصرية عبر دقة متعددة من خلال تراكم تензورات الانتباه ذات الأبعاد الأربعة مع الاتساق المكاني ، ويتضمن عملية دمج تكرارية عن طريق أخذ عينات من نقاط المرجعية. وتعمل هذه النقاط المرجعية كقاعدة لإطلاق دمج أقنعة الانتباه مع امتصاص نقاط المرجعية ذات الكائنات في النهاية. يتحكم إطار DiffSeg في عملية الدمج بمساعدة طريقة الانحراف KL لقياس التشابه بين خريطة انتباه وآخر.

عند مقارنة DiffSeg بالأساليب غير الخاضعة للإشراف القائمة على التجميع ، لا يتعين على المطورين تحديد عدد التجميعات مسبقًا في خوارزمية DiffSeg ، ويمكنه حتى بدون أي معرفة مسبقة إنتاج تقسيم بدون استخدام موارد إضافية. بشكل عام ، DiffSeg هو “نهج جديد غير خاضع للإشراف و بدون إشراف لتقسيم الصور باستخدام نموذج الانسياب المستقر المسبق ، ويمكنه تقسيم الصور بدون موارد إضافية أو معرفة مسبقة”.

DiffSeg : المفاهيم الأساسية

DiffSeg هو خوارزمية جديدة تعتمد على مفاهيم الانسياب ، والتقسيم غير الخاضع للإشراف ، و تقسيم الصور بدون إشراف.

نماذج الانسياب

DiffSeg يعتمد على نماذج الانسياب المسبقة. نماذج الانسياب هي واحدة من الإطارات التوليدية الأكثر شعبية لنماذج الرؤية الحاسوبية ، وتتعلم عملية الانسياب الأمامي والخلفي من صورة مشوشة إلى صورة غير مشوشة.

التقسيم غير الخاضع للإشراف

DiffSeg يرتبط ارتباطًا وثيقًا بالتقسيم غير الخاضع للإشراف ، وهو ممارسة حديثة في الذكاء الاصطناعي تهدف إلى توليد أقنعة تقسيم كثيفة بدون استخدام تعليمات. ومع ذلك ، لتحقيق أداء جيد ، تحتاج نماذج التقسيم غير الخاضع للإشراف إلى بعض التدريب غير الخاضع للإشراف مسبقًا على مجموعة البيانات الهدف.

تقسيم الصور بدون إشراف

DiffSeg يرتبط ارتباطًا وثيقًا بإطارات تقسيم الصور بدون إشراف ، وهي طريقة قادرة على تقسيم أي شيء بدون تدريب أو معرفة مسبقة بالبيانات. وقد أظهرت نماذج تقسيم الصور بدون إشراف القدرة على نقل بدون إشراف بشكل استثنائي في الآونة الأخيرة ، على الرغم من أنها تتطلب بعض الإدخال النصي والإشارات.

DiffSeg : الطريقة والهيكل

DiffSeg يستخدم الطبقات ذات الانتباه الذاتي في نموذج الانسياب المستقر المسبق لتوليد مهام تقسيم عالية الجودة.

نموذج الانسياب المستقر

الانسياب المستقر هو مفهوم أساسي في إطار DiffSeg. الانسياب المستقر هو إطار توليدي ، وهو واحد من نماذج الانسياب الأكثر شعبية.

المكونات والهيكل

DiffSeg هو نهج ما بعد المعالجة الجديد لدمج تензورات الانتباه في أقنعة تقسيم صالحة.

تراكم الانتباه

DiffSeg يولد 16 تензورًا من الانتباه ، و 5 تензورات لكل من الأبعاد. الهدف الأساسي من توليد 16 تензورًا هو تراكم هذه التензورات مع دقة مختلفة في تензور ذي دقة أعلى.

دمج الانتباه التكراري

DiffSeg يهدف إلى دمج أقنعة الانتباه في مجموعة من مقترحات الكائنات ، حيث تحتوي كل مقترح على فئة الخلفية أو تفعيل كائن واحد.

ضغط الحد الأقصى

DiffSeg يستخدم ضغط الحد الأقصى لتحويل قائمة مقترحات الكائنات إلى قناع تقسيم صالح.

DiffSeg : التجارب والنتائج

DiffSeg يستخدم مجموعتي تقسيم بدون إشراف ، وهما Cityscapes و COCO-stuff-27.

النتائج

DiffSeg ينجز نتائج مماثلة لأطر العمل التي تستخدم إدخالًا بدقة 320 ، ويتفوق على أطر العمل التي تستخدم إدخالًا بدقة 512 عبر الدقة و miou.

الخاتمة

تقسيم الصور بدون إشراف لا يزال أحد أكبر التحديات لنماذج الرؤية الحاسوبية ، والأطر الحالية تعتمد على التكيف غير الخاضع للإشراف أو الموارد الخارجية. DiffSeg هو نهج جديد لتحقيق تقسيم الصور بدون إشراف باستخدام نموذج الانسياب المستقر المسبق.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.