نماذج ومنصات الذكاء الاصطناعي

TinySAM : دفع الحدود للخلف في Segment Anything Model

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

التنقيب عن الكائنات هو مجال أساسي وحاسم في رؤية الكمبيوتر الحديثة. يلعب دورًا حيويًا في التطبيقات التي تتطلب مكونات بصرية مكثفة ، مثل تحديد موقع الكائنات وتحديدها ، ويتطلب تنقيباً في الوقت الفعلي وسريعًا ودقيقًا. هذا الأهمية جعلت تنقيب الكائنات موضوعًا بحثيًا ساخنًا باستمرار ، مع عمل كبير في مجالات مثل التنقيب عن الحالات ، والتنقيب الدلالي ، والتنقيب البانوبتيكي.

مع تطور تنقيب الكائنات ، ظهر نموذج Segment Anything (SAM) كأداة رائعة ، حيث أظهر قدرات تنقيب رائعة وتم تبنيه بسرعة في تطبيقات رؤية الكمبيوتر المختلفة. الإطارات التي تستخدم هيكل SAM المسبق التدريب حققت أداءً مثيرًا للإعجاب في المهام البصرية المتدفقة. ومع ذلك ، على الرغم من قدراته وأدائه العالي في مهام التنقيب ، فإن هيكل SAM المعقد والثقيل يتطلب قدرة حسابية كبيرة ، مما يمنع تنفيذه على أجهزة ذات موارد حسابية محدودة.

لمواجهة التحديات الحسابية ل SAM ، قام الباحثون بتطوير Tiny Segment Anything Model (TinySAM) ، الذي يحافظ على أداء Zero-Shot للإطار الأصلي بينما يكون أخف. يستخدم TinySAM طريقة التبخير المعرفي الكامل مع توجيهات صعبة عبر الإنترنت لإنشاء نموذج طالب أكثر كفاءة. التكميم بعد التدريب المعدل لمهام التنقيب القابل للتحفيز يقلل بشكل أكبر من المتطلبات الحسابية. بالإضافة إلى ذلك ، يهدف تصميم TinySAM إلى التنقيب الهرمي ، مما يزيد من سرعة الاستدلال تقريبًا دون التأثير على الأداء.

تتعمق هذه المقالة في إطار TinySAM ، مستكشفة المبادئ الأساسية له ، وهيكله ، وأدائه بالمقارنة مع إطارات التنقيب الأخرى المتقدمة. دعونا نستكشف هذه الجوانب بالتفصيل.

TinySAM : Efficient Segment Anything Model

نموذج Segment Anything ساهم في التقدم السريع لتطبيقات رؤية الكمبيوتر الكثيرة بفضل قدراته الرائعة في التنقيب ومجموعة بيانات التنقيب الضخمة التي تحتوي على أكثر من 11 مليون صورة وأكثر من مليار قناع صورة. نظرًا لأدائه الاستثنائي في مهام تنقيب الكائنات بأي فئة أو شكل ، فإنه يخدم كأساس للإطارات التي تقوم بالمهام البصرية المتدفقة مثل تنقيب الصور ، وتحديد الكائنات ، ورؤية ثلاثية الأبعاد ، وغيرها. بالإضافة إلى ذلك ، يقدم نموذج Segment Anything أداءً رائعًا في التنقيب بدون توجيه ، مما ساعد الصناعات الحساسة التي تعمل مع كمية محدودة من البيانات ، بما في ذلك أبحاث الطب والتصوير الطبي.

على الرغم من أننا لا نستطيع التشكيك في قدرات التنقيب الرائعة التي يقدمها نموذج Segment Anything في مجموعة متنوعة من المهام البصرية المتدفقة ، إلا أنه يوجد جانب سلبي فيما يتعلق بالهيكل المعماري المعقد والمتطلبات الحسابية العالية والتكاليف التشغيلية الكبيرة. بالنسبة لنظام يعمل على جهاز GPU حديث ، يمكن أن يكون وقت الاستدلال لنموذج SAM حتى 2 ثانية لصورة بحجم 1024×1024. ونتيجة لذلك ، من الصعب للغاية تنفيذ تطبيقات SAM على أجهزة ذات موارد حسابية محدودة. لتجاوز هذا العائق ، حاولت الأعمال الحديثة مثل MobileSAM و FastSAM تطوير نموذج SAM أكثر كفاءة حسابيًا. يحاول إطار MobileSAM استبدال المكون الثقيل في ترميز الصورة بترميز TinyViT ، في حين ينقل نموذج FastSAM مهمة التنقيب إلى مهمة تنقيب الحالات مع فئة واحدة فقط باستخدام نموذج YoloV8. على الرغم من أن هذه الطرق نجحت في تحقيق بعض النجاح فيما يتعلق bằngخفض المتطلبات الحسابية ، إلا أنها لم تتمكن من الحفاظ على الأداء ، خاصة في مهام التنقيب بدون توجيه.

TinySAM أو Tiny Segment Anything Model هو محاولة لخفض المتطلبات الحسابية لنموذج SAM الحالي دون المساس بالأداء في مهام التنقيب بدون توجيه. بالإضافة إلى ذلك ، ي提议 إطار TinySAM تنفيذ طريقة التبخير المعرفي الكامل في هيكله بهدف تحسين قدرة شبكة الطالب المدمجة. يتبخر إطار TinySAM شبكة الطالب بطريقة شاملة تحت إشراف شبكة المعلم من مراحل مختلفة. لتعزيز الأداء بشكل أكبر ، يسمح الإطار بعملية التبخير بالاهتمام أكثر بالنماذج الصعبة من خلال تنفيذ استراتيجية عينة التوجيه الصعب عبر الإنترنت. بالإضافة إلى ذلك ، لخفض التكاليف الحسابية ، يتعرض إطار TinySAM لمهام التنقيب القابل للتحفيز إلى تكميم بعد التدريب.

TinySAM : Architecture and Methodology

قبل أن نتحدث عن هيكل و منهجية إطار TinySAM ، من المهم أولاً النظر إلى سابقه ، إطار SAM. منذ تقديمه ، أظهر نموذج Segment Anything أداءً رائعًا وتنوعًا وعمومية عبر مجموعة من المهام البصرية المتدفقة وتنقيب الكائنات.

في جوهره ، يتكون نموذج SAM من ثلاث شبكات فرعية: ترميز التوجيه ، وترميز الصورة ، وترميز القناع. الهدف الرئيسي لترميز التوجيه هو ترميز القناع الشكلي التعسفي والنقاط والصندوق والنص الحر مع المعلومات الموضعية. ترميز الصورة هو شبكة ثقيلة مبنية على Transformer الرؤية أو Transformer البصري الذي يعالج الصورة الإدخال إلى التضمينات. يستخدم النموذج شبكات مختلفة لمعالجة التوجيهات الهندسية والنصية. أخيرًا ، يحتوي ترميز القناع على معول تحويل ثنائي الاتجاه يتلقى مخرجات ترميز التوجيه وترميز الصورة لإنشاء تنبؤ القناع النهائي. مع مجموعة البيانات ، يظهر إطار SAM قدرات تنقيب عالية الجودة لالكائنات بغض النظر عن شكلها وفئتها. بالإضافة إلى ذلك ، يظهر نموذج Segment Anything أداءً رائعًا في مهام التنقيب بدون توجيه ، بما في ذلك اقتراح الكائن ، وكشف الحواف ، وتوقعات القناع النصية ، وتنقيب الحالات.

Knowledge Distillation

التبخير المعرفي هو نهج هام لتعزيز أداء الشبكات المدمجة خلال مرحلة التدريب. يستخدم التبخير المعرفي مخرجات شبكة المعلم لإشراف تدريب شبكة الطالب الخفيفة. يمكن تقسيم التبخير المعرفي إلى فئتين فرعيتين: التبخير للميزات المتوسطة ، والتبخير لمخرجات الشبكة ، مع التركيز الأكبر للبحوث حول التبخير المعرفي على مهام التصنيف الصوري.

Full-Stage Knowledge Distillation

كما ذكرنا سابقًا ، يتكون نموذج Segment Anything من ثلاث شبكات فرعية في جوهره: ترميز التوجيه ، وترميز الصورة ، وترميز القناع ، مع مكون ترميز الصورة مبني على Transformer الرؤية ، والذي يمتلك متطلبات حسابية عالية. لمواجهة هذه القضية ، ينفذ إطار TinySAM طريقة التبخير المعرفي الكامل التي توجيه شبكة الصورة الخفيفة من مستوى التعلم إلى مستويات المعرفة المتعددة.

Quantization

التكميم هو نهج شائع في إطارات رؤية الكمبيوتر ، ويستخدم لضغط النموذج عن طريق كمية الأوزان أو التنشيط من النطاق الأعلى إلى النطاق الأدنى في محاولة لخفض التعقيد الحسابي والمتطلبات التخزينية دون التأثير الكبير على جودة الإخراج.

Hierarchical Segment Anything

يقترح نموذج Segment Anything استخدام مولد قناع تلقائي الذي يأخذ النقاط كشبكة لتنقيب كل شيء في الصورة. ومع ذلك ، فقد أشار إلى أن استخدام شبكة نقط كثيفة يؤدي إلى مخرجات تنقيب دقيقة للغاية ويحتاج إلى متطلبات حسابية كبيرة وتكلفات تشغيلية عالية. بالإضافة إلى ذلك ، قد يؤدي استخدام نقاط عديدة لتنقيب كائن كامل إلى تقسيم أقسام مختلفة من الكائن بشكل خاطئ إلى قناع منفصل ، في حين أن التكلفة الزمنية لنمط التنقيب الكل يعود في الأساس إلى أن ترميز الصورة قد تم تقليله بشكل كبير.

TinySAM : Experiments and Results

لتحفيز عملية التبخير ، يحسب إطار TinySAM وتخزين التضمينات الصورية من شبكة المعلم مسبقًا ، ونتيجة لذلك ، لم يعد من الضروري للنموذج حساب ترميز الصورة الثقيل لشبكة المعلم بشكل متكرر خلال مرحلة التدريب.对于 التكميم بعد التدريب ، يكمم إطار TinySAM جميع طبقات الضرب Матрикс ، وطبقات التجميع ، وطبقات التجميع العكسي ، وطبقات الخطية ، مع استخدام النموذج معاملات مقياس القناة لمعالجات التجميع والتجميع العكسي ، ومعاملات مقياس الرأس لمعالجات الضرب Матрикс ، ومعاملات مقياس الخطي لمعالجات الخطية.

Final Thoughts

في هذه المقالة ، تحدثنا عن TinySAM ، وهو إطار مقترح يضغط الحدود لتنقيب أي مهمة ، ويتحصل على هيكل نموذج كفء مع متطلبات حسابية أقل وأداء متساوي مع إطار SAM الأصلي. إطار TinySAM أو Tiny Segment Anything Model يحافظ على أداء Zero-Shot للهيكل الأصلي. ينفذ إطار TinySAM أولاً طريقة التبخير المعرفي الكامل التي تستخدم توجيهات صعبة لتبخير نموذج طالب خفيف. ثم يعدل إطار TinySAM التكميم بعد التدريب لمهام التنقيب القابل للتحفيز ، مما يساعد في خفض المتطلبات الحسابية. بالإضافة إلى ذلك ، يهدف الإطار إلى تنقيب هرمي ، مما يزيد من سرعة الاستدلال تقريبًا دون التأثير على الأداء.

مهندس بالمهنة، كاتب بالقلب. كونال هو كاتب تقني مع حب عميق وفهم لتقنيات الذكاء الاصطناعي والتعلم الآلي، مخصص لتبسيط المفاهيم المعقدة في هذه المجالات من خلال توثيقه الممتع والمعلوماتي.