نماذج ومنصات الذكاء الاصطناعي

تحويلات الرؤية تتفوق على التحديات بأساليب جديدة “انتباه من شريحة إلى شريحة”

mm
أضف Unite.AI إلى مصادرك المفضلة على Google

تكنولوجيا الذكاء الاصطناعي، ولا سيما تحويلات الرؤية (ViTs)، أظهرت وعدا كبيرا في khảية التعرف على الأشياء وتصنيفها في الصور. ومع ذلك، فإن التطبيق العملي لها كان محدودا ب两个 تحديات كبيرتين: متطلبات القدرة الحاسوبية العالية وعدم وضوحية اتخاذ القرارات. الآن، طوّر فريق من الباحثين حلًا ثوريًا: منهجية جديدة تعرف باسم “انتباه من شريحة إلى شريحة” (PaCa). تهدف PaCa إلى تعزيز قدرات ViTs في تحديد الأشياء وتصنيفها وتجزئتها في الصور، مع حل المشاكل الطويلة الأمد المتعلقة بالمتطلبات الحاسوبية ووضوحية اتخاذ القرارات.

مواجهة تحديات ViTs: نظرة على الحل الجديد

التحويلات، بفضل قدراتها العالية، هي من بين أكثر النماذج تأثيرا في عالم الذكاء الاصطناعي. تم تمديد قوة هذه النماذج إلى البيانات البصرية من خلال ViTs، وهي فئة من التحويلات التي يتم تدريبها على مدخلات بصرية. على الرغم من الإمكانيات الكبيرة التي تقدمها ViTs في تفسير وفهم الصور، إلا أنها كانت محصورة ب两个 مشاكل رئيسية.

أولاً، بسبب طبيعة الصور التي تحتوي على كميات هائلة من البيانات، تتطلب ViTs قدرة حاسوبية ومساحة تخزين كبيرة. يمكن أن يكون هذا التعقيد مخيفا للعديد من الأنظمة، خاصة عند التعامل مع صور عالية الدقة. ثانياً، عملية اتخاذ القرارات في ViTs غالبا ما تكون معقدة وغامضة. يجد المستخدمون صعوبة في فهم كيفية تمييز ViTs بين الأشياء أو الميزات المختلفة في الصورة، وهو ما يعتبر حاسما للعديد من التطبيقات.

然而، تقدم منهجية PaCa الجديدة حلا لهذين التحديين. “نحن نواجه التحدي المتعلق بالمتطلبات الحاسوبية والتخزينية باستخدام تقنيات التجميع، مما يسمح لعمارة التحويل بالتعرف بشكل أفضل على الأشياء في الصورة وتحديدها”، يشرح تيانفو وو، المؤلف المنسق للورقة البحثية والمحاضر المساعد في قسم الهندسة الكهربائية والحاسوب في جامعة ولاية كارولينا الشمالية.

استخدام تقنيات التجميع في PaCa يقلل بشكل كبير من المتطلبات الحاسوبية، مما يحول المشكلة من عملية квадратية إلى عملية خطية يمكن إدارتها. يوضح وو العملية قائلا: “من خلال التجميع، نحول هذه العملية إلى عملية خطية، حيث يحتاج كل وحدة صغيرة فقط إلى مقارنة مع عدد محدد مسبقا من التجميعات”.

كما يخدم التجميع في PaCa في توضيح عملية اتخاذ القرارات في ViTs. عملية تشكيل التجميعات تكشف عن كيفية اتخاذ ViT القرارات حول الأشياء والميزات المهمة في تجميع بيانات الصورة معا. حيث إن الأي تي يخلق عددا محدودا من التجميعات، يمكن للمستخدمين فهم واختبار عملية اتخاذ القرارات بسهولة، مما ي cải thiện قابلية تفسير النموذج بشكل كبير.

منهجية PaCa تتفوق على تحويلات الرؤية الأخرى المتقدمة

من خلال الاختبارات الشاملة، وجد الباحثون أن منهجية PaCa تتفوق على تحويلات الرؤية الأخرى في عدة جوانب. يشرح وو: “وجدنا أن PaCa تتفوق على SWin و PVT في كل شيء”. كشفت عملية الاختبار أن PaCa تتفوق في تصنيف الأشياء وتحديدها وتجزئتها في الصور، وتحديد الحدود الفعالة للأشياء في الصور. بالإضافة إلى ذلك، وجد أنها أكثر كفاءة في الوقت، حيث تقوم بمهامها بسرعة أكبر من تحويلات الرؤية الأخرى.

تشجع النجاح الذي حققته PaCa فريق البحث على مواصلة تطويرها من خلال تدريبها على مجموعات بيانات أساسية أكبر. من خلال القيام بذلك، يأملون في دفع حدود ما هو ممكن حاليا مع الذكاء الاصطناعي القائم على الصور.

سوف يتم تقديم ورقة البحث “PaCa-ViT: تعلم انتباه من شريحة إلى شريحة في تحويلات الرؤية” في المؤتمر القادم حول رؤية الحاسوب والتعرف على الأنماط. وهي خطوة هامة يمكن أن تفتح الطريق لمزيد من أنظمة الذكاء الاصطناعي الفعالة والشفافة والميسورة.

Alex McFarland هو صحفي وكاتب في مجال الذكاء الاصطناعي يستكشف أحدث التطورات في الذكاء الاصطناعي. وقد تعاون مع العديد من الشركات الناشئة في مجال الذكاء الاصطناعي والمنشورات في جميع أنحاء العالم.