أساسيات الذكاء الاصطناعي
ما هي الرؤية الحاسوبية؟
ما هي الرؤية الحاسوبية؟
خوارزميات الرؤية الحاسوبية هي واحدة من أكثر الأنظمة الذكية والقوية في العالم، في الوقت الحالي. نظم الرؤية الحاسوبية تستخدم في المركبات ذاتية القيادة، وتوجيه الروبوتات، وأنظمة التعرف على الوجوه، وغيرها. ومع ذلك، ما هي خوارزميات الرؤية الحاسوبية بالضبط؟ كيف تعمل؟ من أجل الإجابة على هذه الأسئلة، سنغوص في النظرية وراء الرؤية الحاسوبية، وخوارزميات الرؤية الحاسوبية، وتطبيقات أنظمة الرؤية الحاسوبية.
كيف تعمل أنظمة الرؤية الحاسوبية؟
من أجل تقدير كيفية عمل أنظمة الرؤية الحاسوبية، دعونا نتحدث أولاً عن كيفية تمييز الأشياء عند البشر. أفضل تفسير للعلم العصبي لتمييز الأشياء هو نموذج يصف المرحلة الأولى من تمييز الأشياء على أنها مرحلة حيث يتم تفسير المكونات الأساسية للكائنات، مثل الشكل واللون والعمق، بواسطة الدماغ أولاً. يتم تحليل الإشارات من العين التي تدخل الدماغ لاستخراج حواف الكائن أولاً، ثم يتم ربط هذه الحواف معًا في تمثيل أكثر تعقيدًا يكمل شكل الكائن.
تعمل أنظمة الرؤية الحاسوبية بشكل مشابه جدًا للنظام البصري البشري، من خلال التمييز أولاً بين حواف الكائن ثم ربط هذه الحواف معًا في شكل الكائن. الفرق الرئيسي هو أن الأجهزة تفسر الصور على أنها أرقام، لذلك نظام الرؤية الحاسوبية يحتاج إلى طريقة لتحليل كل بكسل فردي في الصورة. سيعين نظام الرؤية الحاسوبية قيمًا للبكسل في الصورة، وبالتحليل الفرق في القيم بين منطقة بكسل وآخر، يمكن للكمبيوتر التمييز بين الحواف. على سبيل المثال، إذا كانت الصورة بالأسود والأبيض، فإن القيم ستتراوح من الأسود (تمثله ب 0) إلى الأبيض (تمثله ب 255). التغيير المفاجئ في نطاق القيم البكسل بالقرب من بعضها البعض يشير إلى حافة.
يمكن تطبيق هذا المبدأ الأساسي لمقارنة قيم البكسل أيضًا على الصور الملونة، حيث يقارن الكمبيوتر الفرق بين القنوات الملونة المختلفة. الآن بعد أن نعرف كيف يفحص نظام الرؤية الحاسوبية قيم البكسل لفهم الصورة، دعونا نلقي نظرة على هيكل نظام الرؤية الحاسوبية.
شبكات العصبية التجميعية (CNNs)
النوع الرئيسي من الذكاء الاصطناعي المستخدم في مهام الرؤية الحاسوبية هو الذي يعتمد على شبكات العصبية التجميعية. ما هي التجميعات بالضبط؟
التجميعات هي عمليات رياضية تستخدمها الشبكة لتحديد الفرق في القيم بين البكسل. إذا كنت تتخيل شبكة من قيم البكسل، فتصور شبكة صغيرة يتم تحريكها على هذه الشبكة الرئيسية. القيم تحت الشبكة الصغيرة يتم تحليلها بواسطة الشبكة، لذلك الشبكة تفحص فقط عددًا قليلاً من البكسل في الوقت نفسه. هذا ما يسمى أحيانًا بتقنية “النوافذ المنزلقة”. القيم التي يتم تحليلها بواسطة النافذة المنزلقة يتم تلخيصها بواسطة الشبكة، مما يساعد على تقليل تعقيد الصورة وجعلها أسهل للشبكة استخراج الأنماط.
تتم تقسيم شبكات العصبية التجميعية إلى قسمين مختلفين، قسم التجميع وقسم الاتصال الكامل. طبقات التجميع في الشبكة هي مستخلصات الميزات، التي تعمل على تحليل البكسل داخل الصورة وتشكيل تمثيلات لها يمكن للطبقات الكاملة في الشبكة العصبية التعلم من الأنماط. تبدأ طبقات التجميع بفحص البكسل فقط واستخراج الميزات البسيطة من الصورة مثل الحواف. فيما بعد، يتم ربط الحواف معًا في أشكال أكثر تعقيدًا بواسطة طبقات التجميع اللاحقة. في النهاية، يجب أن يكون للشبكة تمثيلًا للحواف والتفاصيل في الصورة يمكنها تمريره إلى الطبقات الكاملة.
تعليق الصور
في حين يمكن لشبكة عصبية تجميعية استخراج الأنماط من الصور بمفردها، يمكن تحسين دقة نظام الرؤية الحاسوبية بشكل كبير من خلال تعليق الصور. تعليق الصور هو عملية إضافة بيانات وصفية إلى الصورة تساعد المصنف في الكشف عن الكائنات المهمة في الصورة. استخدام تعليق الصور مهم في كل مرة تحتاج فيها أنظمة الرؤية الحاسوبية إلى دقة عالية، مثل التحكم في مركبة ذاتية القيادة أو روبوت.
توجد طرق مختلفة لتعليق الصور لتحسين أداء مصنف الرؤية الحاسوبية. غالبًا ما يتم تعليق الصور باستخدام صناديق حدودية، وهي صندوق يحيط بحواف الكائن المستهدف ويخبر الكمبيوتر بالتركيز داخل الصندوق. التجزئة الدلالية هي نوع آخر من تعليق الصور، الذي يعمل عن طريق تعيين فئة صورة إلى كل بكسل في الصورة. بمعنى آخر، كل بكسل يمكن اعتباره “عشب” أو “أشجار” سيكون مصنفًا على أنه ينتمي إلى هذه الفئات. تقنية توفر دقة على مستوى البكسل، ولكن إنشاء تعليقات تجزئة دلالية أكثر تعقيدًا وأكثر استهلاكًا للوقت من إنشاء صناديق حدودية بسيطة. توجد طرق تعليق أخرى، مثل الخطوط والنقاط.












