الرعاية الصحية
تقدير وضع الجسم البشري باستخدام الذكاء الاصطناعي في تطبيقات اللياقة البدنية

بواسطة Maksym Tatariants، مهندس علوم البيانات في MobiDev。
يعود تقدير وضع الجسم البشري إلى تقنية – جديدة نسبيًا، ولكنها تتطور بسرعة – تلعب دورًا مهمًا في تطبيقات اللياقة البدنية والرقص، مما يسمح لنا بوضع المحتوى الرقمي على العالم الحقيقي.
في اختصار، مفهوم تقدير وضع الجسم البشري هو تقنية قائمة على رؤية الكمبيوتر قادرة على الكشف عن وضع الجسم البشري ومعالجته. وأهم جزء مركزي في هذه التقنية هو نمذجة الجسم البشري. هناك ثلاثة نماذج للجسم البشري بارزة في أنظمة تقدير وضع الجسم البشري الحالية – نموذج قائم على الهيكل العظمي، نموذج قائم على الحواف، ونموذج قائم على الحجم.
نموذج قائم على الهيكل العظمي
يتكون هذا النموذج من مجموعة من المفاصل (نقاط رئيسية)، مثل الركبتين، الكاحلين، المعصمين، المرفقين، والكتفين، وتوجيه الأطراف. هذا النموذج ملحوظ لمرونته، وبالتالي مناسب لكل من تقدير وضع الجسم البشري ثلاثي الأبعاد وثنائي الأبعاد. مع نمذجة ثلاثية الأبعاد، يستخدم الحل صورة RGB ويجد إحداثيات X وY وZ للمفاصل. مع نمذجة ثنائية الأبعاد، نفس التحليل لصورة RGB، ولكن باستخدام إحداثيات X وY.
نموذج قائم على الحواف
يستخدم هذا النموذج حواف الجذع والأطراف، بالإضافة إلى عرضها التقريبي. هنا، يستخدم الحل صورة الإطار الجسمي ويعرض أجزاء الجسم كأشكال مستطيلة وحدود داخل ذلك الإطار.
نموذج قائم على الحجم
يستخدم هذا النموذج بشكل عام سلسلة من المسح ثلاثي الأبعاد لالتقاط شكل الجسم ويتحول إلى إطار من الأشكال والشبكات الهندسية. هذه الأشكال تخلق سلسلة ثلاثية الأبعاد من أوضاع الجسم ومثيلات الجسم.
كيف يعمل تقدير وضع الجسم البشري ثلاثي الأبعاد
تعتمد تطبيقات اللياقة البدنية على تقدير وضع الجسم البشري ثلاثي الأبعاد. لهذه التطبيقات، كلما كان هناك المزيد من المعلومات حول وضع الجسم البشري، كان ذلك أفضل. باستخدام هذه التقنية، سيسجل مستخدم التطبيق نفسه أثناء ممارسة التمارين أو روتين اللياقة البدنية. ثم يتحليل التطبيق حركات الجسم للمستخدم، ويعرض تصحيحات للأخطاء أو عدم الدقة.
تتبع خريطة تدفق هذا النوع من التطبيقات عادةً هذا النمط:
- أولاً، جمع البيانات حول حركات المستخدم أثناء أداء التمرين.
- ثم، تحديد مدى صحة أو خطأ حركات المستخدم.
- أخيرًا، عرض الأخطاء التي قد يرتكبها المستخدم من خلال الواجهة.
في الوقت الحالي، المعيار في تقنية وضع الجسم البشري هو طوبولوجيا COCO. تتكون طوبولوجيا COCO من 17 معلمًا عبر الجسم، من الوجه إلى الذراعين إلى الساقين. 注意 أن COCO ليس الإطار الوحيد لتحديد وضع الجسم البشري، بل هو الأكثر استخدامًا.
تستخدم هذه العملية عادةً تقنية التعلم العميق لاستخراج المفاصل في تقدير وضع الجسم البشري. ثم تستخدم خوارزميات قائمة على الهندسة لمعالجة ما وجدته (تحليل المواقع النسبية للمفاصل المكتشفة). عند استخدام فيديو ديناميكي كبيانات مصدر، يمكن للنظام استخدام سلسلة من الإطارات، وليس صورة واحدة فقط، لالتقاط معلومات وضع الجسم البشري. النتيجة هي تمثيل أكثر دقة لحركات المستخدم الحقيقية لأن النظام يمكنه استخدام المعلومات من الإطارات المجاورة لحل أي شكوك حول موقع الجسم البشري في الإطار الحالي.
من بين التقنيات الحالية لاستخدام تقدير وضع الجسم البشري ثلاثي الأبعاد في تطبيقات اللياقة البدنية، فإن النهج الأكثر دقة هو تطبيق نموذج لاكتشاف نقاط رئيسية ثنائية الأبعاد، ثم معالجة الكشف ثنائي الأبعاد بنموذج آخر لتحويلها إلى تنبؤات نقاط رئيسية ثلاثية الأبعاد.
في البحث الذي نشرناه مؤخرًا، تم استخدام مصدر فيديو واحد، مع تطبيقات الت膨張 الزمني الممددة على الشبكات العصبية التلافيفية لأداء تحويل نقطة رئيسية من ثنائي الأبعاد إلى ثلاثي الأبعاد.
بعد تحليل النماذج الحالية، وجدنا أن VideoPose3D هو الحل الأمثل لمعظم تطبيقات اللياقة البدنية التي تعتمد على الذكاء الاصطناعي. يجب أن يسمح الإدخال باستخدام هذا النظام بتحديد مجموعة من نقاط رئيسية ثنائية الأبعاد، حيث يتم تطبيق نموذج تم تدريبه مسبقًا على مجموعة بيانات COCO 2017 ككاشف ثنائي الأبعاد.
للتوقعات الأكثر دقة لموقع المفاصل الحالية أو نقاط رئيسية، يمكن لVideoPose3D استخدام إطارات متعددة خلال تسلسل زمني قصير لتوليد معلومات وضع الجسم البشري ثنائي الأبعاد.
لزيادة دقة تقدير وضع الجسم البشري ثلاثي الأبعاد، يمكن لعدة كاميرات جمع وجهات نظر بديلة للمستخدم أثناء أداء التمرين أو الروتين نفسه. ومع ذلك، يتطلب ذلك قوة معالجة أكبر وأrchitecture نموذجية متخصصة لمعالجة مدخلات تيار الفيديو المتعددة.
أعلنت Google (GOOGL ) مؤخرًا عن نظام BlazePose، وهو نموذج موجه للأجهزة المحمولة لتقدير وضع الجسم البشري من خلال زيادة عدد نقاط رئيسية المُحلل إلى 33، وهو مجموعة فرعية من مجموعة نقاط COCO ومجموعتي طوبولوجيا BlazePalm وBlazeFace. ونتيجة لذلك، يمكن لنموذج BlazePose إنتاج نتائج تنبؤ وضع الجسم البشري متسقة مع نماذج اليد والوجه من خلال توضيح معاني الجسم.
كل مكون في نظام تقدير وضع الجسم البشري القائم على التعلم الآلي يجب أن يكون سريعًا، يستغرق أقصى حد من بضعة مللي ثوانٍ لكل إطار لاكتشاف وضع الجسم البشري وتعقبه.
بسبب أن трубة BlazePose (التي تشمل مكونات تقدير وضع الجسم البشري وتعقبه) يجب أن تعمل على مجموعة متنوعة من الأجهزة المحمولة في الوقت الفعلي، كل جزء من трубة BlazePose مصمم ليكون فعالًا من حيث الحوسبة ويعمل بسرعة 200-1000 إطار في الثانية.
يتم عادةً تقدير وضع الجسم البشري وتعقبه في الفيديو الذي لا يعرف فيه ما إذا كان الشخص موجودًا أو لا، في مرحلتين.
في المرحلة الأولى، يتم تشغيل نموذج كشف الكائنات لتحديد وجود شخص أو تحديد غيابه. بعد اكتشاف الشخص، يمكن لنموذج تقدير وضع الجسم البشري معالجة المنطقة المحلية التي تحتوي على الشخص وتنبؤ بموقع نقاط رئيسية.
然而، هناك عيب في هذا الإعداد، وهو أن كلا نموذجي كشف الكائنات وتقدير وضع الجسم البشري يجب أن يعملان لكل إطار، مما يستهلك موارد حسابية إضافية. ومع ذلك، وجد مؤلفو BlazePose طريقة ذكية لتحايل على هذه المشكلة والاستفادة منها في مكونات أخرى لاكتشاف نقاط رئيسية مثل FaceMesh و MediaPipe Hand.
الفكرة هي أن نموذج كشف الكائنات (كاشف الوجه في حالة BlazePose) يمكن استخدامه فقط لبدء تعقب وضع الجسم البشري في الإطار الأول، بينما يمكن إجراء تعقب الشخص التالي باستخدام تنبؤات وضع الجسم البشري حصريًا بعد بعض محاذاة وضع الجسم البشري، حيث يتم التنبؤ بمعلماتها باستخدام نموذج تقدير وضع الجسم البشري.
الوجه ينتج أقوى إشارة لموقع الجذع للشبكة العصبية، نتيجة للانحراف الصغير في المظهر والتباين العالي في ميزاته. ونتيجة لذلك، يمكن إنشاء نظام سريع وذو حمل منخفض لاكتشاف وضع الجسم البشري من خلال سلسلة من الفرضيات المبررة المبنية على فكرة أن رأس الإنسان سيكون موجودًا في كل حالة استخدام شخصي.
التغلب على تحديات تقدير وضع الجسم البشري
استخدام تقدير وضع الجسم البشري في تطبيقات اللياقة البدنية يواجه تحديًا في حجم وتنوع أوضاع الجسم البشري، على سبيل المثال، المئات من الأساناس في معظم برامج اليوغا.
علاوة على ذلك، قد يُخفي الجسم أحيانًا بعض الأطراف كما يتم التقاطها بواسطة أي كاميرا معينة، ويمكن للمستخدمين ارتداء ملابس متنوعة تُخفي ميزات الجسم والمظهر الشخصي.
عند استخدام أي نماذج مدربة مسبقًا، يجب ملاحظة أن الحركات غير العادية أو زوايا الكاميرا الغير عادية يمكن أن تؤدي إلى أخطاء في تقدير وضع الجسم البشري. يمكن التغلب على هذه المشكلة إلى حد ما باستخدام بيانات اصطناعية من نموذج جسم بشري ثلاثي الأبعاد، أو من خلال ضبط دقيق البيانات الخاصة بالمجال المعني.
الخبر السار هو أننا يمكن أن نتجنب أو نتغلب على معظم الضعف. المفتاح لذلك هو اختيار البيانات وتصميم النموذج المناسبين. وعلاوة على ذلك، فإن اتجاه التطور في مجال تقدير وضع الجسم البشري يشير إلى أن بعض المشاكل التي نواجهها الآن ستصبح أقل أهمية في السنوات القادمة.
الكلمة النهائية
يحمل تقدير وضع الجسم البشري مجموعة متنوعة من الاستخدامات المحتملة في المستقبل خارج مجال تطبيقات اللياقة البدنية وتتبع حركات الجسم البشري، من الألعاب إلى الرسوم المتحركة إلى الواقع المعزز إلى الروبوتات. ذلك لا ي代表 قائمة كاملة للامكانيات، ولكنه يبرز بعض المجالات الأكثر احتمالاً التي سيساهم فيها تقدير وضع الجسم البشري في المناظر الرقمية.
















