स्वास्थ्य

एआई पोज़ एस्टीमेशन इन फिटनेस एप्लिकेशन

mm
Unite.AI को Google पर अपने पसंदीदा स्रोतों में जोड़ें

मैक्सिम तातारियंट्स, डेटा साइंस इंजीनियर tại मोबीडेव द्वारा लिखित।

मानव पोज़ एस्टीमेशन एक प्रौद्योगिकी है जो तेजी से विकसित हो रही है और फिटनेस और नृत्य अनुप्रयोगों में महत्वपूर्ण भूमिका निभा रही है, जिससे हम वास्तविक दुनिया पर डिजिटल सामग्री रख सकते हैं।

संक्षेप में, मानव पोज़ एस्टीमेशन की अवधारणा एक कंप्यूटर दृष्टि-आधारित प्रौद्योगिकी है जो मानव मुद्रा का पता लगाने और प्रसंस्करण करने में सक्षम है। इस प्रौद्योगिकी का सबसे महत्वपूर्ण और केंद्रीय भाग मानव शरीर मॉडलिंग है। मानव पोज़ एस्टीमेशन प्रणालियों के भीतर तीन शरीर मॉडल सबसे प्रमुख हैं – स्केलेटन-आधारित, कंटूर-आधारित और वॉल्यूम-आधारित।

स्केलेटन-आधारित मॉडल

यह मॉडल जोड़ों (कीपॉइंट्स) के एक सेट से बना है, जैसे कि घुटने, टखने, कलाई, कोहनी, कंधे और शरीर की बाहों की दिशा। यह मॉडल अपनी लचीलेपन के लिए उल्लेखनीय है और इस प्रकार यह तीन-आयामी और दो-आयामी मानव मुद्रा अनुमान दोनों के लिए उपयुक्त है। तीन-आयामी मॉडलिंग के साथ, समाधान एक आरजीबी छवि का उपयोग करता है और जोड़ों के एक्स, वाई और जेड समन्वय का पता लगाता है। दो-आयामी मॉडलिंग के साथ, यह समान विश्लेषण है एक आरजीबी छवि का, लेकिन एक्स और वाई समन्वय का उपयोग करके।

कंटूर-आधारित मॉडल

यह मॉडल शरीर के टोर्सो और बाहों के कंटूर का उपयोग करता है, साथ ही उनकी खुरदरी चौड़ाई। यहाँ, समाधान शरीर के फ्रेम के सिल्हूट को लेता है और शरीर के अंगों को उस फ्रेमवर्क के भीतर आयताकार और सीमाओं के रूप में प्रस्तुत करता है।

वॉल्यूम-आधारित मॉडल

यह मॉडल आमतौर पर शरीर के आकार को पकड़ने के लिए तीन-आयामी स्कैन की एक श्रृंखला का उपयोग करता है और इसे आकारों और ज्यामितीय जालों के फ्रेमवर्क में परिवर्तित करता है। ये आकार एक 3डी श्रृंखला बनाते हैं और शरीर के प्रतिनिधित्व के लिए मुद्राएं।

3D मानव मुद्रा अनुमान कैसे काम करता है

फिटनेस अनुप्रयोगों में 3-आयामी मानव मुद्रा अनुमान पर निर्भर करता है। इन ऐप्स के लिए, मानव मुद्रा के बारे में जितनी अधिक जानकारी होगी, उतना बेहतर होगा। इस तकनीक के साथ, ऐप का उपयोगकर्ता खुद को व्यायाम या वर्कआउट दिनचर्या में भाग लेते हुए रिकॉर्ड करेगा। ऐप तब उपयोगकर्ता की शरीर की गतिविधियों का विश्लेषण करेगा, गलतियों या असंगतताओं के लिए सुधार प्रदान करेगा।

इस प्रकार के ऐप का फ्लोचार्ट आमतौर पर इस पैटर्न का पालन करता है:

  • सबसे पहले, उपयोगकर्ता द्वारा व्यायाम करते समय उनकी गतिविधियों के बारे में डेटा एकत्र करें।
  • उसके बाद, यह निर्धारित करें कि उपयोगकर्ता की गतिविधियाँ कितनी सटीक या असटीक थीं।
  • अंत में, उपयोगकर्ता को इंटरफ़ेस के माध्यम से दिखाएं कि उन्होंने कौन सी गलतियाँ की हो सकती हैं।

वर्तमान में, मानव मुद्रा प्रौद्योगिकी में मानक सीओसीओ टोपोलॉजी है। सीओसीओ टोपोलॉजी शरीर के चेहरे से लेकर हाथों और पैरों तक 17 लैंडमार्क से बना है। ध्यान दें कि सीओसीओ एकमात्र मानव शरीर मुद्रा फ्रेमवर्क नहीं है, बल्कि सबसे अधिक उपयोग किया जाने वाला फ्रेमवर्क है।

इस प्रकार की प्रक्रिया आमतौर पर जोड़ों के निष्कर्षण के लिए गहरे मशीन लर्निंग प्रौद्योगिकी का उपयोग करती है और फिर ज्यामिति-आधारित एल्गोरिदम का उपयोग करके इसका अर्थ लगाती है (पाए गए जोड़ों की सापेक्ष स्थिति का विश्लेषण करती है)। गतिशील वीडियो को स्रोत डेटा के रूप में उपयोग करते हुए, प्रणाली एकल छवि के बजाय कई फ्रेम का उपयोग कर सकती है अपने कीपॉइंट्स को पकड़ने के लिए। परिणाम उपयोगकर्ता की वास्तविक गतिविधियों का एक बहुत अधिक सटीक प्रस्तुतीकरण है क्योंकि प्रणाली आसपास के फ्रेम से जानकारी का उपयोग करके वर्तमान फ्रेम में मानव शरीर की स्थिति के बारे में किसी भी अनिश्चितता को हल कर सकती है।

वर्तमान में फिटनेस अनुप्रयोगों में 3D पोज़ अनुमान के लिए उपयोग की जाने वाली तकनीकों में से, 2D कीपॉइंट्स का पता लगाने के लिए एक मॉडल लागू करना और फिर उन 2D पता लगाने को 3D कीपॉइंट पूर्वानुमान में परिवर्तित करने के लिए एक और मॉडल का उपयोग करना सबसे सटीक दृष्टिकोण है।

हमारे द्वारा हाल ही में पोस्ट किए गए शोध में, एकल वीडियो स्रोत का उपयोग किया गया था, जिसमें 2D -> 3D कीपॉइंट रूपांतरण करने के लिए डिलेटेड टेम्पोरल कॉन्वोल्यूशनल न्यूरल नेटवर्क लागू किए गए थे।

मॉडल का विश्लेषण करने के बाद, हमने निर्धारित किया कि वीडियोपोज़3डी सबसे अधिक एआई-संचालित फिटनेस अनुप्रयोगों की आवश्यकताओं के लिए सबसे अच्छा समाधान है। इस प्रणाली का इनपुट 2D कीपॉइंट्स का पता लगाने की अनुमति देना चाहिए, जहां एक मॉडल, कोको 2017 डेटासेट पर पूर्व-प्रशिक्षित, 2D डिटेक्टर के रूप में लागू किया जाता है।

वर्तमान जोड़ या कीपॉइंट की स्थिति के सबसे सटीक पूर्वानुमान के लिए, वीडियोपोज़3डी एक छोटी समय श्रृंखला में कई फ्रेम का उपयोग कर सकता है 2D पोज़ जानकारी उत्पन्न करने के लिए।

3D पोज़ अनुमान की सटीकता को और बढ़ाने के लिए, एक ही अभ्यास या दिनचर्या के दौरान उपयोगकर्ता के विभिन्न दृष्टिकोणों को पकड़ने के लिए एक से अधिक कैमरे का उपयोग किया जा सकता है। ध्यान दें, हालांकि, कि यह अधिक प्रसंस्करण शक्ति के साथ-साथ कई वीडियो स्ट्रीम इनपुट को संभालने के लिए विशेष मॉडल आर्किटेक्चर की आवश्यकता है।

हाल ही में, गूगल ने ब्लेज़पोज़ प्रणाली का अनावरण किया, जो मोबाइल डिवाइस-उन्मुख मॉडल है जो मानव मुद्रा का अनुमान लगाने के लिए कीपॉइंट्स के विश्लेषण की संख्या को 33 तक बढ़ाता है, जो कोको कीपॉइंट सेट और दो अन्य टोपोलॉजी – ब्लेज़पाम और ब्लेज़फ़ेस का एक सुपरसेट है। इसके परिणामस्वरूप, ब्लेज़पोज़ मॉडल हाथ मॉडल और चेहरे के मॉडल के साथ संगत मुद्रा पूर्वानुमान परिणाम उत्पन्न कर सकता है शरीर के अर्थ को स्पष्ट करने के द्वारा।

मानव मुद्रा अनुमान प्रणाली के भीतर प्रत्येक घटक को तेज़ होना चाहिए, प्रति फ्रेम मुद्रा पता लगाने और ट्रैकिंग मॉडल के लिए अधिकतम कुछ मिलीसेकंड लेना चाहिए।

चूंकि ब्लेज़पोज़ पाइपलाइन (जिसमें मुद्रा अनुमान और ट्रैकिंग घटक शामिल हैं) को विभिन्न मोबाइल डिवाइसों पर वास्तविक समय में संचालित करना होगा, पाइपलाइन का प्रत्येक भाग बहुत कम गणनात्मक कुशल होने और 200-1000 एफपीएस पर चलने के लिए डिज़ाइन किया गया है।

वीडियो में मुद्रा अनुमान और ट्रैकिंग आमतौर पर दो चरणों में किया जाता है जहां यह ज्ञात नहीं है कि व्यक्ति मौजूद है या नहीं।

पहले चरण में, एक वस्तु पता लगाने वाला मॉडल चलाया जाता है ताकि यह निर्धारित किया जा सके कि क्या एक मानव मौजूद है या नहीं। एक बार जब व्यक्ति का पता लगाया जाता है, तो मुद्रा अनुमान मॉड्यूल व्यक्ति को स्थानीयकृत क्षेत्र को संसाधित कर सकता है और कीपॉइंट्स की स्थिति का पूर्वानुमान लगा सकता है।

इस सेटअप का एक नुकसान यह है कि यह प्रत्येक फ्रेम के लिए वस्तु पता लगाने और मुद्रा अनुमान मॉडल दोनों को चलाने की आवश्यकता है, जो अतिरिक्त गणनात्मक संसाधनों की खपत करता है। ब्लेज़पोज़ के लेखकों ने, हालांकि, इस समस्या को पार करने और अन्य कीपॉइंट पता लगाने वाले मॉड्यूल जैसे फेसमेश और मीडियापाइप हैंड में इसका कुशलता से उपयोग करने का एक चतुर तरीका तैयार किया।

विचार यह है कि एक वस्तु पता लगाने वाला मॉडल (ब्लेज़पोज़ के मामले में चेहरा पता लगाने वाला) का उपयोग केवल पहले फ्रेम में मुद्रा ट्रैकिंग को शुरू करने के लिए किया जा सकता है, जबकि व्यक्ति का बाद का ट्रैकिंग केवल मुद्रा पूर्वानुमान का उपयोग करके किया जा सकता है कुछ मुद्रा संरेखण के बाद, जिसके लिए मॉडल द्वारा मुद्रा अनुमान मॉडल का उपयोग करके पूर्वानुमान लगाया जाता है।

चेहरा टोर्सो की स्थिति के बारे में तंत्रिका नेटवर्क के लिए सबसे मजबूत संकेत प्रदान करता है, चेहरे की विशेषताओं में अपेक्षाकृत कम परिवर्तनशीलता और उच्च कंट्रास्ट के कारण। परिणामस्वरूप, यह संभव है कि मानव सिर को हर व्यक्तिगत उपयोग के मामले में स्थानीयकृत किया जा सकता है, इस विचार पर आधारित एक श्रृंखला के माध्यम से एक तेज़, कम-ओवरहेड प्रणाली के लिए मुद्रा पता लगाने के लिए।

मानव मुद्रा अनुमान की चुनौतियों पर काबू पाना

फिटनेस ऐप्स में मुद्रा अनुमान का उपयोग करना मानव मुद्राओं की विशाल श्रृंखला की चुनौती का सामना करता है, जैसे कि अधिकांश योग कार्यक्रमों में सैकड़ों आसन।

इसके अलावा, शरीर कभी-कभी किसी भी दिए गए कैमरे द्वारा कब्जा किए गए कुछ अंगों को ब्लॉक करेगा, उपयोगकर्ता विभिन्न पोशाकें पहन सकते हैं जो शरीर की विशेषताओं और व्यक्तिगत रूप को धुंधला कर सकते हैं।

पूर्व-प्रशिक्षित मॉडल का उपयोग करते समय, असामान्य शरीर की गतिविधियों या अजीब कैमरा कोण मानव मुद्रा अनुमान में त्रुटियों का कारण बन सकते हैं। हम इस समस्या को एक 3D मानव शरीर मॉडल रेंडर से सिंथेटिक डेटा का उपयोग करके या संबंधित डोमेन के लिए विशिष्ट डेटा के साथ फ़ाइन-ट्यूनिंग करके कुछ हद तक कम कर सकते हैं।

सुखद बात यह है कि हम अधिकांश कमजोरियों से बच सकते हैं या उन्हें कम कर सकते हैं। इसका मुख्य कारण सही प्रशिक्षण डेटा और मॉडल आर्किटेक्चर का चयन करना है। इसके अलावा, मानव मुद्रा अनुमान प्रौद्योगिकी के क्षेत्र में विकास की प्रवृत्ति यह सुझाव देती है कि हम वर्तमान में जिन समस्याओं का सामना कर रहे हैं वे आने वाले वर्षों में कम प्रासंगिक हो जाएंगी।

अंतिम शब्द

मानव मुद्रा अनुमान फिटनेस ऐप्स और मानव गतिविधियों के ट्रैकिंग के क्षेत्र से परे भविष्य के संभावित उपयोगों की एक श्रृंखला रखता है, गेमिंग से लेकर एनिमेशन तक, ऑगमेंटेड रियलिटी से लेकर रोबोटिक्स तक। यह संभावनाओं की एक पूरी सूची का प्रतिनिधित्व नहीं करता है, लेकिन यह कुछ ऐसे क्षेत्रों को उजागर करता है जहां मानव मुद्रा अनुमान हमारे डिजिटल परिदृश्य में योगदान देगा।

मैक्सिम डेटा साइंस और मशीन लर्निंग में नए अंतर्दृष्टि और अनुभव प्राप्त करने के लिए उत्सुक है। वह विशेष रूप से डीप लर्निंग-आधारित प्रौद्योगिकियों और उनके व्यवसायिक उपयोग मामलों में आवेदन में रुचि रखते हैं।