Υγεία

Εκτίμηση Στάσης Ανθρώπου με τη Βοήθεια του AI στις Εφαρμογές Φυσικής Κατάστασης

mm
Προσθέστε το Unite.AI στις προτιμώμενες πηγές σας στο Google

Từ Maksym Tatariants, Μηχανικός Επιστήμης Δεδομένων στην MobiDev.

Η εκτίμηση στάσης ανθρώπου αναφέρεται σε μια τεχνολογία – tương đối καινούργια, αλλά εξελισσόμενη γρήγορα – που παίζει σημαντικό ρόλο στις εφαρμογές φυσικής κατάστασης και χορού, επιτρέποντάς μας να τοποθετήσουμε ψηφιακό περιεχόμενο πάνω στον πραγματικό κόσμο.

Σύντομα, η έννοια της εκτίμησης στάσης ανθρώπου είναι μια τεχνολογία που βασίζεται στην όραση υπολογιστή και μπορεί να ανιχνεύσει και να επεξεργαστεί τη στάση του ανθρώπινου σώματος. Το πιο σημαντικό και κεντρικό μέρος αυτής της τεχνολογίας είναι το μοντέλο του ανθρώπινου σώματος. Τρία μοντέλα σώματος είναι τα πιο εξέχοντα στα τρέχοντα συστήματα εκτίμησης στάσης ανθρώπου – το μοντέλο βασισμένο στο σκελετό, το μοντέλο βασισμένο στο περίγραμμα και το μοντέλο βασισμένο στο όγκο.

Μοντέλο Βασισμένο στο Σκελετό

Αυτό το μοντέλο αποτελείται από ένα σύνολο αρθρώσεων (κλειδιών), όπως τα γόνατα, τα αστράγαλα, οι πήχεις, οι αγκώνες, οι ώμοι και η προσανατολισμός των άκρων του σώματος. Αυτό το μοντέλο είναι αξιοσημείωτο για την ευελιξία του και ως εκ τούτου είναι κατάλληλο και για τρισδιάστατη και για δισδιάστατη εκτίμηση στάσης ανθρώπου. Με τρισδιάστατη μοντελοποίηση, η λύση χρησιμοποιεί μια εικόνα RGB και βρίσκει τις συντεταγμένες X, Y και Z των αρθρώσεων. Με δισδιάστατη μοντελοποίηση, είναι η ίδια ανάλυση μιας εικόνας RGB, αλλά χρησιμοποιώντας τις συντεταγμένες X και Y.

Μοντέλο Βασισμένο στο Περίγραμμα

Αυτό το μοντέλο χρησιμοποιεί τα περιγράμματα του κορμού και των άκρων του σώματος, καθώς και το περίγραμμα του σώματος. Εδώ, η λύση παίρνει το σιλουέτα του σώματος και αποδίδει τα μέρη του σώματος ως ορθογώνια και όρια μέσα σε αυτό το πλαίσιο.

Μοντέλο Βασισμένο στο Όγκο

Αυτό το μοντέλο χρησιμοποιεί γενικά μια σειρά από τρισδιάστατες σκαναρίσεις για να καταγράψει το σχήμα του σώματος και το μετατρέπει σε ένα πλαίσιο από σχήματα και γεωμετρικά πλέγματα. Αυτά τα σχήματα δημιουργούν μια τρισδιάστατη σειρά από στάσεις και αναπαραστάσεις του σώματος.

Πώς Λειτουργεί η Εκτίμηση Στάσης Ανθρώπου σε 3D

Οι εφαρμογές φυσικής κατάστασης έχουν την τάση να βασίζονται σε τρισδιάστατη εκτίμηση στάσης ανθρώπου. Για αυτές τις εφαρμογές, όσο περισσότερες πληροφορίες για τη στάση του ανθρώπου, τόσο το καλύτερο. Με αυτή τη τεχνική, ο χρήστης της εφαρμογής θα καταγράψει τον εαυτό του να συμμετέχει σε μια άσκηση ή ρουτίνα γυμναστικής. Η εφαρμογή θα αναλύσει τις κινήσεις του σώματος του χρήστη, προσφέροντας διορθώσεις για λάθη ή ανακρίβειες.

Το συνηθισμένο σχήμα ροής μιας τέτοιας εφαρμογής ακολουθεί αυτό το μοτίβο:

  • Πρώτα, συλλέγουμε δεδομένα για τις κινήσεις του χρήστη ενώ εκτελεί την άσκηση.
  • Στη συνέχεια, καθορίζουμε πόσο σωστές ή λανθασμένες ήταν οι κινήσεις του χρήστη.
  • Τέλος, δείχνουμε στον χρήστη μέσω της διεπαφής τι λάθη μπορεί να έχει κάνει.

Τώρα, ο τυπικός κανόνας στην τεχνολογία στάσης ανθρώπου είναι τοπική τοπολογία COCO. Η τοπική τοπολογία COCO αποτελείται από 17 ορόσημα σε όλο το σώμα, από το πρόσωπο μέχρι τα χέρια και τα πόδια. Σημειώστε ότι η COCO δεν είναι το μόνο πλαίσιο στάσης ανθρώπινου σώματος, αλλά είναι το πιο συχνά χρησιμοποιούμενο.

Αυτή η διαδικασία χρησιμοποιεί συνήθως τεχνολογία βαθιάς μάθησης μηχανής για την εξαγωγή των αρθρώσεων στην εκτίμηση της στάσης του χρήστη. Στη συνέχεια, χρησιμοποιεί γεωμετρικές αλγορίθμους για να κατανοήσει τι έχει βρει (ανάλυση σχετικών θέσεων των ανιχνευμένων αρθρώσεων). Χρησιμοποιώντας μια δυναμική βίντεο ως πηγή δεδομένων, το σύστημα μπορεί να χρησιμοποιήσει μια σειρά από καρέ, όχι μόνο μια seule εικόνα, για να καταγράψει τα κλειδιά του. Το αποτέλεσμα είναι μια πολύ πιο ακριβής αναπαράσταση των πραγματικών κινήσεων του χρήστη, поскольку το σύστημα μπορεί να χρησιμοποιήσει πληροφορίες από τα γειτονικά καρέ για να επιλύσει bất kỳ αβεβαιότητες σχετικά με τη θέση του ανθρώπινου σώματος στο τρέχον καρέ.

Από τις τρέχουσες τεχνικές για τη χρήση εκτίμησης στάσης ανθρώπου σε 3D στις εφαρμογές φυσικής κατάστασης, η πιο ακριβής προσέγγιση είναι να εφαρμόσουμε πρώτα ένα μοντέλο για να ανιχνεύσουμε τα 2D κλειδιά και στη συνέχεια να επεξεργαστούμε την ανίχνευση 2D με ένα άλλο μοντέλο για να τα μετατρέψουμε σε προβλέψεις 3D κλειδιών.

Στη ερεύνηση που δημοσιεύσαμε πρόσφατα, χρησιμοποιήθηκε μια seule πηγή βίντεο, με συνελικτικές νευρωνικές δικτυώσεις με διασταλμένα χρονικά συζεύγματα για να thực hiện τη μετατροπή 2D σε 3D κλειδιών.

Μετά την ανάλυση των μοντέλων που υπάρχουν τώρα, καθορίσαμε ότι το VideoPose3D είναι η λύση που είναι καλύτερα προσαρμοσμένη στις ανάγκες των περισσότερων εφαρμογών φυσικής κατάστασης που οδηγούνται από το AI. Η εισαγωγή με αυτό το σύστημα πρέπει να επιτρέπει σε ένα σύνολο 2D κλειδιών να ανιχνευτεί, όπου ένα μοντέλο, προ-εκπαιδευμένο στο σύνολο δεδομένων COCO 2017, εφαρμόζεται ως ανιχνευτής 2D.

Για την πιο ακριβή πρόβλεψη της θέσης του τρέχοντος γόνατος ή κλειδιού, το VideoPose3D μπορεί να χρησιμοποιήσει πολλά καρέ σε μια σύντομη ακολουθία χρόνου για να δημιουργήσει πληροφορίες στάσης 2D.

Για να αυξήσουμεさらに την ακρίβεια της εκτίμησης στάσης ανθρώπου σε 3D, περισσότερες από μια κάμερα μπορούν να συλλέξουν εναλλακτικές απόψεις του χρήστη που εκτελεί την ίδια άσκηση ή ρουτίνα. Σημειώστε, ωστόσο, ότι απαιτεί μεγαλύτερη επεξεργαστική ισχύ, καθώς και εξειδικευμένη αρχιτεκτονική μοντέλου για να αντιμετωπίσουμε πολλαπλά εισαγόμενα βίντεο.

Πρόσφατα, η Google (GOOGL ) παρουσίασε το σύστημα BlazePose, ένα μοντέλο προσανατολισμένο σε κινητές συσκευές για την εκτίμηση στάσης ανθρώπου, αυξάνοντας τον αριθμό των κλειδιών που αναλύονται σε 33, ένα υπερσύνολο του συνόλου κλειδιών COCO και δύο άλλων τοπολογιών – BlazePalm και BlazeFace. Ως αποτέλεσμα, το μοντέλο BlazePose μπορεί να παράγει αποτελέσματα πρόβλεψης στάσης που είναι συνεπή με τα μοντέλα χεριών και προσώπου, αναπτύσσοντας σωματικές σημασίες.

Κάθε συνιστώσα σε ένα σύστημα εκτίμησης στάσης ανθρώπου που βασίζεται στη μάθηση μηχανής πρέπει να είναι γρήγορη, παίρνοντας το μέγιστο των δύο χιλιοστών του δευτερολέπτου ανά καρέ για την ανίχνευση και την παρακολούθηση στάσης.

Λόγω του γεγονότος ότι η διαδικασία BlazePose (η οποία περιλαμβάνει την εκτίμηση στάσης και την παρακολούθηση) πρέπει να λειτουργεί σε eine ποικιλία κινητών συσκευών σε πραγματικό χρόνο, κάθε μεμονωμένο μέρος της διαδικασίας είναι σχεδιασμένο να είναι πολύ υπολογιστικά αποδοτικό και να τρέχει με 200-1000 FPS.

Η εκτίμηση στάσης και η παρακολούθηση στο βίντεο όπου δεν είναι γνωστό αν και πού βρίσκεται το άτομο γίνεται συνήθως σε δύο στάδια.

Στο πρώτο στάδιο, ένα μοντέλο ανίχνευσης αντικειμένων εκτελείται για να εντοπίσει την παρουσία ενός ανθρώπου ή να αναγνωρίσει την απουσία του. Μετά την ανίχνευση του ατόμου, το μοντέλο εκτίμησης στάσης μπορεί να επεξεργαστεί την τοποθετημένη περιοχή που περιέχει το άτομο και να προβλέψει τη θέση των κλειδιών.

Μια μείωση αυτής της ρύθμισης είναι ότι απαιτεί τόσο το μοντέλο ανίχνευσης αντικειμένων όσο και το μοντέλο εκτίμησης στάσης να τρέξουν για κάθε καρέ, το οποίο καταναλώνει επιπλέον υπολογιστικές πόρους. Οι δημιουργοί του BlazePose, ωστόσο, επινόησαν ένα έξυπνο τρόπο για να ξεπεραστούν αυτά τα προβλήματα και να αξιοποιηθούν αποτελεσματικά σε άλλα μοντέλα ανίχνευσης κλειδιών, όπως FaceMesh και MediaPipe Hand.

Η ιδέα είναι ότι ένα μοντέλο ανίχνευσης αντικειμένων (ανιχνευτής προσώπου στην περίπτωση του BlazePose) μπορεί να χρησιμοποιηθεί μόνο για να ξεκινήσει την παρακολούθηση στάσης στο πρώτο καρέ, ενώ η επόμενη παρακολούθηση του ατόμου μπορεί να γίνει χρησιμοποιώντας αποκλειστικά τις προβλέψεις στάσης μετά από κάποια ευθυγράμμιση, παραμέτρους για τις οποίες προβλέπονται χρησιμοποιώντας το μοντέλο εκτίμησης στάσης.

Το πρόσωπο παράγει το ισχυρότερο σήμα για τη θέση του κορμού για το νευρωνικό δίκτυο, ως αποτέλεσμα της σχετικά μικρής διακύμανσης στην εμφάνιση και της υψηλής αντίθεσης στις χαρακτηριστικές του. Συνεπώς, είναι δυνατό να δημιουργηθεί ένα γρήγορο, χαμηλού κόστους σύστημα για την ανίχνευση στάσης μέσω μιας σειράς δικαιολογημένων υποθέσεων που βασίζονται στην ιδέα ότι το ανθρώπινο κεφάλι θα είναι τοποθετημένο σε κάθε περίπτωση προσωπικής χρήσης.

Ξεπερνώντας τις Προκλήσεις της Εκτίμησης Στάσης Ανθρώπου

Η χρήση της εκτίμησης στάσης ανθρώπου στις εφαρμογές φυσικής κατάστασης αντιμετωπίζει την πρόκληση του τεράστιου όγκου των διαφορετικών στάσεων ανθρώπου, για παράδειγμα, τις εκατοντάδες των асάνων στις περισσότερες ρουτίνες γιόγκα.

Επιπλέον, το σώμα μπορεί να μπλοκάρει ορισμένα άκρα όπως αυτά που καταγράφονται από οποιαδήποτε κάμερα, οι χρήστες μπορεί να φορούν ποικίλες στολές που αποκρύπτουν τα χαρακτηριστικά του σώματος και την προσωπική εμφάνιση.

Κατά τη χρήση προ-εκπαιδευμένων μοντέλων, σημειώστε ότι οι ασυνήθιστες κινήσεις του σώματος ή οι περίεργες γωνίες κάμερας possono οδηγήσουν σε σφάλματα στην εκτίμηση στάσης ανθρώπου. Μπορούμε να μετριάσουμε αυτό το πρόβλημα μέχρι ένα certo βαθμό χρησιμοποιώντας συνθετικά δεδομένα από ένα 3D μοντέλο ανθρώπινου σώματος ή με την επιμελήωση με δεδομένα συγκεκριμένα για το domaine που αναφέρεται.

Η καλή είδηση είναι ότι μπορούμε να αποφύγουμε ή να μετριάσουμε την πλειοψηφία των αδυναμιών. Το κλειδί για να το κάνουμε αυτό είναι να επιλέξουμε τα σωστά δεδομένα εκπαίδευσης και αρχιτεκτονική μοντέλου. Επιπλέον, η τάση της εξέλιξης στον τομέα της τεχνολογίας εκτίμησης στάσης ανθρώπου υποδηλώνει ότι κάποια από τα προβλήματα που αντιμετωπίζουμε τώρα θα είναι λιγότερο σχετικά στα επόμενα χρόνια.

Το Τελικό Λόγο

Η εκτίμηση στάσης ανθρώπου έχει ποικίλες πιθανές μελλοντικές χρήσεις εκτός του τομέα των εφαρμογών φυσικής κατάστασης και της παρακολούθησης των κινήσεων ανθρώπου, από τα βιντεοπαιχνίδια μέχρι την κίνηση και την Εικονική Πραγματικότητα μέχρι τη ρομποτική. Αυτό δεν αντιπροσωπεύει μια πλήρη λίστα των δυνατοτήτων, αλλά υπογραμμίζει κάποιες από τις πιο πιθανές περιοχές όπου η εκτίμηση στάσης ανθρώπου θα συμβάλλει στο ψηφιακό τοπίο μας.

Ο Maksym είναι πρόθυμος να αποκτήσει νέες γνώσεις και εμπειρία στη Επιστήμη Δεδομένων και τη Μηχανική Μάθηση. Είναι ιδιαίτερα ενδιαφερόμενος για τις τεχνολογίες που βασίζονται στη Βαθιά Μάθηση και την εφαρμογή τους σε επιχειρηματικές περιπτώσεις.