Terveydenhuolto
Ihmisen asennon arvio AI: n avulla kuntoiluohjelmassa

Maksym Tatariants, Data Science Engineer MobiDev:issa.
Ihmisen asennon arvio on melko uusi, mutta nopeasti kehittyvä teknologia, joka on tärkeässä roolissa kuntoilu- ja tanssiapplikaatioissa, jolloin voidaan asettaa digitaalinen sisältö yhteen todellisen maailman kanssa.
Lyhyesti sanottuna, ihmisen asennon arvio on tietokoneen näköntarkastelutekniikkaan perustuva teknologia, joka pystyy havaitsemaan ja prosessoimaan ihmisen asennon. Tämän teknologian tärkein ja keskeisin osa on ihmisen kehon mallinnus. Kolme kehon mallia ovat eniten käytettyjä nykyisissä ihmisen asennon arviointijärjestelmissä – luurankomalli, kontuurimalli ja tilavuusmalli.
Luurankomalli
Tämä malli koostuu joukosta nivelistä (avainpisteistä), kuten polvista, nilkasta, ranteista, kyynärpäistä, olkapäistä ja kehon raajojen suunnasta. Tämä malli on huomattavan joustava, ja siten soveltuu sekä 3-ulotteiseen että 2-ulotteiseen ihmisen asennon arviointiin. 3-ulotteisella mallinnuksella ratkaisu käyttää RGB-kuvaa ja etsii nivelisten X, Y ja Z -koordinaatteja. 2-ulotteisella mallinnuksella on sama analyysi RGB-kuvasta, mutta käyttäen X- ja Y-koordinaatteja.
Kontuurimalli
Tämä malli käyttää kehon ja raajojen kontuureja sekä niiden likimääräistä leveyttä. Tässä ratkaisu ottaa kehon kehyksen siluetin ja esittää kehon osat suorakaiteina ja rajoituksina kyseisessä kehyksessä.
Tilavuusmalli
Tämä malli käyttää yleensä sarjaa 3-ulotteisia skannauksia kehon muodon tallentamiseen ja muuttaa sen muodostamaan muotoja ja geometrisia verkkorakenteita. Nämä muodot luovat 3D-sarjan asentoja ja kehon esityksiä.
Kuinka 3D ihmisen asennon arvio toimii
Kuntoiluohjelmat ovat riippuvaisia 3-ulotteisesta ihmisen asennon arviointitekniikasta. Nämä sovellukset tarvitsevat mahdollisimman paljon tietoa ihmisen asennosta. Tällä tekniikalla sovelluksen käyttäjä tallentaa itsensä suorittamassa harjoitusta tai kuntoiluohjelmaa. Sovellus analysoi sitten käyttäjän kehon liikkeitä ja tarjoaa korjauksia virheistä tai epätarkkuuksista.
Tämänkaltaisen sovelluksen tyypillinen prosessikaavio seuraa tätä mallia:
- Ensinnäkin, kerätään tietoa käyttäjän liikkeistä harjoituksen aikana.
- Seuraavaksi määritetään, kuinka oikein tai väärin käyttäjän liikkeet olivat.
- Lopulta näytetään käyttäjälle käyttöliittymän kautta, mitä virheitä hän saattaa tehdä.
Tällä hetkellä ihmisen asennon arviointitekniikassa on COCO-topologia, joka koostuu 17 merkkikohtaa kehossa, aina kasvoista jalkoihin. Huomaa, että COCO ei ole ainoa ihmisen kehon asennon arviointikehys, vaan yleisimmin käytetty.
Tämä prosessi käyttää yleensä syvää koneoppimistekniikkaa nivelisten etsimiseen asennon arvioinnissa. Se käyttää sitten geometriaan perustuvia algoritmeja ymmärtämään, mitä se on löytänyt (analyysi havaittujen nivelisten suhteellisista asemista). Käyttäen dynaamista videota lähdetietona, järjestelmä voi käyttää sarjaa kehyksiä, ei vain yhtä kuvaa, kehittääkseen avainpisteet. Tuloksena on paljon tarkempi kuva käyttäjän todellisista liikkeistä, koska järjestelmä voi käyttää tietoa viereisistä kehyksistä ratkaistaakseen epävarmuudet kehon sijainnista nykyisessä kehyksessä.
Nykyisistä tekniikoista, joita käytetään 3D-asennon arvioinnissa kuntoiluohjelmissa, tarkin lähestymistapa on soveltaa mallia 2D-avainpisteiden etsimiseen ja käsitellä sitten 2D-havaintoa toisella mallilla 3D-avainpistekohtaisiksi ennusteiksi.
Aiheemme tutkimuksessa, joka julkaistiin äskettäin, käytettiin yhtä videolähdettä, ja sovellettiin konvoluutioneuraaliverkkoja laajennetuilla aikaisilla konvoluutioilla 2D-3D avainpistekohtaisen muunnoksen suorittamiseen.
Analyysin jälkeen olemassa olevista malleista, olemme päättäneet, että VideoPose3D on ratkaisu, joka on parhaiten sovellettavissa useimpiin AI-käyttöön perustuviin kuntoiluohjelmiin. Syötteenä tällä järjestelmällä tulisi olla 2D-avainpistesarja, jossa malli, joka on esikoulutettu COCO 2017 -aineistolla, sovelletaan 2D-havaintojen etsimiseen.
Tarkimman nykyisen nivelen tai avainpisteen sijainnin ennustamiseksi VideoPose3D voi käyttää useita kehyksiä lyhyen aikajanan sisällä luodakseen 2D-asennontiedot.
Jotta 3D-asennon arviointi voidaan tehostaa entisestään, voidaan käyttää useampaa kameraa keräämään vaihtoehtoisia näkymiä käyttäjän suorittaessa samaa harjoitusta tai ohjelmaa. Huomaa kuitenkin, että se vaatii suurempaa prosessointikapasiteettia sekä erikoistuneen mallirakenteen useiden videovirtausten käsittelyyn.
Google (GOOGL ) julkaisi hiljattain BlazePose-järjestelmänsä, joka on mobiililaitteisiin suunniteltu malli ihmisen asennon arvioimiseen lisäämällä analyysissä mukana olevien avainpisteiden määrää 33:een, joka on suppeampi kuin COCO-avainpistejoukko ja kaksi muuta topologiaa – BlazePalm ja BlazeFace. Tämän seurauksena BlazePose-malli voi tuottaa asennon ennustus tuloksia, jotka ovat yhdenmukaisia käden ja kasvon malleja kehon semantiikan avulla.
Jokainen komponentti koneoppimiseen perustuvassa ihmisen asennon arvioinnissa tarvitsee olla nopea, ottamalla enimmillään muutaman millisekunnin kestävän ajan kehyskohtaisesti asennon etsimiseen ja seuraamiseen.
Siksi BlazePose-pipeline (joka sisältää asennon arvioinnin ja seuraamisen komponentit) on suunniteltu toimimaan erilaisilla mobiililaitteilla reaaliajassa, ja jokainen pipelineen kuuluva osa on suunniteltu erittäin laskennallisesti tehokkaaksi ja toimimaan 200-1000 FPS nopeudella.
Asennon arvioinnin ja seuraamisen videossa, jossa ei tiedetä, onko henkilö läsnä tai missä, tehdään yleensä kahdessa vaiheessa.
Ensimmäisessä vaiheessa suoritetaan objektin etsintämalli henkilön sijainnin määrittämiseksi tai hänen poissaolonsa tunnistamiseksi. Kun henkilö on havaittu, asennon arviointimalli voi käsitellä paikallistettua aluetta, joka sisältää henkilön, ja ennustaa avainpisteiden sijainnin.
Tämän asetelman huono puoli on, että se vaatii sekä objektin etsintä- että asennon arviointimallien suorittamisen jokaiselle kehykselle, mikä kuluttaa ylimääräisiä laskennallisia resursseja. BlazePosen kirjoittajat ovat kuitenkin keksineet älykkään tavan kiertää tämän ongelman ja hyödyntää sitä tehokkaasti muiden avainpistekohtaisissa havaintamalleissa, kuten FaceMesh ja MediaPipe Hand.
Idea on, että objektin etsintämalli (kasvojen etsintä tapauksessa BlazePose) voidaan käyttää vain asennon seuraamisen käynnistämiseen ensimmäisessä kehyksessä, kun taas seuraava henkilön seuraaminen voidaan tehdä yksinomaan asennon ennustusten avulla, jotka tehdään asennon arviointimallilla. Parametrit, joita käytetään asennon järjestämiseen, ennustetaan asennon arviointimallilla.
Kasvoista tulee vahvin signaali vartalon sijainnista neuroverkolle, koska siinä on suhteellisen vähän muutosta ulkonäössä ja korkea kontrasti sen piirteissä. Seuraus on, että voidaan luoda nopea ja vähäinen järjestelmä asennon etsimiseen, joka perustuu oletuksiin, jotka perustuvat siihen, että ihmisen pää on aina sijainnissa, josta se voidaan havaita.
Ihmisen asennon arvioinnin haasteiden voittaminen
Ihmisen asennon arvioinnin käyttäminen kuntoiluohjelmissa kohtaa haasteen ihmisen asentojen valtavan määrän, esimerkiksi satoja asanoita useimmissa joogarepeertoireissa.
Lisäksi keho voi joskus estää tiettyjä raajoja, mitä tahansa kameraa käytetään, ja käyttäjät voivat käyttää erilaisia vaatteita, jotka peittävät kehon piirteitä ja yksilöllisiä ulkonäköjä.
Kun käytetään esikoulutettuja malleja, on huomattava, että epätavalliset kehon liikkeet tai outoja kamerakulmia voi johtaa virheisiin ihmisen asennon arvioinnissa. Tämän ongelman voidaan lieventää tietynlaista syntetistä dataa käyttämällä 3D-ihmisen kehon mallista tai säätämällä dataa kyseisen alan mukaan.
Hyviä uutisia on, että voidaan välttää tai lieventää useimpia heikkouksia. Avain siihen on valita oikea koulutusdata ja mallirakenne. Lisäksi ihmisen asennon arvioinnin kehityksen suunta viittaa siihen, että jotkut nykyisistä haasteista eivät ole enää relevantteja tulevaisuudessa.
Loppusanat
Ihmisen asennon arvioinnilla on monia mahdollisia tulevia sovelluksia kuntoiluohjelmien ja ihmisen liikkeiden seuraamisen ulkopuolella, aina pelaamisesta animaatioon, lisätystä todellisuuteen ja robottiikkaan. Tämä ei ole kattava luettelo mahdollisuuksista, mutta korostaa joitakin todennäköisimpiä alueita, joilla ihmisen asennon arvioinnilla on vaikutusta digitaaliseen maisemaamme.
















