医疗健康
人体姿势估计在健身应用中的应用

由Maksym Tatariants,MobiDev的数据科学工程师撰写。
人体姿势估计是一种相对较新的技术,但它正在迅速发展,并在健身和舞蹈应用中发挥着重要作用,允许我们将数字内容叠加在现实世界上。
简而言之,人体姿势估计是一种基于计算机视觉的技术,能够检测和处理人体姿势。这种技术最重要和核心的部分是人体建模。目前,人体姿势估计系统中最常用的三种身体模型是基于骨骼、基于轮廓和基于体积的模型。
基于骨骼的模型
这种模型由一组关节(关键点)组成,例如膝盖、脚踝、手腕、肘部、肩膀和身体肢体的方向。这种模型以其灵活性而著名,因此适用于三维和二维的人体姿势估计。对于三维建模,解决方案使用RGB图像并找到关节的X、Y和Z坐标。对于二维建模,同样是分析RGB图像,但仅使用X和Y坐标。
基于轮廓的模型
这种模型利用身体的轮廓和肢体的粗略宽度。这里,解决方案获取身体框架的剪影,并将身体部位渲染为矩形和边界框架内的边界。
基于体积的模型
这种模型通常使用一系列三维扫描来捕捉身体的形状,并将其转换为形状和几何网格的框架。这些形状创建了一系列三维姿势和身体表示。
三维人体姿势估计的工作原理
健身应用通常依赖于三维人体姿势估计。对于这些应用,人体姿势的信息越多越好。使用这种技术,应用的用户将记录自己进行锻炼或运动。应用将分析用户的身体运动,提供错误或不准确的纠正。
这种应用的流程图通常遵循以下模式:
- 首先,收集用户在进行锻炼时的运动数据。
- 其次,确定用户的运动是否正确或不正确。
- 最后,通过界面向用户显示可能犯下的错误。
目前,人体姿势技术的标准是 COCO拓扑。COCO拓扑由身体上的17个标志组成,从面部到手臂到腿部。注意,COCO不是唯一的人体姿势框架,只是最常用的一个。
这种过程通常使用深度机器学习技术来提取关节并估计用户的姿势。然后,它使用基于几何的算法来分析检测到的关节的相对位置。使用动态视频作为源数据,系统可以使用一系列帧,而不仅仅是一个图像来捕捉其关键点。结果是对用户的真实运动的更准确的渲染,因为系统可以使用相邻帧的信息来解决当前帧中人体位置的不确定性。
目前,使用三维姿势估计在健身应用中的最准确的方法是首先应用一个模型来检测二维关键点,然后使用另一个模型将二维检测转换为三维关键点预测。
在我们最近发布的 研究 中,我们使用了单个视频源,并应用了具有膨胀时间卷积的卷积神经网络来执行二维到三维关键点转换。
分析了当前的模型后,我们确定VideoPose3D是最适合大多数AI驱动健身应用的解决方案。使用这个系统,输入应该允许检测二维关键点, 其中一个预训练的COCO 2017数据集模型被应用为 二维检测器。
为了更准确地预测当前关节或关键点的位置,VideoPose3D可以使用多个帧在短时间序列内生成二维姿势信息。
为了进一步提高三维姿势估计的准确性,可以使用多个摄像头来获取用户执行相同锻炼或例行程序的不同视角。注意,这需要更大的处理能力以及专门的模型架构来处理多个视频流输入。
最近,Google (GOOGL ) 推出了他们的BlazePose系统,这是一个面向移动设备的模型,用于通过增加分析的关键点数量(33个)来估计人体姿势,这是COCO关键点集和两个其他拓扑结构(BlazePalm和BlazeFace)的超集。因此,BlazePose模型可以通过关节模型和面部模型来产生一致的姿势预测结果。
每个机器学习基于的人体姿势估计系统的组件都需要快速,pose检测和跟踪模型每帧最多需要几毫秒。
由于BlazePose管道(包括姿势估计和跟踪组件)需要在各种移动设备上实时运行,因此管道的每个部分都被设计为计算效率很高,可以以200-1000 FPS运行。
在不知道人体是否存在或存在位置的视频中,姿势估计和跟踪通常分为两个阶段。
在第一阶段,运行对象检测模型来定位人体或确定其不存在。检测到人体后,姿势估计模块可以处理包含人体的局部区域并预测关键点的位置。
这种设置的一个缺点是它需要对象检测和姿势估计模块为每个帧运行,这会消耗额外的计算资源。然而,BlazePose的作者想出了一个巧妙的方法来高效地利用它在其他关键点检测模块中,例如 FaceMesh 和 MediaPipe Hand。
这个想法是,对象检测模块(在BlazePose中是面部检测器)可以仅用于启动第一帧的姿势跟踪,而后续的跟踪可以仅使用姿势预测,这些预测使用姿势估计模型来预测一些姿势对齐参数。
面部产生了最强的信号,表明躯干的位置对于神经网络来说是可以接受的,因为面部的外观变化相对较小,特征对比度很高。因此,可以通过一系列合理的假设来创建一个快速、低开销的姿势检测系统,这些假设基于这样一个想法:在每个个人使用案例中,人头都是可以定位的。
克服人体姿势估计的挑战
在健身应用中使用姿势估计面临着人体姿势范围的挑战,例如瑜伽常规中的数百个姿势。
此外,身体有时会阻挡某些肢体,如摄像机捕捉到的那样,用户可能会穿着不同的服装来遮挡身体特征和个人外貌。
在使用任何预训练模型时,注意到不寻常的身体运动或奇怪的摄像机角度可能会导致 人体姿势估计错误。我们可以通过使用来自3D人体模型渲染的合成数据或对特定领域的数据进行微调来一定程度上缓解这个问题。
好消息是,我们可以避免或减轻大多数弱点。做到这一点的关键是选择合适的训练数据和模型架构。此外,人体姿势估计技术领域的发展趋势表明,我们目前面临的一些问题在未来几年将变得不那么相关。
最后的话
人体姿势估计具有多种潜在的未来应用,超出了健身应用和跟踪人体运动的范围,从游戏到动画到增强现实到机器人。虽然这并不代表所有可能性,但它突出了人体姿势估计将为我们的数字化景观做出贡献的最有可能的领域。
















