Y tế

Ước lượng tư thế con người bằng AI trong ứng dụng thể dục

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Bởi Maksym Tatariants, Kỹ sư Khoa học Dữ liệu tại MobiDev.

Ước lượng tư thế con người đề cập đến một công nghệ – khá mới, nhưng đang phát triển nhanh chóng – đóng vai trò quan trọng trong các ứng dụng thể dục và khiêu vũ, cho phép chúng ta đặt nội dung kỹ thuật số lên thế giới thực.

Tóm lại, khái niệm ước lượng tư thế con người là một công nghệ dựa trên tầm nhìn máy tính có thể phát hiện và xử lý tư thế con người. Phần quan trọng và trung tâm của công nghệ này là mô hình hóa cơ thể con người. Ba mô hình cơ thể nổi bật trong các hệ thống ước lượng tư thế con người hiện tại – dựa trên khung xương, dựa trên đường nét và dựa trên thể tích.

Mô hình dựa trên khung xương

Mô hình này bao gồm một tập hợp các khớp (điểm then chốt), chẳng hạn như đầu gối, mắt cá chân, cổ tay, khuỷu tay, vai và hướng của các chi của cơ thể. Mô hình này nổi bật với sự linh hoạt và do đó phù hợp cho cả ước lượng tư thế con người 3 chiều và 2 chiều. Với mô hình hóa 3 chiều, giải pháp sử dụng hình ảnh RGB và tìm kiếm tọa độ X, Y và Z của các khớp. Với mô hình hóa 2 chiều, đó là cùng một phân tích hình ảnh RGB, nhưng sử dụng tọa độ X và Y.

Mô hình dựa trên đường nét

Mô hình này sử dụng các đường nét của thân và chi của cơ thể, cũng như chiều rộng thô của chúng. Ở đây, giải pháp lấy hình dạng của khung cơ thể và biểu diễn các bộ phận cơ thể dưới dạng hình chữ nhật và ranh giới trong khuôn khổ đó.

Mô hình dựa trên thể tích

Mô hình này thường sử dụng một loạt các quét 3 chiều để thu thập hình dạng của cơ thể và chuyển đổi nó thành một khuôn khổ của các hình dạng và lưới hình học. Những hình dạng này tạo ra một loạt các tư thế và biểu diễn cơ thể 3 chiều.

Ước lượng tư thế con người 3D hoạt động như thế nào

Các ứng dụng thể dục thường dựa vào ước lượng tư thế con người 3 chiều. Đối với các ứng dụng này, càng nhiều thông tin về tư thế con người, càng tốt. Với kỹ thuật này, người dùng của ứng dụng sẽ ghi lại bản thân tham gia vào một bài tập hoặc quy trình tập luyện. Sau đó, ứng dụng sẽ phân tích các chuyển động của cơ thể người dùng, cung cấp các sửa đổi cho các sai sót hoặc không chính xác.

Biểu đồ luồng của loại ứng dụng này thường theo mẫu sau:

  • Trước tiên, thu thập dữ liệu về các chuyển động của người dùng khi họ thực hiện bài tập.
  • Tiếp theo, xác định xem các chuyển động của người dùng có chính xác hay không.
  • Cuối cùng, hiển thị cho người dùng qua giao diện những sai sót họ có thể đã mắc phải.

Hiện tại, tiêu chuẩn trong công nghệ tư thế con người là cấu trúc COCO. Cấu trúc COCO bao gồm 17 điểm mốc trên cơ thể, từ khuôn mặt đến tay đến chân. Lưu ý rằng COCO không phải là khuôn khổ tư thế cơ thể duy nhất, mà chỉ là khuôn khổ được sử dụng phổ biến nhất.

Quy trình này thường sử dụng công nghệ học máy sâu để trích xuất các khớp trong việc ước lượng tư thế. Sau đó, nó sử dụng các thuật toán dựa trên hình học để hiểu những gì nó đã tìm thấy (phân tích vị trí tương đối của các khớp được phát hiện). Khi sử dụng video động như dữ liệu nguồn, hệ thống có thể sử dụng một loạt các khung, không chỉ một hình ảnh đơn, để thu thập thông tin về các điểm then chốt. Kết quả là một bản trình bày chính xác hơn về các chuyển động thực của người dùng vì hệ thống có thể sử dụng thông tin từ các khung liền kề để giải quyết bất kỳ sự không chắc chắn nào về vị trí của cơ thể trong khung hiện tại.

Trong số các kỹ thuật hiện tại để sử dụng ước lượng tư thế 3D trong các ứng dụng thể dục, cách tiếp cận chính xác nhất là áp dụng một mô hình để phát hiện các điểm then chốt 2D và sau đó xử lý phát hiện 2D với một mô hình khác để chuyển đổi chúng thành dự đoán điểm then chốt 3D.

Trong nghiên cứu chúng tôi đăng gần đây, một nguồn video đơn được sử dụng, với các mạng nơ-ron tích chập có sự dilated thời gian được áp dụng để thực hiện việc chuyển đổi điểm then chốt 2D -> 3D.

Sau khi phân tích các mô hình hiện có, chúng tôi xác định rằng VideoPose3D là giải pháp tốt nhất cho nhu cầu của hầu hết các ứng dụng thể dục được thúc đẩy bởi AI. Đầu vào sử dụng hệ thống này nên cho phép một tập hợp các điểm then chốt 2D được phát hiện, trong đó một mô hình được đào tạo trước trên tập dữ liệu COCO 2017 được áp dụng làm bộ phát hiện 2D.

Để dự đoán chính xác vị trí của một khớp hoặc điểm then chốt hiện tại, VideoPose3D có thể sử dụng nhiều khung trong một chuỗi thời gian ngắn để tạo ra thông tin tư thế 2D.

Để tăng cường độ chính xác của ước lượng tư thế 3D, hơn một máy ảnh có thể thu thập các góc nhìn thay thế của người dùng khi thực hiện cùng một bài tập hoặc quy trình. Lưu ý, tuy nhiên, rằng nó yêu cầu nhiều năng lực xử lý hơn cũng như kiến trúc mô hình chuyên dụng để xử lý nhiều luồng video đầu vào.

Gần đây, Google (GOOGL ) ra mắt hệ thống BlazePose của họ, một mô hình dành cho thiết bị di động để ước lượng tư thế con người bằng cách tăng số lượng điểm then chốt được phân tích lên 33, một tập hợp con của tập điểm then chốt COCO và hai cấu trúc khác – BlazePalm và BlazeFace. Kết quả là, mô hình BlazePose có thể tạo ra kết quả dự đoán tư thế nhất quán với các mô hình tay và khuôn mặt bằng cách diễn giải ngữ nghĩa cơ thể.

Mỗi thành phần trong hệ thống ước lượng tư thế con người dựa trên học máy cần phải nhanh, chỉ mất tối đa một vài mili giây cho mỗi khung hình để phát hiện tư thế và theo dõi mô hình.

Do thực tế là đường ống BlazePose (bao gồm các thành phần ước lượng tư thế và theo dõi) phải hoạt động trên nhiều thiết bị di động trong thời gian thực, mỗi phần của đường ống được thiết kế để rất hiệu quả về mặt tính toán và chạy tại 200-1000 FPS.

Ước lượng tư thế và theo dõi trong video nơi không biết liệu người có mặt hay không và ở đâu là một quá trình thường được thực hiện ở hai giai đoạn.

Ở giai đoạn đầu, một mô hình phát hiện đối tượng được chạy để xác định sự hiện diện của một người hoặc để xác định sự vắng mặt của họ. Sau khi người đã được phát hiện, mô hình ước lượng tư thế có thể xử lý khu vực được xác định có chứa người và dự đoán vị trí của các điểm then chốt.

Một điểm yếu của thiết lập này là nó yêu cầu cả mô hình phát hiện đối tượng và mô hình ước lượng tư thế phải chạy cho mỗi khung hình, điều này tiêu tốn thêm tài nguyên tính toán. Tuy nhiên, các tác giả của BlazePose đã nghĩ ra một cách thông minh để tránh vấn đề này và sử dụng nó một cách hiệu quả trong các mô hình phát hiện điểm then chốt khác như FaceMeshMediaPipe Hand.

Ý tưởng là một mô hình phát hiện đối tượng (phát hiện khuôn mặt trong trường hợp của BlazePose) có thể được sử dụng chỉ để khởi động việc theo dõi tư thế trong khung hình đầu tiên trong khi việc theo dõi tiếp theo của người có thể được thực hiện bằng cách sử dụng độc quyền các dự đoán tư thế sau khi một số điều chỉnh tư thế, các tham số cho điều đó được dự đoán bằng cách sử dụng mô hình ước lượng tư thế.

Khuôn mặt tạo ra tín hiệu mạnh nhất về vị trí của thân cho mạng nơ-ron, kết quả của sự biến thiên nhỏ trong ngoại hình và độ tương phản cao trong các tính năng của nó. Do đó, có thể tạo ra một hệ thống nhanh chóng, thấp về tải trọng để phát hiện tư thế thông qua một loạt các giả định hợp lý dựa trên ý tưởng rằng đầu của con người sẽ có thể định vị được trong mọi trường hợp sử dụng cá nhân.

Chuyển đổi các thách thức của ước lượng tư thế con người

Sử dụng ước lượng tư thế trong các ứng dụng thể dục phải đối mặt với thách thức của số lượng lớn các tư thế con người, ví dụ, hàng trăm tư thế trong hầu hết các chế độ yoga.

Hơn nữa, cơ thể sẽ đôi khi chặn các chi nhất định như được chụp bởi bất kỳ máy ảnh nào, người dùng có thể mặc các trang phục khác nhau che giấu các tính năng cơ thể và diện mạo cá nhân.

Khi sử dụng bất kỳ mô hình được đào tạo trước nào, lưu ý rằng các chuyển động cơ thể bất thường hoặc các góc máy ảnh lạ có thể dẫn đến lỗi trong ước lượng tư thế con người. Chúng ta có thể giảm thiểu vấn đề này đến một mức độ nhất định bằng cách sử dụng dữ liệu tổng hợp từ mô hình cơ thể con người 3D hoặc bằng cách tinh chỉnh với dữ liệu cụ thể cho lĩnh vực đang được xem xét.

Tin tốt là chúng ta có thể tránh hoặc giảm thiểu hầu hết các điểm yếu. Chìa khóa để làm điều này là chọn ra dữ liệu đào tạo phù hợp và kiến trúc mô hình. Hơn nữa, xu hướng phát triển trong lĩnh vực công nghệ ước lượng tư thế con người cho thấy rằng một số vấn đề chúng ta đang gặp phải hiện nay sẽ ít liên quan hơn trong những năm tới.

Lời cuối

Ước lượng tư thế con người nắm giữ nhiều tiềm năng cho các ứng dụng tương lai ngoài lĩnh vực ứng dụng thể dục và theo dõi chuyển động con người, từ trò chơi đến hoạt hình đến Thực tế ảo tăng cường đến robot. Điều đó không đại diện cho danh sách đầy đủ các khả năng nhưng nó làm nổi bật một số lĩnh vực có khả năng nhất mà ước lượng tư thế con người sẽ đóng góp vào cảnh quan kỹ thuật số của chúng ta.

Maksym rất quan tâm đến việc thu được những hiểu biết và kinh nghiệm mới trong lĩnh vực Khoa học Dữ liệu và Học máy. Ông đặc biệt quan tâm đến các công nghệ dựa trên Học sâu và ứng dụng của chúng vào các trường hợp sử dụng kinh doanh.