Góc nhìn Anderson

Tổng hợp Hình ảnh Con người từ Sóng vô tuyến

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những nhà nghiên cứu từ Trung Quốc đã phát triển một phương pháp để tổng hợp hình ảnh gần như ảnh thực của con người mà không cần sử dụng máy ảnh, bằng cách sử dụng sóng vô tuyến và Mạng đối kháng sinh (GANs). Hệ thống mà họ đã tạo ra được đào tạo trên hình ảnh thực được chụp trong điều kiện ánh sáng tốt, nhưng có khả năng chụp ‘bức ảnh’ của con người một cách khá chính xác ngay cả khi điều kiện ánh sáng yếu – và thậm chí cả khi có vật cản lớn mà máy ảnh thông thường không thể chụp được.

Hình ảnh dựa trên ‘bản đồ nhiệt’ từ hai ăng ten sóng vô tuyến, một ăng ten thu dữ liệu từ trần xuống và một ăng ten khác ghi lại sự xáo trộn sóng vô tuyến từ vị trí ‘đứng’.

Hình ảnh kết quả từ các thí nghiệm chứng minh của các nhà nghiên cứu có một khía cạnh ‘không có khuôn mặt’, ‘J-Horror’:

Dựa trên việc đào tạo hình ảnh thực của con người trong cùng một môi trường, RFGAN sử dụng bản đồ nhiệt sóng vô tuyến để ghi lại hoạt động của con người và tạo ra hình ảnh gần giống với những gì mà độ phân giải thấp của tín hiệu RF hạn chế. Ánh sáng không cần thiết, vì màu sắc được nhận thức bởi cách sóng vô tuyến bị xáo trộn bởi sự hiện diện của con người, và bởi sự thay đổi tần số khi sóng vô tuyến quay trở lại với nhiều cường độ tín hiệu khác nhau và các đặc điểm khác nhau. Nguồn: https://arxiv.org/pdf/2112.03727.pdf

RFGAN được đào tạo trên hình ảnh của con người thực trong môi trường được kiểm soát và trên bản đồ nhiệt sóng vô tuyến ghi lại hoạt động của con người. Sau khi học các tính năng từ dữ liệu, RFGAN có thể tạo ra hình ảnh dựa trên dữ liệu RF mới. Hình ảnh kết quả là một xấp xỉ, dựa trên độ phân giải thấp của tín hiệu RF hạn chế. Quá trình này hoạt động даже trong môi trường tối và qua nhiều vật cản khác nhau. Nguồn: https://arxiv.org/pdf/2112.03727.pdf

Để đào tạo GAN, được gọi là RFGAN, các nhà nghiên cứu đã sử dụng dữ liệu được ghép từ máy ảnh RGB tiêu chuẩn và từ bản đồ nhiệt sóng vô tuyến được tạo ra tại thời điểm chụp. Hình ảnh của con người được tổng hợp trong dự án mới này có xu hướng bị mờ giống như nhiếp ảnh Daguerreotype sớm, vì độ phân giải của sóng vô tuyến được sử dụng rất thấp, với độ phân giải sâu 7,5cm và độ phân giải góc khoảng 1,3 độ.

Trên, hình ảnh được cung cấp cho mạng GAN - dưới, hai bản đồ nhiệt, ngang và dọc, mô tả người trong phòng và được tổng hợp trong kiến trúc thành một biểu diễn 3D của dữ liệu bị xáo trộn.

Trên, hình ảnh được cung cấp cho mạng GAN – dưới, hai bản đồ nhiệt, ngang và dọc, mô tả người trong phòng và được tổng hợp trong kiến trúc thành một biểu diễn 3D của dữ liệu bị xáo trộn.

Bài báo mới này, có tiêu đề RFGAN: Tổng hợp Con người Dựa trên Sóng vô tuyến, đến từ sáu nhà nghiên cứu từ Đại học Khoa học và Công nghệ Điện tử Trung Quốc.

Dữ liệu và Kiến trúc

Do không có dữ liệu hoặc dự án nào trước đó có phạm vi tương tự, và thực tế là tín hiệu RF chưa từng được sử dụng trước đây trong khuôn khổ tổng hợp hình ảnh GAN, các nhà nghiên cứu đã phải phát triển các phương pháp mới.

Kiến trúc cốt lõi của RFGAN.

Kiến trúc cốt lõi của RFGAN.

Sự chuẩn hóa thích ứng được sử dụng để giải thích các hình ảnh bản đồ nhiệt đôi trong quá trình đào tạo, để chúng tương ứng không gian với dữ liệu hình ảnh được chụp.

Các thiết bị thu sóng vô tuyến RF là radar sóng milimét (mmWave) được cấu hình thành hai mảng ăng ten, ngang và dọc. Tần số Modulated Continuous Wave (FMCW) và ăng ten tuyến tính được sử dụng cho việc truyền và nhận.

Bộ tạo của RFGAN nhận một khung nguồn làm lớp đầu vào, với bản đồ nhiệt sóng vô tuyến (được hợp nhất) điều khiển mạng thông qua chuẩn hóa ở cấp độ các lớp convolutional.

Dữ liệu

Dữ liệu được thu thập từ phản xạ tín hiệu RF từ ăng ten sóng milimét tại tần số 20hz, với video con người được chụp đồng thời tại tốc độ khung hình rất thấp 10fps. Chín cảnh trong nhà được chụp, sử dụng sáu tình nguyện viên, mỗi người mặc quần áo khác nhau cho các phiên của quá trình thu thập dữ liệu.

Kết quả là hai tập dữ liệu riêng biệt, RF-ActivityRF-Walk, tập đầu tiên chứa 68.860 hình ảnh của con người ở các vị trí khác nhau (như quỳđi bộ), cùng với 137.760 khung bản đồ nhiệt tương ứng; và tập thứ hai chứa 67.860 khung hình đi bộ ngẫu nhiên của con người, cùng với 135.720 cặp bản đồ nhiệt tương ứng.

Dữ liệu, theo quy ước, được chia không đều giữa đào tạo và kiểm tra, với 55.225 khung hình và 110.450 cặp bản đồ nhiệt được sử dụng cho đào tạo, và phần còn lại được giữ lại để kiểm tra. Khung hình RGB được thay đổi kích thước thành 320×180, và bản đồ nhiệt được thay đổi kích thước thành 201×160.

Mô hình được đào tạo với Adam tại tốc độ học nhất quán 0,0002 cho cả bộ tạo và bộ phân biệt, tại kỷ 80 và kích thước batch rất thưa (2). Quá trình đào tạo diễn ra thông qua PyTorch trên một GPU GTX-1080 tiêu dùng duy nhất, với 8gb VRAM thường được coi là khá khiêm tốn cho nhiệm vụ này (giải thích kích thước batch thấp).

Mặc dù các nhà nghiên cứu đã điều chỉnh một số metric thông thường để kiểm tra tính thực tế của đầu ra (chi tiết trong bài báo), và thực hiện các thử nghiệm loại bỏ thông thường, không có công việc tương đương trước đó để đo hiệu suất của RFGAN.

Sự quan tâm mở trong tín hiệu bí mật

RFGAN không phải là dự án đầu tiên cố gắng sử dụng tần số vô tuyến để xây dựng một hình ảnh thể tích của những gì đang xảy ra trong một phòng. Vào năm 2019, các nhà nghiên cứu từ MIT CSAIL đã phát triển một kiến trúc gọi là RF-Avatar, có khả năng tái tạo 3D con người dựa trên tín hiệu tần số vô tuyến trong phạm vi Wi-Fi, trong điều kiện che khuất nghiêm trọng.

Trong dự án MIT CSAIL từ năm 2019, sóng vô tuyến được sử dụng để loại bỏ che khuất, thậm chí bao gồm cả tường và quần áo, để tái tạo đối tượng được chụp trong một quy trình CGI truyền thống. Nguồn: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Trong dự án MIT CSAIL từ năm 2019, sóng vô tuyến được sử dụng để loại bỏ che khuất, thậm chí bao gồm cả tường và quần áo, để tái tạo đối tượng được chụp trong một quy trình CGI truyền thống. Nguồn: https://people.csail.mit.edu/mingmin/papers/rf-avatar.pdf

Các nhà nghiên cứu của bài báo mới cũng công nhận công việc trước đó liên quan đến việc lập bản đồ môi trường bằng sóng vô tuyến (không cố gắng tái tạo con người thực tế), nhằm đ估 tốc độ con người; xem qua tường với Wi-Fi; đánh giá tư thế con người; và thậm chí nhận dạng cử chỉ con người, trong số các mục tiêu khác.

Khả năng chuyển giao và ứng dụng rộng rãi hơn

Sau đó, các nhà nghiên cứu đã cố gắng xem liệu khám phá của họ có bị quá拟 hợp với môi trường ban đầu và hoàn cảnh đào tạo hay không, mặc dù bài báo cung cấp rất ít chi tiết về giai đoạn này của thí nghiệm. Họ khẳng định:

‘Để triển khai mô hình của chúng tôi trong một cảnh mới, chúng tôi không cần phải đào tạo lại toàn bộ mô hình từ đầu. Chúng tôi có thể tinh chỉnh mô hình RFGAN đã được đào tạo trước bằng rất ít dữ liệu (khoảng 40 giây dữ liệu) để có được kết quả tương tự.’

Và tiếp tục:

‘Hàm mất mát và siêu tham số là như nhau với giai đoạn đào tạo. Từ kết quả định lượng, chúng tôi thấy rằng mô hình RFGAN đã được đào tạo trước có thể tạo ra khung hình hoạt động của con người mong muốn trong cảnh mới sau khi tinh chỉnh với chỉ một ít dữ liệu, điều này có nghĩa là mô hình được đề xuất của chúng tôi có tiềm năng được sử dụng rộng rãi.’

Dựa trên chi tiết của bài báo về ứng dụng then chốt này của một kỹ thuật mới, không rõ liệu mạng mà các nhà nghiên cứu đã tạo ra có được ‘đào tạo phù hợp’ độc quyền cho các đối tượng ban đầu hay không, hoặc liệu bản đồ nhiệt RF có thể suy ra chi tiết như màu quần áo, vì điều này dường như nằm giữa hai loại tần số khác nhau liên quan đến phương pháp chụp quang học và sóng vô tuyến.

Dù thế nào, RFGAN là một cách mới để sử dụng sức mạnh bắt chước và đại diện của Mạng đối kháng sinh để tạo ra một hình thức giám sát mới và thú vị – một hình thức có thể hoạt động trong bóng tối và qua tường, theo cách thậm chí còn ấn tượng hơn so với các nỗ lực gần đây để nhìn quanh góc với ánh sáng phản chiếu.

 

 

8 tháng 12 năm 2021 (ngày đầu tiên được xuất bản), 8:04 chiều GMT+2 – loại bỏ từ lặp. – MA

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai