Góc nhìn Anderson

Trí tuệ nhân tạo tiết lộ hoạt động bí mật được tiết lộ bởi tường trống

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một sự hợp tác nghiên cứu, bao gồm các đóng góp từ NVIDIA và MIT, đã phát triển một phương pháp học máy có thể xác định người ẩn chỉ bằng cách quan sát ánh sáng gián tiếp trên tường gần đó, ngay cả khi những người đó không ở gần nguồn ánh sáng. Phương pháp này có độ chính xác gần 94% khi cố gắng xác định số lượng người ẩn, và cũng có thể xác định hoạt động cụ thể của một người ẩn bằng cách khuếch đại mạnh mẽ các phản xạ ánh sáng không thể nhìn thấy bằng mắt thường và các phương pháp khuếch đại hình ảnh tiêu chuẩn.

Các biến đổi ánh sáng không đáng kể, được khuếch đại bởi phương pháp mới, sử dụng mạng nơ-ron tích chập để xác định các khu vực thay đổi. Nguồn: https://www.youtube.com/watch?v=K4PapXyX-bI

Các biến đổi ánh sáng không đáng kể, được khuếch đại bởi phương pháp mới, sử dụng mạng nơ-ron tích chập để xác định các khu vực thay đổi. Nguồn: https://www.youtube.com/watch?v=K4PapXyX-bI

Bài báo mới này có tiêu đề Điều bạn có thể học được bằng cách nhìn vào tường trống, với các đóng góp từ NVIDIA và MIT, cũng như Viện Công nghệ Israel.

Các phương pháp trước đây để ‘nhìn thấy xung quanh tường’ đã dựa vào nguồn ánh sáng có thể điều khiển, hoặc kiến thức trước về các nguồn che khuất đã biết, trong khi kỹ thuật mới này có thể tổng quát hóa cho bất kỳ phòng nào mới, không yêu cầu hiệu chỉnh lại. Hai mạng nơ-ron tích chập xác định người ẩn sử dụng dữ liệu thu được từ chỉ 20 cảnh.

Dự án này nhằm vào các tình huống an ninh quan trọng, cao rủi ro, cho các hoạt động tìm kiếm và cứu hộ, nhiệm vụ giám sát an ninh chung, các kịch bản ứng phó khẩn cấp, để phát hiện ngã ở người già, và như một phương tiện để phát hiện người đi bộ ẩn cho xe tự hành.

Đánh giá thụ động

Như thường lệ với các dự án tầm nhìn máy tính, nhiệm vụ trung tâm là xác định, phân loại và vận hành các thay đổi trạng thái được nhận thức trong dòng hình ảnh. Nối các thay đổi này dẫn đến các mẫu đặc trưng có thể được sử dụng để xác định số lượng cá nhân hoặc phát hiện hoạt động của một hoặc nhiều cá nhân.

Công việc này mở ra khả năng đánh giá cảnh thụ động hoàn toàn, không cần sử dụng bề mặt phản chiếu, tín hiệu Wi-Fi, radar, âm thanh hoặc bất kỳ ‘điều kiện đặc biệt’ nào khác được yêu cầu trong các nỗ lực nghiên cứu gần đây nhằm thiết lập sự hiện diện của con người ẩn trong một môi trường nguy hiểm hoặc quan trọng.

Một kịch bản thu thập dữ liệu mẫu của loại được sử dụng cho nghiên cứu mới. Các đối tượng được đặt cẩn thận để không tạo bóng hoặc che khuất trực tiếp bất kỳ nguồn ánh sáng nào, và không có bề mặt phản chiếu hoặc 'vector gian lận' nào khác được phép. Nguồn: https://arxiv.org/pdf/2108.13027.pdf

Một kịch bản thu thập dữ liệu mẫu của loại được sử dụng cho nghiên cứu mới. Các đối tượng được đặt cẩn thận để không tạo bóng hoặc che khuất trực tiếp bất kỳ nguồn ánh sáng nào, và không có bề mặt phản chiếu hoặc ‘vector gian lận’ nào khác được phép. Nguồn: https://arxiv.org/pdf/2108.13027.pdf

Hiệu quả, ánh sáng môi trường cho kịch bản điển hình dự kiến cho ứng dụng sẽ áp đảo bất kỳ sự xáo trộn ánh sáng nhỏ nào gây ra bởi ánh sáng phản chiếu từ người ẩn ở nơi khác trong cảnh. Các nhà nghiên cứu tính toán rằng sự đóng góp xáo trộn ánh sáng của các cá nhân sẽ thường nhỏ hơn 1% tổng ánh sáng nhìn thấy.

Loại bỏ ánh sáng tĩnh

Để trích xuất chuyển động từ hình ảnh tường tĩnh có vẻ, cần phải tính toán giá trị trung bình thời gian của video và loại bỏ nó khỏi mỗi khung hình. Các mẫu chuyển động kết quả thường nằm dưới ngưỡng nhiễu của thậm chí thiết bị video chất lượng tốt, và trên thực tế, hầu hết chuyển động xảy ra trong không gian pixel âm.

Để khắc phục điều này, các nhà nghiên cứu giảm mẫu video bằng một yếu tố 16 và tăng kích thước footage kết quả bằng một yếu tố 50, đồng thời thêm một mức cơ sở màu xám trung bình để phân biệt sự hiện diện của pixel âm (không thể được tính toán bởi nhiễu cảm biến video cơ bản).

Sự khác biệt giữa tường được con người nhận thức và sự xáo trộn của các cá nhân ẩn. Vì chất lượng hình ảnh là một vấn đề trung tâm trong nghiên cứu này, vui lòng tham khảo video chính thức ở cuối bài viết để có hình ảnh chất lượng cao hơn.

Sự khác biệt giữa tường được con người nhận thức và sự xáo trộn của các cá nhân ẩn. Vì chất lượng hình ảnh là một vấn đề trung tâm trong nghiên cứu này, vui lòng tham khảo video chính thức ở cuối bài viết để có hình ảnh chất lượng cao hơn.

Cửa sổ cơ hội để nhận thức chuyển động rất mong manh, và có thể bị ảnh hưởng thậm chí bởi sự nhấp nháy của đèn ở tần số 60 Hz AC. Do đó, sự xáo trộn tự nhiên này cũng phải được đánh giá và loại bỏ khỏi footage trước khi chuyển động do người gây ra sẽ xuất hiện.

Cuối cùng, hệ thống tạo ra các đồ thị không gian-thời gian cho thấy một số lượng cụ thể các cư dân trong phòng ẩn – các chữ ký trực quan rời rạc:

Các đồ thị không gian-thời gian đặc trưng đại diện cho các số lượng người ẩn khác nhau trong một phòng.

Các đồ thị không gian-thời gian đặc trưng đại diện cho các số lượng người ẩn khác nhau trong một phòng.

Các hoạt động khác nhau của con người cũng sẽ dẫn đến các xáo trộn đặc trưng có thể được phân loại và nhận ra:

Các đồ thị không gian-thời gian đặc trưng cho không hoạt động, đi bộ, quỳ, vẫy tay và nhảy.

Các đồ thị không gian-thời gian đặc trưng cho không hoạt động, đi bộ, quỳ, vẫy tay và nhảy.

Để tạo ra một quy trình học máy tự động cho việc nhận biết người ẩn, các đoạn footage đa dạng từ 20 kịch bản phù hợp đã được sử dụng để đào tạo hai mạng nơ-ron hoạt động trên các cấu hình tương tự – một để đếm số lượng người trong cảnh và một để xác định bất kỳ chuyển động nào xảy ra.

Thử nghiệm

Các nhà nghiên cứu đã thử nghiệm hệ thống đã được đào tạo trong mười môi trường thực tế không nhìn thấy được thiết kế để tái tạo các hạn chế dự kiến cho việc triển khai cuối cùng. Hệ thống đã đạt được độ chính xác lên đến 94,4% (trong 256 khung – thường là khoảng 8 giây video) trong việc phân loại số lượng người ẩn, và lên đến 93,7% độ chính xác (trong cùng điều kiện) trong việc phân loại hoạt động. Mặc dù độ chính xác giảm với ít khung hơn, nhưng nó không giảm tuyến tính, và thậm chí 64 khung sẽ đạt được tốc độ chính xác 79,4% cho việc đánh giá ‘số lượng người’ (so với gần 95% cho bốn lần số khung hình).

Mặc dù phương pháp này robust với các thay đổi về ánh sáng dựa trên thời tiết, nhưng nó gặp khó khăn trong một cảnh được chiếu sáng bởi truyền hình, hoặc trong trường hợp những người đó mặc quần áo đơn sắc cùng màu với tường phản chiếu.

Chi tiết hơn về nghiên cứu, bao gồm cả đoạn footage chất lượng cao hơn của các sự trích xuất, có thể được xem trong video chính thức dưới đây.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai