Góc nhìn Anderson

Tạo Bản Đồ Đường Dẫn cho Người Mù với Học Máy

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nghiên cứu mới từ Đức cung cấp một hệ thống di động, chạy bằng GPU, giúp người khiếm thị điều hướng trong thế giới thực. Hệ thống này giải quyết một trong những thách thức cốt lõi trong các khung công việc tầm nhìn máy tính thời gian thực – việc xác định các chướng ngại vật trong suốt như kính.

Bài báo từ Viện Công nghệ Karlsruhe, mô tả việc xây dựng một hệ thống đeo trên người, gọi là Trans4Trans, bao gồm một cặp kính thông minh kết nối với hộp GPU di động, hiệu quả là một chiếc laptop nhẹ, thu nhận hình ảnh RGB và độ sâu ở độ phân giải 640×480 pixel trong một dòng liên tục, sau đó được chạy qua một khung công việc phân đoạn ngữ nghĩa.

Cảm biến di động trong bộ Trans4Trans. Nguồn: https://arxiv.org/pdf/2107.03172.pdf

Cảm biến di động trong bộ Trans4Trans. Nguồn: https://arxiv.org/pdf/2107.03172.pdf

Khả năng phản hồi cảm biến của hệ thống được tăng cường bởi một cặp tai nghe dẫn xương, phát ra phản hồi âm thanh khi gặp chướng ngại vật trong môi trường.

Hệ thống Trans4Trans cũng đã được thử nghiệm trên thiết bị thực tế ảo HoloLens 2 của Microsoft, đạt được phân đoạn hoàn chỉnh và nhất quán (tức là nhận dạng) các chướng ngại vật nguy hiểm như cửa kính.

Trans4Trans chạy trên HoloLens 2.

Trans4Trans chạy trên HoloLens 2.

Kiến Trúc

Trans4Trans sử dụng một phương pháp kép, tận dụng cả mã hóa và giải mã dựa trên transformer, và tận dụng mô块 ghép transformer (TPM) độc quyền, có khả năng thu thập bản đồ tính năng được tạo ra bởi các phân vùng dày đặc, trong khi giải mã dựa trên transformer có thể phân tích bản đồ tính năng từ mã hóa của nó một cách nhất quán.

Kiến trúc của Trans4Trans.

Kiến trúc của Trans4Trans.

Mỗi mô-đun TPM bao gồm một lớp transformer-based, thiết yếu cho việc tiêu thụ tài nguyên thấp và tính di động của hệ thống. Bộ giải mã chứa bốn giai đoạn đối xứng cho bộ mã hóa, với một mô-đun TPM được gán cho mỗi mô-đun. Hệ thống tiết kiệm tài nguyên bằng cách tích hợp chức năng của nhiều phương pháp vào một hệ thống nhất quán, thay vì triển khai hai mô hình riêng biệt trong một luồng công việc tuyến tính.

Phần Cứng

Kính thông minh được sử dụng trong hệ thống bao gồm cảm biến RGB-D RealSense R200, trong khi máy chủ chứa bộ xử lý đồ họa NVIDIA Jetson AGX Xavier, được thiết kế cho hệ thống nhúng, và có 384 lõi CUDA của NVIDIA và 48 lõi Tensor.

Cảm biến R200 cung cấp định dạng điểm và ghép stereo thụ động, làm cho nó phù hợp cho cả môi trường trong nhà và ngoài trời. Cơ sở định dạng điểm đặc biệt có lợi khi đánh giá bề mặt trong suốt, vì nó tăng cường và làm rõ dữ liệu hình ảnh đầu vào mà không bị che khuất bởi nguồn sáng cực đoan. Khả năng hồng ngoại của cảm biến cũng giúp nhận được hình dạng và hình học riêng biệt, cũng như tạo ra bản đồ độ sâu có thể hành động, điều này rất quan trọng cho việc tránh chướng ngại vật, trong khuôn khổ mục tiêu của dự án.

Ngăn Chặn Quá Tải Nhận Thức cho Người Dùng

Hệ thống cần phải cân bằng giữa tần suất dữ liệu đủ và thông tin quá mức, vì người đeo cần phải có thể phân biệt môi trường một cách nhất quán thông qua phản hồi âm thanh và rung.
Do đó, Trans4Trans hạn chế nhân tạo lượng dữ liệu phản hồi, với một ngưỡng mặc định được đặt ở một mét, thay vì buộc người dùng phải học một loạt các cài đặt rung tương ứng với khoảng cách khác nhau của các vật thể và chướng ngại vật.

Thử Nghiệm Trans4Trans

Hệ thống Trans4Trans đã được thử nghiệm trên hai tập dữ liệu liên quan đến phân đoạn các vật thể trong suốt: Trans10K-V2, từ Đại học Hồng Kông và các đồng nghiệp, chứa 10.428 hình ảnh của các vật thể trong suốt để xác thực, đào tạo và thử nghiệm; và tập dữ liệu Stanford2D3D, chứa 70.496 hình ảnh của các vật thể trong suốt hỗn hợp, được chụp ở độ phân giải 1080×1080.

Hình ảnh và mặt nạ tương ứng từ tập dữ liệu Trans10k. Nguồn: https://arxiv.org/pdf/2101.08461.pdf

Hình ảnh và mặt nạ tương ứng từ tập dữ liệu Trans10k. Nguồn: https://arxiv.org/pdf/2101.08461.pdf

Hệ thống Stanford2D3D hoạt động. Nguồn: http://buildingparser.stanford.edu/dataset.html

Hệ thống Stanford2D3D hoạt động. Nguồn: http://buildingparser.stanford.edu/dataset.html

Trong thử nghiệm, Trans4Trans cũng có khả năng phân đoạn các vật thể trong suốt bị phân loại sai bởi Trans2Seg đề xuất được phát hành vào đầu năm 2021 bởi cùng một nhóm nghiên cứu, trong khi yêu cầu ít phép tính GFLOPS hơn để tính toán và phân đoạn bề mặt.

Không giống như Trans2Seq, sử dụng mã hóa dựa trên CNN và giải mã dựa trên transformer, Trans4Trans sử dụng kiến trúc mã hóa-giải mã dựa trên transformer, vượt qua phương pháp trước đó và cũng cải thiện đáng kể so với PVT.

Thuật toán cũng đạt được kết quả tốt nhất trong một số lớp trong suốt, bao gồm lọ, cửa sổ, cửa, ly, hộpchai.

Nhà văn về học máy, chuyên gia lĩnh vực tổng hợp hình ảnh con người. Cựu trưởng nhóm nội dung nghiên cứu tại Metaphysic.ai, cho đến khi nó được併 nhập vào Brahma.ai của DNEG.
Portfolio site: martinanderson.ai
Contact: martin@martinanderson.ai