Lãnh đạo tư tưởng

Định vị Người dùng Trong nhà Sử dụng Nhận dạng Địa điểm Hình ảnh

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Nhận dạng địa điểm hình ảnh là một trong những nền tảng của phát triển tầm nhìn máy tính và robot. Nhiệm vụ của các thuật toán VPR là xác định các vị trí được kiểm tra dựa trên hình ảnh. Công nghệ này có thể hỗ trợ robot tự động và lực lượng lao động con người, xác định môi trường xung quanh và tạo điều kiện cho việc thực hiện các hành động mong muốn.

Các nhà nghiên cứu tại NeuroSYS sử dụng các thuật toán tầm nhìn máy tính như một phần của nền tảng AR được phát triển, Nsflow, cho phép hướng dẫn công việc tương tác và đào tạo thực hành để xác định vị trí người dùng trong khi đào tạo tại chỗ. Trong trường hợp này, việc sử dụng VPR dẫn đến sự tăng tốc đáng kể của quá trình đào tạo và học tập do giảm nhu cầu đào tạo và giám sát trước.

Tìm kiếm một người hoặc tìm kiếm địa điểm mong muốn sử dụng GPS đã là cũ. Nhưng làm thế nào khi hệ thống định vị dựa trên vệ tinh không hoạt động? Hệ thống định vị trong nhà (IPS) đang đến để cứu giúp.

Khi tìm kiếm một chiếc kim trong một đống rơm, bạn có thể sử dụng các kỹ thuật khác nhau, bao gồm cả tín hiệu, định vị từ, đơn vị đo lường quán tính (IMU) với gia tốc kế và con quay hồi chuyển, đo chuyển động từ điểm cuối cùng, định vị dựa trên Wi-Fi hoặc đơn giản là sử dụng các dấu hiệu hình ảnh.

Tất cả các phương pháp trên đều có những hạn chế (ví dụ: cần cài đặt dấu hiệu hoặc tín hiệu, IMU tăng lỗi đo lường theo thời gian và yêu cầu định vị lại), vượt quá lợi ích của chúng. Giải pháp cho vấn đề then chốt – vị trí người dùng chung với độ chính xác đến vài mét – nằm trong phạm vi của các thuật toán.

Quá trình nhận dạng địa điểm dựa trên một thủ tục hai bước, tạo ra hai cơ sở dữ liệu. Ban đầu, địa điểm mục tiêu được chụp ảnh và một số mục, điểm đánh dấu, được đánh dấu bởi một bộ phát hiện tính năng để xác định các yếu tố đặc trưng của khu vực. Sau đó, các điểm đã được gắn nhãn được so sánh với một hình ảnh tham chiếu. Khi các điểm đánh dấu được đánh giá là đủ tương似 bởi một bộ trùng khớp tính năng, hình ảnh đủ điều kiện để hiển thị cùng một địa điểm.

Cơ sở dữ liệu hình ảnh kết hợp các hình ảnh của các vị trí mục tiêu, trong trường hợp này là không gian làm việc, và một tập hợp các thuộc tính của chúng, bao gồm cả mã định danh duy nhất, sau đó là mô tả cục bộ và toàn cầu. Tập hợp khác, cơ sở dữ liệu phòng, khớp các điểm đánh dấu riêng lẻ với các khu vực nhất định trong không gian được xem xét.

Sử dụng SuperPoint, SuperGlue và mạng nơ-ron netVLAD từ lĩnh vực nhận dạng địa điểm hình ảnh, các nhà nghiên cứu đã sử dụng quá trình trên trong việc định vị người dùng. Các mạng nơ-ron sâu, SuperPoint và SuperGlue, hợp tác trong việc phát hiện và trùng khớp tính năng, trích xuất thông tin từ các cơ sở dữ liệu.

Các mô tả toàn cầu bước vào sân khấu

Quá trình này yêu cầu các mô tả toàn cầu, đóng vai trò là các vector phân biệt địa điểm, xác định các khu vực mà không có sự mơ hồ. Để thực hiện vai trò của mình, các vector nên không phụ thuộc vào ánh sáng và điểm nhìn – không phụ thuộc vào góc nhìn và điều kiện ánh sáng, các mô tả toàn cầu nên không để lại sự mơ hồ khi phân biệt các địa điểm trong các hình ảnh khác nhau.

Ngoài ra, các đối tượng biến đổi trong khu vực quan tâm không nên bị ràng buộc bởi các mô tả toàn cầu như các tính năng phân biệt địa điểm. Các mục như đồ nội thất và thiết bị dễ bị thay đổi (tái trang trí, tháo dỡ), có nghĩa là chúng không thể xác định các khu vực thông qua sự hiện diện của chúng.

Nhận dạng địa điểm dựa trên tầm nhìn máy tính sử dụng các yếu tố cố định của các vị trí được kiểm tra, như cửa, cửa sổ, cầu thang và các mục đặc trưng khác của bản chất lâu dài. Trong quá trình nghiên cứu này, mạng nơ-ron sâu NetVLAD đã được sử dụng để tính toán, trình bày, như một kết quả, các vector đáp ứng các yêu cầu đặt ra. Trong quá trình trùng khớp mô tả toàn cầu, các hình ảnh của các vector tương tự nhất được xử lý, sau khi tính toán khoảng cách giữa mỗi điểm neo đặc trưng.

Khi xử lý hai cơ sở dữ liệu – cơ sở dữ liệu phòng và cơ sở dữ liệu khác chứa các điểm đánh dấu và mô tả toàn cầu – hệ thống xử lý các thuộc tính của hình ảnh. Sau khi thực hiện ước tính sự tương似 và khoảng cách ngắn nhất, mạng nơ-ron thứ hai, SuperGlue, xác định hình ảnh vị trí. Hệ thống sử dụng VPR cho phép định vị người dùng dựa trên số lượng điểm đánh dấu trùng khớp.

Các thuật toán đã tìm thấy ứng dụng trong nền tảng AI & AR, giúp người dùng thực hiện đào tạo với kính thông minh. VPR cho phép định vị người dùng trong nơi làm việc, khởi chạy các hướng dẫn và hướng dẫn phù hợp được gán cho các điểm cụ thể, cải thiện an toàn và giảm nhu cầu giám sát trực tiếp.

Dự án được tài trợ bởi các quỹ của Liên minh Châu Âu trong khuôn khổ Chương trình Hoạt động Smart Growth. Dự án được thực hiện trong khuôn khổ Trung tâm Nghiên cứu và Phát triển Quốc gia: Fast Track.

Jowita Kessler là một người đam mê công nghệ có trụ sở tại Ba Lan, làm việc như một chuyên gia tiếp thị nội dung tại NeuroSYS. Người đọc và viết cuồng nhiệt, dành để xóa bỏ rào cản giữa nhân văn và công nghệ. Riêng tư: người mơ mộng ban ngày và đi dạo ban đêm, người hâm mộ mèo và dơi.