Mô hình và nền tảng AI

Kỹ Thuật Mới Giúp Trí Tuệ Nhân Tạo Xác Định Đối Tượng 3D

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một kỹ thuật mới được phát triển bởi các nhà nghiên cứu tại Đại học North Carolina State giúp cải thiện khả năng của các chương trình trí tuệ nhân tạo (AI) trong việc xác định đối tượng 3D. Kỹ thuật này, được gọi là MonoCon, cũng giúp AI học cách các đối tượng 3D liên quan đến nhau trong không gian bằng cách sử dụng hình ảnh 2D.

MonoCon có thể có nhiều ứng dụng rộng rãi, bao gồm giúp xe tự hành điều hướng xung quanh các xe khác bằng cách sử dụng hình ảnh 2D nhận được từ camera trên xe. Nó cũng có thể đóng vai trò trong sản xuất và robot.

Tianfu Wu là tác giả chính của bài báo nghiên cứu và là giáo sư trợ lý về kỹ thuật điện và máy tính tại Đại học North Carolina State.

“Chúng ta sống trong một thế giới 3D, nhưng khi bạn chụp một bức ảnh, nó ghi lại thế giới đó trong hình ảnh 2D,” Wu nói.

“Các chương trình AI nhận đầu vào trực quan từ camera. Vì vậy, nếu chúng ta muốn AI tương tác với thế giới, chúng ta cần đảm bảo rằng nó có thể giải thích những gì hình ảnh 2D có thể cho nó biết về không gian 3D. Trong nghiên cứu này, chúng tôi tập trung vào một phần của thách thức đó: làm thế nào chúng ta có thể giúp AI nhận ra chính xác đối tượng 3D – như người hoặc xe – trong hình ảnh 2D và đặt những đối tượng đó trong không gian,” Wu tiếp tục.

Xe Tự Hành

Xe tự hành thường dựa vào lidar để điều hướng trong không gian 3D. Lidar, sử dụng laser để đo khoảng cách, rất tốn kém, có nghĩa là các hệ thống tự hành không bao gồm nhiều dư thừa. Để đặt hàng chục cảm biến lidar trên một xe tự hành sản xuất hàng loạt sẽ rất tốn kém.

“Nhưng nếu một xe tự hành có thể sử dụng đầu vào trực quan để điều hướng trong không gian, bạn có thể xây dựng sự dư thừa,” Wu nói. “Bởi vì camera ít tốn kém hơn lidar, sẽ có thể xây dựng sự dư thừa vào hệ thống và làm cho nó an toàn và mạnh mẽ hơn.

“Đó là một ứng dụng thực tế. Tuy nhiên, chúng tôi cũng rất hào hứng về tiến bộ cơ bản của công việc này: đó là có thể lấy dữ liệu 3D từ đối tượng 2D.”

Đào Tạo Trí Tuệ Nhân Tạo

MonoCon có thể xác định đối tượng 3D trong hình ảnh 2D trước khi đặt chúng trong một “hộp giới hạn,” cho AI biết các cạnh ngoài của đối tượng.

“Điều gì làm cho công việc của chúng tôi khác biệt là cách chúng tôi đào tạo AI, xây dựng trên các kỹ thuật đào tạo trước đó,” Wu nói. “Giống như các nỗ lực trước đó, chúng tôi đặt đối tượng trong hộp giới hạn 3D trong khi đào tạo AI. Tuy nhiên, ngoài việc yêu cầu AI dự đoán khoảng cách từ camera đến đối tượng và kích thước của hộp giới hạn, chúng tôi cũng yêu cầu AI dự đoán vị trí của từng điểm của hộp và khoảng cách từ trung tâm của hộp giới hạn trong hai chiều. Chúng tôi gọi đây là ‘bối cảnh phụ,’ và chúng tôi thấy rằng nó giúp AI xác định và dự đoán đối tượng 3D dựa trên hình ảnh 2D chính xác hơn.

“Phương pháp đề xuất được thúc đẩy bởi một định lý nổi tiếng trong lý thuyết đo lường, định lý Cramér-Wold. Nó cũng có thể áp dụng cho các nhiệm vụ dự đoán đầu ra cấu trúc khác trong thị giác máy tính.”

MonoCon đã được thử nghiệm với một tập dữ liệu chuẩn rộng rãi được gọi là KITTI.

“Vào thời điểm chúng tôi gửi bài báo này, MonoCon đã hoạt động tốt hơn bất kỳ chương trình AI nào khác nhằm trích xuất dữ liệu 3D về ô tô từ hình ảnh 2D,” Wu nói.

Đội ngũ sẽ hiện đang mở rộng quy trình này với các tập dữ liệu lớn hơn.

“Chúng tôi sẽ mở rộng quy trình này và làm việc với các tập dữ liệu lớn hơn để đánh giá và tinh chỉnh MonoCon cho sử dụng trong lái xe tự hành,” Wu nói. “Chúng tôi cũng muốn khám phá các ứng dụng trong sản xuất, để xem liệu chúng tôi có thể cải thiện hiệu suất của các nhiệm vụ như sử dụng cánh tay robot.”

Alex McFarland là một nhà báo và nhà văn về trí tuệ nhân tạo, khám phá những phát triển mới nhất trong lĩnh vực trí tuệ nhân tạo. Ông đã hợp tác với nhiều công ty khởi nghiệp và xuất bản về trí tuệ nhân tạo trên toàn thế giới.