Modele i platformy AI
Nowa technika pomaga sztucznej inteligencji identyfikować obiekty 3D

Naukowcy z Uniwersytetu Stanu Karolina Północna opracowali nową technikę, która poprawia zdolność programów sztucznej inteligencji (AI) do identyfikowania obiektów 3D. Technika ta, nazwana MonoCon, pomaga również AI uczyć się, jak obiekty 3D są względem siebie w przestrzeni, używając obrazów 2D.
MonoCon może mieć szeroki zakres zastosowań, w tym pomoc w nawigowaniu pojazdów autonomicznych wokół innych pojazdów, używając obrazów 2D otrzymanych z kamery na pokładzie. Może również odegrać rolę w produkcji i robotyce.
Tianfu Wu jest współautorem artykułu badawczego i adiunktem na wydziale elektrotechniki i informatyki na Uniwersytecie Stanu Karolina Północna.
“Żyjemy w świecie 3D, ale gdy robimy zdjęcie, jest ono zapisywane w postaci obrazu 2D”, mówi Wu.
“Programy AI otrzymują dane wizualne z kamer. Jeśli chcemy, aby AI wchodziło w interakcje ze światem, musimy upewnić się, że potrafi interpretować to, co obrazy 2D mogą mu powiedzieć o przestrzeni 3D. W tym badaniu koncentrujemy się na jednej części tego wyzwania: jak możemy uzyskać, aby AI dokładnie rozpoznawało obiekty 3D – takie jak ludzie lub samochody – w obrazach 2D i umieszczało te obiekty w przestrzeni”, kontynuuje Wu.
Pojazdy autonomiczne
Pojazdy autonomiczne często polegają na lidarze do nawigowania w przestrzeni 3D. Lidar, który używa laserów do pomiaru odległości, jest drogi, co oznacza, że systemy autonomiczne nie zawierają wielu redundancji. Umieszczenie kilkudziesięciu czujników lidarowych na produkowanym seryjnie samochodzie bez kierowcy byłoby niezwykle drogie.
“Ale jeśli pojazd autonomiczny mógłby używać danych wizualnych do nawigowania w przestrzeni, można by wprowadzić redundancję”, mówi Wu. “Ponieważ kamery są znacznie tańsze niż lidar, byłoby to ekonomicznie uzasadnione, aby uwzględnić dodatkowe kamery – wprowadzając redundancję do systemu i czyniąc go bezpieczniejszym i bardziej niezawodnym.
“To jest jeden z praktycznych zastosowań. Jednak jesteśmy również podekscytowani podstawowym postępem tej pracy: tym, że jest możliwe uzyskanie danych 3D z obiektów 2D”.
Szkolenie AI
MonoCon może identyfikować obiekty 3D w obrazach 2D, zanim umieści je w “bounding box”, który informuje AI o zewnętrznych krawędziach obiektu.
“To, co odróżnia naszą pracę, to sposób, w jaki szkolimy AI, który opiera się na poprzednich technikach szkolenia”, mówi Wu. “Podobnie jak poprzednie wysiłki, umieszczamy obiekty w 3D bounding boxach podczas szkolenia AI. Jednak oprócz tego, że prosimy AI o przewidzenie odległości od kamery do obiektu i wymiarów bounding boxów, prosimy AI również o przewidzenie położenia każdego z ośmiu punktów i jego odległości od środka bounding boxu w dwóch wymiarach. Nazywamy to “auxiliary context” i stwierdziliśmy, że pomaga AI dokładniej identyfikować i przewidywać obiekty 3D na podstawie obrazów 2D.
“Metoda ta jest zainspirowana znanym twierdzeniem z teorii miary, twierdzeniem Craméra-Wolda. Może być również stosowana do innych zadań predykcji danych wyjściowych w zadaniach komputerowego widzenia.”
MonoCon został przetestowany z powszechnie używanym zestawem danych benchmarkowych o nazwie KITTI.
“W momencie, gdy złożyliśmy ten artykuł, MonoCon działał lepiej niż jakikolwiek inny program AI, którego celem było wyodrębnienie danych 3D o samochodach z obrazów 2D”, mówi Wu.
Zespół będzie teraz starał się skalować ten proces z większymi zestawami danych.
“Przechodzimy do przodu, skalując to i pracując z większymi zestawami danych, aby ocenić i udoskonalić MonoCon do użytku w pojazdach autonomicznych”, mówi Wu. “Chcemy również zbadać zastosowania w produkcji, aby zobaczyć, czy możemy poprawić wydajność zadań, takich jak używanie ramion robota.”












