Modely a platformy AI

Nová technika pomáhá umělým inteligencím identifikovat 3D objekty

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Výzkumníci ze Severokarolínské univerzity vyvinuli novou techniku, která zlepšuje schopnost programů umělé inteligence (AI) identifikovat 3D objekty. Tato technika, nazvaná MonoCon, také pomáhá AI naučit se, jak se 3D objekty vztahují k sobě navzájem v prostoru pomocí 2D obrazů.

MonoCon by mohl mít široké spektrum aplikací, včetně pomoci autonomním vozidlům navigovat kolem ostatních vozidel pomocí 2D obrazů přijatých z palubní kamery. Může také hrát roli ve výrobě a robotice.

Tianfu Wu je hlavní autor výzkumné práce a asistent profesora elektrotechniky a počítačového inženýrství na Severokarolínské univerzitě.

“Žijeme ve 3D světě, ale když pořizujeme fotografii, zaznamenává se tento svět ve 2D obraze,” říká Wu.

“Programy AI přijímají vizuální vstup z kamer. Pokud chceme, aby AI interagovaly se světem, musíme zajistit, aby byly schopny interpretovat, co 2D obrazy říkají o 3D prostoru. V tomto výzkumu se zaměřujeme na jednu část této výzvy: jak můžeme zajistit, aby AI přesně rozpoznala 3D objekty – jako lidi nebo auta – v 2D obrazech a umístila tyto objekty do prostoru,” pokračuje Wu.

Autonomní vozidla

Autonomní vozidla často spoléhají na lidar k navigaci v 3D prostoru. Lidar, který používá lasery k měření vzdálenosti, je drahý, což znamená, že autonomní systémy neobsahují mnoho redundance. Umístit desítky lidarových senzorů na sériově vyráběné vozidlo by bylo neuvěřitelně drahé.

“Ale pokud by autonomní vozidlo mohlo použít vizuální vstup k navigaci skrz prostor, bylo by možné vestavět redundanci,” říká Wu. “Protože kamery jsou podstatně levnější než lidar, bylo by ekonomicky proveditelné zahrnout další kamery – vestavět redundanci do systému a učinit jej bezpečnějším a robustnějším.

“To je jeden praktický aplikací. Jsme však také nadšeni z fundamentálního pokroku této práce: že je možné získat 3D data z 2D objektů.”

Školení AI

MonoCon může identifikovat 3D objekty v 2D obrazech předtím, než je umístí do “bounding boxu”, který AI říká vnější okraje objektu.

“To, co odlišuje naší práci, je způsob, jakým školení AI, který vychází z předchozích školicích technik,” říká Wu. “Stejně jako předchozí úsilí, umístíme objekty do 3D bounding boxů během školení AI. Kromě toho, nežádáme AI, aby předpověděla kameru-objekt vzdálenost a rozměry bounding boxů, také žádáme AI, aby předpověděla umístění každého z osmi bodů boxu a jeho vzdálenost od středu bounding boxu ve dvou dimenzích. Nazýváme to “auxiliary context” a zjistili jsme, že pomáhá AI přesněji identifikovat a předpovědět 3D objekty na základě 2D obrazů.

“Navrhovaná metoda je motivována dobře známým teoremem v teorie míry, Cramér-Wold teorem. Je také potenciálně aplikovatelná na další strukturované výstupní úkoly v počítačovém vidění.”

MonoCon byl testován s široce používanou benchmark datovou sadou nazvanou KITTI.

“V době, kdy jsme podali tuto práci, MonoCon vykázal lepší výsledky než desítky dalších AI programů zaměřených na extrakci 3D dat o automobilech z 2D obrazů,” říká Wu.

Tým se nyní bude snažit rozšířit proces s většími datovými sadami.

“Pohybujeme se vpřed, škálováním tohoto procesu a pracujeme s většími datovými sadami, abychom mohli vyhodnotit a vyladit MonoCon pro použití v autonomním řízení,” říká Wu. “Chceme také prozkoumat aplikace ve výrobě, abychom zjistili, zda můžeme zlepšit výkon úkolů, jako je použití robotických ramen.”

Alex McFarland je AI novinář a spisovatel, který zkoumá nejnovější vývoj v oblasti umělé inteligence. Spolupracoval s mnoha AI startupy a publikacemi po celém světě.