Modele și platforme AI
O tehnică nouă ajută inteligența artificială să identifice obiecte 3D

O tehnică nouă dezvoltată de cercetători de la Universitatea de Stat din Carolina de Nord îmbunătățește capacitatea programelor de inteligență artificială (IA) de a identifica obiecte 3D. Tehnica, numită MonoCon, ajută de asemenea IA să învețe cum obiectele 3D se relaționează între ele în spațiu, utilizând imagini 2D.
MonoCon ar putea avea o varietate largă de aplicații, inclusiv ajutarea vehiculelor autonome să navigheze în jurul altor vehicule, utilizând imagini 2D primite de la o cameră de bord. De asemenea, ar putea juca un rol în fabricație și robotică.
Tianfu Wu este autorul corespondent al articolului de cercetare și profesor asistent de inginerie electrică și informatică la Universitatea de Stat din Carolina de Nord.
“Trăim într-o lume 3D, dar atunci când faci o fotografie, ea înregistrează lumea într-o imagine 2D”, spune Wu.
“Programele de IA primesc intrări vizuale de la camere. Așadar, dacă vrem ca IA să interacționeze cu lumea, trebuie să ne asigurăm că poate interpreta ceea ce imaginile 2D îi pot spune despre spațiul 3D. În această cercetare, ne concentrăm pe o parte a acestei provocări: cum putem face IA să recunoască cu acuratețe obiecte 3D – cum ar fi oameni sau mașini – în imagini 2D și să le plaseze în spațiu”, continuă Wu.
Vehicule autonome
Vehiculele autonome se bazează adesea pe lidar pentru a naviga în spațiu 3D. Lidarul, care utilizează laseri pentru a măsura distanța, este scump, ceea ce înseamnă că sistemele autonome nu includ multă redundanță. Plasarea a zeci de senzori lidar pe o mașină fără șofer ar fi incredibil de scumpă.
“Dar dacă un vehicul autonom ar putea utiliza intrări vizuale pentru a naviga prin spațiu, ar putea construi redundanță”, spune Wu. “Deoarece camerele sunt semnificativ mai ieftine decât lidarul, ar fi fezabil din punct de vedere economic să includă camere suplimentare – construind redundanță în sistem și făcându-l atât mai sigur, cât și mai robust.
“Acesta este un aplicativ practic. Cu toate acestea, suntem și entuziasmați de progresul fundamental al acestei lucrări: că este posibil să obținem date 3D din obiecte 2D.”
Antrenarea IA
MonoCon poate identifica obiecte 3D în imagini 2D înainte de a le plasa într-o “cutie de delimitare”, care spune IA marginile exterioare ale obiectului.
“Ceea ce ne diferențiază munca este modul în care antrenăm IA, care se bazează pe tehnici de antrenare anterioare”, spune Wu. “La fel ca și eforturile anterioare, plasăm obiecte în cutii de delimitare 3D în timpul antrenării IA. Cu toate acestea, în plus față de a cere IA să prevadă distanța dintre cameră și obiect și dimensiunile cutiilor de delimitare, cerem IA să prevadă și locațiile fiecărui punct al cutiei și distanța sa față de centrul cutiei de delimitare în două dimensiuni. Numim acest lucru “context auxiliar” și am constatat că ajută IA să identifice și să prevadă cu acuratețe obiecte 3D pe baza imaginilor 2D.
“Metoda propusă este motivată de un teoremă bine cunoscută în teoria măsurii, teorema Cramér-Wold. De asemenea, este potențial aplicabilă și altor sarcini de predicție a ieșirilor structurate în vedere computațională.”
MonoCon a fost testat cu un set de date de referință larg utilizat, numit KITTI.
“La momentul în care am depus acest articol, MonoCon a performant mai bine decât oricare dintre cele zeci de alte programe de IA care extrag date 3D despre automobile din imagini 2D”, spune Wu.
Echipa va lucra acum pentru a scala procesul cu seturi de date mai mari.
“Înainte, vom scala acest proces și vom lucra cu seturi de date mai mari pentru a evalua și a ajusta MonoCon pentru utilizare în conducerea autonomă”, spune Wu. “De asemenea, dorim să explorăm aplicații în fabricație, pentru a vedea dacă putem îmbunătăți performanța unor sarcini, cum ar fi utilizarea brațelor robotice.”












