AI-modellen en platforms
Nieuwe techniek helpt AI bij het identificeren van 3D-objecten

Een nieuwe techniek ontwikkeld door onderzoekers aan de North Carolina State University verbetert de mogelijkheid van artificial intelligence (AI)-programma’s om 3D-objecten te identificeren. Deze techniek, genaamd MonoCon, helpt AI ook bij het leren van de relatie tussen 3D-objecten in de ruimte met behulp van 2D-afbeeldingen.
MonoCon kan mogelijk een breed scala aan toepassingen hebben, waaronder het helpen van autonome voertuigen om andere voertuigen te navigeren met behulp van 2D-afbeeldingen ontvangen van een onboardcamera. Het kan ook een rol spelen in de productie en robotica.
Tianfu Wu is de corresponderende auteur van het onderzoeksrapport en een assistent-professor in de elektrotechniek en informatica aan de North Carolina State University.
“We leven in een 3D-wereld, maar wanneer je een foto maakt, wordt die wereld vastgelegd in een 2D-afbeelding,” zegt Wu.
“AI-programma’s ontvangen visuele input van camera’s. Dus als we willen dat AI met de wereld omgaat, moeten we ervoor zorgen dat het in staat is om te interpreteren wat 2D-afbeeldingen kunnen vertellen over 3D-ruimte. In dit onderzoek richten we ons op één deel van die uitdaging: hoe we AI kunnen helpen om 3D-objecten – zoals mensen of auto’s – in 2D-afbeeldingen nauwkeurig te herkennen en die objecten in de ruimte te plaatsen,” vervolgt Wu.
Autonome voertuigen
Autonome voertuigen vertrouwen vaak op lidar om 3D-ruimte te navigeren. Lidar, dat lasers gebruikt om afstand te meten, is duur, waardoor autonome systemen niet veel redundantie hebben. Het zou extreem duur zijn om tientallen lidar-sensoren op een massaal geproduceerde driverless auto te plaatsen.
“Maar als een autonoom voertuig visuele input kan gebruiken om door de ruimte te navigeren, kun je redundantie opbouwen,” zegt Wu. “Omdat camera’s aanzienlijk minder duur zijn dan lidar, zou het economisch haalbaar zijn om extra camera’s toe te voegen – redundantie opbouwen in het systeem en het veiliger en robuuster maken.
“Dat is één praktische toepassing. We zijn echter ook enthousiast over de fundamentele vooruitgang van dit werk: het is mogelijk om 3D-gegevens uit 2D-objecten te halen.”
Trainen van de AI
MonoCon kan 3D-objecten in 2D-afbeeldingen identificeren voordat ze in een “bounding box” worden geplaatst, die de AI de buitenste randen van het object vertelt.
“Wat ons werk onderscheidt, is hoe we de AI trainen, wat voortbouwt op eerdere trainingsmethoden,” zegt Wu. “Net als de eerdere inspanningen, plaatsen we objecten in 3D-bounding boxes tijdens het trainen van de AI. Echter, in aanvulling op het vragen van de AI om de camera-objetafstand en de afmetingen van de bounding boxes te voorspellen, vragen we de AI ook om de locaties van elk van de acht punten van de box en de afstand van het centrum van de bounding box in twee dimensies te voorspellen. We noemen dit ‘auxiliary context’, en we vonden dat het de AI helpt om 3D-objecten op basis van 2D-afbeeldingen nauwkeuriger te identificeren en te voorspellen.
“De voorgestelde methode is gemotiveerd door een bekend theorem in de meettheorie, het Cramér-Wold-theorem. Het is ook potentieel toepasbaar op andere gestructureerde uitvoerpredictietaken in computer vision.”
MonoCon werd getest met een breed gebruikte benchmarkdataset genaamd KITTI.
“Op het moment dat we dit artikel indienden, presteerde MonoCon beter dan enkele tientallen andere AI-programma’s die gericht waren op het extraheren van 3D-gegevens over auto’s uit 2D-afbeeldingen,” zegt Wu.
Het team zal nu proberen het proces op te schalen met grotere datasets.
“We gaan verder met het opschalen van dit proces en werken met grotere datasets om MonoCon te evalueren en te fijnafstemmen voor gebruik in autonome rijden,” zegt Wu. “We willen ook toepassingen in de productie onderzoeken, om te zien of we de prestaties van taken zoals het gebruik van robotarmen kunnen verbeteren.”












