Modelos y plataformas de IA
Nueva técnica ayuda a la IA a identificar objetos 3D

Una nueva técnica desarrollada por investigadores de la Universidad Estatal de Carolina del Norte mejora la capacidad de los programas de inteligencia artificial (IA) para identificar objetos 3D. Llamada MonoCon, la técnica también ayuda a la IA a aprender cómo los objetos 3D se relacionan entre sí en el espacio utilizando imágenes 2D.
MonoCon podría tener una amplia gama de aplicaciones, incluyendo ayudar a los vehículos autónomos a navegar alrededor de otros vehículos utilizando imágenes 2D recibidas de una cámara a bordo. También podría desempeñar un papel en la fabricación y la robótica.
Tianfu Wu es el autor correspondiente del artículo de investigación y profesor asistente de ingeniería eléctrica y computacional en la Universidad Estatal de Carolina del Norte.
“Vivimos en un mundo 3D, pero cuando tomas una foto, registra ese mundo en una imagen 2D”, dice Wu.
“Los programas de IA reciben entrada visual de cámaras. Así que si queremos que la IA interactúe con el mundo, debemos asegurarnos de que pueda interpretar lo que las imágenes 2D pueden decirle sobre el espacio 3D. En esta investigación, nos centramos en una parte de ese desafío: cómo podemos hacer que la IA reconozca con precisión los objetos 3D, como personas o coches, en imágenes 2D, y coloque esos objetos en el espacio”, continúa Wu.
Vehículos autónomos
Los vehículos autónomos a menudo confían en lidar para navegar en el espacio 3D. El lidar, que utiliza láseres para medir la distancia, es caro, lo que significa que los sistemas autónomos no incluyen mucha redundancia. Colocar docenas de sensores lidar en un coche sin conductor producido en masa sería increíblemente caro.
“Pero si un vehículo autónomo pudiera utilizar entradas visuales para navegar a través del espacio, podrías construir redundancia”, dice Wu. “Como las cámaras son significativamente menos costosas que el lidar, sería económicamente factible incluir cámaras adicionales, construyendo redundancia en el sistema y haciéndolo más seguro y robusto.
“Esa es una aplicación práctica. Sin embargo, también estamos emocionados con el avance fundamental de este trabajo: que es posible obtener datos 3D a partir de objetos 2D.”
Entrenamiento de la IA
MonoCon puede identificar objetos 3D en imágenes 2D antes de colocarlos en una “caja delimitadora”, que le indica a la IA los bordes externos del objeto.
“Lo que nos distingue es cómo entrenamos a la IA, lo que se basa en técnicas de entrenamiento anteriores”, dice Wu. “Al igual que los esfuerzos anteriores, colocamos objetos en cajas delimitadoras 3D mientras entrenamos a la IA. Sin embargo, además de pedirle a la IA que prediga la distancia de la cámara al objeto y las dimensiones de las cajas delimitadoras, también le pedimos que prediga las ubicaciones de cada uno de los ocho puntos de la caja y su distancia desde el centro de la caja delimitadora en dos dimensiones. Llamamos a esto ‘contexto auxiliar’, y encontramos que ayuda a la IA a identificar y predecir objetos 3D con mayor precisión en función de imágenes 2D.
“El método propuesto está motivado por un teorema bien conocido en la teoría de la medida, el teorema de Cramér-Wold. También es potencialmente aplicable a otras tareas de predicción de salida estructurada en visión por computadora.”
MonoCon se probó con un conjunto de datos de referencia ampliamente utilizado llamado KITTI.
“En el momento en que presentamos este artículo, MonoCon funcionó mejor que cualquiera de los otros programas de IA dirigidos a extraer datos 3D de automóviles de imágenes 2D”, dice Wu.
El equipo ahora buscará ampliar el proceso con conjuntos de datos más grandes.
“Avanzando, estamos ampliando esto y trabajando con conjuntos de datos más grandes para evaluar y afinar MonoCon para su uso en la conducción autónoma”, dice Wu. “También queremos explorar aplicaciones en la fabricación, para ver si podemos mejorar el rendimiento de tareas como el uso de brazos robóticos.”












