AI 모델 및 플랫폼
새로운 기술, AI가 3D 객체 식별 능력 향상

노스 캐롤라이나 주립 대학교의 연구자들이 개발한 새로운 기술인 MonoCon은 인공 지능(AI) 프로그램이 3D 객체를 식별하는 능력을 향상시킵니다. MonoCon은 또한 2D 이미지에서 3D 객체를 식별하고, 그 객체들이 공간에서 어떻게 관련되어 있는지 학습하는 데 도움을 줍니다.
MonoCon은 자율 주행 자동차가 2D 이미지에서 받은 정보를 사용하여 다른 자동차를 탐지하고, 주행하는 데 도움을 줄 수 있습니다. 또한 제조业와 로봇공학 분야에서도 적용될 수 있습니다.
Tianfu Wu는 해당 연구 논문의 공동 저자이자 노스 캐롤라이나 주립 대학교의 전기 및 컴퓨터 공학부 조교수입니다.
“우리는 3D 세계에서 살고 있지만, 사진을 찍으면 2D 이미지로 기록됩니다. 따라서 AI가 세계와 상호 작용하려면, 2D 이미지에서 3D 공간에 대한 정보를 해석할 수 있어야 합니다. 이 연구에서 우리는 AI가 2D 이미지에서 3D 객체를 정확하게 식별하고, 그 객체를 공간에 배치하는 데 중점을 두고 있습니다.”라고 Wu는 말합니다.
“AI 프로그램은 카메라에서 입력을 받습니다. 따라서 AI가 세계와 상호 작용하려면, 2D 이미지에서 3D 공간에 대한 정보를 해석할 수 있어야 합니다. 이 연구에서 우리는 2D 이미지에서 3D 객체를 식별하고, 그 객체를 공간에 배치하는 데 중점을 두고 있습니다.”라고 Wu는 계속합니다.
자율 주행 자동차
자율 주행 자동차는 일반적으로 lidar를 사용하여 3D 공간을 탐지합니다. lidar는 레이저를 사용하여 거리를 측정하는 기술로, 비용이 많이 듭니다. 따라서 자율 주행 자동차에 lidar 센서를 많이 설치하는 것은 매우 비용이 많이 듭니다.
“그러나 자율 주행 자동차가 시각 입력을 사용하여 공간을 탐지할 수 있다면, 중복성을 구축할 수 있습니다. 카메라는 lidar보다 훨씬 저렴하기 때문에, 추가 카메라를 설치하여 시스템을 더 안전하고 강력하게 만들 수 있습니다.”라고 Wu는 말합니다.
“이것은 실제적인 적용입니다. 그러나 우리는 이 연구의 근본적인 발전을兴奮합니다. 즉, 2D 객체에서 3D 데이터를 얻을 수 있다는 것입니다.”
AI 학습
MonoCon은 2D 이미지에서 3D 객체를 식별하고, 그 객체를 “바운딩 박스”에 배치하여 AI가 객체의 외부 경계를 알 수 있도록 합니다.
“우리의 연구는 이전의 학습 기술을 기반으로 합니다. 이전의 연구와 마찬가지로, 우리는 3D 바운딩 박스에 객체를 배치하여 AI를 학습합니다. 그러나 우리는 또한 AI가 카메라에서 객체까지의 거리와 바운딩 박스의 크기를 예측하도록 요청합니다. 우리는 이 추가적인 정보를 ‘보조 컨텍스트’라고 부르며, 이것이 AI가 2D 이미지에서 3D 객체를 더 정확하게 식별하도록 도움을 줍니다.”라고 Wu는 말합니다.
“제안된 방법은 측도 이론의 잘 알려진 정리인 Cramér-Wold 정리를 기반으로 합니다. 이것은 또한 컴퓨터 비전의 다른 구조화된 출력 예측 작업에 적용될 수 있습니다.”
MonoCon은 널리 사용되는 벤치마크 데이터 세트인 KITTI에서 테스트되었습니다.
“우리가 이 논문을 제출했을 때, MonoCon은 2D 이미지에서 자동차의 3D 데이터를 추출하는 다른 AI 프로그램보다 더 잘 수행되었습니다.”라고 Wu는 말합니다.
연구 팀은 이제 더 큰 데이터 세트에서 이 과정을 확대할 것입니다.
“향후 우리는 더 큰 데이터 세트에서 MonoCon을 평가하고, 자율 주행 자동차에서 사용하기 위해 세부적으로 조정할 것입니다. 우리는 또한 제조业에서 로봇 팔의 성능을 개선할 수 있는지 확인하기 위해 적용할 것입니다.”라고 Wu는 말합니다.












