로보틱스 및 피지컬 AI

기계 학습 모델은 객체 관계를 이해한다

mm
Unite.AI를 Google의 선호 소스에 추가

매사추세츠 공과 대학(MIT)의 연구자들은 장면中的 객체 간의 기본 관계를 이해하는 새로운 기계 학습(ML) 모델을 개발했다. 이 모델은 개별 관계를 하나씩 표현한 다음 전체 장면을 설명하기 위해 이러한 표현을 결합한다.

이 새로운 접근법을 통해 ML 모델은 텍스트 설명에서 더 정확한 이미지를 생성할 수 있으며, 여러 프로젝트가 서로 다른 관계로 배열된 장면에서도 이를 수행할 수 있다.

이 새로운 개발은 많은 深層 학습 모델이 개별 객체 간의 얽힌 관계를 이해하지 못하는 경우가 많기 때문에 중요하다.

팀의 모델은 산업 로봇이 여러 단계의 조작 작업을 수행해야 하는 경우, 즉 항목을 쌓거나 가전제품을 조립하는 경우에 사용될 수 있다. 또한 기계가 궁극적으로 인간과 마찬가지로 환경에서 학습하고 상호 작용할 수 있도록 한다.

Yilun Du는 컴퓨터 과학 및 인공 지능 연구소(CSAIL)의 박사 과정 학생이자 논문의 공동 제1저자이다. Du는 Shuang Li, CSAIL의 박사 과정 학생, 및 Nan Liu, 일리노이 주 어반나캠퍼스의 대학원 학생과 함께 연구를 공동 주도했다. 또한 Joshua B. Tenenbaum, 인지 과학 및 계산의 Paul E. Newton 커리어 개발 교수이자 뇌 및 인지 과학부의 교수, 및 Antonio Torralba, 델타 전자 공학 교수이자 전기 공학 및 컴퓨터 과학부의 교수가 포함되었다. Tenenbaum와 Torralba는 모두 CSAIL의 회원이다.

새로운 프레임워크

“나는 테이블을 볼 때, XYZ 위치에 객체가 있다고 말할 수 없다. 우리의 마음은那样으로 작동하지 않는다. 우리가 장면을 이해할 때, 우리는 실제로 객체 간의 관계를 기반으로 이해한다. 객체 간의 관계를 이해할 수 있는 시스템을 구축함으로써, 우리는 그 시스템을 사용하여 환경을 더 효과적으로 조작하고 변경할 수 있을 것이라고 생각한다”라고 Du는 말했다.

새로운 프레임워크는 객체와 그 관계에 대한 텍스트 설명을 기반으로 장면의 이미지를 생성할 수 있다.

시스템은 이러한 문장을 더 작은 조각으로 나누어 각 개별 관계를 설명한다. 각 부분은 별도로 모델링되며, 최적화 프로세스를 통해 장면의 이미지를 생성한다.

문장이 더 작은 조각으로 나뉘면, 시스템은 이러한 조각을 다른 방식으로 재조합하여 이전에遭遇하지 않은 장면 설명에 적응할 수 있다.

“다른 시스템은 모든 관계를 전체적으로 취하여 설명에서 한 번에 이미지를 생성한다. 그러나 이러한 접근 방식은 설명에 더 많은 관계가 있는 경우, 즉 모델이 실제로 하나의 이미지를 생성하여 더 많은 관계를 포함하는 이미지를 생성할 수 없는 경우에 실패한다. 그러나 우리는 이러한 별도의 작은 모델을 함께 구성함으로써, 더 많은 관계를 모델링하고 새로운 조합에 적응할 수 있다”라고 Du는 말했다.

시스템은 이 과정을 반대로 수행할 수도 있다. 이미지를 입력하면, 시스템은 장면中的 객체 간의 관계와 일치하는 텍스트 설명을 찾을 수 있다.

모델 평가

연구자들은 인간이 생성된 이미지가 원래 장면 설명과 일치하는지 여부를 평가하도록 요청했다. 설명에 3개의 관계가 포함된 경우, 즉 가장 복잡한 유형인 경우, 91%의 참가자가 새로운 모델이 다른 深層 학습 방법보다 더 잘 수행된다고 말했다.

“하나의 관계 설명에서 두 개, 세 개, 또는 네 개의 설명으로 문장을 증가시킬 수 있으며, 우리의 접근 방식은 여전히 설명된 이미지들을 생성할 수 있다. 그러나 다른 방법은 실패한다”라고 Du는 말했다.

모델은 이전에遭遇하지 않은 설명과 함께 작업할 수 있는 능력도 보여주었다.

“이것은 매우 유망하다. 왜냐하면 그것은 인간이 작동하는 방식과 더ใกล운 방식이다. 인간은 몇 가지 예만 볼 수 있지만, 우리는 그 몇 가지 예에서 유용한 정보를 추출하여 무한한 조합을 생성할 수 있다. 그리고 우리의 모델은 더 적은 데이터에서 학습하고 더 복잡한 장면 또는 이미지 생성으로 일반화할 수 있는 그런 속성이 있다”라고 Li는 말했다.

팀은 이제 더 복잡한 실제 이미지에 모델을 테스트하고 궁극적으로 모델을 로봇 시스템에 통합하는 방법을 탐색할 것이다.

Alex는 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구 및 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 조명되도록 하면서도 출판물의 편집 기준을 유지하도록 돕습니다.