로보틱스 및 피지컬 AI

다중 데이터셋을 결합하여 다기능 로봇을 훈련하는 PoCo 기술

mm
Unite.AI를 Google의 선호 소스에 추가

로봇공학에서 가장 중요한 도전 중 하나는 다양한 작업과 환경에 적응할 수 있는 다기능 로봇을 훈련하는 것입니다. 이러한 다기능 기계를 생성하려면 연구자와 엔지니어는 다양한 시나리오와 응용 프로그램을 포함하는 대규모 다중 데이터셋에 접근할 수 있어야 합니다. 그러나 로봇 데이터의 이질적인 특성으로 인해 여러 소스에서 정보를 하나의 통일된 기계 학습 모델로 효율적으로 통합하기 어렵습니다.

이 도전을 해결하기 위해 매사추세츠 공과 대학(MIT)의 연구자 팀은 Policy Composition(PoCo)라는 혁신적인 기술을 개발했습니다. 이 접근법은 확산 모델이라고 하는 일종의 생성적 인공지능을 사용하여 도메인, 모달리티 및 작업을 초과하는 여러 데이터 소스를 결합합니다. PoCo의 힘을 활용하여 연구자들은 다양한 작업과 환경에서 효율성과 정확성이 향상된 다기능 로봇을 훈련하는 것을 목표로 합니다.

로봇 데이터셋의 이질성

다기능 로봇을 훈련하는 주요 장애물 중 하나는 로봇 데이터셋의 광범위한 이질성입니다. 이러한 데이터셋은 데이터 모달리티 측면에서 크게 다를 수 있습니다. 일부에는 색상 이미지와 다른 일부에는 촉각적 인상 또는 기타 감각 정보가 포함될 수 있습니다. 이 데이터 표현의 다양성은 기계 학습 모델에 도전을 제기합니다. 모델은 다양한 유형의 입력을 효과적으로 처리하고 해석할 수 있어야 합니다.

또한 로봇 데이터셋은 시뮬레이션 또는 인간 시연과 같은 다양한 도메인에서 수집될 수 있습니다. 시뮬레이션 환경은 데이터 수집을 위한 제어된 설정을 제공하지만 항상 실제 시나리오를 정확하게 나타내지 않을 수 있습니다. 반면에 인간 시연은 작업을 수행하는 방법에 대한 귀중한 통찰력을 제공하지만 확장성과 일관성 측면에서 제한될 수 있습니다.

로봇 데이터셋의 또 다른 중요한 측면은 고유한 작업과 환경에 대한 특이성입니다. 예를 들어, 로봇 창고에서 수집된 데이터셋은 항목 포장 및 검색과 같은 작업에 중점을 둘 수 있습니다. 반면에 제조 공장에서 수집된 데이터셋은 조립 라인 작업에 중점을 둘 수 있습니다. 이러한 특이성으로 인해 다양한 응용 프로그램에 적응할 수 있는 단일, 보편적인 모델을 개발하는 것이 어려워집니다.

따라서 여러 소스에서 다양한 데이터를 기계 학습 모델에 효율적으로 통합하는 어려움은 다기능 로봇 개발의重大한 장애물이었습니다. 전통적인 접근 방식은 일반적으로 로봇을 훈련하기 위해 단일 유형의 데이터에 의존하여 새로운 작업과 환경에 대한 제한된 적응성과 일반화를 초래합니다. 이 제한을 극복하기 위해 MIT 연구자들은 이질적인 데이터셋을 효과적으로 결합하여 더 다기능적이고 능력있는 로봇 시스템을 생성할 수 있는 새로운 기술을 개발하려고 했습니다.

출처: MIT 연구자

Policy Composition (PoCo) 기술

MIT 연구자들이 개발한 Policy Composition (PoCo) 기술은 확산 모델의 힘을 활용하여 로봇 데이터셋의 이질성을 해결합니다. PoCo의 핵심 아이디어는:

  • 개별 작업 및 데이터셋에 대한 별도의 확산 모델을 훈련
  • 학습된 정책을 결합하여 여러 작업 및 설정을 처리할 수 있는 일반 정책을 생성

PoCo는 개별 작업 및 데이터셋에 대한 별도의 확산 모델을 훈련함으로써 시작합니다. 각 확산 모델은 관련된 데이터셋에서 제공된 정보를 사용하여 특정 작업을 완료하기 위한 전략 또는 정책을 학습합니다. 이러한 정책은 사용 가능한 데이터를 사용하여 작업을 수행하기 위한 최적의 접근 방식을 나타냅니다.

이미지 생성에 일반적으로 사용되는 확산 모델은 PoCo에서 학습된 정책을 나타내는 데 사용됩니다. 이미지 생성 대신 확산 모델은 로봇이 따라야 하는軌跡을 생성합니다. 출력을 반복적으로 개선하고 노이즈를 제거함으로써 확산 모델은 작업 완성을 위한 매끄럽고 효율적인軌跡을 생성합니다.

개별 정책이 학습된 후에 PoCo는 가중 접근 방식을 사용하여 일반 정책을 생성합니다. 여기서 각 정책은 관련성과 중요성에 따라 가중치가 할당됩니다. 초기 결합 후에 PoCo는 일반 정책이 각 개별 정책의 목표를 만족하도록 반복적으로 개선합니다. 이를 통해 모든 작업과 설정에서 최상의 성능을 달성할 수 있습니다.

PoCo 접근 방식의 이점

PoCo 기술은 전통적인 다기능 로봇 훈련 접근 방식과 비교하여 여러 가지 중요한 이점을 제공합니다:

  1. 작업 성능 개선: 시뮬레이션 및 실제 실험에서 PoCo를 사용하여 훈련된 로봇은 기준선 기술과 비교하여 20%의 작업 성능 개선을 보여주었습니다.
  2. 다기능성 및 적응성: PoCo는 다른 측면에서 우수한 정책을 결합할 수 있으므로 로봇은 최상의 결과를 달성할 수 있습니다.
  3. 새로운 데이터 통합의 유연성: 새로운 데이터셋이 사용 가능해지면 연구자들은 기존의 PoCo 프레임워크에 추가적인 확산 모델을 쉽게 통합할 수 있습니다. 이는 전체 훈련 프로세스를 처음부터 시작할 필요가 없게 합니다.

이러한 유연성으로 인해 새로운 데이터가 사용 가능해질 때 로봇의 능력을 지속적으로 개선하고 확장할 수 있습니다. 이는 로봇공학 분야에서 고급 다기능 로봇 시스템 개발에 강력한 도구를 제공합니다.

실험 및 결과

PoCo 기술의 효과를 검증하기 위해 MIT 연구자들은 시뮬레이션과 실제 실험을 모두 로봇 팔을 사용하여 수행했습니다. 이러한 실험은 전통적인 방법으로 훈련된 로봇과 비교하여 PoCo로 훈련된 로봇의 작업 성능 개선을 보여주었습니다.

로봇 팔을 사용한 시뮬레이션 및 실제 실험

연구자들은 시뮬레이션 환경과 실제 로봇 팔에서 PoCo를 테스트했습니다. 로봇 팔은 해머로 못을 박거나 스패튤라로 물건을 뒤집는 것과 같은 다양한 도구 사용 작업을 수행하도록 지시받았습니다. 이러한 실험은 다양한 설정에서 PoCo의 성능을 종합적으로 평가했습니다.

PoCo를 사용한 작업 성능 개선

실험 결과는 PoCo로 훈련된 로봇이 기준선 방법과 비교하여 20%의 작업 성능 개선을 보여주었습니다. 이러한 개선은 시뮬레이션과 실제 설정 모두에서 명확히 나타났습니다. 이는 PoCo 기술의 강건성과 효과성을 강조했습니다. 연구자들은 PoCo에 의해 생성된 결합된軌跡이 개별 정책에 의해 생성된軌跡보다 시각적으로 우수하다는 것을 관찰했습니다. 이는 정책 결합의 이점을 보여주었습니다.

장기 지평 작업 및 더 큰 데이터셋에 대한 미래 응용 가능성

수행된 실험의 성공은 미래 응용 프로그램에 대한 흥미로운 가능성을 열어줍니다. 연구자들은 PoCo를 장기 지평 작업에 적용하고자 합니다. 여기서 로봇은 다양한 도구를 사용하여 작업 순서를 수행해야 합니다. 또한 더 큰 로봇 데이터셋을 통합하여 PoCo로 훈련된 로봇의 성능과 일반화 능력을进一步 개선하고자 합니다. 이러한 미래 응용 프로그램은 로봇공학 분야를 크게 발전시키고真正한 다기능 및 지능형 로봇 개발에 더 가까이 다가갈 수 있습니다.

다기능 로봇 훈련의 미래

PoCo 기술의 개발은 다기능 로봇 훈련 분야에서 중요한 발전입니다. 그러나 여전히 앞으로 해결해야 할 도전과 기회가 있습니다.

높은 성능과 적응성을 가진 로봇을 생성하기 위해서는 다양한 소스에서 데이터를 활용해야 합니다. 인터넷 데이터, 시뮬레이션 데이터 및 실제 로봇 데이터는 각각 로봇 훈련에 대한 고유한 통찰력과 이점을 제공합니다. 이러한 다양한 유형의 데이터를 효과적으로 결합하는 것은 미래의 로봇공학 연구 및 개발의 성공에 중요한 요소가 될 것입니다.

PoCo 기술은 다양한 데이터셋을 결합하여 로봇을 더 효과적으로 훈련할 수 있는 잠재력을 보여줍니다. 확산 모델과 정책 결합을 사용하여 PoCo는 데이터를 다른 모달리티와 도메인에서 통합할 수 있는 프레임워크를 제공합니다. 아직 작업이 남아 있지만 PoCo는 로봇공학에서 데이터 결합의 잠재력을 해방하는 데 중요한 단계입니다.

다양한 데이터셋을 결합하고 여러 작업을 훈련할 수 있는 능력은 다기능 및 적응성 로봇 개발에重大한 의미를 갖습니다. 이러한 기술로 로봇이 다양한 경험에서 학습하고 새로운 상황에 적응할 수 있도록 함으로써真正한 지능형 및 능력있는 로봇 시스템을 생성할 수 있습니다. 이 분야의 연구가 진행됨에 따라 복잡한 환경을 탐색하고 다양한 작업을 수행하며 지속적으로 기술을 개선할 수 있는 로봇을 기대할 수 있습니다.

다기능 로봇 훈련의 미래는 흥미로운 가능성으로 가득 차 있습니다. PoCo와 같은 기술은 앞장서서 새로운 방식으로 데이터를 결합하고 로봇을 더 효과적으로 훈련할 수 있는 방법을 탐색하고 있습니다. 연구자들이 이 분야를 계속 탐구함에 따라 로봇이 다양한 작업과 도메인에서 우리를 지원할 수 있는 지능형 파트너가 되는 미래를 기대할 수 있습니다.

Alex McFarland은 인공 지능의 최신 개발을 탐구하는 AI 저널리스트이자 작가입니다. 그는 전 세계의 수많은 AI 스타트업과 출판물들과 협력했습니다.