사상 리더
로봇에게 움직임을 가르쳤습니다. 이제 로봇에게 살아가는 법을 가르치고 있습니다.

현대 로봇공학은 움직임이 더 이상 주요 도전이 아니게 되었습니다. 기계는 이미 탐색,抓取, 공간에서 작동하는 것을 인상적인 정밀도로 수행할 수 있습니다. 그러나 로봇을真正로 “살아”게 하고 현실 세계에서 작동하게 하는 것은 여전히 해결되지 않은 문제입니다.
이 과정에서 핵심 역할을 하는 것은 “척수”라고 불릴 수 있는 시스템입니다. 이는 기본 반응, 행동, 환경과의 상호작용을负责합니다.
로봇의 발전을 이 렌즈를 통해 보면, 각 단계에서 시스템이 새로운 것을 배우는 이 순서는 인간 발전에 매우 유사합니다.
이 발전 과정에서, 즉 “빈” 하드웨어에서 의미 있는 행동으로의 전환에서 물리적 AI의 주요 변환)이 발생하고 있습니다. 더 깊이 배우고 싶습니다.
로봇공학의 기초: 거의 논의되지 않는 단계
로봇이란 실제로 무엇일까요? 그것은 초기에 특정 작업에 적응하고, 주어진 환경에서 작동하며, 필요한 동작을 수행하도록 訓練되어야 하는 보편적인 플랫폼으로 만들어진 물리적 장치입니다. 본질적으로, 그것은 “빈”으로 시작하여 이후에 특정 작업에 맞게 訓練되어야 합니다.
일상적인 시나리오를 넘어서서 더 현실적인 근미래 적용을 고려해 보면, 로봇의 완전한 채택은 주로 산업 및 잠재적으로 위험한 환경에서 발생할 것임이 명백합니다. 이는 로봇의 행동, 강건성, 訓練 품질에 대한 요구 사항이 크게 증가함을 의미합니다.
이 과정은 가장 기본적인 단계, 즉 장치를 구축하는 것으로 시작됩니다. 로봇은 작동기, 모터, 센서, 카메라, LiDAR 등 여러 구성 요소로 구성됩니다. 그것은 인간형, 바퀴형, 두 발형, 또는 사족형일 수 있습니다. 형태는 두번째입니다. 중요한 것은 이 단계에서 우리는 아직 “빈” 상태지만 작동하는 장치를 얻는다는 것입니다.
다음 단계는 행동의 기초가 되는 기본 모델을 설치하는 것입니다.廣い 의미에서 “모델”은 전체 기능적 제어 層입니다. 그것은 핵심 능력에 책임이 있습니다. 균형을 유지하고, 서서 움직이고, 장애물에서 벗어나고, 환경을 손상하지 않고, 인간과 안전하게 상호작용하는 것입니다.
강화 학습이 여기서 적용됩니다. 이러한 시스템에서 수십억 개의 시뮬레이션이 실행됩니다. 우리는 복잡한 환경에서 로봇이 “학습”하는 비디오를 자주 봅니다. 대부분의 로봇은 넘어지거나, 균형을 잃거나, 작업을 완료하지 못합니다. 그러나 서서 움직이는 로봇은 발전합니다.
이것이 강화 학습의 본질입니다. 성공적인 행동을 선택하는 것입니다. 살아남은 로봇의 알고리즘이 다음 반복의 기초가 됩니다. 결과적으로, 엄청난 수의 실행 후, 장애물에 자신감을 갖는 모델이 나타납니다. 이 알고리즘이 물리적 장치에 전송됩니다.
이것은 근본적인 물리학과 역학을 시스템에 내재시키는 초기 단계입니다. 이것은 이후의 모든 단계에서 매우 중요합니다.
로봇이 세계를 “感じ”기 시작하는 방법
이미 “하드웨어”를 갖추고 있습니다. 기본 모델이 설치된 로봇: 서서, 걸어다니고, 균형을 유지할 수 있습니다. 그러나 산업 환경과 같은 실제 작업에 충분한가요? 분명히 그렇지 않습니다.
다음 단계가 여기서 시작됩니다. 센서를 통합하고 모델을 센서 입력에 따라 행동하도록 訓練합니다. 핵심 능력의 새로운 層이 나타납니다. 이미 단순한 움직임보다 훨씬 더 복잡합니다.
인간 발전과의 유사점이 여기서 유용합니다. 첫 단계에서, 시스템을 약 1세의 아이 수준으로 올렸습니다. 서서, 첫 걸음, 균형을 유지할 수 있습니다. 다음 단계는 8세의 수준에 더 가깝습니다.
이 나이에, 아이는 이미 자신의 “센서”를 적극적으로 사용합니다. 위험을 인식하고 행동의 결과를 평가할 수 있습니다. 뜨거운 것을 만지거나 매우 차가운 것을 입에 넣지 않습니다. 테이블에 올라가고, 자전거를 타고, 물건과 상호작용할 수 있습니다. 잡고, 가지고, 조작하고, 기본적인 자기 관리 행동을 수행할 수 있습니다.
이 단계를 사전 訓練이라고 합니다. 그리고 여기서 시뮬레이션만으로는 더 이상 충분하지 않습니다.
예를 들어, 일부 시나리오는 여전히 효과적으로 모델링할 수 있습니다. 유리잔을 잡거나, 배터리를 교체하는 방법, 즉 하나의 구성 요소를 제거하고, 충전하고, 다른 하나를 설치하는 방법입니다.
그러나 전체적으로 균형이 바뀝니다. 약 80%의 訓練은 여전히 시뮬레이션에서 발생할 수 있지만 약 20%의 데이터는 실제 세계에서 나와야 합니다. 그리고 여기서 우리는 Egocentric 데이터에 대해 논의하기 시작합니다.
Egocentric 데이터: 환경 이해의 기초
오늘날, Egocentric 데이터는 전 세계적으로 대규모로 수집되고 있습니다. 왜냐하면 이를 통해 기본적인 역학에서 의미 있는 환경 상호작용으로 이동할 수 없기 때문입니다. 내 동료 중 하나는 자동차 수리점 네트워크를 운영하며, 직원이 헤드마운트 카메라를 사용하여 자동차 수리 과정을 전체적으로 녹화합니다. 뉴욕시의 건물 주인도 유사한 접근 방식을 구현했습니다. 청소 직원이 이마에 부착된 카메라를 사용하여 청소 공간과 위생 지역을 유지하는 방법을 녹화합니다.
시간이 지나면 이러한 녹화는 독립적인 제품이 됩니다. 패키지화되어 판매됩니다. 그 핵심 가치는 사전 訓練 단계에서 환경과 행동 순서에 대한 기본적인 이해를 구축하는 데 도움이 된다는 것입니다.
예를 들어, 이러한 서비스는 Keymakr에서 제공되었습니다. 여기서 팀은 단순한 시나리오에서부터 복잡한 시나리오까지 독립적으로 Egocentric 데이터의 전체 컬렉션을 만들었습니다.
왜 이것이 så 중요할까요? 이러한 데이터는 순수한 시뮬레이션이 제공할 수 없는 것을 제공하기 때문입니다. 실제 환경의 다양성입니다. 사무실, 자동차 수리점, 건설 현장, 레스토랑, 호텔 – 각 환경은独自의 컨텍스트, 시나리오, 그리고 뉴앙스를 가지고 있습니다. 함께하면, 시스템이 단순히 “보는” 것이 아니라 실제 세계의 역학을渐渐히 이해하는 데이터셋을 형성합니다.
이 단계에서 목표는 더 이상 특정 동작을 완벽하게 수행하도록 로봇을 가르치는 것이 아닙니다. 무엇보다도 로봇이 먼저 자신의 주변 환경을 이해하는 것입니다.
오늘날 거의 모든 로봇공학 회사 – 테슬라에서 Unitree Robotics 및 Figure AI까지 – 이 정확한 단계에 초점을 두고 있습니다. 그들의 목표는 기본 모델을 구축하는 것입니다. 그 모델의 능력은 먼저 “8세 아이”의 수준에 도달한 다음 “12세”의 수준으로 발전합니다. 이것이 Introspector에서 하는 일입니다. 현대 로봇공학의 “성인”이 되는 가장 중요한 단계인 사전 訓練에 필요한 데이터를 준비하는 것입니다.
훈련의 마지막 마일: 보편성이 끝나고 전문성이 시작되는 곳
로봇이 이미 사전 訓練을 완료하고, 기본적인 세계 이해와 비교할 수 있는 기술을 갖춘 상태에서 제조되었다고 가정해 보겠습니다. 그러나 이것만으로 실제 비즈니스 사용 사례에 충분하지 않습니다. 회사들은 단순히 “일반적인” 로봇이 아니라 전문가를 필요로 합니다.
예를 들어, 자동차 제조를 고려해 보겠습니다. 일부 작업은 여전히 인간이 수행하는 것으로, 감각, 정밀도, 지속적인 시각적 제어가 필요합니다. 전통적인 자동화는 여기서 어려움을 겪습니다. 산업용 매니퓰레이터는 반복적이고剛性 작업에 탁월합니다. 그러나 적응성, 압력 감지, 실시간 조정이 필요한 작업은 여전히 인간의 영역에 있습니다.
이 여기서 새로운 요구가 등장합니다. 로봇을 특정 작업을 수행하도록 訓練하는 것입니다. 즉, 특정 전문가와 시나리오를 위한 다음 단계입니다.
이 여기서 실제적인 질문이 등장합니다. 이 수준의 訓練을 위해서는 무엇이 필요한가요? 인간의 성과를 복제하도록 로봇을 訓練하려면, 인간의 행동을 가능한 한 정확하게 캡처해야 합니다. 예를 들어, 공장의 전문가는 카메라를 착용하고, 작업을 수행하는 방법을 장기간, 몇 개월 또는 1년 동안 녹화해야 합니다.
로봇이 인간 세계에서 “살아”기 위해 필요한 것
카메라만으로는 충분하지 않습니다. 시각적인 관점뿐만 아니라 운동의 물리학을 캡처해야 합니다. 이것은 압력, 적용된 힘, 물체와의 상호작용의 성질을 측정하는 특수한 장갑과 터치 센서를 사용하여 수행됩니다. 이것은 특히 중요합니다. 왜냐하면 물체 자체가 차량 모델에 따라僵硬성에서 크게 다를 수 있기 때문입니다. 이는 작업을 수행하는 방법에 직접적인 영향을 미칩니다.
다음은 운동학적 추적입니다. 시각적 또는 센서 기반 마커가 손목, 팔꿈치, 때때로 어깨에 부착됩니다. 여기에는 비디오에서 손의 위치를 추적할 수 있는 식별 가능한 마커(QR 코드와 유사한)를 가진 팔찌가 포함될 수 있습니다. 추가 센서, 즉 자이로스코프를 사용하여 관절 운동을 캡처합니다.
최종 목표는 운동의 역학을 완전히 재구성하는 것입니다. 어깨가 어떻게 움직이고, 팔꿈치가 어떻게 구부러지고, 손목이 어떻게 회전하는지. 모두 다음 단계인 사후 訓練에 필수적입니다.
사전 訓練에서 우리는 부분적으로 시뮬레이션에 의존할 수 있지만, 이 단계에서는 더 이상 작동하지 않습니다. 이 “마지막 마일”은 거의 정확하게 모델링할 수 없습니다. 예를 들어, 요리사가 도우를 어떻게 밀는지, 압력이 어떻게 분배되는지, 재료가 어떻게 느껴지는지 정확하게 시뮬레이션할 수 없습니다.
그렇기 때문에 사후 訓練에서 거의 모든 데이터는 실제 세계에서 나와야 합니다. 그리고 여기서 실제 도전이 나타납니다. 이러한 데이터를 실제로 얻는 방법입니다. 이 단계의 Egocentric 데이터를 수집하는 것은 접근, 전문 장비, 숙련된 근로자의 참여, 이후 데이터 준비와 같은 복잡한 다단계 과정입니다.
이론을 넘어서, 로봇이真正로 “살아”기 시작하는 곳입니다. 우리는 이 과정을 조직하고, 산업 전반의 팀이 직면하는 제약을 극복하며, 이러한 데이터셋을 대규모로 주석화할 수 있을 때입니다. 이것은 다음 부분에서 다루어질 것입니다. 여기서 우리는 이러한 데이터의 레이블링과 준비에서 발생하는 모든 도전을 자세히 살펴볼 것입니다.












