사상 리더
로봇 훈련의 실제 비용

첫 번째 부분에서, 우리는 로봇이 기본적인 기계에서 환경을 이해하는 방법에 대해 논의했습니다. “마지막 마일” 단계에서 – 로봇이 특정한 사용자 정의 작업을 위해 사전 훈련을 받은 후 – 예상치 못한 장벽이 나타납니다. 그것은 데이터와 관련이 있습니다. 데이터의 수집, 조직 및 실제 환경에서의 확장입니다.
이 단계에서 개념과 구현 사이의 간격이 가장 현저하게 나타납니다. 주요 병목 현상은 무엇이며, 어떻게 최소한의 마찰로 극복할 수 있을까요?
수천 시간의 데이터가 몇 년의 작업으로 변하는 이유
이미 사전 훈련을 받은 로봇을 상상해 보겠습니다. 그것은 주변 환경을 탐색할 수 있고, 이동할 수 있고, 장애물을 피할 수 있고, 물체와 상호 작용할 수 있습니다. 그것은 “10살 아이”와 비슷합니다. 일반적으로 독립적으로 행동할 수 있습니다. 다음 단계는 특정 조건에서 특정 작업을 수행하도록 가르치는 것입니다. 예를 들어, 자동차 생산 라인에서 유리 패널과 밀봉 스트립을 설치하는 것입니다.
일견 단순한 작업으로 보입니다. 하나의 시나리오를 마스터하는 것이고, 필요한 데이터의 양은 사전 훈련보다 훨씬 작습니다. 기초 훈련에는 수십 만 시간의 데이터가 필요할 수 있지만, 사후 훈련에는 수천 시간만 필요할 수 있습니다. 그러나 이러한 숫자는 오해의 소지가 있습니다.
실제 시간으로 번역할 때, 과정은 실제 복잡성을 나타냅니다. 표준 작업 일정에서, 한 사람이 한 달에 약 160시간을 일합니다. 그러나 이는 모든 시간이 기록에 사용될 수 있다는 것을 의미하지 않습니다.
실제로 끊임없는 중단이 발생합니다. 배터리가 방전되거나, 카메라가 이동하거나, 센서가 고장납니다. 장비 설정이 더 복잡할수록 문제가 발생할 가능성이 더 높습니다. 심지어 글러브에 장착된 센서가 작동을停止하면 프로세스가 중단되고 시간이 손실됩니다.
결과적으로 실제 데이터 수집 속도는 2-3배 더 낮습니다. 높은 품질의 1시간 녹화에는 실제 작업 시간 3시간이 필요할 수 있습니다. 이는 계산을 근본적으로 변경합니다. 5,000시간의 데이터는 약 15,000시간의 노동으로 번역됩니다.
복잡성의 계층
사전 훈련에서는 사람이 카메라를 가지고 일상 활동을 녹화하도록 요청하는 것이 충분할 수 있습니다. 그러나 이 단계에서는 특정 환경에 대한 액세스가 필요합니다. 예를 들어, 공장, 건설 현장 또는 전문 생산 시설입니다.
이것은 즉시 실제 제약을 도입합니다. 예를 들어, 건설 현장에서는 작업자가 안전 헬멧을 착용해야 하므로 특수 장비를 개발해야 합니다. 카메라가 장착된 헬멧은 пы지, 습기, 충격에 저항할 수 있어야 합니다.
그런 다음 사이트 자체에 대한 액세스가 필요합니다. 사이트 소유자와의 계약, 허가, 조건 협상을 해야 합니다. 이것은 거의 항상 추가 비용을 수반합니다. 회사에서는 보상을 기대하고, 작업자는 참여에 대한 보수를 받기를 기대합니다.
보험 및 안전 규정 준수도 중요한 문제가 됩니다. 장비가 필요한 표준을 충족하지 못하면 보험이 무효화될 수 있으며, 전체 프로세스를 재구성해야 할 수 있습니다.
일일 운영 수준에서 도전은 지속됩니다. 카메라는 켜져 있어야 하며, 모니터링되어야 하며, 유지보수되어야 합니다. 작업자는 장갑을 착용하고, 혹독한 조건에서 일합니다. 장비는 더러워지고, 마모되며, 고장납니다. 카메라는 몇 분 후에 종료될 수 있으며, 사용자는 이를 알아차리지 못할 수도 있습니다.
이것은 참가자가自分을 훈련해야 하는 필요성을 생성합니다. 그들은 장비를 사용하는 방법을 이해해야 합니다. 또한 지속적인 감시가 필요합니다. 누군가는 녹화가 진행 중이고 장치가 올바르게 작동하는지 확인해야 합니다.
원시 비디오에서 훈련 데이터로
녹화 후, 다음 단계가 시작됩니다. 데이터 수집, 업로드, 구조화, 품질 검증 및 레이블 지정.
원시 데이터는 비디오 및 센서 신호로 구성됩니다. 훈련 자료로 변환하려면 구조화해야 합니다. 객체를 식별하고, 동작을 캡처하고, 상태, 이동 및 환경과의 상호 작용을 설명해야 합니다. 여기서 주석이 작용합니다. 논리적인 질문이 발생합니다. 이러한 주석 워크플로우의 금본은 무엇일까요?
일부 경우에는 프레임에서 객체를 식별하기 위해 단순한 바운딩 박스가 충분합니다. 다른 경우에는 시간적 주석이 필요합니다. 시간 경과에 따른 동작 시퀀스를 설명하기 위해. 특정 시나리오에서는 키 포인트와 스켈레탈 모델을 사용하여 신체 이동을 캡처합니다. 더 복잡한 경우에는 3D 메시 또는 손 자세 추적이 필요합니다. 상호 작용 메커니즘을 정확하게 표현하기 위해. 추가 센서인 가속도계가 종종 통합되어 운동 역학 및 적용력을 캡처합니다.
이러한 프로젝트는 또한 팀의 확장을 필요로 합니다. 레이블 지정은 시간, 전문 지식 및 상당한 인적 자원이 요구되는 큰 작업입니다. 여기서 데이터 솔루션 제공업체가 등장합니다. 내부 주석 팀을 보유한 제공업체는 데이터 볼륨에 따라 팀을 확장할 수 있습니다. 예를 들어, Keymakr는 데이터 볼륨에 따라 전문가 한 명부터 수백 명의 주석자를 확장할 수 있는 능력으로 인해 특히 효과적이었습니다.
まだ 훈련에 대한 올바른 접근법은 없습니다
산업은 여전히 탐색 단계에 있습니다. 어떤 데이터 조합이 가장好的 결과를 낳는지에 대한 합의가 없습니다. 많은 접근법은 경험적으로 검증됩니다. 특정 실험에서 작동하기 때문입니다. 결과적으로, 다른 팀은 자신의 경험, 작업 및 제약 조건에 의해 형성된 다른 기술에 의존하게 됩니다.
학술적 및 응용 수준에서, 이것은 분산으로 이어집니다. 연구소와 회사들은 다른 방향으로 이동하고 있습니다. 상황은 자율 주행 자동차의 초기와 비슷합니다. 테슬라는 LiDAR 없이 비전만을 사용하는 접근법에 베팅했으며, 대부분의 다른 선수들은 LiDAR를 핵심 센서로 선택했습니다.
오늘날, LiDAR 기반 시스템은 더 안정적인 성능을 나타내는 경향이 있습니다. 그러나 테슬라의 접근법은 계속 발전하고 있습니다. 차이점은 자율 주행 자동차 시장은 이미 성숙했다는 것입니다. 안정적인 아키텍처가 등장했으며, 한계는 잘 이해되고, 상당한 전문 지식이 축적되었습니다.
반면에, 물리적 AI 및 유사한 모델 훈련을 위한 이러한 수준의 성숙도는 아직 달성되지 않았습니다. 시장은 아직 형성 중이며, 표준이 부족하며, 많은 진보는 실험에 의해 주도되고 있습니다. 모델 훈련, 효율성 개선 및 실제 시나리오에 대한 적응을 위한 새로운 방법이 계속 등장하고 있습니다. 이는 이 분야에서 가장 중요한 돌파구가 아직 앞에 있음을 시사합니다.
인간은 강화 시스템입니다
레이블 지정은 고립되어 있지 않으며, 모델만을 위한 도구가 아닙니다. 엔지니어가 모델을 구축하는 데 사용하는 도구입니다. 이를 통해 엔지니어는 현실을 공식화하고, 주요 매개 변수를 식별하며, 시스템의 행동 규칙을 정의합니다.
엔지니어의 작업은 시스템이 실제 환경에서 올바르게 작동하도록 훈련하는 것입니다. 예를 들어, 기본 시나리오는 네 가지 동작으로 구성될 수 있습니다. 유리잔을 집어들기, 수도꼭지를 켜기, 물을 채우기, 수도꼭지를 끄기. 그러나 실제 상황에서 편차가 발생합니다. 유리잔이 넘칩니다.
그 순간, 모델은 시나리오를 완료하고 추가 동작을 수행하도록 예상됩니다. 물 흐름을 중지하고, 물 수준을 조정하고, 물이 넘치지 않도록 합니다. 이것은 상황에 대한 이해를 기반으로 하는 행동 논리입니다.
엔지니어는 주기를 따릅니다. 데이터를 주석으로 표시하고, 모델을 훈련시키고, 테스트합니다. 시스템이 작동하면 가설이 확인됩니다. 그렇지 않으면 분석이 시작됩니다.
어떤 시점에 모델이 중요한 매개 변수를 누락하고 있음을 알 수 있습니다. 예를 들어, 유리잔의 채움 수준. 이전에 데이터에는 객체(유리잔, 수도꼭지, 손잡이) 및 동작(열기, 채우기, 닫기)에 대한 주석이 포함되었지만, 상태(채움 수준)에 대한 주석은 포함되지 않았습니다.
그런 다음 프로세스에 새로운 계층이 추가됩니다. 채움 수준을 주석으로 표시하고, 정식화합니다. 예를 들어, 85% 이상을 임계 상태로 정의합니다.
이것은 훈련의 다음 반복으로 이어집니다. 이러한 반복이 수백 개 있을 수 있습니다.
누구도 시스템이 즉시 작동할 것으로 가정하지 않습니다. 반대로, 프로세스는 점진적인 근사값을 중심으로 구축됩니다. 먼저, 기준 버전을 생성하고, 실제 또는 거의 실제 조건에서 테스트하고, 격차를 식별하고, 시스템을 tinh chỉnh합니다. 이것은 제가 Introspector와 함께 클라이언트와 논의하는 것입니다. 함께 물리적 AI의 전체 여정을 거치게 됩니다.
어떤 시점에 원하는 결과가 달성됩니다. 그러나 그 가치는 시스템이 작동하기 시작하는 것뿐만 아니라, 결과를 더 예측 가능한 방식으로 재현할 수 있는 축적된 경험에 있습니다.
모두가 잊어버리는 경제학
지난 1년 동안, 나는 회사들이 이기적 데이터와 함께 작업할 때 가장 큰 실수를 범하는 것을 보았습니다. 기술과 관련이 없습니다.
핵심 문제는 프로젝트 경제학을 과소평가하는 것입니다.
아이디어 단계에서 기술이 중심이 됩니다. 어떤 모델을 사용할지, 어떻게 훈련할지, 어떤 접근법을 적용할지에 대해 연구하고, 연구하고, 토론하고, 가설을 테스트합니다. 이것은 자연스러운 과정입니다. 기술이 가장 구체적이고 명백한 문제의 일부로 느껴지기 때문입니다.
그러나 팀이 이 단계에서 직접적인 질문을 던지지 않는 경우가 많습니다. 얼마나 비용이 들지?
프로젝트가 이론에서 구현으로 이동할 때, 모델 뒤에 수만 시간의 데이터가 있다는 것이 명백해집니다. 이 데이터를 수집하려면 시간, 실제 환경에 대한 액세스, 전문가의 참여가 필요합니다. 레이블 지정은 또 다른 복잡성과 비용의 계층을 추가합니다. 결과적으로, 최종 숫자는 처음 예상한 것보다 훨씬 높습니다.
그러나 이러한 프로젝트를 추진해서는 안 된다는 것을 의미하지 않습니다. 반대로, 이러한 프로젝트가 산업을 발전시키는 원동력입니다.
그러나 중요한 것은 처음부터 도전의 규모를 이해하는 것입니다. 모델 훈련에서 복잡하고 자원 집약적인 데이터 작업이 뒤따르는 것을 인식하는 것입니다.
thậm chí 강력한 아이디어도 데이터 비용이 7자리 숫자 이상으로 증가하기 시작하면 완전한 구현에 도달하지 못할 수 있습니다.
또한 로봇공학에서 오늘날 발생하는 가장 중요한 변화는 이 인식과 관련이 있습니다. 이러한 시스템의 미래는 그들이 “지능적”인지와 데이터 파이프라인이 어떻게 구축되어 있는지에 의해 정의될 것입니다. 데이터 수집에서 최종 해석까지.












