사상 리더

새로운 로봇트 경쟁의 내부: 데이터, 모델, 제조

mm
Unite.AI를 Google의 선호 소스에 추가

혁신은 종종 고립되지 않다. 더 자주, 그것은 기술이 어디로 향하는지 이해하려고 하는 엔지니어, 창립자, 연구자 및 투자자 간의 대화에서 태어난다.

1년 동안 나는 세계各地의 수십 개의 컨퍼런스에 참석했다. 비즈니스 여행은 때때로 수개월 동안 지속되며, 아시아에서 북미까지 파트너와 고객との 회의가 열린다. 그러나 최근 스위스에 갔던 여행은 특히 흥미로웠다. 그것은 그곳에서 있었던 대화와 사람들 때문이었다.

취리히는 로봇공학과 물리적 인공지능의 미래가 활발히 논의되고 있는 곳 중 하나로 입증되었다. 이러한 대화가 깊어질수록 로봇공학에서 실제 경쟁은 데이터를 중심으로 전개되고 있음을 더 명확히 알 수 있다.

유럽의 실리콘 밸리

취리히는 전통적으로 금융 부문과 관련되어 왔지만 최근 몇 년 동안 유럽의 실리콘 밸리라고 불리우고 있다. 이는 유럽에서 가장 존경받는 엔지니어링 대학 중 하나인 취리히 연방 공과 대학(ETH Zurich)와 관련이 있다. 이 대학은 세계各地의 연구자, 박사 과정 학생, 기업가, 엔지니어들을 끌어모으고 있다. 결과적으로 대학을 중심으로 연구, 스타트업, 산업 프로젝트가 거의同時적으로 진화하는 강력한 기술 생태계가 형성되었다.

내가 그곳을 방문한 이유 중 하나는 로봇공학 시장에서 Introspector가 무엇을 제공할 수 있는지 더 깊이 이해하기 위해서였다. 이 산업은 2025년 초부터 번창해 왔으며, 많은 스타트업이 이 분야에 진입하려고 하고 있다. 주요 기술 회사들의 기술적 돌파구가 이 산업을 활발히 재형성하고 있다. 그러나 이러한 모든 모멘텀에도 불구하고, 이 분야는 여전히 더 많은 질문을 제기한다.

취리히는 또한 우리의 파트너인 Lightly의 본거지이다. 그들은 로봇공학, 컴퓨터 비전, 인공지능의 교차점에서 일하는 동료들을 소개해주었다. 이 지역 기술 생태계에서 강조하고 싶은 한 가지 중요한 측면은 사람들이 놀라울 정도로 열려 있고 환영하는 태도라는 것이다. 그들은 아이디어와 가설을 공유하는 것을 두려워하지 않으며, 해결하려고 하는 도전 과제와 진행 중인 실험에 대해 이야기한다. 결과적으로 시장의 실제 상황과 산업이 어디로 향하는지 더 빠르게 이해할 수 있다.

사람들이 나에게 유럽의 “실리콘 밸리”가 미국의 것과 어떻게 다른지 묻는다면, 대답은 종종 그들을 놀라게 한다. 취리히에서는 일과 삶의 균형이 훨씬 더 강하다. 아침에는 스포츠를 하고, 낮에는 집중된 작업을 하는데, 조용하면서도 생산적인 리듬을 유지하고, 저녁에는 산에서 가족과 함께 시간을 보거나 단순히 휴식을 취한다. 샌프란시스코에서는 항상 다른 사람보다 더 열심히 일해야 한다는 느낌이 있다. 취리히에서는 속도가 다르다. 더 지속 가능하다. 그러나 기술적 야망의 수준은 여기서 더 낮지 않다.

로봇보다 먼저 데이터

그 여행에서 얻은 주요 인사이트 중 하나는 매우 간단한 관찰이었다. 많은 사람들이 오늘날 로봇공학에 관심을 가지고 있다. 그러나 이 산업에 대한巨大的 관심에도 불구하고, 많은 팀은 여전히 탐색 단계에 있다. 그들은 새로운 로봇공학과 물리적 인공지능의 물결에서 어떤 역할을 할 수 있을지, 어떤 기여를 할 수 있을지 이해하려고 한다.

많은 대화는 결국 같은 주제로 수렴한다. 데이터. 오늘날, 이 산업은 정교한 운동任务에 대한 데이터가 부족하다. 즉, 미세한 운동 기술이다. 로봇의 능력은 여전히 매우 제한적이다. 인간이 손으로 거의 자동으로 하는 것 – 객체를 잡고, 돌리고, 조심스럽게どこ에 놓고, 작은 조작을 수행하거나 – 로봇에게는 가장 어려운 작업 중 하나이다.

여기서의 진보의 열쇠는 주로 대규모, 적절하게 수집된 데이터 세트에 있다. 오늘날, 사람들은 종종 1인칭 관점에서 기록된 에고센트릭 데이터 세트에 대해 이야기한다. 시스템은 인간의 행동을 자기가 수행하는 것처럼 캡처한다. 그러나 실제로, 에고센트릭 데이터 세트의 개념은 매우 다른 것을 의미할 수 있으며 기술적인 질문을 많이 제기한다. 카메라는 어디에 위치해야 하는가? 이마에, 가슴에, 아니면 눈높이에? 비디오 녹화를 동반하는 센서는 무엇인가? 손 움직임을 캡처하는 경우, 연산자는 특수 장갑을 사용해야 하는가? 그리고 그렇다면, 그 장갑에는 감각 센서, 자이로스코프, 또는 다른 운동 추적 시스템이 포함되어 있어야 하는가?

보다 복잡한 질문이 발생한다. 어떻게 하면 운동의 깊이를 제대로 캡처할 수 있는가? 2차원 평면에서 손의 위치뿐만 아니라, 3차원 공간에서 어떻게 움직이는지 이해하는 것이 중요하다.

현재까지 산업은 통일된答案에 도달하지 못했다. Đó là 왜 많은 팀이 오늘날 다른 센서 구성, 녹음 방법, 데이터 세트 형식을 실험하고 있는가.

다중 모달 시스템

로봇공학을 위한 데이터 수집에 대한 대화가 시작되면, 추가 센서와 다중 모달리티에 대한 주제가 빠르게 등장한다. 이것은 몸의 움직임, 손의 동작, 객체와의 상호작용을 더 높은 정밀도로 캡처할 수 있게 해준다. 또한 데이터 수집 중에 오류를 줄여준다.

사람이 카메라로 자신의 행동을 녹음할 때, 항상 일부 자료가 사용할 수 없는 위험이 있다. 카메라는 약간 이동할 수 있고, 촬영 각도가 올바르지 않을 수 있으며, 연산자가 실수로 반대 방향으로 돌거나, 너무 빠른 동작을 수행할 수 있다. 결과적으로, 녹화된 자료의 상당한 부분이 폐기된다. 간단한 예로,真正로 사용할 수 있는 1시간의 비디오를 얻으려면, 연산자는 약 2시간의 원시 영상을 녹화해야 한다.

추가 센서가 이러한 문제를 일부 보상할 수 있다. 카메라가 약간 이동하더라도, 센서 데이터는 여전히 손이나 몸의 움직임을 재구성할 수 있다. 결과적으로, 2시간의 녹화 대신, 약 1시간 20분의 녹화로 동일한 양의 사용 가능한 데이터를 얻을 수 있다. 이는 데이터 수집의 효율성을 크게提高하고, 데이터 세트를 생성하는 비용을 줄인다.

그этому, 많은 팀이 다중 모달 데이터 주석에 대한 관심이 증가하는 것을 알 수 있다. 이것은 로봇공학과 구체화된 인공지능 개발에 직접적으로 연결된 더 가시적인 트렌드 중 하나가 되었다.

다음 점은 이러한 데이터 세트의 레이블이다. 우리는 Keymakr에서 로봇공학 사례를 위한 클라이언트 데이터 세트와 함께 일할 때 비슷한 질문을 만났다. 이러한 주석은 실제로 어떻게 보일까? 골격적이어야 하는가? 2차원 또는 3차원이어야 하는가? 강화 학습의 요소를 파이프라인에 통합해야 하는가? 수십 개의 이러한 질문이 있다. 엔지니어들은 아직誰도 어떤 특정 데이터 구성이 실제 기술적 돌파구로 이어질지 확신할 수 없다고 인정한다.

이러한 우려는 이해할 수 있다. 복잡한 데이터 세트를 구축하는 것은 비싼 과정이다. 데이터 구조에서의 오류는 수천 또는 수백만 달러의 비용을 초래할 수 있다. “잘못된” 데이터 세트를 수집하거나 실제 세계에서 재현하기 어려운 조건에서 녹화할 수 있다. 결과적으로, 전체 프로젝트가 무너질 수 있다. đó là 왜 오늘날, 모델 자체와 모델을 훈련하는 데이터의 품질 및 아키텍처에 더 많은 주목을 받고 있다.

시장에서 어떤 로봇이 필요할까?

전형적인 산업용 로봇은 수십 년 동안 자동차 조립 라인에서 작동해 왔으며, 실제로 컴퓨터 비전이나 복잡한 인공지능 모델이 거의 필요하지 않다. 그들의 작업은 매우 구체적이다. 높은 정밀도와 일관성으로 왼쪽, 오른쪽, 위, 아래와 같은 엄격한 반복 동작을 수행한다. 이 분야에서 그들은 이미 인간을 능가했다.

완전히 다른 범주는 인형 로봇이다. 이러한 시스템은 “뇌”가 필요하다. 즉, 공간을 탐색하고, 주변 환경을 인식하며, 상황의 맥락을 이해하고, 사전 프로그램된 궤적을 통해가 아니라 실제 세계에 적응하여 조종기를 제어하는 능력이 필요하다.

현대 공장의 자동화 수준이 높음에도 불구하고, 여전히 많은 작업이 인간에 의해 수행된다. 객체를 이동시키는 것, 박스를 집는 것, 부품을 분류하는 것, 구성 요소를 고정하는 것, 또는 재료를 정리하는 것과 같은 작은 동작은 유연성과 조정성이 필요하다. 이 영역은 여전히 자동화하기 가장 어려운 영역 중 하나이며, 여기서 인형 시스템이 자신의 역할을 찾을 수 있다.

나는 대화한 많은 팀이 유사한 비즈니스 모델을 사용한다. 그들은 공장에 접근하여 특정 생산 사례를 해결하는 것을 제안한다. 예를 들어, 일일 전체를 창고 구역 사이에서 박스를 옮기는 작업자에게, 엔지니어는 비교적 간단한 실험을 제안한다. 작업자를 카메라와 센서 세트로 장비하고, 그들의 행동을 수천 시간 동안 녹음한 다음, 이 데이터를 사용하여 인형 로봇을 제어할 모델을 훈련한다.这样, 로봇은 인간 작업자가 수행하는 정확한 작업을 수행하도록 학습한다.

본질적으로, 회사는 인형 플랫폼을 구매하고, 개발 팀은 특정 상황 또는 생산 작업 그룹을 위해 행동을 복제하는 사용자 정의 모델을 구축한다. 이것은 모든 작업을 해결할 수 있는 보편적인 지능이 아니다. 특정 시나리오 또는 생산 작업 그룹을 위해 훈련된 기술 세트이다. 오늘날 많은 엔지니어에게 이는 더 현실적인 접근 방식으로 보인다. 보편적인 로봇을 즉시 생성하려고 시도하는 대신, 팀은 狭い지만 경제적으로 жиз능한 자동화 시나리오에 집중한다.

비즈니스 차원

미래가 사용자 정의 모델에 있다면, 경제적 관점에서 이것이 비교적 긴 개발 경로라는 것을 이해하는 것이 중요하다.

각 산업은 본질적으로 자신의 세계이다. 모든 생산 환경에는 자신의 프로세스, 워크플로, 예외가 있다. 자동차 공장에서 작동하는 로봇을 단순히 식품 제조 또는 창고 물류로 이전할 수 없다. 각 경우에, 시스템을 처음부터 다시 훈련해야 한다.

이것은 다음 논리적인 질문으로 이어진다. 이러한 기술의 첫 고객은 누구일까?

이 단계에서, 주요 사용자는 아마도 대규모 기업일 것이다. 예산이 있으며, 자동화가 의미있는 경제적 영향을 미칠 수 있는 곳이다. 오늘날, 인형 로봇의 하드웨어 비용은 약 6만 달러에서 9만 달러이다. 이것은 기본 구성이다. 그 위에 유지 보수 비용, 배터리, 충전기, 인프라, 소프트웨어가 있다.

결과적으로, 이러한 시스템을 실험할 수 있는 회사들은 대규모 조직, 자동차 제조업체, 식품 기업, 주요 산업 기업이다.

물론, 더 작은 부문에서도 초기 사용자가 일부 있을 수 있다. 일부 회사에서는 특정 작업을 위해 1~2개의 로봇을 구매할 수 있다. 그러나 대부분의 경우, 이러한 비즈니스들은 아직 특정 운영 시나리오를 위한 사용자 정의 데이터 세트를 수집하고 주석을 달기 위해 수십만 유로를 투자할 준비가 되지 않았다. 그들에게 인간 노동은 여전히 더 저렴한 선택이다.

로봇공학 혁신의 장기 게임

우리는 결국 기본적인 경제적 질문에 도달한다. 인간과 로봇 중 무엇이 더 효율적인가? 오늘날의 경제를 살펴보면, 답은 명백하다. 인간 노동은 더 저렴하며, 새로운 조건에 더 빠르게 적응하며, 복잡한 인프라를 필요로 하지 않는다.

那么, 왜 산업은 오늘날에도 로봇공학에 투자하는가? 答은 주로 전략적이다.

많은 회사들은 기술적 리더십을 위한 경쟁이進行中이라는 것을 이해한다. 그들은 높은 비용에도 불구하고, 로봇공학 경제가 변경될 때 앞서 있도록 해결책을 개발하고 있다.

전자 장치가 발전하고, 구성 요소 비용이 하락하며, 컴퓨팅 효율이 향상됨에 따라, 로봇공학은 결국 더 경제적이 될 것이다. 그리고 그때, 로봇공학을 준비한 회사, 모델을 구축하고, 데이터를 축적하고, 필요한 기술 인프라를 구축한 회사가优势를 가지게 될 것이다.

예를 들어, 대규모로 인형 로봇을 사용할 수 있는 새로운 규제가 나타난다. 또는 정부가 산업의 로봇화를 보조금 지급하기 시작한다. 이러한 시나리오에서, 시장은 몇 년 내에 크게 성장할 수 있다. 그리고 미리 준비한 회사, 모델을 갖춘 회사, 연구를 수행한 회사, 기술 스택을 갖춘 회사가 가장 많은 혜택을 받게 될 것이다.

그этому, 개발은 현재에도 계속되고 있다. 비즈니스 경제학이 아직 이상적이지 않을 수 있지만, 많은 회사들에게这是 미래에 대한 투자이다. 기술이 더 접근하기 쉬워지고, 수요가 급격히 증가할 때를 위한 투자이다.

그리고 이러한 경쟁에서, 많은 기술적 혁신에서와 같이, 한 가지 요소가 종종 결정적이다. 누가 먼저 시작했는가? 이 sentido에서, 오늘날의 로봇공학은 인공지능의 초기 단계와 많이似하다. 그때도 더 많은 질문이 있었지만, 데이터와 인프라를 먼저 시작한 팀이最終적으로整个 산업의 방향을 결정했다.

마이클 아브라모프는 인트로스펙터(Introspector)의 창립자이자 CEO로, 15년 이상의 소프트웨어 엔지니어링 및 컴퓨터 비전 AI 시스템 경험을 바탕으로 기업급 레이블링 툴을 개발하고 있습니다.

마이클은 소프트웨어 엔지니어 및 연구개발 책임자로 경력을 시작하여 확장 가능한 데이터 시스템을 구축하고 교차기능 엔지니어 팀을 관리했습니다. 2025년까지 그는 데이터 레이블링 서비스 회사인 키마크르(Keymakr)의 CEO로 재직하며 인간-인-루프 워크플로, 고급 QA 시스템, 대규모 컴퓨터 비전 및 자율주행 데이터 요구를 지원하기 위한 맞춤형 툴링을 개척했습니다.

그는 컴퓨터 과학 학사 학위를 가지고 있으며 엔지니어링 및 창의적 예술을 배경으로 어려운 문제를 해결하는 데 다학제적 렌즈를 제공합니다. 마이클은 기술 혁신, 전략적 제품 리더십, 실제 영향의 교차로에서 살며 자율 시스템 및 지능형 자동화의 다음 전선을 앞으로 추진하고 있습니다.