로보틱스 및 피지컬 AI
다이나 로보틱스, DYNA-2를 인간 비디오 1백만 시간으로 훈련, 로봇 데이터 없이

이 주장은 분야의 제약이 있는 곳에 중요합니다. 일반적인 로봇 정책은 주로 텔레오퍼레이션 액션 데이터로 훈련되어 왔습니다. 즉, 인간이 로봇을 통해 작업을 수행하는 동안 로봇을 물리적으로 안내합니다. 이러한 데이터는 비용이 많이 들고 수집하기 어렵기 때문에 로봇 기초 모델이 확장할 수 있는 범위를 제한했습니다. DYNA-2의 베팅은 로봇이 물리적 직관을 얻는 데 필요한 것은 인간이 하는 것을 보여주는 비디오에서 학습할 수 있으며, 로봇 하드웨어로 전달할 수 있다고 합니다.
“우리가 세계-액션 모델을 구축하여 물리적 세계가 어떻게 움직이는지 상상하고 행동을 취할 수 있게 해줌으로써, 전통적인 비전-언어 모델이 결여한 공간적推論과 접촉 물리학을 로봇에게 제공합니다.”
DYNA-2가 로봇을 보지 않고 비디오에서 학습하는 방법
이 아키텍처는 다이나가 세계-액션 모델이라고 부르는 것으로, 비전-언어-액션 어댑테이션 대신 비디오 생성에 기반합니다. 사전 훈련 중에 모델은 인간 비디오 코퍼스에 대해 두 가지 목표(다음 프레임과 다음 액션 예측)를 수행합니다. 회사는 이것이 모델이 물리적 세계를 이해하고 공간적推論을 할 수 있도록 해주며, 이러한 지식이 다양한 로봇 몸체(정지 로봇 팔, 휴머노이드 프로토タイプ, 다exterous 다중 손가락 손)에 전달될 수 있다고 말합니다.
특정 플랫폼에 대한 결과를 적용하는 데에는 몇 시간의 로컬 세부 조정이 필요하며, 데이터 수집에는 몇 주가 필요합니다. 다이나는 13분의 데이터가 충분하여 다중 손가락 로봇 손이 병 캡을 열 수 있었다고 말합니다. 15개의 벤치마크 작업에서, 더 많은 인간 데이터로 사전 훈련된 정책은 덜한 데이터로 훈련된 정책보다 일관되게 성능이 좋았으며, 회사는 이것이 확장 곡선의 법칙이라고 말합니다.
가장 명확한 비교는 다이나의 이전 모델 DYNA-1과입니다. DYNA-1은 회사의 상업적 배포에서 실행 중인 비전-언어-액션 모델로, DYNA-2와 동일한 훈련 단계와 데이터 세트에서 물리적 평가를 수행했습니다. 다이나는 DYNA-2가 물리적干擾에서 회복할 수 있었으며, 사용자 명령에 대한 구체적인 동작을 요구하는 작업에서 133%의 지시를 따르는 점수를 개선했다고 말합니다.
DYNA-2의 숫자
- 1百만+ 시간의 인간 중심 비디오 사전 훈련 – 회사가 약 170년의 연속적인覚醒 경험으로 설명
- 20% → 80–90% 작업 성공률, 사전 훈련 규모만으로 높은 정밀도 제조 작업
- 1.55배 더 많은 작업을 완료한 DYNA-1 대비 실제 평가
- 87% 대 46% 고객 배포에서 통과율, DYNA-2 대비 DYNA-1
- 13분의 데이터로 다중 손가락 손이 병 캡을 열 수 있음
- 133% 지시를 따르는 작업에서 개선된 비디오 공동 훈련 알고리즘
- 1천만 시간: 다이나가 접근법이 열어주는 훈련 데이터 규모
다이나의 배포는 이미 테스트 베드였다
DYNA-2는 매우 구체적인 상업적 기반을 가진 회사에서 나왔습니다. 다이나의 로봇은 DYNA-1을 실행하며, 호텔, 레스토랑, 세탁소, 체육관에서 배포되어 있습니다. 회사의 자료에 따르면 DYNA-1은 40개 이상의 셔츠를 1시간마다 접을 수 있으며, 고객 사이트에서 16시간 동안 99% 이상의 성공률을 보입니다.
이 배포는 또한 연구의 데이터 플라이휠입니다.
회사의 앞으로의 경로는 확장입니다. 다이나는 인간 비디오 확장 곡선이 유지된다면, 1천만 시간의 훈련이 비디오 수집 문제가 아니라 텔레오퍼레이션 리그를 구축하는 문제가 된다고 말합니다. 1백만 시간의 결과는 곡선이 존재한다는 증거입니다. 10배에서 곡선이 유지되는지 여부는 열린 엔지니어링 질문이며, 다이나는 지금 이 질문에 도전하고 있습니다.












