Робототехника и физический ИИ
Робототехника Dyna обучает DYNA-2 на миллионе часов видео с людьми, без данных о роботах

Этот факт имеет значение, потому что он связан с ограничением в этой области. Политики роботов-универсалов в основном обучались на данных о телеприсутствии: люди физически руководили роботами при выполнении задач, час за часом. Эти данные дороги и медленно собираются, и они ограничили масштабируемость моделей роботов. Ставка DYNA-2 заключается в том, что физическая интуиция, необходимая роботам, может быть получена из видео с людьми, а затем перенесена на робототехнику.
“Создавая модель мира-действия, которая представляет, как физический мир движется до принятия действия, мы даем роботам пространственную логику и физику контакта, которых традиционные модели зрения-языка просто не имеют.”
Как DYNA-2 обучается на видео без видения робота
Архитектура DYNA-2 представляет собой модель мира-действия, построенную на видео-генерации, а не на адаптациях зрения-языка-действия, которые доминировали в этой области. Во время предварительного обучения модель работает с двойной целью (предсказание следующего кадра и следующего действия) над корпусом видео с людьми. Компания утверждает, что это дает модели рабочую модель контактной физики и пространственной логики, которая переносится на различные воплощения: стационарные роботизированные руки, гуманоидные прототипы и ловкие пять-пальцевые руки, несмотря на то, что ни один из этих роботов не появляется в предварительном обучении.
Адаптация результата к конкретной платформе занимает несколько часов локальной тонкой настройки, а не недель сбора данных. В одном случае, который цитирует Dyna, 13 минут данных было достаточно, чтобы научить пару пятипальцевых роботизированных рук открывать бутылку. Суммируя результаты по 15 тестовым задачам, политики, предварительно обученные на большем количестве человеческих данных, последовательно превосходили те, которые были обучены на меньшем количестве данных, что является кривой масштабирования, на которую компания указывает как на закон.
Самое ясное сравнение – это сравнение с предыдущей моделью Dyna. DYNA-1, модель зрения-языка-действия, работающая в коммерческих развертываниях Dyna, противостояла DYNA-2 в физических оценках под одинаковыми шагами обучения и наборами данных. На ловких задачах, таких как нарезка продуктов и очистка рабочих пространств, Dyna утверждает, что DYNA-2 восстанавливалась после физических нарушений без вмешательства человека, в то время как базовая модель VLA потерпела неудачу и потребовала ручного сброса. Алгоритм совместного обучения видео повысил оценки выполнения инструкций на 133% на задачах, требующих различных движений в ответ на команды пользователя.
DYNA-2 в цифрах
- 1 миллион+ часов эгоцентрического видео с людьми в предварительном обучении — описывается компанией как примерно 170 лет непрерывного бодрствования
- 20% → 80–90% показатели успешности задач на высокоточных задачах производства, только из масштаба предварительного обучения
- 1,55 раза больше задач, выполненных по сравнению с DYNA-1 в реальных головных оценках
- 87% против 46% показатели прохождения на развертывании клиента, DYNA-2 против DYNA-1
- 13 минут данных для обучения пятипальцевых рук открывать бутылку
- 133% улучшение на задачах выполнения инструкций от алгоритма совместного обучения видео
- 10 миллионов часов: масштаб обучающих данных, который, по словам Dyna, открывает путь к
Развертывания Dyna уже были тестовой площадкой
DYNA-2 появляется на фоне необычно конкретной коммерческой базы для такой молодой компании. Роботы Dyna, работающие под DYNA-1, развернуты в производстве в отелях, ресторанах, прачечных и спортзалах. Материалы компании описывают DYNA-1, складывающую более 40 рубашек в час непрерывно и работающую 16 часов в день на объектах клиентов, с показателем успешности 99% и более за 24-часовую непрерывную работу.
Эта база развертывания также является данным маховиком за исследованием.
Объявленный компанией путь отсюда – масштаб: если кривая масштабирования видео с людьми сохраняется, утверждает Dyna, обучение на 10 миллионах часов становится вопросом сбора видео, а не строительства флотов телеприсутствия. Результат 1 миллиона часов – это доказательство существования кривой. Будет ли она сохраняться в 10 раз – это открытый инженерный вопрос – и теперь это тот, на который Dyna поставила свою дорожную карту.












