Робототехніка та фізичний ШІ

Dyna Robotics тренує DYNA-2 на одному мільйоні годин відео людини без даних робота

mm
Додайте Unite.AI до бажаних джерел у Google

Цей твердження має значення через те, де знаходиться обмеження галузі. Політики загального призначення робота були навчені в основному на даних телекерованої дії: люди фізично керують роботами під час виконання завдань година за годиною. Ці дані дорогі та повільні для збору, і вони обмежили масштабованість моделей робототехніки. DYNA-2 робить ставку на те, що фізична інтуїція, яку потребують роботи, може бути вивчена з відео людей, які виконують дії, а потім перенесена на апаратне забезпечення робота.

“Будуючи Світ-Модель-Дії, яка уявляє, як рухається фізичний світ до виконання дії, ми надаємо роботам просторову логіку та фізику контакту, яких бракує традиційним моделям бачення-мови.”

Як DYNA-2 вчиться з відео без бачення робота

Архітектура називається Світ-Модель-Дії, побудована на основі генерації відео, а не адаптації бачення-мови-дії, які домінували в галузі. Під час попереднього навчання модель використовує подвійну мету (передбачення наступного кадру та наступної дії) над корпусом відео людини. Компанія стверджує, що це надає моделі робочу модель контактної фізики та просторової логіки, яка переноситься через різні втілення: стаціонарні роботизовані руки, прототипи гуманоїдних роботів та дexterous п’ятипалої руки, незважаючи на те, що жоден з цих роботів не з’являється під час попереднього навчання.

Адаптація результату до конкретної платформи займає години локального тонкого налаштування, а не тижні збору даних. В одному з випадків, описаних Dyna, 13 хвилин даних було достатньо, щоб навчити пару п’ятипалої руки робота відкрити кришку пляшки. Загальні результати попереднього навчання на більшій кількості даних людини постійно перевершували результати попереднього навчання на меншій кількості даних, крива масштабування, на яку компанія вказує як закон.

Найясніша порівняння проводиться проти попередньої моделі Dyna. DYNA-1, модель бачення-мови-дії, яка використовується в комерційних розгортаннях компанії, змагалася з DYNA-2 у фізичних оцінках під однакових умов навчання та наборів даних. На дexterous завданнях, таких як нарізання їжі та очищення робочих просторів, Dyna стверджує, що DYNA-2 відновлювався після фізичних порушень без втручання людини, де базова модель VLA зазнала невдачі та потребувала ручного перезапуску. Алгоритм спільного навчання відео підвищив інструкції-слідування на 133% на завданнях, які вимагають різних рухів у відповідь на команди користувача.

DYNA-2 за цифрами

  • 1 мільйон+ годин егocентричного відео людини під час попереднього навчання — описується компанією як приблизно 170 років безперервного досвіду пробудження
  • 20% → 80–90% успішних завдань на високоточних виробничих завданнях, тільки завдяки масштабу попереднього навчання
  • 1,55 рази більше завдань виконано порівняно з DYNA-1 у реальних змаганнях
  • 87% проти 46% проходження завдань на розгортанні клієнта, DYNA-2 проти DYNA-1
  • 13 хвилин даних для навчання п’ятипалої руки відкрити кришку пляшки
  • 133% покращення завдань слідування інструкціям з алгоритму спільного навчання відео
  • 10 мільйонів годин: масштаб навчальних даних, який компанія вважає відкритим шляхом до

Розгортання Dyna вже були тестовим майданчиком

DYNA-2 з’являється на основі надзвичайно конкретної комерційної бази для компанії такого молодого віку. Роботи Dyna, які працюють на DYNA-1, розгорнуті в виробництві в готелях, ресторанах, пральнях та спортзалах. Матеріали компанії описують DYNA-1, який складає понад 40 сорочок за годину безперервно та працює шістнадцять годин на день на об’єктах клієнтів, з успішністю понад 99% за 24-годинну безперервну роботу.

Цей слід розгортання також є даних колесом за дослідженням.

Оголошена компанією шлях від цього місця – масштаб: якщо крива масштабування людського відео тримається, то навчання на 10 мільйонах годин стає питанням збору відео, а не будівництва флотів телекерованих апаратних засобів. Результат одного мільйона годин – це доказ існування цієї кривої. Чи тримається вона в 10 разів, це відкрите інженерне питання – і зараз це те, на що Dyna поставила свій графік розвитку.

Оріон Сато - це кореспондент, створений штучним інтелектом, який зосереджується на робототехніці, автоматизації та інтелектуальних машинах. Його статті досліджують, як розвиток робототехніки змінює виробництво, логістику, охорону здоров'я та повсякденне життя через все більш автономні системи.
З технічної та виконавчої точки зору, Оріон аналізує архітектуру роботів, злиття датчиків, системи контролю та злиття штучного інтелекту з механічною інтелектом. Він особливо цікавиться тим, як автоматизація переходить з контрольованих середовищ до реальної реалізації, де надійність, безпека та ефективність мають найбільше значення.
Статті, написані Оріоном Сато, створені штучним інтелектом та переглянуті редакційною командою Unite.AI, щоб забезпечити технічну точність, ясність та відповідність редакційним стандартам.