Robotyka i fizyczna AI

Dyna Robotics szkoli DYNA-2 na milionie godzin nagranego materiału wideo z ludźmi, bez danych z robotów

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Twierdzenie to ma znaczenie ze względu na to, gdzie leży ograniczenie w tej dziedzinie. Polityki robotów ogólnego przeznaczenia były szkolone głównie na danych z działań teleoperowanych: ludzie fizycznie prowadzili roboty przez zadania, godzina po godzinie. Te dane są drogie i wolno zbierać, a także ograniczają skalowalność modeli robotów. Zakład DYNA-2 jest taki, że intuicja fizyczna, której potrzebują roboty, może być naucona z nagranego materiału wideo z ludźmi, a następnie przeniesiona na sprzęt robota.

“Poprzez budowanie modelu świata i akcji, który wyobraża sobie, jak porusza się świat fizyczny przed podjęciem akcji, dajemy robotom zdolność rozumienia przestrzeni i fizyki kontaktu, których tradycyjne modele widzenia i języka po prostu nie posiadają.”

Jak DYNA-2 uczy się z wideo bez widzenia robota

Architektura jest tym, co Dyna nazywa modelem świata i akcji, zbudowanym na generowaniu wideo, a nie na adaptacjach widzenia-języka-akcji, które dominowały w tej dziedzinie. Podczas pre-trenowania model uruchamia podwójny cel (przewidywanie następnego klatki i następnej akcji) nad korpusami wideo z ludźmi. Firma twierdzi, że daje to modelowi działający model fizyki kontaktu i zdolność rozumienia przestrzeni, który przenosi się na różne wcielenia: stacjonarne ramiona robota, prototypy humanoidów i dłonie pięcio-palczaste, pomimo że żaden z tych robotów nie pojawia się w pre-trenowaniu.

Dostosowanie wyniku do określonej platformy zajmuje kilka godzin lokalnego dokształcania, a nie tygodni zbierania danych. W jednym przypadku, o którym mówi Dyna, 13 minut danych było wystarczających, aby nauczyć parę dłoni robota pięcio-palczastych, aby odkręcić nakrętkę butelki. Zsumowane wyniki z 15 zadań testowych wykazały, że polityki wstępnie szkolone na większych ilościach danych ludzkich konsekwentnie przewyższały te szkolone na mniejszych, co firma uważa za dowód istnienia krzywej skalowania.

Najwyraźniejsze porównanie jest z własnym poprzednim modelem Dyna, DYNA-1, modelem widzenia-języka-akcji, który działa w komercyjnych wdrożeniach firmy. DYNA-2 i DYNA-1 zostały poddane ocenie fizycznej w warunkach wdrożenia, z tymi samymi krokami trenowania i zbiorami danych. W zadaniach wymagających delikatności, takich jak krojenie jedzenia i czyszczenie przestrzeni roboczych, Dyna twierdzi, że DYNA-2 odzyskał od zakłóceń fizycznych bez interwencji człowieka, podczas gdy model VLA wymagał ręcznego resetu. Algorytm współtrenowania wideo podniósł wyniki instrukcji o 133% w zadaniach wymagających odrębnych ruchów w odpowiedzi na polecenia użytkownika.

DYNA-2 w liczbach

  • 1 milion+ godzin wideo z ludźmi w pre-trenowaniu — opisanych przez firmę jako około 170 lat ciągłego doświadczenia
  • 20% → 80–90% wskaźników powodzenia zadań o wysokiej precyzji, z samej skali pre-trenowania
  • 1,55-krotnie więcej zadań wykonanych niż DYNA-1 w rzeczywistych, bezpośrednich ocenach
  • 87% vs. 46% wyniki zdawalności w wdrożeniu u klienta, DYNA-2 przeciwko DYNA-1
  • 13 minut danych wystarczających do nauczenia dłoni robota pięcio-palczastych, aby odkręcić nakrętkę butelki
  • 133% poprawa wyników instrukcji z algorytmu współtrenowania wideo
  • 10 milionów godzin: skala danych trenowania, którą firma uważa za osiągalną dzięki temu podejściu

Wdrożenia Dyna były już poligonem doświadczalnym

DYNA-2 pojawia się na konkretnym komercyjnym gruncie, co jest niezwykłe dla firmy tak młodej. Roboty Dyna, zasilane przez DYNA-1, są wdrożone w produkcji w hotelach, restauracjach, pralniach i siłowniach. Materiały samej firmy opisują DYNA-1 jako składające ponad 40 koszul na godzinę w sposób ciągły i pracujące szesnaście godzin dziennie na terenie klienta, z wskaźnikiem powodzenia przekraczającym 99% podczas 24-godzinnego nieprzerwanego działania.

To wdrożenie jest również źródłem danych dla badań.

Ścieżka firmy od tego momentu jest taka, aby skalować: jeśli krzywa skalowania wideo z ludźmi się utrzyma, firma twierdzi, że trenowanie na 10 milionach godzin staje się kwestią zbierania wideo, a nie budowania flot teleoperacyjnych. Wynik z 1 milionem godzin jest dowodem, że krzywa istnieje. Czy krzywa utrzyma się przy 10-krotnym wzroście, jest otwartym pytaniem inżynieryjnym — i jest to pytanie, na które firma postawiła swoją mapę drogową.

Orion Sato jest korespondentem wygenerowanym przez AI, specjalizującym się w robotyce, automatyce i inteligentnych maszynach. Jego pisanie opisuje, jak postępy w robotyce zmieniają produkcję, logistykę, opiekę zdrowotną i codzienne życie poprzez coraz bardziej autonomiczne systemy.
Z technicznego i ukierunkowanego na wykonanie punktu widzenia, Orion analizuje architektury robotów, fuzję czujników, systemy sterowania i zbieżność AI z inteligencją mechaniczną. Jest szczególnie zainteresowany tym, jak automatyka przechodzi z kontrolowanych środowisk do rzeczywistego wdrożenia, gdzie niezawodność, bezpieczeństwo i wydajność mają największe znaczenie.
Artykuły autorstwa Orion Sato są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić techniczną dokładność, klarowność i zgodność z normami redakcyjnymi.