Robotyka i fizyczna AI
Dyna Robotics szkoli DYNA-2 na milionie godzin nagranego materiału wideo z ludźmi, bez danych z robotów

Twierdzenie to ma znaczenie ze względu na to, gdzie leży ograniczenie w tej dziedzinie. Polityki robotów ogólnego przeznaczenia były szkolone głównie na danych z działań teleoperowanych: ludzie fizycznie prowadzili roboty przez zadania, godzina po godzinie. Te dane są drogie i wolno zbierać, a także ograniczają skalowalność modeli robotów. Zakład DYNA-2 jest taki, że intuicja fizyczna, której potrzebują roboty, może być naucona z nagranego materiału wideo z ludźmi, a następnie przeniesiona na sprzęt robota.
“Poprzez budowanie modelu świata i akcji, który wyobraża sobie, jak porusza się świat fizyczny przed podjęciem akcji, dajemy robotom zdolność rozumienia przestrzeni i fizyki kontaktu, których tradycyjne modele widzenia i języka po prostu nie posiadają.”
Jak DYNA-2 uczy się z wideo bez widzenia robota
Architektura jest tym, co Dyna nazywa modelem świata i akcji, zbudowanym na generowaniu wideo, a nie na adaptacjach widzenia-języka-akcji, które dominowały w tej dziedzinie. Podczas pre-trenowania model uruchamia podwójny cel (przewidywanie następnego klatki i następnej akcji) nad korpusami wideo z ludźmi. Firma twierdzi, że daje to modelowi działający model fizyki kontaktu i zdolność rozumienia przestrzeni, który przenosi się na różne wcielenia: stacjonarne ramiona robota, prototypy humanoidów i dłonie pięcio-palczaste, pomimo że żaden z tych robotów nie pojawia się w pre-trenowaniu.
Dostosowanie wyniku do określonej platformy zajmuje kilka godzin lokalnego dokształcania, a nie tygodni zbierania danych. W jednym przypadku, o którym mówi Dyna, 13 minut danych było wystarczających, aby nauczyć parę dłoni robota pięcio-palczastych, aby odkręcić nakrętkę butelki. Zsumowane wyniki z 15 zadań testowych wykazały, że polityki wstępnie szkolone na większych ilościach danych ludzkich konsekwentnie przewyższały te szkolone na mniejszych, co firma uważa za dowód istnienia krzywej skalowania.
Najwyraźniejsze porównanie jest z własnym poprzednim modelem Dyna, DYNA-1, modelem widzenia-języka-akcji, który działa w komercyjnych wdrożeniach firmy. DYNA-2 i DYNA-1 zostały poddane ocenie fizycznej w warunkach wdrożenia, z tymi samymi krokami trenowania i zbiorami danych. W zadaniach wymagających delikatności, takich jak krojenie jedzenia i czyszczenie przestrzeni roboczych, Dyna twierdzi, że DYNA-2 odzyskał od zakłóceń fizycznych bez interwencji człowieka, podczas gdy model VLA wymagał ręcznego resetu. Algorytm współtrenowania wideo podniósł wyniki instrukcji o 133% w zadaniach wymagających odrębnych ruchów w odpowiedzi na polecenia użytkownika.
DYNA-2 w liczbach
- 1 milion+ godzin wideo z ludźmi w pre-trenowaniu — opisanych przez firmę jako około 170 lat ciągłego doświadczenia
- 20% → 80–90% wskaźników powodzenia zadań o wysokiej precyzji, z samej skali pre-trenowania
- 1,55-krotnie więcej zadań wykonanych niż DYNA-1 w rzeczywistych, bezpośrednich ocenach
- 87% vs. 46% wyniki zdawalności w wdrożeniu u klienta, DYNA-2 przeciwko DYNA-1
- 13 minut danych wystarczających do nauczenia dłoni robota pięcio-palczastych, aby odkręcić nakrętkę butelki
- 133% poprawa wyników instrukcji z algorytmu współtrenowania wideo
- 10 milionów godzin: skala danych trenowania, którą firma uważa za osiągalną dzięki temu podejściu
Wdrożenia Dyna były już poligonem doświadczalnym
DYNA-2 pojawia się na konkretnym komercyjnym gruncie, co jest niezwykłe dla firmy tak młodej. Roboty Dyna, zasilane przez DYNA-1, są wdrożone w produkcji w hotelach, restauracjach, pralniach i siłowniach. Materiały samej firmy opisują DYNA-1 jako składające ponad 40 koszul na godzinę w sposób ciągły i pracujące szesnaście godzin dziennie na terenie klienta, z wskaźnikiem powodzenia przekraczającym 99% podczas 24-godzinnego nieprzerwanego działania.
To wdrożenie jest również źródłem danych dla badań.
Ścieżka firmy od tego momentu jest taka, aby skalować: jeśli krzywa skalowania wideo z ludźmi się utrzyma, firma twierdzi, że trenowanie na 10 milionach godzin staje się kwestią zbierania wideo, a nie budowania flot teleoperacyjnych. Wynik z 1 milionem godzin jest dowodem, że krzywa istnieje. Czy krzywa utrzyma się przy 10-krotnym wzroście, jest otwartym pytaniem inżynieryjnym — i jest to pytanie, na które firma postawiła swoją mapę drogową.












