Robotika a fyzická AI
Dyna Robotics Trénuje DYNA-2 na Milionu Hodin Lidského Videu, Bez Robotických Dat

Tvrzení má význam kvůli omezení, ve kterém se nachází toto odvětví. Obecné robotické politiky byly většinou trénovány na datech teleoperovaných akcí: lidé fyzicky řídí roboty prostřednictvím úkolů, hodinu po hodině. Tato data jsou drahá a pomalá na sběr, a omezila, jak daleko mohou robotické modely základních funkcí škálovat. Sázka DYNA-2 spočívá v tom, že fyzická intuice, kterou roboti potřebují, může být naučena z videa lidí, kteří dělají věci, a poté přenesena na robotické hardwarové vybavení.
“Stavbou Svět-Akce Modelu, který si představuje, jak se fyzický svět pohybuje před provedením akce, poskytujeme robotům prostorovou logiku a fyziku kontaktů, které tradiční modely vidění-jazyka prostě postrádají.”
Jak DYNA-2 Učí z Videí Bez Vidění Robota
Architektura je to, co Dyna nazývá Svět-Akce Model, postavený na generaci videa spíše než na adaptacích vidění-jazyka-akce, které dominují v tomto odvětví. Během předběžného trénování běží model s dvojitým cílem (předpovídání dalšího snímku a další akce) nad korpusem lidského videa. Společnost tvrdí, že to dává modelu funkční model kontaktové fyziky a prostorové logiky, který se přenáší napříč různými provedeními: stacionárními robotickými rameny, humanoidními prototypy a dexterous pěti-prstovými rukama, a to navzdory tomu, že žádný z těchto robotů se neobjevuje v předběžném trénování.
Adaptace výsledku na konkrétní platformu vyžaduje hodiny místního jemného ladění spíše než týdny sběru dat. V jednom případě, který Dyna uvádí, stačilo 13 minut dat k tomu, aby se dvěma pěti-prstovým robotickým rukám naučily otočit víčko lahve. Agregované výsledky z 15 testovacích úkolů ukázaly, že politiky, které byly předběžně trénovány na více lidských datech, konzistentně překonaly ty, které byly trénovány na méně datech, a to je škálovací křivka, na kterou společnost upozorňuje jako zákon.
Nejsrozumitelnější srovnání je proti vlastnímu předchozímu modelu Dyny. DYNA-1, model vidění-jazyka-akce, který běží v komerčních nasazeních společnosti, se utkal s DYNA-2 v hlavě-hlavě fyzických hodnocení za shodných trénovacích kroků a dat. U dexterous úkolů, jako je krájení potravin a vyčištění pracovních prostorů, tvrdí Dyna, že DYNA-2 se zotavila z fyzických poruch bez lidského zásahu, zatímco základní model VLA selhal a potřeboval manuální reset. Algoritmus video-spolu-trénování zvýšil skóre pro sledování instrukcí o 133 % u úkolů, které vyžadují rozdílné pohyby v reakci na uživatelské příkazy.
DYNA-2 Čísly
- 1 milion+ hodin egocentrického lidského videa v předběžném trénování — popsáno společností jako zhruba 170 let nepřetržitého bdění
- 20% → 80–90% úspěšnost úkolů na úkolech s vysokou přesností, z předběžného trénování
- 1,55x více úkolů dokončených než DYNA-1 v reálných hlavě-hlavě hodnocení
- 87% vs. 46% úspěšnost úkolů u zákaznického nasazení, DYNA-2 proti DYNA-1
- 13 minut dat pro trénování pěti-prstových rukou k otevření víčka lahve
- 133% zlepšení u úkolů pro sledování instrukcí z algoritmu video-spolu-trénování
- 10 milionů hodin: měřítko trénovacích dat, které společnost tvrdí, že otevírá cestu k
Nasazení Dyny Už Byla Testovací Základnou
DYNA-2 přichází na základě neobvykle konkrétní komerční základny pro společnost tak mladou. Roboty Dyny, běžící DYNA-1, jsou nasazeny v produkci v hotelech, restauracích, prádelnách a fitness centrech. Materiály společnosti popisují DYNA-1 jako skládací více než 40 košil za hodinu nepřetržitě a běží 16 hodin denně na zákaznických místech, s úspěšností 99 % plus po 24 hodinách nepřetržitého provozu.
Tato základna nasazení je také datový mechanismus za výzkumem.
Cesta společnosti od tohoto místa je škálovat: pokud křivka škálování lidského videa platí, tvrdí Dyna, trénování na 10 milionů hodin se stává otázkou sběru videa spíše než budování flotil teleoperovaných zařízení. Výsledek 1 milionu hodin je důkazem, že křivka existuje. Zda platí na 10x, je otevřenou inženýrskou otázkou — a je to otázka, na kterou Dyna vsadila svou roadmapu.












