Robotika a fyzická AI

Dyna Robotics Trénuje DYNA-2 na Milionu Hodin Lidského Videu, Bez Robotických Dat

mm
Přidejte Unite.AI mezi své preferované zdroje na Google

Tvrzení má význam kvůli omezení, ve kterém se nachází toto odvětví. Obecné robotické politiky byly většinou trénovány na datech teleoperovaných akcí: lidé fyzicky řídí roboty prostřednictvím úkolů, hodinu po hodině. Tato data jsou drahá a pomalá na sběr, a omezila, jak daleko mohou robotické modely základních funkcí škálovat. Sázka DYNA-2 spočívá v tom, že fyzická intuice, kterou roboti potřebují, může být naučena z videa lidí, kteří dělají věci, a poté přenesena na robotické hardwarové vybavení.

“Stavbou Svět-Akce Modelu, který si představuje, jak se fyzický svět pohybuje před provedením akce, poskytujeme robotům prostorovou logiku a fyziku kontaktů, které tradiční modely vidění-jazyka prostě postrádají.”

Jak DYNA-2 Učí z Videí Bez Vidění Robota

Architektura je to, co Dyna nazývá Svět-Akce Model, postavený na generaci videa spíše než na adaptacích vidění-jazyka-akce, které dominují v tomto odvětví. Během předběžného trénování běží model s dvojitým cílem (předpovídání dalšího snímku a další akce) nad korpusem lidského videa. Společnost tvrdí, že to dává modelu funkční model kontaktové fyziky a prostorové logiky, který se přenáší napříč různými provedeními: stacionárními robotickými rameny, humanoidními prototypy a dexterous pěti-prstovými rukama, a to navzdory tomu, že žádný z těchto robotů se neobjevuje v předběžném trénování.

Adaptace výsledku na konkrétní platformu vyžaduje hodiny místního jemného ladění spíše než týdny sběru dat. V jednom případě, který Dyna uvádí, stačilo 13 minut dat k tomu, aby se dvěma pěti-prstovým robotickým rukám naučily otočit víčko lahve. Agregované výsledky z 15 testovacích úkolů ukázaly, že politiky, které byly předběžně trénovány na více lidských datech, konzistentně překonaly ty, které byly trénovány na méně datech, a to je škálovací křivka, na kterou společnost upozorňuje jako zákon.

Nejsrozumitelnější srovnání je proti vlastnímu předchozímu modelu Dyny. DYNA-1, model vidění-jazyka-akce, který běží v komerčních nasazeních společnosti, se utkal s DYNA-2 v hlavě-hlavě fyzických hodnocení za shodných trénovacích kroků a dat. U dexterous úkolů, jako je krájení potravin a vyčištění pracovních prostorů, tvrdí Dyna, že DYNA-2 se zotavila z fyzických poruch bez lidského zásahu, zatímco základní model VLA selhal a potřeboval manuální reset. Algoritmus video-spolu-trénování zvýšil skóre pro sledování instrukcí o 133 % u úkolů, které vyžadují rozdílné pohyby v reakci na uživatelské příkazy.

DYNA-2 Čísly

  • 1 milion+ hodin egocentrického lidského videa v předběžném trénování — popsáno společností jako zhruba 170 let nepřetržitého bdění
  • 20% → 80–90% úspěšnost úkolů na úkolech s vysokou přesností, z předběžného trénování
  • 1,55x více úkolů dokončených než DYNA-1 v reálných hlavě-hlavě hodnocení
  • 87% vs. 46% úspěšnost úkolů u zákaznického nasazení, DYNA-2 proti DYNA-1
  • 13 minut dat pro trénování pěti-prstových rukou k otevření víčka lahve
  • 133% zlepšení u úkolů pro sledování instrukcí z algoritmu video-spolu-trénování
  • 10 milionů hodin: měřítko trénovacích dat, které společnost tvrdí, že otevírá cestu k

Nasazení Dyny Už Byla Testovací Základnou

DYNA-2 přichází na základě neobvykle konkrétní komerční základny pro společnost tak mladou. Roboty Dyny, běžící DYNA-1, jsou nasazeny v produkci v hotelech, restauracích, prádelnách a fitness centrech. Materiály společnosti popisují DYNA-1 jako skládací více než 40 košil za hodinu nepřetržitě a běží 16 hodin denně na zákaznických místech, s úspěšností 99 % plus po 24 hodinách nepřetržitého provozu.

Tato základna nasazení je také datový mechanismus za výzkumem.

Cesta společnosti od tohoto místa je škálovat: pokud křivka škálování lidského videa platí, tvrdí Dyna, trénování na 10 milionů hodin se stává otázkou sběru videa spíše než budování flotil teleoperovaných zařízení. Výsledek 1 milionu hodin je důkazem, že křivka existuje. Zda platí na 10x, je otevřenou inženýrskou otázkou — a je to otázka, na kterou Dyna vsadila svou roadmapu.

Orion Sato je korespondent generovaný umělou inteligencí, zaměřený na robotiku, automatizaci a inteligentní stroje. Jeho psaní zkoumá, jak pokroky v robotice mění výrobu, logistiku, zdravotnictví a každodenní život prostřednictvím stále autonomnějších systémů.
S technickým a výkonnostně orientovaným pohledem analyzuje Orion robotické architektury, fúzi senzorů, řídicí systémy a konvergenci umělé inteligence s mechanickou inteligencí. Zajímá se zejména o to, jak se automatizace přesouvá z kontrolovaných prostředí do reálného nasazení, kde záleží na spolehlivosti, bezpečnosti a efektivitě.
Články autora Oriona Sata jsou generovány umělou inteligencí a recenzovány redakčním týmem Unite.AI, aby zajistily technickou přesnost, srozumitelnost a soulad s redakčními standardy.