Robotik och fysisk AI
Dyna Robotics Tränar DYNA-2 på en miljon timmar av mänsklig video, ingen robotdata

Påståendet är viktigt på grund av var fältets begränsning ligger. Generalistiska robotpolicyer har till stor del tränats på teleopererad aktionsdata: människor som fysiskt guidar robotar genom uppgifter, timme för timme. Den datan är dyr och långsam att samla in, och den har begränsat hur långt robotens grundmodeller kan skalas. DYNA-2:s satsning är att den fysiska intuitionen robotar behöver kan läras från video av människor som gör saker, och sedan överföras till robotmaskinvara.
“Genom att bygga en World-Action Model som föreställer sig hur den fysiska världen rör sig innan den tar action, ger vi robotar rumslig resonemang och kontaktfysik som traditionella vision-språksmodeller helt enkelt saknar.”
Hur DYNA-2 lär sig från video utan att se en robot
Arkitekturen är vad Dyna kallar en World-Action Model, byggd på video-generation snarare än vision-språk-action-anpassningar som har dominerat fältet. Under förträning kör modellen en dubbel mål (förutsäga nästa bild och nästa åtgärd) över den mänskliga video-korpusen. Företaget säger att detta ger modellen en fungerande modell av kontaktfysik och rumslig resonemang som överförs över kroppar: stationära robotarmar, humanoida prototyper och dexterösa femfingrade händer, trots att ingen av dessa robotar visas i förträning.
Att anpassa resultatet till en specifik plattform tar timmar av lokal finjustering snarare än veckor av datainsamling. I ett fall som Dyna citerar var 13 minuters data tillräckligt för att lära en par femfingrade robot-händer att vrida upp en flaska. Aggregerat över 15 benchmark-uppgifter presterade policyer som förtränats på mer mänsklig data konsekvent bättre än de som tränats på mindre, den skalningskurva som företaget pekar på som lagen.
Den tydligaste jämförelsen är mot Dynas egen tidigare modell. DYNA-1, vision-språk-action-modellen som körs i företagets kommersiella distributioner, mötte DYNA-2 i fysiska utvärderingar under matchade träningssteg och datamängder. På dexterösa uppgifter som att hacka mat och rensa arbetsytor säger Dyna att DYNA-2 återhämtade sig från fysiska störningar utan mänskligt ingripande, där VLA-baslinjen misslyckades och behövde manuell återställning. En video-samträningsalgoritm höjde instruktionsföljande poäng med 133% på uppgifter som kräver distinkta rörelser i svar på användarkommandon.
DYNA-2 i siffror
- 1 miljon+ timmar av egocentrisk mänsklig video i förträning — beskriven av företaget som ungefär 170 år av kontinuerlig vaken upplevelse
- 20% → 80–90% uppgiftsframgångsgrader på högprecisions-tillverkningsuppgifter, från förtränings-skala ensam
- 1,55x fler uppgifter slutförda än DYNA-1 i realvärldens huvud mot huvud-utvärderingar
- 87% vs. 46% godkännandegrad på en kunddistribution, DYNA-2 mot DYNA-1
- 13 minuter av data för att träna femfingrade händer att öppna en flaska
- 133% förbättring på instruktionsföljande uppgifter från video-samträningsalgoritmen
- 10 miljoner timmar: den träningsdata-skala som Dyna säger att tillvägagångssättet öppnar en väg mot
Dynas distributioner var redan testbädden
DYNA-2 anländer på toppen av en ovanligt konkret kommersiell bas för ett företag så ungt. Dynas robotar, som körs av DYNA-1, är distribuerade i produktion på hotell, restauranger, tvättstugor och gym. Företagets egna material beskriver DYNA-1 som vikande mer än 40 skjortor per timme kontinuerligt och kör 16 timmar om dygnet på kundplatser, med en 99%-plus framgångsgrad under 24-timmars non-stop-drift.
Den distributionsfoten är också data-elmjölet bakom forskningen.
Företagets uttalade väg från här är skala: om den mänskliga video-skalningskurvan håller, säger Dyna, blir träningsdata på 10 miljoner timmar en fråga om att samla in video snarare än att bygga flottor av teleoperation-riggar. 1-miljon-timmarsresultatet är beviset för att kurvan existerar. Om den håller vid 10x är den öppna ingenjörsfrågan — och det är nu den som Dyna har satsat sin roadmap på.












