Robotikk og fysisk AI
Dyna Robotics Trenar DYNA-2 på en million timer med menneskevideo, ingen robottdata

Kravet er viktig på grunn av hvor feltets begrensning ligger. Generalist robotpolitikk har blitt trenet hovedsakelig på teleoperert handlingdata: mennesker som fysisk guider roboter gjennom oppgaver, time for time. Denne dataen er dyrekjøpt og treg å samle inn, og den har begrenset hvor langt robotfunksjonsmodellene kan skaleres. DYNA-2s veddemål er at den fysiske forståelsen robotene trenger, kan læres fra video av mennesker som gjør ting, og deretter overføres til robott hårdtware.
“Ved å bygge en World-Action Model som forestiller seg hvordan den fysiske verden beveger seg før handling, gir vi roboter romlig forståelse og kontakt fysikk som tradisjonelle visjon-språk-modeller mangler.”
Hvordan DYNA-2 lærer fra video uten å se en robot
Arkitekturen er det Dyna kaller en World-Action Model, bygget på video-generering i stedet for visjon-språk-handling-tilpasninger som har dominert feltet. Under pre-trening, kjører modellen en dobbelt mål (forutsi neste ramme og neste handling) over menneskevideo-korpuset. Selskapet sier at dette gir modellen en fungerende modell av kontakt fysikk og romlig forståelse som overføres over inkarnasjoner: stasjonære robot-armer, humanoid-prototyper og dexterous fem-fingrede hender, til tross for at ingen av disse robotene vises i pre-trening.
Tilpasning av resultatet til en bestemt plattform tar timer med lokal fin-justering i stedet for uker med datainnsamling. I ett tilfelle som Dyna nevner, var 13 minutter med data nok til å lære en par fem-fingrede robot-hender å åpne en flaskekork. Aggregert over 15 benchmark-oppdrag, politikker pre-trenet på mer menneske-data, overgikk konsistent de som var trenet på mindre, skaleringskurven som selskapet peker på som loven.
Den tydeligste sammenligningen er mot Dynas egen forrige modell. DYNA-1, visjon-språk-handling-modellen som kjører i selskapets kommersielle utrullinger, møtte DYNA-2 i head-to-head fysiske evalueringer under matchet treningstrinn og datasett. På dexterous oppgaver som å hakke mat og rydde arbeidsplasser, sier Dyna at DYNA-2 gjenopprettet seg fra fysiske forstyrrelser uten menneskelig inngripen, der VLA-baselinjen feilet og trengte manuell tilbakestilling. En video co-trening algoritme løftet instruksjons-følging-poeng med 133% på oppgaver som krever distinkte bevegelser i respons til bruker-kommandoer.
DYNA-2 i tall
- 1 million+ timer med egosentrisk menneskevideo i pre-trening — beskrevet av selskapet som omtrent 170 år med kontinuerlig våken erfaring
- 20% → 80–90% oppgave-suksess-rater på høy-presisjons produksjonsoppdrag, fra pre-trening skala alene
- 1,55 ganger flere oppgaver fullført enn DYNA-1 i virkelige head-to-head evalueringer
- 87% vs. 46% bestått-rater ved en kunde-utrullering, DYNA-2 mot DYNA-1
- 13 minutter med data for å trenere fem-fingrede hender å åpne en flaskekork
- 133% forbedring på instruksjons-følging-oppdrag fra video co-trening algoritmen
- 10 millioner timer: den treningsdata-skalaen Dyna sier tilnærmingen åpner en vei mot
Dynas utrullinger var allerede test-sengen
DYNA-2 ankommer på toppen av en usedvanlig konkrekt kommersiell base for et selskap så ung. Dynas roboter, som kjører DYNA-1, er utrullet i produksjon på hoteller, restauranter, vaskerier og treningsstudioer. Selskapets egne materialer beskriver DYNA-1 som folder mer enn 40 skjorter per time kontinuerlig og kjører seksten timer om dagen på kundesider, med en 99%-pluss suksessrate over 24-timers non-stop drift.
Denne utrullingsavtrykket er også data-hjulene bak forskningen.
Selskapets erklærte vei fra her er skala: hvis menneske-video skaleringskurven holder, sier Dyna, blir trening på 10 millioner timer et spørsmål om å samle inn video i stedet for å bygge flåter av teleoperasjons-rigg. 1-million-timers-resultatet er beviset for at kurven eksisterer. Om den holder på 10 ganger er det åpne ingeniør-spørsmålet — og det er nå det Dyna har satset sin veikart på.












