Robotteknologi og fysisk AI
Dyna Robotics træner DYNA-2 på en million timer af menneskevideo, ingen robotdata

Påstanden er vigtig på grund af, hvor feltets begrænsning ligger. Generalist robotpolitikker er blevet trænet overvejende på teleopereret handlingsdata: mennesker, der fysisk guider robotter gennem opgaver, time for time. Denne data er dyrekøbt og langsom at indsamle, og den har sat en grænse for, hvor langt robot grundmodeller kan skala. DYNA-2’s indsats er, at den fysiske intuition, robotterne har brug for, kan læres fra video af mennesker, der gør ting, og derefter overføres til robot hardware.
“Ved at bygge en World-Action Model, der forestiller, hvordan den fysiske verden bevæger sig før handling, giver vi robotter rumlig fornuft og kontakt fysik, som traditionelle vision-sprog-modeller simpelthen mangler.”
How DYNA-2 learns from video without seeing a robot
Arkitekturen er, hvad Dyna kalder en World-Action Model, bygget på video-generering i stedet for vision-sprog-handling tilpasninger, der har domineret feltet. Under præ-træning kører modellen en dobbelt objekt (forudsigelse af næste ramme og næste handling) over menneskevideo-korpusset. Selskabet siger, at dette giver modellen en fungerende model af kontakt fysik og rumlig fornuft, der overføres på tværs af inkarnationer: stationære robotarme, humanoid prototyper og dygtige fem-fingerede hænder, på trods af at ingen af disse robotter optræder i præ-træning.
Tilpasning af resultatet til en specifik platform tager timer af lokal finjustering i stedet for uger af dataindsamling. I et tilfælde, som Dyna nævner, var 13 minutters data nok til at lære en pair af fem-fingerede robot-hænder at dreje åbne en flaskeprop. Aggregeret over 15 benchmark-opgaver, politikker, der er præ-trænet på mere menneske-data, overgik konsekvent dem, der er trænet på mindre, skala-kurven, som selskabet peger på som loven.
Den tydeligste sammenligning er mod Dyna’s egen forrige model. DYNA-1, vision-sprog-handling modellen, der kører i selskabets kommercielle udrulninger, stod over for DYNA-2 i fysiske evalueringer under matchede trænings-skridt og datasæt. På dygtige opgaver som at hakke mad og rydde arbejdspladser, siger Dyna, at DYNA-2 genoprettede sig fra fysiske forstyrrelser uden menneskelig indgriben, hvor VLA-basen fejlede og havde brug for manuel genoprettelse. En video co-træningsalgoritme løftede instruktions-følge-scores med 133% på opgaver, der kræver distinkte bevægelser i respons til bruger-kommandoer.
DYNA-2 i tal
- 1 million+ timer af egocentrisk menneskevideo i præ-træning — beskrevet af selskabet som omtrent 170 års kontinuerlig vågen oplevelse
- 20% → 80–90% opgave-succes-rater på højpræcisions-fremstillingsopgaver, fra præ-træningsskala alene
- 1,55 gange flere opgaver fuldført end DYNA-1 i virkelige head-to-head-evalueringer
- 87% vs. 46% bestå-rater ved en kunde-udrulning, DYNA-2 mod DYNA-1
- 13 minutter af data til at træne fem-fingerede hænder til at åbne en flaskeprop
- 133% forbedring på instruktions-følge-opgaver fra video co-træningsalgoritmen
- 10 millioner timer: det trænings-data-skala, som Dyna siger, denne tilgang åbner en vej mod
Dynas udrulninger var allerede test-bædden
DYNA-2 ankommer på toppen af en usædvanlig konkrekt kommerciel base for et selskab af denne alder. Dynas robotter, der kører DYNA-1, er udrullet i produktion på hoteller, restauranter, vaskerier og fitnesscentre. Selskabets egne materialer beskriver DYNA-1, der folder mere end 40 skjorter per time kontinuerligt og kører 16 timer om dagen på kunde-sites, med en 99%-plus succes-rate over 24 timers non-stop-drift.
Denne udrulnings-fodspor er også data-hjulet bag forskningen.
Selskabets erklærede vej fra her er skala: hvis den menneske-video-skala-kurve holder, siger Dyna, bliver træning på 10 millioner timer en sag om at indsamle video i stedet for at bygge flåder af teleoperation-rig. Det 1-million-timers-resultat er beviset for, at kurven findes. Om den holder ved 10 gange er det åbne ingeniør-spørgsmål — og det er nu det, Dyna har sat sin vej på.












