Robotteknologi og fysisk AI

Dyna Robotics træner DYNA-2 på en million timer af menneskevideo, ingen robotdata

mm
Føj Unite.AI til dine foretrukne kilder på Google

Påstanden er vigtig på grund af, hvor feltets begrænsning ligger. Generalist robotpolitikker er blevet trænet overvejende på teleopereret handlingsdata: mennesker, der fysisk guider robotter gennem opgaver, time for time. Denne data er dyrekøbt og langsom at indsamle, og den har sat en grænse for, hvor langt robot grundmodeller kan skala. DYNA-2’s indsats er, at den fysiske intuition, robotterne har brug for, kan læres fra video af mennesker, der gør ting, og derefter overføres til robot hardware.

“Ved at bygge en World-Action Model, der forestiller, hvordan den fysiske verden bevæger sig før handling, giver vi robotter rumlig fornuft og kontakt fysik, som traditionelle vision-sprog-modeller simpelthen mangler.”

How DYNA-2 learns from video without seeing a robot

Arkitekturen er, hvad Dyna kalder en World-Action Model, bygget på video-generering i stedet for vision-sprog-handling tilpasninger, der har domineret feltet. Under præ-træning kører modellen en dobbelt objekt (forudsigelse af næste ramme og næste handling) over menneskevideo-korpusset. Selskabet siger, at dette giver modellen en fungerende model af kontakt fysik og rumlig fornuft, der overføres på tværs af inkarnationer: stationære robotarme, humanoid prototyper og dygtige fem-fingerede hænder, på trods af at ingen af disse robotter optræder i præ-træning.

Tilpasning af resultatet til en specifik platform tager timer af lokal finjustering i stedet for uger af dataindsamling. I et tilfælde, som Dyna nævner, var 13 minutters data nok til at lære en pair af fem-fingerede robot-hænder at dreje åbne en flaskeprop. Aggregeret over 15 benchmark-opgaver, politikker, der er præ-trænet på mere menneske-data, overgik konsekvent dem, der er trænet på mindre, skala-kurven, som selskabet peger på som loven.

Den tydeligste sammenligning er mod Dyna’s egen forrige model. DYNA-1, vision-sprog-handling modellen, der kører i selskabets kommercielle udrulninger, stod over for DYNA-2 i fysiske evalueringer under matchede trænings-skridt og datasæt. På dygtige opgaver som at hakke mad og rydde arbejdspladser, siger Dyna, at DYNA-2 genoprettede sig fra fysiske forstyrrelser uden menneskelig indgriben, hvor VLA-basen fejlede og havde brug for manuel genoprettelse. En video co-træningsalgoritme løftede instruktions-følge-scores med 133% på opgaver, der kræver distinkte bevægelser i respons til bruger-kommandoer.

DYNA-2 i tal

  • 1 million+ timer af egocentrisk menneskevideo i præ-træning — beskrevet af selskabet som omtrent 170 års kontinuerlig vågen oplevelse
  • 20% → 80–90% opgave-succes-rater på højpræcisions-fremstillingsopgaver, fra præ-træningsskala alene
  • 1,55 gange flere opgaver fuldført end DYNA-1 i virkelige head-to-head-evalueringer
  • 87% vs. 46% bestå-rater ved en kunde-udrulning, DYNA-2 mod DYNA-1
  • 13 minutter af data til at træne fem-fingerede hænder til at åbne en flaskeprop
  • 133% forbedring på instruktions-følge-opgaver fra video co-træningsalgoritmen
  • 10 millioner timer: det trænings-data-skala, som Dyna siger, denne tilgang åbner en vej mod

Dynas udrulninger var allerede test-bædden

DYNA-2 ankommer på toppen af en usædvanlig konkrekt kommerciel base for et selskab af denne alder. Dynas robotter, der kører DYNA-1, er udrullet i produktion på hoteller, restauranter, vaskerier og fitnesscentre. Selskabets egne materialer beskriver DYNA-1, der folder mere end 40 skjorter per time kontinuerligt og kører 16 timer om dagen på kunde-sites, med en 99%-plus succes-rate over 24 timers non-stop-drift.

Denne udrulnings-fodspor er også data-hjulet bag forskningen.

Selskabets erklærede vej fra her er skala: hvis den menneske-video-skala-kurve holder, siger Dyna, bliver træning på 10 millioner timer en sag om at indsamle video i stedet for at bygge flåder af teleoperation-rig. Det 1-million-timers-resultat er beviset for, at kurven findes. Om den holder ved 10 gange er det åbne ingeniør-spørgsmål — og det er nu det, Dyna har sat sin vej på.

Orion Sato er en AI-genereret korrespondent, der fokuserer på robotteknologi, automation og intelligente maskiner. Hans skrivning udforsker, hvordan fremskridt inden for robotteknologi former omvendt produktion, logistik, sundhedsvesen og hverdagsliv gennem stadig mere autonome systemer.
Med en teknisk og udviklingsorienteret perspektiv analyserer Orion robotarkitekturer, sensorfusion, kontrolsystemer og konvergencen af AI med mekanisk intelligens. Han er særligt interesseret i, hvordan automation flytter sig fra kontrollerede miljøer til reel verden, hvor pålidelighed, sikkerhed og effektivitet betyder mest.
Artikler skrevet af Orion Sato er AI-genereret og gennemgået af Unite.AIs redaktionelle team for at sikre teknisk nøjagtighed, klarhed og overholdelse af redaktionelle standarder.