Robotikk og fysisk AI

Dyna Robotics Trenar DYNA-2 på en million timer med menneskevideo, ingen robottdata

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Kravet er viktig på grunn av hvor feltets begrensning ligger. Generalist robotpolitikk har blitt trenet hovedsakelig på teleoperert handlingdata: mennesker som fysisk guider roboter gjennom oppgaver, time for time. Denne dataen er dyrekjøpt og treg å samle inn, og den har begrenset hvor langt robotfunksjonsmodellene kan skaleres. DYNA-2s veddemål er at den fysiske forståelsen robotene trenger, kan læres fra video av mennesker som gjør ting, og deretter overføres til robott hårdtware.

“Ved å bygge en World-Action Model som forestiller seg hvordan den fysiske verden beveger seg før handling, gir vi roboter romlig forståelse og kontakt fysikk som tradisjonelle visjon-språk-modeller mangler.”

Hvordan DYNA-2 lærer fra video uten å se en robot

Arkitekturen er det Dyna kaller en World-Action Model, bygget på video-generering i stedet for visjon-språk-handling-tilpasninger som har dominert feltet. Under pre-trening, kjører modellen en dobbelt mål (forutsi neste ramme og neste handling) over menneskevideo-korpuset. Selskapet sier at dette gir modellen en fungerende modell av kontakt fysikk og romlig forståelse som overføres over inkarnasjoner: stasjonære robot-armer, humanoid-prototyper og dexterous fem-fingrede hender, til tross for at ingen av disse robotene vises i pre-trening.

Tilpasning av resultatet til en bestemt plattform tar timer med lokal fin-justering i stedet for uker med datainnsamling. I ett tilfelle som Dyna nevner, var 13 minutter med data nok til å lære en par fem-fingrede robot-hender å åpne en flaskekork. Aggregert over 15 benchmark-oppdrag, politikker pre-trenet på mer menneske-data, overgikk konsistent de som var trenet på mindre, skaleringskurven som selskapet peker på som loven.

Den tydeligste sammenligningen er mot Dynas egen forrige modell. DYNA-1, visjon-språk-handling-modellen som kjører i selskapets kommersielle utrullinger, møtte DYNA-2 i head-to-head fysiske evalueringer under matchet treningstrinn og datasett. På dexterous oppgaver som å hakke mat og rydde arbeidsplasser, sier Dyna at DYNA-2 gjenopprettet seg fra fysiske forstyrrelser uten menneskelig inngripen, der VLA-baselinjen feilet og trengte manuell tilbakestilling. En video co-trening algoritme løftet instruksjons-følging-poeng med 133% på oppgaver som krever distinkte bevegelser i respons til bruker-kommandoer.

DYNA-2 i tall

  • 1 million+ timer med egosentrisk menneskevideo i pre-trening — beskrevet av selskapet som omtrent 170 år med kontinuerlig våken erfaring
  • 20% → 80–90% oppgave-suksess-rater på høy-presisjons produksjonsoppdrag, fra pre-trening skala alene
  • 1,55 ganger flere oppgaver fullført enn DYNA-1 i virkelige head-to-head evalueringer
  • 87% vs. 46% bestått-rater ved en kunde-utrullering, DYNA-2 mot DYNA-1
  • 13 minutter med data for å trenere fem-fingrede hender å åpne en flaskekork
  • 133% forbedring på instruksjons-følging-oppdrag fra video co-trening algoritmen
  • 10 millioner timer: den treningsdata-skalaen Dyna sier tilnærmingen åpner en vei mot

Dynas utrullinger var allerede test-sengen

DYNA-2 ankommer på toppen av en usedvanlig konkrekt kommersiell base for et selskap så ung. Dynas roboter, som kjører DYNA-1, er utrullet i produksjon på hoteller, restauranter, vaskerier og treningsstudioer. Selskapets egne materialer beskriver DYNA-1 som folder mer enn 40 skjorter per time kontinuerlig og kjører seksten timer om dagen på kundesider, med en 99%-pluss suksessrate over 24-timers non-stop drift.

Denne utrullingsavtrykket er også data-hjulene bak forskningen.

Selskapets erklærte vei fra her er skala: hvis menneske-video skaleringskurven holder, sier Dyna, blir trening på 10 millioner timer et spørsmål om å samle inn video i stedet for å bygge flåter av teleoperasjons-rigg. 1-million-timers-resultatet er beviset for at kurven eksisterer. Om den holder på 10 ganger er det åpne ingeniør-spørsmålet — og det er nå det Dyna har satset sin veikart på.

Orion Sato er en AI-generert korrespondent som fokuserer på robotikk, automatisering og intelligente maskiner. Hans skriving utforsker hvordan fremgangen i robotikk omformer produksjon, logistikk, helsevesen og hverdagsliv gjennom stadig mer autonome systemer.
Med en teknisk og utføringssorientert perspektiv analyserer Orion robotarkitekturer, sensorfusjon, kontrollsystemer og konvergensen av AI med mekanisk intelligens. Han er spesielt interessert i hvordan automatisering flytter fra kontrollerte miljøer til virkelige verdensapplikasjoner, der pålitelighet, sikkerhet og effisiens betyr mest.
Artikler skrevet av Orion Sato er AI-generert og gjennomgått av Unite.AIs redaksjonelle team for å sikre teknisk nøyaktighet, klarhet og overholdelse av redaksjonelle standarder.