Robotiikka ja fyysinen AI

Dyna Robotics kouluttaa DYNA-2:ta miljoonalla tunnilla ihmisen videoaineistoa, ilman robottiaineistoa

mm
Lisää Unite.AI suosikkilähteisiisi Google-palvelussa

Väite on merkittävä, koska kentän rajoitus on siinä, missä se on. Yleispätevien robotti-politiikkojen on koulutettu pääosin etäohjatuilla toimintadatailla: ihmiset ohjaavat roboteja fyysisesti tehtävien läpi, tunti tunnilta. Tieto on kallista ja hitaasti kerättävissä, ja se on rajoittanut sitä, kuinka pitkälle robotti-perusmallit voivat skaalautua. DYNA-2:n veto on, että roboteille tarvittava fyysinen intuitio voidaan oppia ihmisten tekemistä videoista ja siirtää sitten robottiin.

“Rakentamalla maailma-toimintamalli, joka kuvittelee, miten fyysinen maailma liikkuu ennen toimintaa, annamme robotille spatiaalisen päättelyn ja kosketusfysiikan, joita perinteiset visio-kieli-mallit eivät vain puutu.”

Kuinka DYNA-2 oppii videosta ilman robottinäkemystä

Arkkitehtuuri on se, mitä Dyna kutsuu maailma-toimintamalliksi, joka on rakennettu videon generoimiselle, ei visio-kieli-toiminta -sopeutumisille, jotka ovat hallinneet alaa. Esikoulutuksen aikana malli suorittaa kaksinkertaisen tavoitteen (ennustaa seuraava kehys ja seuraava toiminta) ihmisen videoaineistossa. Yhtiö sanoo, että tämä antaa mallille toimivan mallin kosketusfysiikasta ja spatiaalisesta päättelystä, joka siirtää eri ruumiinrakenteiden yli: paikallaan olevat robotti-käsivarret, humanoidi-prototyypit ja taitavat viisisormiset kädet, vaikka näitä roboteja ei esiinny esikoulutuksessa.

Tuloksen sovittaminen tiettyyn alustaan vie vain muutamia tunteja paikallista hienosäätöä, ei viikkoja aineiston keräämistä. Yhdessä tapauksessa Dyna mainitsee, että 13 minuutin aineisto oli tarpeeksi opettaakseen parille viisisormiselle robotti-kädelle, kuinka avata pullokuori. Yhdistetty 15 benchmark-tehtävään, politiikat, jotka oli esikoulutettu enemmän ihmisen aineistolla, suorittivat johdonmukaisesti paremmin kuin ne, jotka oli koulutettu vähemmän, skaalauksen kaareen, jonka yhtiö osoittaa olevan laki.

Selkein vertailu on Dynan edellisen mallin vastaan. DYNA-1, visio-kieli-toimintamalli, joka toimii yhtiön kaupallisissa käyttökohteissa, kohtasi DYNA-2:n päätöksenteon fyysisissä arvioissa, jotka olivat vastaavat koulutusaskelilla ja aineistoilla. Taitavissa tehtävissä, kuten ruoan hakkaamisessa ja työtilojen tyhjentämisessä, Dyna sanoo, että DYNA-2 toipui fyysisistä häiriöistä ilman ihmisen väliintuloa, kun taas VLA-pohjalinja tarvitsi manuaalisen resetoinnin. Videon yhteisopetus-algoritmi nosti käskyjä seuraamisen tuloksia 133 %:lla tehtävissä, jotka vaativat eri liikkeitä käyttäjän käskyjen mukaan.

DYNA-2 luvuissa

  • 1 miljoonaa+ tuntia egosentristä ihmisen videota esikoulutuksessa — yhtiön mukaan noin 170 vuoden jatkuva heräävä kokemus
  • 20% → 80–90% tehtävän onnistumisprosentit korkean tarkkuuden valmistustehtävissä, pelkästään esikoulutuksen mittakaavasta
  • 1,55-kertaa enemmän tehtäviä suoritettu kuin DYNA-1:ssä todellisen maailman päättöksenteon arvioissa
  • 87% vs. 46% läpäisiprotsentit asiakas käyttökohteessa, DYNA-2 vs. DYNA-1
  • 13 minuuttia aineistoa kouluttaakseen viisisormisen robotti-käden avaamaan pullokuoren
  • 133% parannus käskyjä seuraamisen tehtävissä videon yhteisopetus-algoritmin ansiosta
  • 10 miljoonaa tuntia: koulutusaineiston mittakaava, jota yhtiö sanoo olevan reittiä kohti

Dynan käyttökohteet olivat jo testipenkki

DYNA-2 saapuu epätavallisen konkreettisen kaupallisen perustan päälle niin nuorelle yhtiölle. Dynan robotit, jotka suorittavat DYNA-1:ää, ovat käytössä tuotannossa hotelleissa, ravintoloissa, pesulassa ja urheilukeskuksissa. Yhtiön omat materiaalit kuvaavat DYNA-1:n taittavan yli 40 paitaa tunnissa jatkuvasti ja toimivan 16 tuntia päivässä asiakas kohteissa, yli 99 %:n onnistumisprosentilla 24 tunnin yhteenmittaisessa toiminnassa.

Tämä käyttökohteen jälki on myös tutkimuksen takana oleva data-voima.

Yhtiön ilmoittama polku tästä eteenpäin on skaala: jos ihmisen videon skaalauksen kaare pidetään, Dyna sanoo, koulutus 10 miljoonalla tunnilla tulee olemaan videon kerääminen, ei teleoperaatiolaitteiden rakentamista. 1 miljoonan tunnin tulos on todiste siitä, että kaare on olemassa. Onko se pidetään 10-kertaisella, on avoin insinööritieteellinen kysymys — ja se on nyt se, mihin Dyna on asettanut tiensä.

Orion Sato on tekoälygeneroiva kirjeenvaihtaja, joka keskittyy robotiikkaan, automaatioon ja älykkäisiin koneisiin. Hänen kirjoituksensa tarkastelevat, miten robotiikan edistysaskeleet muokkaavat valmistusta, logistiikkaa, terveydenhuoltoa ja arkipäivän elämää yhä enenevässä määrin autonomisten järjestelmien kautta.
Teknisen ja toteutukseen suunnatun näkökulman kautta Orion analysoi robotiikan arkkitehtuureja, sensorien yhdistämistä, ohjausjärjestelmiä ja tekoälyn yhdistymistä mekaaniseen älykkyyteen. Hän on erityisen kiinnostunut siitä, miten automaatio siirtyy ohjatuista ympäristöistä todelliseen maailman käyttöön, jossa luotettavuus, turvallisuus ja tehokkuus ovat tärkeimmät.
Orion Sato kirjoittamat artikkelit ovat tekoälygeneroituja ja Unite.AI:n toimittajatiimin tarkastamia, jotta varmistetaan tekninen tarkkuus, selkeys ja yhdenmukaisuus toimittajien standardeiden kanssa.