Robotică și IA fizică

Roboții Dyna antrenează DYNA-2 pe un milion de ore de videoclipuri umane, fără date de robot

mm
Adaugă Unite.AI la sursele tale preferate pe Google

Afirmarea este importantă din cauza locului în care se află constrângerile domeniului. Politicile robotice generaliste au fost antrenate în mare parte pe date de acțiune teleoperate: oamenii care ghidează fizic roboții prin sarcini, ore după ore. Aceste date sunt scumpe și greu de colectat și au limitat modul în care modelele de bază ale roboților pot fi extinse. Paria lui DYNA-2 este că intuiția fizică de care au nevoie roboții poate fi învățată din videoclipuri cu oameni care fac lucruri, și apoi transferată către hardware-ul robotului.

“Prin construirea unui model de acțiune mondial care imaginează cum se mișcă lumea fizică înainte de a lua o acțiune, oferim roboților raționament spațial și fizică de contact pe care modelele tradiționale de viziune-limbaj nu le au.”

Cum învață DYNA-2 din videoclipuri fără a vedea un robot

Arhitectura este ceea ce Dyna numește un model de acțiune mondial, construit pe generarea de videoclipuri și nu pe adaptările de viziune-limbaj-acțiune care au dominat domeniul. În timpul pre-antrenamentului, modelul rulează un obiectiv dual (previziunea următoarei cadre și a următoarei acțiuni) pe corpusul de videoclipuri umane. Compania spune că acest lucru oferă modelului un model funcțional de fizică de contact și raționament spațial care se transferă între încarnări: brațe robotice staționare, prototipuri umanoide și mâini cu cinci degete, în ciuda faptului că niciunul dintre acești roboți nu apare în pre-antrenament.

Adaptarea rezultatului la o platformă specifică necesită doar câteva ore de ajustare locală, și nu săptămâni de colectare a datelor. Într-un caz pe care Dyna îl citează, 13 minute de date au fost suficiente pentru a învăța o pereche de mâini robotice cu cinci degete să deschidă un capac de sticlă. Agregate pe 15 sarcini de referință, politicile pre-antrenate pe mai multe date umane au performant mai bine decât cele antrenate pe mai puține date, curbă de scalare pe care compania o consideră a fi legea.

Cea mai clară comparație este împotriva modelului anterior al Dyna. DYNA-1, modelul de viziune-limbaj-acțiune care rulează în depozitele comerciale ale companiei, s-a confruntat cu DYNA-2 în evaluări fizice față în față sub pași de antrenament și seturi de date potrivite. La sarcini dexteritate, cum ar fi tăierea alimentelor și curățarea spațiilor de lucru, Dyna spune că DYNA-2 a recuperat de la perturbări fizice fără intervenție umană, în timp ce modelul de bază VLA a eșuat și a necesitat resetare manuală. Un algoritm de co-antrenare video a ridicat scorurile de urmărire a instrucțiunilor cu 133% la sarcini care necesită mișcări distincte în răspuns la comenzi utilizator.

DYNA-2 în cifre

  • 1 milion+ ore de videoclipuri umane egocentrice în pre-antrenament — descrise de companie ca aproximativ 170 de ani de experiență continuă de trezire
  • 20% → 80–90% rate de succes la sarcini de fabricație de înaltă precizie, de la scala de pre-antrenament singură
  • 1,55x mai multe sarcini finalizate decât DYNA-1 în evaluări reale față în față
  • 87% vs. 46% rate de trecere la o depozitare a clientului, DYNA-2 împotriva DYNA-1
  • 13 minute de date pentru a antrena mâini cu cinci degete să deschidă un capac de sticlă
  • 133% îmbunătățire la sarcini de urmărire a instrucțiunilor de la algoritmul de co-antrenare video
  • 10 milioane ore: scala de date de antrenament pe care Dyna spune că abordarea deschide o cale către

Depozitele Dyna erau deja patul de testare

DYNA-2 sosește pe o bază comercială concretă neobișnuit de tânără pentru o companie atât de tânără. Roboții Dyna, care rulează DYNA-1, sunt depozitați în producție la hoteluri, restaurante, lavătorii și săli de sport. Materialele companiei descriu DYNA-1 pliind mai mult de 40 de cămăși pe oră în mod continuu și rulează 16 ore pe zi la site-urile clienților, cu o rată de succes de peste 99% în timpul operațiunii continue de 24 de ore.

Această amprentă de depozitare este și roata de date din spatele cercetării.

Drumul declarat al companiei de aici este scalabilitatea: dacă curbă de scalare a videoclipurilor umane se menține, spune Dyna, antrenamentul pe 10 milioane de ore devine o chestiune de colectare a videoclipurilor, și nu de construire a flotelor de teleoperații. Rezultatul de 1 milion de ore este dovada că curbă există. Dacă se menține la 10x este întrebarea de inginerie deschisă — și este acum cea pe care Dyna și-a pus drumul.

Orion Sato este un corespondent generat de inteligență artificială, axat pe robotică, automatizare și mașini inteligente. Scrierile sale explorează modul în care progresele în robotică restructurează producția, logistica, sănătatea și viața de zi cu zi prin sisteme din ce în ce mai autonome.
Cu o perspectivă tehnică și orientată spre execuție, Orion analizează arhitecturi robotice, fuziunea senzorilor, sisteme de control și convergența inteligenței artificiale cu inteligența mecanică. El este în special interesat de modul în care automatizarea se mută din medii controlate în implementarea în lumea reală, unde fiabilitatea, siguranța și eficiența sunt cele mai importante.
Articolele scrise de Orion Sato sunt generate de inteligență artificială și revizuite de echipa editorială Unite.AI pentru a asigura acuratețea tehnică, claritatea și conformitatea cu standardele editoriale.