Robotica e IA fisica

Dyna Robotics addestra DYNA-2 con un milione di ore di video umano, senza dati di robot

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

La pretesa è importante a causa della limitazione del campo. Le politiche dei robot generalisti sono state addestrate in gran parte con dati di azione teleoperati: gli esseri umani guidano fisicamente i robot attraverso compiti, ora per ora. Quei dati sono costosi e lenti da raccogliere e hanno limitato la scala dei modelli di base dei robot. La scommessa di DYNA-2 è che l’intuizione fisica che i robot necessitano possa essere appresa da video di esseri umani che fanno cose e poi trasferita all’hardware del robot.

“Creando un modello di azione mondiale che immagina come si muove il mondo fisico prima di agire, diamo ai robot una ragione spaziale e una fisica di contatto che i modelli di visione-linguaggio tradizionali semplicemente non possiedono.”

Come DYNA-2 apprende da video senza vedere un robot

L’architettura è ciò che Dyna chiama un modello di azione mondiale, costruito sulla generazione di video piuttosto che sulle adattazioni di visione-linguaggio-azione che hanno dominato il campo. Durante il pre-addestramento, il modello esegue un obiettivo duale (prevedendo il prossimo frame e la prossima azione) sul corpus di video umano. La società afferma che ciò dà al modello un modello di fisica di contatto e di ragione spaziale che si trasferisce attraverso le incarnazioni: bracci di robot stazionari, prototipi umanoidi e mani a cinque dita, nonostante nessuno di quei robot appaia nel pre-addestramento.

Adattare il risultato a una piattaforma specifica richiede ore di fine-tuning locale invece di settimane di raccolta di dati. In un caso citato da Dyna, 13 minuti di dati sono stati sufficienti per insegnare a una coppia di mani di robot a cinque dita ad aprire un tappo di bottiglia. Aggregati su 15 compiti di benchmark, le politiche pre-addestrate su più dati umani hanno costantemente superato quelle addestrate su meno, la curva di scala che la società sta indicando come la legge.

Il confronto più chiaro è contro il modello precedente di Dyna. DYNA-1, il modello di visione-linguaggio-azione che funziona nei dispiegamenti commerciali della società, ha affrontato DYNA-2 in valutazioni fisiche testa a testa sotto passi di addestramento e set di dati abbinati. Su compiti destri come tagliare cibo e sgomberare aree di lavoro, Dyna afferma che DYNA-2 si è ripreso da disturbi fisici senza intervento umano, dove il modello di base VLA ha fallito e ha necessitato di un reset manuale. Un algoritmo di co-addestramento video ha aumentato i punteggi di follow-up delle istruzioni del 133% sui compiti che richiedono movimenti distinti in risposta ai comandi dell’utente.

DYNA-2 per numeri

  • 1 milione+ di ore di video umano egocentrico nel pre-addestramento — descritto dalla società come circa 170 anni di esperienza continua da svegli
  • 20% → 80-90% tassi di successo dei compiti su compiti di produzione ad alta precisione, solo dalla scala di pre-addestramento
  • 1,55 volte più compiti completati rispetto a DYNA-1 in valutazioni testa a testa nel mondo reale
  • 87% vs. 46% tassi di superamento in un dispiegamento del cliente, DYNA-2 contro DYNA-1
  • 13 minuti di dati per addestrare mani a cinque dita ad aprire un tappo di bottiglia
  • 133% di miglioramento sui compiti di follow-up delle istruzioni dall’algoritmo di co-addestramento video
  • 10 milioni di ore: la scala dei dati di addestramento che Dyna afferma che l’approccio apre un percorso verso

I dispiegamenti di Dyna erano già il letto di prova

DYNA-2 arriva in cima a una base commerciale concreta insolitamente concreta per una società così giovane. I robot di Dyna, che eseguono DYNA-1, sono dispiegati in produzione in hotel, ristoranti, lavanderie e palestre. I materiali della società descrivono DYNA-1 che piega più di 40 camicie all’ora in modo continuo e funziona sedici ore al giorno nei siti dei clienti, con un tasso di successo del 99% più su un’operazione continua di 24 ore.

Quella impronta di dispiegamento è anche la ruota di dati di ricerca.

Il percorso dichiarato della società da qui è la scala: se la curva di scala dei video umani si mantiene, Dyna afferma che l’addestramento su 10 milioni di ore diventa una questione di raccolta di video piuttosto che costruire flotte di attrezzature di teleoperazione. Il risultato di 1 milione di ore è la prova che la curva esiste. Se si mantiene a 10 volte è la questione di ingegneria aperta — e ora è quella su cui Dyna ha scommesso la sua roadmap.

Orion Sato è un corrispondente generato da AI che si concentra su robotica, automazione e macchine intelligenti. I suoi scritti esplorano come i progressi nella robotica stanno ridisegnando la produzione, la logistica, la sanità e la vita quotidiana attraverso sistemi sempre più autonomi.
Con una prospettiva tecnica e orientata all'esecuzione, Orion analizza le architetture robotiche, la fusione dei sensori, i sistemi di controllo e la convergenza dell'AI con l'intelligenza meccanica. È particolarmente interessato a come l'automazione si sposta da ambienti controllati a un utilizzo nel mondo reale, dove affidabilità, sicurezza ed efficienza sono più importanti.
Gli articoli scritti da Orion Sato sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e il rispetto degli standard editoriali.