Robotica e IA fisica

Figure presenta Helix 2.5, testato zero-shot in 30 case non viste

mm
Aggiungi Unite.AI alle tue fonti preferite su Google

Figure ha introdotto Helix 2.5 il 17 settembre 2026, una rete neurale umanoide preaddestrata sul dataset Index dell’azienda, relativo al comportamento umano, e valutata in 30 case della Bay Area senza che fossero raccolti dati in nessuna di esse. Figure ha riferito che il preaddestramento su Index ha aumentato il successo zero-shot dal 9% al 56% in un confronto controllato con una politica altrimenti identica addestrata da zero.

Figure ha descritto Helix 2.5 come la rete neurale più avanzata che abbia mai costruito. Partendo dal singolo modello di base preaddestrato su Index, l’azienda ha prodotto tre comportamenti a corpo intero: riordinare i soggiorni, piegare gli asciugamani e rifare i letti. Il precedente sistema Helix 02 coordinava il controllo a corpo intero su lunghi orizzonti temporali, includendo lo scarico di una lavastoviglie e l’esecuzione autonoma di un compito logistico per 200 ore, ma aveva appreso dai dati raccolti nei luoghi in cui i robot avrebbero operato.

Progettazione della valutazione e rubriche di valutazione

Figure definisce zero-shot come riferito agli ambienti di valutazione e agli oggetti manipolati; ogni comportamento è stato specificato tramite dati di fine-tuning raccolti altrove. Nessun giocattolo, asciugamano o biancheria da letto di valutazione è comparso nei dati di specifica del compito, e il robot ha utilizzato i divani, i letti e le superfici di piegatura già presenti in ciascuna casa. Gli oggetti di valutazione sono stati messi da parte prima dell’inizio degli esperimenti, e un modello di IA, seguito da una revisione umana, ha verificato che non fossero presenti nei dati di specifica del compito.

Ogni compito ha utilizzato un unico checkpoint fisso in tutte le 30 case. Nessun peso è stato adattato alle case o agli oggetti di valutazione, e nessun dato o risultato di rollout di valutazione è stato usato per la selezione del checkpoint. Il successo richiedeva il completamento dell’intero compito senza credito parziale. Ogni prova è iniziata da una configurazione iniziale unica, con condizioni di reset applicate identicamente a tutte le politiche valutate, e qualsiasi intervento umano per motivi di sicurezza ha interrotto il rollout segnalandolo come fallito.

I valutatori hanno operato secondo criteri fissati prima dell’inizio della valutazione. L’ordine del soggiorno richiedeva che tutti i 13–15 giocattoli sparsi nella scena fossero raccolti e collocati in un cestino, con un timeout di un minuto per giocattolo prima dell’interruzione del rollout. Il piegamento degli asciugamani richiedeva che ogni asciugamano fosse raccolto, piegato e collocato nel cestino, con la qualità della piega valutata sull’allineamento degli angoli — il voto più alto richiedeva che tutti e quattro gli angoli si avvicinassero entro un pollice — e un timeout di tre minuti per asciugamano. La rifacitura del letto richiedeva che entrambi i cuscini e gli angoli della trapunta raggiungessero il terzo superiore del letto con la trapunta tirata liscia, con i cuscini valutati anche sull’orientamento e un timeout di un minuto applicato a ciascun cuscino e a ciascun lato della trapunta.

Isolamento dell’effetto del preaddestramento Index

Per misurare quanto del risultato derivasse da Index piuttosto che dai dati di specifica del compito, Figure ha addestrato due politiche su dati di specifica identici, una inizializzata con pesi casuali e l’altra inizializzata dal modello Helix 2.5 preaddestrato su Index. Architettura, ottimizzazione, iperparametri, dati a valle e valutazione sono stati mantenuti fissi, lasciando il preaddestramento su Index come unica variabile sperimentale. Helix 2.5 è stato preaddestrato da un’inizializzazione casuale interamente su Index, a differenza di Helix 02, che è partito da un modello vision-language preaddestrato.

Nelle valutazioni cieche, la politica addestrata da zero ha avuto successo nel 9% delle prove zero-shot, mentre la politica preaddestrata su Index ha avuto successo nel 56%, un divario che Figure descrive come più di sei volte superiore. Poiché il preaddestramento era l’unica variabile, l’azienda afferma che il divario misura direttamente il suo contributo. Figure ha riferito che nessun singolo compito di valutazione rappresenta più dell’1.90% del dataset di preaddestramento Index, e ha dichiarato che, per quanto ne sappia, questo lavoro è la prima dimostrazione di generalizzazione zero-shot a corpo intero a questa scala su un umanoide.

Efficienza dei dati e una legge di scaling del trasferimento

Figure ha anche confrontato Helix 2.5 con una precedente politica Helix 02 addestrata per svolgere lo stesso compito usando dati raccolti direttamente nell’ambiente in cui è stata valutata. L’azienda ha riferito che Helix 2.5 ha eguagliato il tasso di successo di quella politica utilizzando metà dei dati di adattamento, e lo ha fatto zero-shot in 30 case non viste. Figure ha inoltre descritto un miglioramento qualitativo nell’auto-correzione a corpo intero, come fare un passo indietro per riposizionarsi, cambiare postura o muoversi attorno a un letto intero per correggere una piega, definendolo un effetto importante del preaddestramento su Index.

Separatamente, l’azienda ha addestrato quattro modelli su sottoinsiemi annidati di Index che coprono un aumento di 8 volte dei dati di preaddestramento, mantenendo fissi la dimensione del modello e l’addestramento a valle, e ha riferito che la perdita di previsione delle azioni tenuta fuori è diminuita in modo prevedibile ad ogni raddoppio dei dati di Index. Figure ha dichiarato di aver usato solo le esecuzioni più piccole per prevedere la perdita di test dell’esecuzione più grande fino a quattro cifre decimali prima dell’inizio dell’addestramento, con un errore di previsione pari allo 0.54% della variazione sull’intera gamma di dati 8x. L’azienda ha descritto il risultato come, per quanto ne sappia, la prima legge di scaling del trasferimento da umano a robot misurata su un umanoide, notando che misura solo lo scaling dei dati.

Il dataset Index alla base di Helix 2.5

Figure ha introdotto Index il 25 agosto 2026, uscendo dalla modalità stealth e rinominando un’app di raccolta dati lanciata quattro mesi prima, descrivendola come il più diversificato dataset di addestramento per robot mai creato. In quell’annuncio, Figure ha segnalato 264.000 download dell’app in 108 paesi, più di 44.000 utenti attivi settimanali, oltre 16 milioni di video caricati dai Creators che raccolgono i dati, $15 milioni pagati a quei Creators e 30 minuti di video caricati elaborati ogni secondo. Per 1.000 ore raccolte, l’azienda ha dichiarato che Index conteneva 373 compiti unici, 1.146 oggetti manipolati unici e 116 ambienti unici, processati attraverso una pipeline a cinque fasi di filtraggio, revisione antifrode, deduplicazione, riequilibrio e annotazione.

L’annuncio di Helix 2.5 afferma che Index sta ora generando circa 35 minuti di nuova esperienza umana ogni secondo, e che Figure ha impegnato $3,5 miliardi di dollari di potenza di calcolo per l’addestramento di Helix. L’azienda ha concluso l’annuncio dichiarando di essere alla ricerca di personale per lavori sull’intelligenza fisica generale.

Orion Sato è un corrispondente generato da AI che si concentra su robotica, automazione e macchine intelligenti. I suoi scritti esplorano come i progressi nella robotica stanno ridisegnando la produzione, la logistica, la sanità e la vita quotidiana attraverso sistemi sempre più autonomi.
Con una prospettiva tecnica e orientata all'esecuzione, Orion analizza le architetture robotiche, la fusione dei sensori, i sistemi di controllo e la convergenza dell'AI con l'intelligenza meccanica. È particolarmente interessato a come l'automazione si sposta da ambienti controllati a un utilizzo nel mondo reale, dove affidabilità, sicurezza ed efficienza sono più importanti.
Gli articoli scritti da Orion Sato sono generati da AI e revisionati dal team editoriale di Unite.AI per garantire l'accuratezza tecnica, la chiarezza e il rispetto degli standard editoriali.