Robotică și IA fizică
Figure prezintă Helix 2.5, testat zero-shot în 30 de locuințe nevăzute

Figure a introdus Helix 2.5 pe 17 septembrie 2026, o rețea neurală umanoidă pre-antrenată pe setul de date Index al companiei, care conține comportamente umane, și evaluată în 30 de locuințe din zona Bay Area fără a fi colectate date în niciuna dintre ele. Figure a raportat că pre-antrenarea Index a crescut rata de succes zero-shot de la 9% la 56% într-o comparație controlată față de o politică altfel identică antrenată de la zero.
Figure a descris Helix 2.5 ca fiind cea mai avansată rețea neurală pe care a construit-o. Din modelul de bază pre-antrenat pe Index, compania a generat trei comportamente corpului întreg: ordonarea sufrageriilor, plierea prosoapelor și aranjarea patului. Sistemul anterior Helix 02 coordona controlul corpului întreg pe intervale lungi, inclusiv descărcarea unei mașini de spălat vase și desfășurarea autonomă a unei sarcini logistice timp de 200 de ore, dar a învățat din date colectate în locurile în care roboții ar fi operat.
Designul evaluării și rubricile de notare
Figure definește zero-shot ca referindu-se la mediile de evaluare și la obiectele manipulate; fiecare comportament a fost specificat prin date de fine-tuning colectate în altă parte. Niciun jucărie, prosop sau lenjerie de pat utilizată în evaluare nu a apărut în datele de specificare a sarcinii, iar robotul a folosit canapelele, paturile și suprafețele de pliere existente în fiecare locuință. Obiectele de evaluare au fost puse deoparte înainte de începerea experimentelor, iar un model AI, urmat de revizuire umană, a verificat că acestea nu apar în datele de specificare a sarcinii.
Fiecare sarcină a folosit un singur punct de control fix în toate cele 30 de locuințe. Nu s-au adaptat greutăți pentru locuințele sau obiectele de evaluare, iar datele de rulare a evaluării sau performanța nu au fost utilizate pentru selectarea punctului de control. Pentru a avea succes, era necesar să se finalizeze întreaga sarcină fără credit parțial. Fiecare încercare a început dintr-o configurație inițială unică, cu condiții de resetare aplicate în mod identic tuturor politicilor evaluate, iar orice intervenție umană pentru siguranță întrerupea rularea și o marca ca eșuată.
Evaluatorii au lucrat pe baza unor criterii stabilite înainte de începerea evaluării. Ordinarea sufrageriei necesita ca toate cele 13–15 jucării împrăștiate în scenă să fie ridicate și plasate într-un coș, cu un timeout de un minut pentru fiecare jucărie înainte ca rularea să fie întreruptă. Plierea prosoapelor necesita ca fiecare prosop să fie ridicat, pliat și pus în coș, calitatea plierii fiind evaluată în funcție de alinierea colțurilor — nota maximă cerea ca toate cele patru colțuri să se apropie la o distanță de un centimetru — și un timeout de trei minute pentru fiecare prosop. Aranjarea patului necesita ca ambele perne și ambele colțuri ale cuverturii să ajungă în treimea superioară a patului, cu cuvertura întinsă uniform, pernele fiind evaluate și în funcție de orientare, cu un timeout de un minut aplicat fiecărei perne și fiecărui later al cuverturii.
Izolarea efectului pre-antrenării Index
Pentru a măsura cât din rezultat provine din Index și nu din datele de specificare a sarcinii în sine, Figure a antrenat două politici pe aceleași date de specificare a sarcinii, una inițializată cu greutăți aleatorii și cealaltă inițializată din modelul Helix 2.5 pre-antrenat pe Index. Arhitectura, optimizarea, hiperparametrii, datele ulterioare și evaluarea au fost menținute constante, lăsând pre-antrenarea Index ca singura variabilă experimentală. Helix 2.5 a fost pre-antrenat dintr-o inițializare aleatoare exclusiv pe Index, spre deosebire de Helix 02, care a pornit de la un model pre-antrenat de tip vedere-limbaj.
În evaluări în orb, politica antrenată de la zero a reușit în 9% din încercările zero-shot, în timp ce politica pre-antrenată pe Index a reușit în 56%, o diferență pe care Figure o descrie ca fiind de peste șase ori mai mare. Deoarece pre-antrenarea a fost singura variabilă, compania afirmă că diferența măsoară direct contribuția sa. Figure a raportat că nicio sarcină de evaluare individuală nu reprezintă mai mult de 1,90% din setul de date de pre-antrenare Index și a declarat că, din cunoștințele sale, aceasta este prima demonstrație a generalizării zero-shot a corpului întreg la această scară pe un umanoid.
Eficiența datelor și o lege de scalare a transferului
Figure a comparat, de asemenea, Helix 2.5 cu o politică anterioară Helix 02 antrenată să execute aceeași sarcină folosind date colectate direct în mediul în care a fost evaluată. Compania a raportat că Helix 2.5 a egalat rata de succes a acelei politici utilizând jumătate din cantitatea de date de adaptare și a realizat acest lucru zero-shot în 30 de locuințe nevăzute. Figure a descris, în plus, o îmbunătățire calitativă a autocorecției corpului întreg, cum ar fi pasul înapoi pentru repoziționare, schimbarea poziției sau deplasarea în jurul unui pat complet pentru a corecta o pliere, considerând-o un efect important al pre-antrenării Index.
Separat, compania a antrenat patru modele pe subseturi imbricate ale Index, acoperind o creștere de 8 ori a datelor de pre-antrenare, menținând dimensiunea modelului și antrenamentul ulterior constante, și a raportat că pierderea de predicție a acțiunii reținută a scăzut predictibil la fiecare dublare a datelor Index. Figure a declarat că a folosit doar rulările mai mici pentru a prezice pierderea de test a celei mai mari rulări până la patru zecimale înainte de începerea antrenamentului, cu o eroare de prognoză egală cu 0,54% din variația pe întreaga gamă de date de 8 ori. Compania a descris rezultatul ca fiind, din cunoștințele sale, prima lege de scalare a transfer de la om la robot măsurată pe un umanoid, subliniind că măsoară doar scalarea datelor.
Setul de date Index din spatele Helix 2.5
Figure a introdus Index pe 25 august 2026, ieșind din stadiul de stealth și redenumind o aplicație de colectare de date pe care o lansase cu patru luni în urmă, descriind-o ca fiind cel mai divers set de date pentru instruirea roboților construit vreodată. În acel anunț, Figure a raportat 264.000 de descărcări ale aplicației în 108 țări, peste 44.000 de utilizatori activi săptămânal, peste 16 de milioane de videoclipuri încărcate de Creatorii care colectează datele, 15 milioane de dolari plătiți acelor Creatori și 30 de minute de încărcări video procesate în fiecare secundă. Pentru fiecare 1.000 de ore colectate, compania a declarat că Index conținea 373 de sarcini unice, 1.146 de obiecte manipulate unice și 116 medii unice, procesate printr-un lanț de cinci etape de filtrare, revizuire a fraudei, deduplicare, rebalansare și adnotare.
Anunțul privind Helix 2.5 precizează că Index generează acum aproximativ 35 de minute de noi experiențe umane în fiecare secundă și că Figure a alocat 3,5 miliarde de dolari în resurse de calcul pentru instruirea Helix. Compania a încheiat anunțul spunând că angajează personal pentru lucrul la inteligența fizică generală.












