Robotteknologi og fysisk AI
Figure introducerer Helix 2.5, testet zero‑shot i 30 ukendte hjem

Figure introducerede Helix 2.5 den 17. september 2026, en humanoid neuralt netværk forudtrænet på virksomhedens Index‑datasæt af menneskelig adfærd og evalueret i 30 hjem i Bay Area uden at der blev indsamlet data i nogen af dem. Figure rapporterede, at Index‑forudtræning øgede zero‑shot‑succesen fra 9 % til 56 % i en kontrolleret sammenligning med en ellers identisk politik, der blev trænet fra bunden.
Figure beskrev Helix 2.5 som det mest avancerede neurale netværk, det har bygget. Ud fra den enkeltstående Index‑forudtrænede grundmodel producerede virksomheden tre helkrops‑adfærd: oprydning af stuer, foldning af håndklæder og redning af senge. Det tidligere Helix 02‑system koordinerede helkropskontrol over lange horisonter, herunder aflæsning af en opvaskemaskine og udførelse af en logistikopgave autonomt i 200 timer, men det lærte af data indsamlet på de steder, hvor robotterne skulle operere.
Evalueringsdesign og bedømmelsesrubrikker
Figure definerer zero‑shot som henvisende til evalueringsmiljøerne og de objekter, der manipuleres; hver adfærd blev specificeret gennem finjusteringsdata indsamlet andre steder. Ingen evalueringslegetøj, håndklæde eller sengetøj fremkom i dataene for opgavespecifikation, og robotten brugte hver boligs eksisterende sofaer, senge og foldningsflader. Evalueringsobjekter blev sat til side inden eksperimenterne startede, og en AI‑model efterfulgt af menneskelig gennemgang bekræftede, at de ikke forekom i opgavespecifikationsdataene.
Hver opgave brugte et enkelt fast checkpoint i alle 30 hjem. Ingen vægte blev tilpasset til evalueringshjem eller -objekter, og ingen evaluerings‑rollout‑data eller -præstation blev brugt til valg af checkpoint. Succes krævede, at hele opgaven blev fuldført uden delvis kredit. Hvert forsøg startede fra en unik startkonfiguration, med nulstillingsbetingelser anvendt identisk på alle evaluerede politikker, og enhver menneskelig indgriben af sikkerhedsmæssige årsager afbrød rollouten og markerede den som mislykket.
Bedømmere arbejdede ud fra kriterier fastlagt inden evalueringen begyndte. Oprydning af stue krævede, at alle 13–15 legetøj spredt i scenen blev samlet op og placeret i en kurv, med et minut timeout pr. legetøj før rollouten blev afbrudt. Foldning af håndklæder krævede, at hvert håndklæde blev samlet op, foldet og placeret i kurven, med foldkvalitet bedømt på hjørnejustering — den højeste bedømmelse krævede, at alle fire hjørner næsten rørte hinanden inden for en tomme — og en tre minutters timeout pr. håndklæde. Sengeopdækning krævede, at både puder og begge hjørner af dynen nåede den øverste tredjedel af sengen med dynen trukket glat, med puder også bedømt på orientering og et minut timeout anvendt på hver pude og hver side af dynen.
Isolering af Index‑forudtrænings effekten
For at måle, hvor meget af resultatet der kom fra Index i stedet for selve opgavespecifikationsdataene, trænede Figure to politikker på identiske opgavespecifikationsdata, den ene initialiseret med tilfældige vægte og den anden initialiseret fra den Index‑forudtrænede Helix 2.5‑model. Arkitektur, optimering, hyperparametre, efterfølgende data og evaluering holdtes faste, så Index‑forudtræning var den eneste eksperimentelle variabel. Helix 2.5 blev selv forudtrænet fra tilfældig initialisering udelukkende på Index, i modsætning til Helix 02, som startede fra en forudtrænet vision‑sprog‑model.
I blinde evalueringer lykkedes den fra bunden trænet politik på 9 % af zero‑shot‑forsøgene, mens den Index‑forudtrænede politik lykkedes på 56 %, et hul, som Figure beskriver som mere end seks gange større. Da forudtræning var den eneste variabel, siger virksomheden, at hullet direkte måler dens bidrag. Figure rapporterede, at ingen enkelt evalueringsopgave udgør mere end 1,90 % af Index‑forudtræningsdatasættet, og erklærede, at så vidt de ved, er arbejdet den første demonstration af zero‑shot‑helkrops‑generalisation i denne skala på en humanoid.
Dataeffektivitet og en overførsels‑skalingslov
Figure sammenlignede også Helix 2.5 med en tidligere Helix 02‑politik, der var trænet til at udføre den samme opgave ved hjælp af data indsamlet direkte i det miljø, hvor den blev evalueret. Virksomheden rapporterede, at Helix 2.5 matchede den politik’s succesrate, mens den brugte halvt så meget tilpasningsdata, og gjorde det zero‑shot på tværs af 30 ukendte hjem. Figure beskrev desuden en kvalitativ forbedring i helkrops‑selvkorrektion, såsom at træde tilbage for at repositionere, ændre holdning eller bevæge sig omkring en fuld seng for at rette en fold, og kaldte det en vigtig effekt af Index‑forudtræning.
Separat trænede virksomheden fire modeller på indlejrede delmængder af Index, der spænder over en 8‑gange stigning i forudtræningsdata, mens modelstørrelse og efterfølgende træning holdtes faste, og rapporterede, at den hold‑ud‑handlings‑forudsigelses‑tab faldt forudsigeligt med hver fordobling af Index‑data. Figure sagde, at den kun brugte de mindre kørsel til at forudsige den største kørsels test‑tab til fire decimaler før træningen begyndte, med en forudsigelsesfejl på 0,54 % af variationen over det fulde 8‑gange datainterval. Virksomheden beskrev resultatet som, så vidt de ved, den første menneske‑til‑robot overførsel‑skalingslov målt på en humanoid, mens de bemærkede, at den kun måler dataskalering.
Index‑datasættet bag Helix 2.5
Figure introducerede Index den 25. august 2026, trådte ud af stealth‑tilstand og omdøbte en dataindsamlings‑app, den havde lanceret fire måneder tidligere, og beskrev den som det mest alsidige robot‑træningsdatasæt, der nogensinde er bygget. I den meddelelse rapporterede Figure 264.000 app‑downloads i 108 lande, mere end 44.000 ugentlige aktive brugere, mere end 16 millioner videoer uploadet af de Creators, der indsamler dataene, $15 millioner udbetalt til disse Creators, og 30 minutter af video‑uploads behandlet hver sekund. Pr. 1.000 indsamlede timer sagde virksomheden, at Index indeholdt 373 unikke opgaver, 1.146 unikke manipulerede objekter og 116 unikke miljøer, som blev behandlet gennem en femtrins‑pipeline bestående af filtrering, svindelgennemgang, deduplikering, rebalancering og annotering.
Helix 2.5‑meddelelsen angiver, at Index nu genererer cirka 35 minutter af ny menneskelig erfaring hver sekund, og at Figure har forpligtet $3,5 milliarder i beregningskraft til træning af Helix. Virksomheden afsluttede meddelelsen med at sige, at de ansætter til arbejde med generel fysisk intelligens.












