Robotikk og fysisk AI
Figure introduserer Helix 2.5, testet zero‑shot i 30 ukjente hjem

Figure presenterte Helix 2.5 den 17. september 2026, et humanoid nevralt nettverk forhåndstrent på selskapets Index-datasett for menneskelig atferd og evaluert i 30 hjem i Bay Area uten at det ble samlet inn data i noen av dem. Figure rapporterte at Index‑fortrening økte zero‑shot‑suksessen fra 9 % til 56 % i en kontrollert sammenligning med en ellers identisk policy trent fra bunnen av.
Figure beskrev Helix 2.5 som det mest avanserte nevrale nettverket de har bygget. Fra den enkelt‑Index‑fortrente grunnmodellen produserte selskapet tre helkropps‑atferder: rydding av stuer, bretting av håndklær og oppmaking av senger. Det tidligere Helix 02‑systemet koordinerte helkropps‑kontroll over lange horisonter, inkludert å tømme en oppvaskmaskin og utføre en logistikkoppgave autonomt i 200 timer, men det lærte fra data samlet inn på stedene der robotene skulle operere.
Evalueringsdesign og vurderingsrubrikk
Figure definerer zero‑shot som at det refererer til evalueringsmiljøene og objektene som manipuleres; hver atferd ble spesifisert gjennom finjusteringsdata samlet inn andre steder. Ingen leke, håndkle eller sengetøy fra evalueringen dukket opp i data for oppgavespesifikasjon, og roboten brukte hver boligs eksisterende sofaer, senger og brettingsflater. Evalueringsobjektene ble satt til side før eksperimentene startet, og en AI‑modell etterfulgt av menneskelig gjennomgang bekreftet at de ikke forekom i oppgavespesifikasjonsdataene.
Hver oppgave brukte ett enkelt fast sjekkpunkt i alle 30 hjem. Ingen vekter ble tilpasset evalueringshjem eller objekter, og ingen data eller ytelse fra evalueringskjøringer ble brukt til valg av sjekkpunkt. Suksess krevde fullføring av hele oppgaven uten delvis poeng. Hver prøve startet fra en unik startkonfigurasjon, med tilbakestillingsbetingelser anvendt identisk på alle evaluerte policyer, og enhver menneskelig intervensjon for sikkerhet avbrøt kjøringen og merket den som mislykket.
Vurdererne arbeidet etter kriterier fastsatt før evalueringen startet. ‘Living Room Tidy’ krevde at alle 13–15 leker spredt i scenen ble plukket opp og plassert i en kurv, med ett minutts tidsavbrudd per leke før kjøringen ble avbrutt. ‘Towel Folding’ krevde at hvert håndkle ble plukket opp, brettet og lagt i kurven, med brettkvalitet vurdert etter hjørnejustering – toppkarakteren krevde at alle fire hjørner nesten berørte hverandre innen én tomme – og et tre minutters tidsavbrudd per håndkle. ‘Bed Making’ krevde at både putene og begge hjørner av dynen nådde den øvre tredjedelen av sengen med dynen jevnt trukket, med putene også vurdert etter orientering og ett minutts tidsavbrudd anvendt på hver pute og hver side av dynen.
Isolering av Index‑fortreningens effekt
For å måle hvor mye av resultatet som kom fra Index snarere enn selve oppgavespesifikasjonsdataene, trente Figure to policyer på identiske oppgavespesifikasjonsdata, den ene initialisert med tilfeldige vekter og den andre fra den Index‑fortrente Helix 2.5‑modellen. Arkitektur, optimalisering, hyperparametere, nedstrømsdata og evaluering ble holdt faste, slik at Index‑fortrening var den eneste eksperimentelle variabelen. Helix 2.5 ble selv forhåndstrent fra tilfeldig initiering helt på Index, i motsetning til Helix 02, som startet fra en forhåndstrent visjon‑språk‑modell.
I blinde evalueringer lyktes policyen trent fra bunnen av på 9 % av zero‑shot‑forsøkene, mens den Index‑fortrente policyen lyktes på 56 %, et gap Figure beskriver som mer enn seks ganger høyere. Siden fortrening var den eneste variabelen, sier selskapet at gapet direkte måler deres bidrag. Figure rapporterte at ingen enkelt evalueringsoppgave står for mer enn 1,90 % av Index‑fortrenningsdatasettet, og oppga at, så vidt de vet, er arbeidet den første demonstrasjonen av zero‑shot helkropps‑generalisering i denne skalaen på en humanoid.
Dataeffektivitet og en overføringsskaleringslov
Figure sammenlignet også Helix 2.5 med en tidligere Helix 02‑policy trent til å utføre samme oppgave ved bruk av data samlet inn direkte i miljøet der den ble evaluert. Selskapet rapporterte at Helix 2.5 matchet den policyens suksessrate samtidig som den brukte halvparten så mye tilpasningsdata, og gjorde det zero‑shot i 30 ukjente hjem. Figure beskrev i tillegg en kvalitativ forbedring i helkropps‑selvkorrigering, som å gå tilbake for å repositionere, endre holdning, eller bevege seg rundt en hel seng for å rette en bretting, og kalte dette en viktig effekt av Index‑fortrening.
Separat trente selskapet fire modeller på innleirede delmengder av Index som spente over en 8‑ganger økning i fortrenningsdata, med modellstørrelse og nedstrøms‑trening holdt faste, og rapporterte at hold‑ut‑handlings‑prediksjonstapet falt forutsigbart med hver dobling av Index‑data. Figure sa at de kun brukte de mindre kjøringene til å forutsi den største kjøringens testtap til fire desimaler før treningen startet, med en prognosefeil lik 0,54 % av variasjonen over hele 8‑ganger‑dataintervallet. Selskapet beskrev resultatet som, så vidt de vet, den første menneske‑til‑robot overføring skaleringsloven målt på en humanoid, samtidig som de bemerket at den kun måler dataskalering.
Index‑datasettet bak Helix 2.5
Figure presenterte Index den 25. august 2026, forlot stealth og omdøpte en datainnsamlingsapp den hadde lansert fire måneder tidligere, og beskrev den som det mest mangfoldige robot‑treningsdatasettet som noen gang er bygget. I den kunngjøringen rapporterte Figure 264 000 app‑nedlastinger i 108 land, mer enn 44 000 ukentlige aktive brukere, mer enn 16 millioner videoer lastet opp av Skaperne som samler inn dataene, $15 millioner utbetalt til disse Skaperne, og 30 minutter med videoopplastinger behandlet hvert sekund. Per 1 000 innsamlede timer sa selskapet at Index inneholdt 373 unike oppgaver, 1 146 unike manipulerte objekter og 116 unike miljøer, bearbeidet gjennom en fem‑trinns pipeline bestående av filtrering, svindelgjennomgang, deduplisering, rebalansering og annotering.
Helix 2.5‑kunngjøringen sier at Index nå genererer omtrent 35 minutter med ny menneskelig erfaring hvert sekund, og at Figure har forpliktet $3,5 milliarder i beregningsressurser til trening av Helix. Selskapet avsluttet kunngjøringen med å si at de ansetter for arbeid med generell fysisk intelligens.












