Robotik och fysisk AI
Figure presenterar Helix 2.5, testad zero-shot i 30 osedda hem

Figure introducerade Helix 2.5 den 17 september 2026, ett humanoidt neuralt nätverk förtränat på företagets Index‑datamängd av mänskligt beteende och utvärderat i 30 hem i Bay Area utan att någon data samlats in i dem. Figure rapporterade att Index‑förträning ökade zero‑shot‑framgången från 9 % till 56 % i en kontrollerad jämförelse mot en i övrigt identisk policy som tränades från grunden.
Figure beskrev Helix 2.5 som det mest avancerade neurala nätverk som företaget har byggt. Från den enda Index‑förtränade grundmodellen producerade företaget tre helkropps‑beteenden: att städa vardagsrum, vika handdukar och bädda sängar. Det tidigare Helix 02‑systemet samordnade helkroppskontroll över långa horisonter, inklusive att tömma en diskmaskin och utföra en logistikuppgift autonomt i 200 timmar, men det lärde sig från data som samlades in på de platser där robotarna skulle verka.
Utvärderingsdesign och bedömningsrubriker
Figure definierar zero-shot som att det avser utvärderingsmiljöerna och de objekt som manipuleras; varje beteende specificerades genom finjusteringsdata som samlats in på annat håll. Inga leksaker, handdukar eller sängkläder som användes för utvärdering förekom i data för uppgiftsspecifikation, och roboten använde varje hems befintliga soffor, sängar och vikytor. Utvärderingsobjekten lades åt sidan innan experimenten påbörjades, och en AI‑modell följd av mänsklig granskning verifierade att de inte fanns med i data för uppgiftsspecifikation.
Varje uppgift använde en enda fast checkpoint i samtliga 30 hem. Inga vikter anpassades till utvärderingshemmen eller objekten, och ingen data eller prestanda från utvärderingskörningar användes för checkpoint‑urval. Framgång krävde att hela uppgiften slutfördes utan partiell poäng. Varje försök startade från en unik initial konfiguration, med återställningsvillkor som tillämpades identiskt på alla utvärderade policies, och varje mänsklig ingripande för säkerhet avbröt körningen och markerade den som misslyckad.
Bedömare arbetade utifrån kriterier som fastställdes innan utvärderingen påbörjades. “Living Room Tidy” krävde att alla 13–15 leksaker som var spridda i scenen plockades upp och placerades i en korg, med en minuts tidsgräns per leksak innan körningen avbröts. “Towel Folding” krävde att varje handduk plockades upp, viks och placerades i korgen, med vikningskvalitet bedömd efter hörnalignment — högsta betyg krävde att alla fyra hörn nästan rörde vid varandra inom en tum — och en tre minuters tidsgräns per handduk. “Bed Making” krävde att både kuddarna och båda hörnen på täcket nådde den övre tredjedelen av sängen med täcket jämnt draget, med kuddarna även bedömda efter orientering och en minuts tidsgräns tillämpad på varje kudde och varje sida av täcket.
Isolering av Index‑förtränings effekt
För att mäta hur mycket av resultatet som kom från Index snarare än själva data för uppgiftsspecifikation, tränade Figure två policies på identisk uppgiftsspecifikationsdata, den ena initierad med slumpmässiga vikter och den andra initierad från den Index‑förtränade Helix 2.5‑modellen. Arkitektur, optimering, hyperparametrar, efterföljande data och utvärdering hölls konstanta, vilket gjorde Index‑förträning till den enda experimentella variabeln. Helix 2.5 tränades själv från slumpmässig initiering helt på Index, till skillnad från Helix 02, som startade från en förtränad vision‑språk‑modell.
I blinda utvärderingar lyckades den från grunden tränade policyn i 9 % av zero-shot‑försöken, medan den Index‑förtränade policyn lyckades i 56 %, ett gap som Figure beskriver som mer än sex gånger högre. Eftersom förträning var den enda variabeln säger företaget att gapet direkt mäter dess bidrag. Figure rapporterade att ingen enskild utvärderingsuppgift står för mer än 1,90 % av Index‑förträningsdatamängden, och uppgav att, såvitt de vet, arbetet är den första demonstrationen av zero-shot‑helkropps‑generalisation i denna omfattning på en humanoid.
Dataeffektivitet och en överföringsskalningslag
Figure jämförde också Helix 2.5 med en tidigare Helix 02‑policy som tränades för att utföra samma uppgift med data som samlats in direkt i den miljö där den utvärderades. Företaget rapporterade att Helix 2.5 matchade den policyns framgångsfrekvens samtidigt som den använde hälften så mycket anpassningsdata, och gjorde det zero-shot i 30 osedda hem. Figure beskrev dessutom en kvalitativ förbättring i helkropps‑självkorrigering, såsom att ta ett steg tillbaka för att ompositionera, ändra hållning eller röra sig runt en hel säng för att korrigera en vikning, och kallade det en viktig effekt av Index‑förträning.
Separat tränade företaget fyra modeller på nästlade delmängder av Index som spände över en 8‑faldig ökning av förträningsdata, med modellstorlek och efterföljande träning oförändrade, och rapporterade att den hållna handlings‑prediktionsförlusten minskade förutsägbart med varje fördubbling av Index‑data. Figure sade att de endast använde de mindre körningarna för att förutsäga den största körningens testförlust till fyra decimaler innan träningen påbörjades, med en prognosfel som motsvarade 0,54 % av variationen över hela det 8‑faldiga dataintervallet. Företaget beskrev resultatet som, såvitt de vet, den första människa‑till‑robot‑överföring‑skalningslagen som mättes på en humanoid, samtidigt som de påpekade att den endast mäter dataskalning.
Index‑datamängden bakom Helix 2.5
Figure introducerade Index den 25 augusti 2026, lämnade stealth‑läget och bytte namn på en datainsamlingsapp som lanserades fyra månader tidigare, och beskrev den som det mest mångsidiga robotträningsdatamängden som någonsin byggts. I det tillkännagivandet rapporterade Figure 264 000 appnedladdningar i 108 länder, mer än 44 000 veckovisa aktiva användare, mer än 16 miljoner videor som laddats upp av de skapare som samlar in data, 15 miljoner dollar som betalats ut till dessa skapare, och 30 minuter av videouppladdningar som bearbetas varje sekund. Per 1 000 insamlade timmar sade företaget att Index innehöll 373 unika uppgifter, 1 146 unika manipulerade objekt och 116 unika miljöer, bearbetade genom en femstegsprocess bestående av filtrering, bedrägerigranskning, deduplicering, ombalansering och annotering.
Helix 2.5‑tillkännagivandet anger att Index nu genererar ungefär 35 minuter av ny mänsklig upplevelse varje sekund, och att Figure har avsatt 3,5 miljarder dollar i beräkningskapacitet för att träna Helix. Företaget avslutade tillkännagivandet med att säga att de rekryterar för arbete med generell fysisk intelligens.












