Robotica en fysieke AI
Figure introduceert Helix 2.5, getest zero-shot in 30 onbekende huizen

Figure introduceerde Helix 2.5 op 17 september 2026, een mensachtige neuraal netwerk dat voorgetraind is op de Index-dataset van het bedrijf met menselijk gedrag en geëvalueerd is in 30 huizen in de Bay Area zonder dat er in een van die huizen gegevens werden verzameld. Figure meldde dat de Index-voortraining de zero-shot-succes verhoogde van 9 % naar 56 % in een gecontroleerde vergelijking met een verder identieke beleidslijn die vanaf nul getraind was.
Figure beschreef Helix 2.5 als het meest geavanceerde neurale netwerk dat het heeft gebouwd. Vanuit het enkele Index-voorgetrainde foundation‑model produceerde het bedrijf drie volledige‑lichaamsgedragingen: het opruimen van woonkamers, het vouwen van handdoeken en het opmaken van bedden. Het eerdere Helix‑02‑systeem coördineerde volledige‑lichaamscontrole over lange tijdshorizonten, waaronder het uitladen van een vaatwasser en het zelfstandig uitvoeren van een logistieke taak gedurende 200 uur, maar het leerde van gegevens die waren verzameld op de plaatsen waar de robots zouden opereren.
Ontwerp van evaluatie en beoordelingsrubrieken
Figure definieert zero-shot als verwijzend naar de evaluatieomgevingen en de te manipuleren objecten; elk gedrag werd gespecificeerd via fine‑tuning‑data die elders waren verzameld. Er verscheen geen evaluatietoy, handdoek of beddengoed in de taak‑specificatiedata, en de robot gebruikte de bestaande banken, bedden en vouwoppervlakken van elk huis. Evaluatie‑objecten werden apart gezet voordat de experimenten begonnen, en een AI‑model, gevolgd door een menselijke controle, verifieerde dat ze niet in de taak‑specificatiedata voorkwamen.
Elke taak maakte gebruik van één vaste checkpoint in alle 30 huizen. Er werden geen gewichten aangepast aan de evaluatiehuizen of -objecten, en er werden geen evaluatie‑rollout‑data of prestaties gebruikt voor de selectie van de checkpoint. Succes vereiste het volledig voltooien van de taak zonder gedeeltelijke krediet. Elke proef begon vanuit een unieke initiële configuratie, met reset‑condities die identiek werden toegepast op alle geëvalueerde beleidslijnen, en elke menselijke interventie om veiligheid te waarborgen onderbrak de rollout en werd gemarkeerd als mislukt.
Beoordelaars werkten volgens criteria die vóór de evaluatie waren vastgesteld. Het opruimen van de woonkamer vereiste dat alle 13–15 speelgoedstukken die in de scène verspreid lagen, werden opgepakt en in een mand geplaatst, met een timeout van één minuut per stuk voordat de rollout werd afgebroken. Het vouwen van handdoeken vereiste dat elke handdoek werd opgepakt, gevouwen en in de mand werd geplaatst, waarbij de vouwkwaliteit werd beoordeeld op hoekuitlijning — de hoogste beoordeling vereiste dat alle vier hoeken bijna binnen één inch elkaar raakten — en een timeout van drie minuten per handdoek. Het opmaken van het bed vereiste dat zowel beide kussens als beide dekbedoekenhoeken de bovenste derde van het bed bereikten met het dekbedoek glad getrokken, waarbij de kussens ook werden beoordeeld op oriëntatie en een timeout van één minuut werd toegepast op elk kussen en elke kant van het dekbedoek.
Het isoleren van het effect van Index‑voortraining
Om te meten hoeveel van het resultaat voortkwam uit Index in plaats van uit de taak‑specificatiedata zelf, trainde Figure twee beleidslijnen op identieke taak‑specificatiedata, de ene geïnitieerd met willekeurige gewichten en de andere vanuit het Index‑voorgetrainde Helix 2.5‑model. Architectuur, optimalisatie, hyperparameters, downstream‑data en evaluatie werden constant gehouden, waardoor Index‑voortraining de enige experimentele variabele bleef. Helix 2.5 zelf werd volledig vanaf een willekeurige initialisatie voorgetraind op Index, in tegenstelling tot Helix 02, dat begon vanuit een voorgetraind vision‑language‑model.
In blinde evaluaties slaagde het vanaf nul getrainde beleid in 9 % van de zero-shot‑proeven, terwijl het Index‑voorgetrainde beleid in 56 % slaagde, een kloof die Figure beschrijft als meer dan zes keer zo groot. Omdat voortraining de enige variabele was, zegt het bedrijf dat de kloof direct hun bijdrage meet. Figure meldde dat geen enkele evaluatietaak meer dan 1,90 % van de Index‑voortrainingsdataset vertegenwoordigt, en stelde dat, voor zover bekend, dit werk de eerste demonstratie is van zero-shot generalisatie van het volledige lichaam op deze schaal bij een humanoïde.
Gegevens efficiëntie en een transfer‑schaalwet
Figure vergeleek Helix 2.5 ook met een eerdere Helix‑02‑beleidslijn die was getraind om dezelfde taak uit te voeren met data die rechtstreeks in de omgeving waar het werd geëvalueerd, waren verzameld. Het bedrijf meldde dat Helix 2.5 dezelfde succesratio behaalde als dat beleid, terwijl het de helft van de adaptatiedata gebruikte, en dat dit zero-shot gebeurde in 30 onbekende huizen. Figure beschreef bovendien een kwalitatieve verbetering in volledige‑lichaam zelfcorrectie, zoals een stap terug nemen om zich te herpositioneren, van houding veranderen, of rond een volledig bed bewegen om een vouw te corrigeren, en noemde dit een belangrijk effect van Index‑voortraining.
Separaat trainde het bedrijf vier modellen op geneste subsets van Index die een 8‑voudige toename in voortrainingsdata besloegen, waarbij modelgrootte en downstream‑training constant werden gehouden, en meldde dat de achtergehouden actie‑voorspellingsverlies voorspelbaar daalde bij elke verdubbeling van de Index‑data. Figure zei dat het alleen de kleinere runs gebruikte om de test‑verlies van de grootste run tot vier decimalen te voorspellen voordat de training begon, met een voorspellingsfout gelijk aan 0,54 % van de variatie over het volledige 8‑voudige datumbereik. Het bedrijf beschreef het resultaat als, voor zover bekend, de eerste mens‑naar‑robot overdracht schaalwet gemeten op een humanoïde, terwijl het opmerkte dat het alleen datascale meet.
De Index‑dataset achter Helix 2.5
Figure introduceerde Index op 25 augustus 2026, verliet de stealth‑fase en hernoemde een data‑verzamelapp die vier maanden eerder was gelanceerd, en beschreef het als de meest diverse robot‑trainingsdataset die ooit is gebouwd. In die aankondiging meldde Figure 264.000 app‑downloads in 108 landen, meer dan 44.000 wekelijks actieve gebruikers, meer dan 16 miljoen video’s geüpload door de makers die de data verzamelen, $15 miljoen uitbetaald aan die makers, en 30 minuten aan video‑uploads die elke seconde worden verwerkt. Per 1.000 verzamelde uren zei het bedrijf dat Index 373 unieke taken, 1.146 unieke gemanipuleerde objecten en 116 unieke omgevingen bevatte, verwerkt via een vijf‑stappen‑pipeline van filtering, fraude‑review, deduplicatie, herbalancering en annotatie.
De Helix 2.5‑aankondiging stelt dat Index nu ongeveer 35 minuten aan nieuwe menselijke ervaring per seconde genereert, en dat Figure $3,5 miljard aan rekenkracht heeft toegezegd voor het trainen van Helix. Het bedrijf sloot de aankondiging af met de mededeling dat het personeel werft voor werk aan algemene fysieke intelligentie.












