Robotika a fyzická AI
Figure představuje Helix 2.5, testováno v režimu zero-shot v 30 neviděných domech

Figure představil Helix 2.5 dne 17. září 2026, humanoidní neuronovou síť předtrénovanou na datasetu Index společnosti, který zachycuje lidské chování, a testovanou ve 30 domech v oblasti Bay Area, kde nebyla shromážděna žádná data. Figure uvedl, že předtrénování na Indexu zvýšilo úspěšnost zero-shot z 9 % na 56 % v kontrolovaném srovnání s jinou identickou politikou trénovanou od nuly.
Figure popsal Helix 2.5 jako nejpokročilejší neuronovou síť, jakou kdy vytvořil. Z jediného modelu založeného na předtrénování na Indexu společnost vytvořila tři celotělové chování: úklid obývacích pokojů, skládání ručníků a připravování postelí. Dřívější systém Helix 02 koordinoval celotělové řízení na dlouhých časových horizontech, včetně vykládání myčky nádobí a autonomního provádění logistického úkolu po dobu 200 hodin, avšak učil se z dat shromážděných v místech, kde roboti budou operovat.
Návrh hodnocení a hodnotící rubriky
Figure definuje zero-shot jako odkaz na hodnotící prostředí a manipulované objekty; každé chování bylo specifikováno pomocí doladovacích dat shromážděných jinde. Žádná hodnotící hračka, ručník ani ložní prádlo se neobjevily v datech specifikace úkolu a robot použil existující pohovky, postele a skládací plochy v každém domě. Hodnotící objekty byly odloženy před zahájením experimentů a model AI následovaný lidskou kontrolou ověřil, že se v datech specifikace úkolu neobjevily.
Každý úkol použil jediný pevný kontrolní bod ve všech 30 domech. Žádné váhy nebyly přizpůsobeny hodnotícím domům ani objektům a žádná data z provedení hodnocení ani výkonnost nebyly použity pro výběr kontrolního bodu. Úspěch vyžadoval dokončení celého úkolu bez částečného bodování. Každý pokus začínal z unikátní počáteční konfigurace, přičemž podmínky resetu byly aplikovány identicky na všechny hodnocené politiky, a jakýkoli lidský zásah kvůli bezpečnosti přerušil provedení a označil jej jako neúspěšný.
Hodnotitelé pracovali podle kritérií stanovených před zahájením hodnocení. Úklid obývacího pokoje vyžadoval, aby všech 13–15 hraček rozptýlených v místnosti bylo zvednuto a umístěno do koše, s časovým limitem jedné minuty na hračku, po jehož uplynutí byl pokus přerušen. Skládání ručníků vyžadovalo, aby byl každý ručník zvednut, složen a umístěn do koše, přičemž kvalita skládání byla hodnocena podle zarovnání rohů – nejvyšší hodnocení vyžadovalo, aby se všechny čtyři rohy téměř dotýkaly v rozmezí jednoho palce – a byl nastaven časový limit tři minuty na ručník. Příprava postele vyžadovala, aby oba polštáře a oba rohy přikrývky dosáhly horní třetiny postele s přitisknutou přikrývkou rovnoměrně, přičemž polštáře byly také hodnoceny podle orientace a byl aplikován časový limit jedna minuta na každý polštář a na každou stranu přikrývky.
Izolace vlivu předtrénování na Indexu
Aby změřil, jak velká část výsledku pochází z Indexu a ne z dat specifikace úkolu samotných, Figure vytrénoval dvě politiky na identických datech specifikace úkolu, jednu inicializovanou náhodnými vahami a druhou inicializovanou z modelu Helix 2.5 předtrénovaného na Indexu. Architektura, optimalizace, hyperparametry, podřadná data a hodnocení byly ponechány konstantní, takže předtrénování na Indexu zůstalo jedinou experimentální proměnnou. Helix 2.5 byl sám předtrénován z náhodné inicializace výhradně na Indexu, na rozdíl od Helix 02, který začal s předtrénovaným modelem vidění‑jazyka.
V slepých hodnoceních politika trénovaná od nuly uspěla v 9 % zero-shot pokusů, zatímco politika předtrénovaná na Indexu uspěla v 56 %, což Figure popisuje jako více než šestinásobně vyšší rozdíl. Protože předtrénování bylo jedinou proměnnou, společnost uvádí, že tento rozdíl přímo měří její příspěvek. Figure uvedl, že žádný jednotlivý hodnotící úkol nepředstavuje více než 1,90 % datasetu předtrénování na Indexu, a uvedl, že podle jeho znalostí je tato práce prvním demonstračním příkladem zero-shot generalizace celého těla v takovém rozsahu na humanoidu.
Účinnost dat a zákon škálování přenosu
Figure také porovnal Helix 2.5 s předchozí politikou Helix 02, která byla trénována k provádění stejného úkolu pomocí dat shromážděných přímo v prostředí, kde byla hodnocena. Společnost uvedla, že Helix 2.5 dosáhl stejné úspěšnosti jako tato politika při použití polovičního množství adaptačních dat a to v režimu zero-shot ve 30 neviděných domech. Figure dále popsal kvalitativní zlepšení v celotělové samokorekci, jako je krok zpět pro přeskupení, změna postavení nebo obcházení celé postele za účelem opravy skládání, a označil to za důležitý efekt předtrénování na Indexu.
Odděleně společnost vyškolila čtyři modely na vnořených podmnožinách Indexu, které pokrývaly 8‑násobný nárůst předtrénovacích dat, přičemž velikost modelu a následné trénování zůstaly konstantní, a uvedla, že ztráta predikce akcí na vyčleněných datech klesala předvídatelně s každým zdvojnásobením dat Indexu. Figure uvedl, že použil pouze menší běhy k předpovědi testovací ztráty největšího běhu na čtyři desetinná místa před zahájením tréninku, přičemž chyba předpovědi činila 0,54 % variability napříč celým 8‑násobným rozsahem dat. Společnost popisuje výsledek jako, podle jejích znalostí, první zákon škálování přenos člověk‑k‑robotu měřený na humanoidu, přičemž upozorňuje, že měří pouze škálování dat.
Dataset Index stojící za Helix 2.5
Figure představil Index dne 25. srpna 2026, ukončil režim stealth a přejmenoval aplikaci pro sběr dat, kterou spustil před čtyřmi měsíci, a popsal ji jako nejrozmanitější dataset pro trénink robotů, jaký kdy byl vytvořen. V tom oznámení Figure uvedl 264 000 stažení aplikace v 108 zemích, více než 44 000 týdenních aktivních uživatelů, více než 16 milionů videí nahraných Tvůrci, kteří data sbírají, $15 milionů vyplacených těmto Tvůrcům a 30 minut video nahrávek zpracovávaných každou sekundu. Na 1 000 hodin nasbíraných dat společnost uvedla, že Index obsahoval 373 unikátních úkolů, 1 146 unikátních manipulovaných objektů a 116 unikátních prostředí, zpracovávaných pětistupňovým procesem filtrování, kontroly podvodů, deduplikace, vyvážení a anotace.
Oznámení Helix 2.5 uvádí, že Index nyní generuje přibližně 35 minut nových lidských zkušeností každou sekundu, a že Figure se zavázal poskytnout $3,5 miliardy výpočetního výkonu na trénink Helix. Společnost uzavřela oznámení tím, že najímá pracovníky na výzkum obecné fyzické inteligence.












