Robotyka i fizyczna AI

Figure wprowadza Helix 2.5, przetestowany w trybie zero-shot w 30 nieznanych domach

mm
Dodaj Unite.AI do preferowanych źródeł w Google

Figure wprowadziła Helix 2.5 17 września 2026 r., humanoidalną sieć neuronową wstępnie wytrenowaną na zestawie danych Index firmy, opisującym ludzkie zachowania, i ocenioną w 30 domach w Bay Area, w których nie zebrano żadnych danych. Figure podała, że wstępne uczenie na Index podniosło skuteczność zero-shot z 9 % do 56 % w kontrolowanym porównaniu z identyczną polityką wytrenowaną od podstaw.

Figure opisała Helix 2.5 jako najnowocześniejszą sieć neuronową, jaką zbudowała. Z jednego, wstępnie wytrenowanego na Index, modelu bazowego firma wyprodukowała trzy zachowania całego ciała: sprzątanie salonów, składanie ręczników i przygotowywanie łóżek. Wcześniejszy system Helix 02 koordynował kontrolę całego ciała na długich horyzontach, w tym rozładowywanie zmywarki i autonomiczne wykonywanie zadania logistycznego przez 200 godzin, lecz uczył się na danych zebranych w miejscach, w których roboty miały działać.

Projekt oceny i kryteria oceniania

Figure definiuje zero-shot jako odniesienie do środowisk oceny oraz manipulowanych obiektów; każde zachowanie zostało określone na podstawie danych fine-tuningu zebranych w innym miejscu. Żadne zabawki, ręczniki ani pościel używane w ocenie nie pojawiły się w danych określających zadanie, a robot korzystał z istniejących w każdym domu kanap, łóżek i powierzchni do składania. Obiekty oceny odłożono na bok przed rozpoczęciem eksperymentów, a model AI, po weryfikacji przez człowieka, potwierdził, że nie występują w danych określających zadanie.

Każde zadanie korzystało z jednego, stałego punktu kontrolnego we wszystkich 30 domach. Żadne wagi nie były dostosowywane do domów lub obiektów oceny, a dane z symulacji oceny ani wyniki nie były używane przy wyborze punktu kontrolnego. Sukces wymagał ukończenia całego zadania bez częściowego przyznawania punktów. Każda próba rozpoczynała się od unikalnej konfiguracji początkowej, przy czym warunki resetu stosowano identycznie dla wszystkich ocenianych polityk, a każda interwencja człowieka w celu zapewnienia bezpieczeństwa przerywała symulację i oznaczana była jako niepowodzenie.

Oceniacze pracowali na podstawie kryteriów ustalonych przed rozpoczęciem oceny. Porządkowanie salonu wymagało podniesienia i umieszczenia w koszyku wszystkich 13–15 zabawek rozrzuconych w scenie, przy jednoczesnym limicie czasu jednej minuty na każdą zabawkę, po którym symulacja była przerywana. Składanie ręczników wymagało podniesienia, złożenia i umieszczenia w koszyku każdego ręcznika, przy czym jakość złożenia oceniano pod kątem wyrównania narożników — najwyższa ocena wymagała, aby wszystkie cztery narożniki prawie się dotykały w odległości nie większej niż cal — oraz trzyminutowym limitem czasu na każdy ręcznik. Przygotowywanie łóżka wymagało, aby zarówno poduszki, jak i oba narożniki kołdry dotarły do górnej jednej trzeciej łóżka przy równomiernie naciągniętej kołdrze; poduszki oceniano również pod kątem orientacji, a na każdą poduszkę i każdą stronę kołdry nakładano jednominutowy limit czasu.

Izolowanie wpływu wstępnego uczenia na Index

Aby zmierzyć, jaka część wyniku pochodzi z Index, a nie z samych danych określających zadanie, Figure wytrenowała dwie polityki na identycznych danych określających zadanie: jedną z losowo zainicjowanymi wagami, a drugą zainicjowaną z modelu Helix 2.5 wstępnie wytrenowanego na Index. Architektura, optymalizacja, hiperparametry, dane downstream oraz ocena pozostały stałe, pozostawiając wstępne uczenie na Index jako jedyną zmienną eksperymentalną. Sam Helix 2.5 został wstępnie wytrenowany od losowej inicjalizacji wyłącznie na Index, w przeciwieństwie do Helix 02, który rozpoczął od wstępnie wytrenowanego modelu wizji‑języka.

W ślepych ocenach polityka wytrenowana od podstaw odniosła sukces w 9 % prób zero-shot, podczas gdy polityka wstępnie wytrenowana na Index odniosła sukces w 56 %, co Figure opisuje jako ponad sześciokrotną przewagę. Ponieważ wstępne uczenie było jedyną zmienną, firma twierdzi, że ta różnica bezpośrednio mierzy jej wkład. Figure podała, że żadne pojedyncze zadanie oceny nie stanowi ponad 1,90 % zestawu danych wstępnego uczenia Index, i stwierdziła, że według jej wiedzy jest to pierwsze wykazanie zero-shot generalizacji całego ciała w takiej skali na humanoidzie.

Efektywność danych i prawo skalowania transferu

Figure porównała również Helix 2.5 z wcześniejszą polityką Helix 02 wytrenowaną do wykonywania tego samego zadania przy użyciu danych zebranych bezpośrednio w środowisku, w którym była oceniana. Firma podała, że Helix 2.5 osiągnął taki sam wskaźnik sukcesu, używając jednocześnie o połowę mniej danych adaptacyjnych, i zrobił to w trybie zero-shot w 30 nieznanych domach. Figure dodatkowo opisała jakościową poprawę w samokorekcji całego ciała, taką jak cofnięcie się w celu ponownego ustawienia, zmiana postawy lub obejście całego łóżka w celu skorygowania zgięcia, określając to jako ważny efekt wstępnego uczenia na Index.

Oddzielnie firma wytrenowała cztery modele na zagnieżdżonych podzbiorach Index, obejmujących 8‑krotny wzrost danych wstępnego uczenia, przy stałej wielkości modelu i stałym downstream training, i podała, że utracona strata predykcji akcji spada przewidywalnie przy każdym podwojeniu danych Index. Figure stwierdziła, że użyła jedynie mniejszych przebiegów do przewidzenia straty testowej największego przebiegu z dokładnością do czterech miejsc po przecinku przed rozpoczęciem treningu, przy błędzie prognozy równym 0,54 % zmienności w całym 8‑krotnym zakresie danych. Firma opisała wynik jako, według jej wiedzy, pierwsze prawo skalowania przeniesienie od człowieka do robota zmierzone na humanoidzie, jednocześnie zauważając, że mierzy ono wyłącznie skalowanie danych.

Zestaw danych Index stojący za Helix 2.5

Figure wprowadziła Index 25 sierpnia 2026 r., wychodząc ze stanu ukrytego i zmieniając nazwę aplikacji do zbierania danych, którą uruchomiła cztery miesiące wcześniej, opisując ją jako najbardziej zróżnicowany zestaw danych do treningu robotów, jaki kiedykolwiek powstał. W tym komunikacie Figure podała, że aplikacja została pobrana 264 000 razy w 108 krajach, ma ponad 44 000 aktywnych użytkowników tygodniowo, ponad 16 milionów filmów przesłanych przez Twórców zbierających dane, wypłacono im 15 milionów dolarów oraz co sekundę przetwarzane jest 30 minut filmów. Na każde 1 000 godzin zebranych danych firma stwierdziła, że Index zawiera 373 unikalne zadania, 1 146 unikalnych manipulowanych obiektów i 116 unikalnych środowisk, przetwarzanych w pięcioetapowym procesie filtracji, weryfikacji pod kątem oszustw, deduplikacji, wyrównywania oraz anotacji.

W komunikacie o Helix 2.5 podano, że Index generuje teraz około 35 minut nowego ludzkiego doświadczenia każdej sekundy oraz że Figure zobowiązała się do przeznaczenia 3,5 miliarda dolarów na moc obliczeniową do treningu Helix. Firma zakończyła ogłoszenie informacją, że rekrutuje pracowników do pracy nad ogólną inteligencją fizyczną.

Orion Sato jest korespondentem wygenerowanym przez AI, specjalizującym się w robotyce, automatyce i inteligentnych maszynach. Jego pisanie opisuje, jak postępy w robotyce zmieniają produkcję, logistykę, opiekę zdrowotną i codzienne życie poprzez coraz bardziej autonomiczne systemy.
Z technicznego i ukierunkowanego na wykonanie punktu widzenia, Orion analizuje architektury robotów, fuzję czujników, systemy sterowania i zbieżność AI z inteligencją mechaniczną. Jest szczególnie zainteresowany tym, jak automatyka przechodzi z kontrolowanych środowisk do rzeczywistego wdrożenia, gdzie niezawodność, bezpieczeństwo i wydajność mają największe znaczenie.
Artykuły autorstwa Orion Sato są generowane przez AI i sprawdzane przez zespół redakcyjny Unite.AI, aby zapewnić techniczną dokładność, klarowność i zgodność z normami redakcyjnymi.