Робототехніка та фізичний ШІ
Figure представляє Helix 2.5, протестований zero-shot у 30 невідомих будинках

Figure представила Helix 2.5 17 вересня 2026 року, гуманоїдну нейронну мережу, попередньо навчену на наборі даних Index компанії, що містить дані про людську поведінку, і протестовану у 30 будинках Bay Area без збору даних у жодному з них. Figure повідомила, що попереднє навчання на Index підвищило успішність zero-shot з 9 % до 56 % у контрольному порівнянні з ідентичною політикою, навченою з нуля.
Figure описала Helix 2.5 як найпросунутішу нейронну мережу, яку вона створила. На основі єдиної фундаментальної моделі, попередньо навченої на Index, компанія створила три цілотілові поведінки: прибирання віталень, складання рушників і застилання ліжок. Раніше система Helix 02 координувала цілотілове управління протягом довгих часових горизонтів, включаючи розвантаження посудомийної машини та автономне виконання логістичного завдання протягом 200 годин, але вона навчалась на даних, зібраних у місцях, де роботи працюватимуть.
Дизайн оцінювання та критерії оцінювання
Figure визначає zero-shot як відношення до середовищ оцінювання та маніпульованих об’єктів; кожна поведінка була задана за допомогою даних тонкого налаштування, зібраних в іншому місці. Жодна іграшка, рушник або постільна білизна, що використовувались у оцінюванні, не з’являлися у даних специфікації завдань, і робот використовував існуючі дивани, ліжка та поверхні для складання в кожному будинку. Об’єкти оцінювання були відкладені в окрему колекцію перед початком експериментів, і модель ШІ, після чого здійснив перевірку людиною, підтвердила, що вони не присутні у даних специфікації завдань.
Кожне завдання використовувало один фіксований чекпоінт у всіх 30 будинках. Жодні ваги не адаптувалися під будинки чи об’єкти оцінювання, і дані або результати розгортання не використовувалися для вибору чекпоінту. Успіх вимагав повного виконання завдання без часткових балів. Кожен випробунок починався з унікальної початкової конфігурації, при цьому умови скидання застосовувалися однаково до всіх оцінюваних політик, і будь‑яке людське втручання задля безпеки переривало розгортання та позначалося як невдача.
Оцінювачі працювали за критеріями, зафіксованими до початку оцінювання. Прибирання вітальні вимагало підняти та покласти у кошик усі 13–15 іграшок, розкиданих по сцені, з однохвилинним тайм‑аутом для кожної іграшки перед перериванням розгортання. Складання рушників вимагало підняти, скласти та покласти у кошик кожен рушник, при цьому якість складання оцінювалася за вирівнюванням кутів — найвища оцінка вимагала, щоб усі чотири кути майже доторкалися один до одного в межах одного дюйма — і трьоххвилинним тайм‑аутом для кожного рушника. Застилання ліжка вимагало, щоб обидві подушки та обидва кути ковдри досягли верхньої третини ліжка, при цьому ковдра повинна була бути розгладженою, а подушки оцінювалися за орієнтацією, з однохвилинним тайм‑аутом для кожної подушки та кожної сторони ковдри.
Виділення впливу попереднього навчання Index
Щоб виміряти, яку частину результату забезпечує Index, а не дані специфікації завдань, Figure навчила дві політики на ідентичних даних специфікації завдань: одну ініціалізовану випадковими вагами, іншу — з попередньо навченого на Index Helix 2.5. Архітектура, оптимізація, гіперпараметри, нижчестоячі дані та оцінювання залишалися незмінними, залишаючи попереднє навчання на Index єдиною експериментальною змінною. Сам Helix 2.5 був попередньо навчений з випадкової ініціалізації повністю на Index, на відміну від Helix 02, який стартував з попередньо навченої моделі зору‑мова.
У сліпих оцінюваннях політика, навчена з нуля, досягла успіху у 9 % zero-shot спроб, тоді як політика, попередньо навчена на Index, успішна у 56 %, різниця, яку Figure описує як більш ніж у шість разів вища. Оскільки попереднє навчання було єдиною змінною, компанія стверджує, що ця різниця безпосередньо вимірює її внесок. Figure повідомила, що жодне окреме завдання оцінювання не становить більше 1,90 % набору даних попереднього навчання Index, і зазначила, що, наскільки їй відомо, це перша демонстрація zero-shot цілотілового узагальнення у такому масштабі на гуманоїді.
Ефективність даних та закон масштабування перенесення
Figure також порівняла Helix 2.5 з попередньою політикою Helix 02, навченою виконувати те саме завдання, використовуючи дані, зібрані безпосередньо в середовищі, де вона оцінювалася. Компанія повідомила, що Helix 2.5 досягла того ж рівня успішності, використовуючи вдвічі менше даних адаптації, і зробила це у режимі zero-shot у 30 невідомих будинках. Figure додатково описала якісне покращення у цілотіловій самокорекції, таке як крок назад для зміни позиції, зміна постави або переміщення навколо повного ліжка для виправлення складання, назвавши це важливим ефектом попереднього навчання Index.
Окремо компанія навчила чотири моделі на вкладених підмножинах Index, що охоплювали 8‑кратне збільшення обсягу даних попереднього навчання, залишивши розмір моделі та нижчестояче навчання незмінними, і повідомила, що втрата передбачення дій на відкладеній вибірці передбачувано зменшувалась з кожним подвоєнням даних Index. Figure зазначила, що використовувала лише менші прогонки для прогнозування втрати тесту найбільшої прогонки з точністю до чотирьох десяткових знаків до початку навчання, причому помилка прогнозу становила 0,54 % варіації по всьому 8‑кратному діапазону даних. Компанія описала результат, наскільки їй відомо, як перший закон масштабування перенесення від людини до робота, виміряний на гуманоїді, зазначивши, що він вимірює лише масштабування даних.
Набір даних Index, що лежить в основі Helix 2.5
Figure представила Index 25 серпня 2026 р., вийшовши зі стану «стелс» і перейменувавши додаток для збору даних, запущений чотири місяці раніше, і описавши його як найрізноманітніший набір даних для навчання роботів, який коли‑небудь створювали. У цьому оголошенні Figure повідомила про 264 000 завантажень додатку у 108 країнах, понад 44 000 щотижневих активних користувачів, більше 16 млн відео, завантажених творцями, які збирають дані, виплату $15 млн цим творцям і обробку 30 хвилин відео щосекунди. На кожні 1 000 зібраних годин компанія зазначила, що Index містить 373 унікальні завдання, 1 146 унікальних маніпульованих об’єктів і 116 унікальних середовищ, які проходять п’ятиетапний конвеєр фільтрації, перевірки на шахрайство, дедуплікації, ребалансування та анотації.
У оголошенні про Helix 2.5 зазначено, що Index тепер генерує приблизно 35 хвилин нового людського досвіду щосекунди, і що Figure зобов’язалася надати $3,5 млрд обчислювальних ресурсів для навчання Helix. Компанія завершила оголошення заявою про відкриття вакансій для роботи над загальним фізичним інтелектом.












