Робототехника и физический ИИ

Figure представляет Helix 2.5, протестированный zero-shot в 30 неизвестных домах

mm
Добавьте Unite.AI в избранные источники в Google

Figure представила Helix 2.5 17 сентября 2026 г., гуманоидную нейронную сеть, предобученную на наборе данных Index компании, содержащем данные о человеческом поведении, и оценённую в 30 домах района залива, где не собирались никакие данные. Figure сообщила, что предобучение на Index повысило успех zero-shot с 9 % до 56 % в контролируемом сравнении с иначе идентичной политикой, обученной с нуля.

Figure описала Helix 2.5 как самую продвинутую нейронную сеть, которую она построила. На основе единой модели‑основы, предобученной на Index, компания создала три поведения всего тела: приведение в порядок гостиной, складывание полотенец и заправка кровати. Ранее система Helix 02 координировала управление всем телом на длительные промежутки времени, включая выгрузку посудомоечной машины и автономное выполнение логистической задачи в течение 200 часов, но обучалась на данных, собранных в местах, где роботы будут работать.

Дизайн оценки и критерии оценивания

Figure определяет zero-shot как относящийся к оценочным средам и манипулируемым объектам; каждое поведение задавалось с помощью данных дообучения, собранных в другом месте. Ни одна оценочная игрушка, полотенце или постельное бельё не присутствовали в данных спецификации задачи, и робот использовал существующие в каждом доме диваны, кровати и поверхности для складывания. Оценочные объекты были отложены до начала экспериментов, и модель ИИ, проверенная человеком, удостоверилась, что они не присутствуют в данных спецификации задачи.

Для каждой задачи использовалась одна фиксированная контрольная точка во всех 30 домах. Весы не адаптировались к оценочным домам или объектам, и данные развертывания оценки или их производительность не использовались при выборе контрольной точки. Успех требовал полного выполнения задачи без частичного начисления баллов. Каждый пробный запуск начинался с уникальной начальной конфигурации, при этом условия сброса применялись одинаково ко всем оцениваемым политикам, и любое человеческое вмешательство в целях безопасности прерывало развертывание и помечало его как неудачное.

Оценщики работали по критериям, зафиксированным до начала оценки. Для задачи «Уборка гостиной» требовалось собрать все 13–15 разбросанных по сцене игрушек и разместить их в корзине, при этом на каждую игрушку был установлен тайм‑аут в одну минуту, после чего развертывание прерывалось. Для задачи «Складывание полотенец» требовалось подобрать каждое полотенце, сложить его и поместить в корзину; качество складки оценивалось по выравниванию углов — высшая оценка требовала, чтобы все четыре угла почти соприкасались в пределах одного дюйма, — и был установлен тайм‑аут в три минуты на каждое полотенце. Для задачи «Заправка кровати» требовалось, чтобы обе подушки и оба угла одеяла достигли верхней трети кровати, при этом одеяло должно было быть ровно натянуто; подушки также оценивались по ориентации, а на каждую подушку и каждую сторону одеяла был установлен тайм‑аут в одну минуту.

Изоляция эффекта предобучения Index

Чтобы измерить, какая часть результата пришлась на Index, а не на сами данные спецификации задачи, Figure обучила две политики на одинаковых данных спецификации задачи: одну с инициализацией случайными весами, другую — с инициализацией из предобученной модели Helix 2.5 на Index. Архитектура, оптимизация, гиперпараметры, последующие данные и оценка оставались фиксированными, делая предобучение Index единственной экспериментальной переменной. Сам Helix 2.5 был предобучен с нулевой инициализации полностью на Index, в отличие от Helix 02, который начинал с предобученной модели зрительно‑языкового типа.

В слепых оценках политика, обученная с нуля, добивалась успеха в 9 % zero-shot испытаний, тогда как политика, предобученная на Index, — в 56 %, разница, которую Figure описывает как более чем в шесть раз выше. Поскольку предобучение было единственной переменной, компания утверждает, что разница напрямую измеряет его вклад. Figure сообщила, что ни одна отдельная оценочная задача не составляет более 1,90 % набора данных предобучения Index, и заявила, что, насколько ей известно, эта работа является первой демонстрацией zero-shot обобщения всего тела в таком масштабе на гуманоиде.

Эффективность данных и закон масштабирования переноса

Figure также сравнила Helix 2.5 с предыдущей политикой Helix 02, обученной выполнять ту же задачу с использованием данных, собранных непосредственно в среде, где проводилась оценка. Компания сообщила, что Helix 2.5 достигла того же уровня успеха, используя вдвое меньше данных адаптации, и сделала это в режиме zero-shot в 30 неизвестных домах. Figure дополнительно описала качественное улучшение самокоррекции всего тела, например шаг назад для переориентировки, изменение стойки или перемещение вокруг полной кровати для исправления складки, назвав это важным эффектом предобучения Index.

Отдельно компания обучила четыре модели на вложенных подмножествах Index, охватывающих увеличение предобучающих данных в 8 раз, при фиксированном размере модели и последующем обучении, и сообщила, что потеря предсказания действий на отложенной выборке предсказуемо уменьшалась при каждом удвоении объёма данных Index. Figure заявила, что использовала только меньшие прогоны для прогнозирования тестовой потери самого большого прогона с точностью до четырёх знаков после запятой до начала обучения, при этом ошибка прогноза составляла 0,54 % вариации по всему 8‑кратному диапазону данных. Компания описала результат как, насколько ей известно, первый закон масштабирования человеческо-роботского переноса, измеренный на гуманоиде, отмечая, что он измеряет только масштабирование данных.

Набор данных Index, лежащий в основе Helix 2.5

Figure представила Index 25 августа 2026 г., завершив режим скрытности и переименовав приложение для сбора данных, запущенное четыре месяца ранее, и назвав его самым разнообразным набором данных для обучения роботов, когда‑либо созданным. В этом объявлении Figure сообщила о 264 000 загрузках приложения в 108 странах, более 44 000 еженедельных активных пользователей, более 16 млн видеозаписей, загруженных Создателями, собирающими данные, $15 млн, выплаченных этим Создателям, и 30 минут видеозагрузок, обрабатываемых каждую секунду. На каждые 1 000 собранных часов компания заявила, что в Index содержится 373 уникальных задачи, 1 146 уникальных манипулируемых объектов и 116 уникальных сред, обрабатываемых через пятиэтапный конвейер фильтрации, проверки на мошенничество, дедупликации, ребалансировки и аннотирования.

В объявлении о Helix 2.5 говорится, что Index теперь генерирует примерно 35 минут нового человеческого опыта каждую секунду, и что Figure выделила $3,5 млрд вычислительных ресурсов на обучение Helix. Компания завершила объявление, заявив, что набирает сотрудников для работы над общей физической интеллектуальностью.

Орион Сато - это корреспондент, сгенерированный ИИ, который фокусируется на робототехнике, автоматизации и интеллектуальных машинах. Его статьи исследуют, как достижения в робототехнике меняют производство, логистику, здравоохранение и повседневную жизнь посредством все более автономных систем.
С технической и ориентированной на выполнение точки зрения, Орион анализирует робототехнические архитектуры, слияние датчиков, системы управления и слияние ИИ с механической интеллектом. Он особенно интересуется тем, как автоматизация переходит из контролируемых сред в реальное внедрение, где надежность, безопасность и эффективность имеют наибольшее значение.
Статьи, написанные Орионом Сато, сгенерированы ИИ и проверены редакционной командой Unite.AI, чтобы обеспечить техническую точность, ясность и соответствие редакционным стандартам.