Robótica e IA física

Figure apresenta o Helix 2.5, testado zero-shot em 30 casas não vistas

mm
Adicione Unite.AI às suas fontes preferidas no Google

Figure introduziu o Helix 2.5 em 17 de setembro de 2026, uma rede neural humanoide pré-treinada no conjunto de dados Index da empresa, que captura comportamento humano, e avaliada em 30 residências da Bay Area sem que nenhum dado fosse coletado nelas. A Figure informou que o pré-treinamento no Index elevou o sucesso zero-shot de 9 % para 56 % em uma comparação controlada contra uma política idêntica treinada do zero.

A Figure descreveu o Helix 2.5 como a rede neural mais avançada que já construiu. A partir do único modelo de base pré-treinado no Index, a empresa produziu três comportamentos de corpo inteiro: organizar salas de estar, dobrar toalhas e fazer camas. O sistema anterior Helix 02 coordenava o controle de corpo inteiro ao longo de longos horizontes, incluindo descarregar uma máquina de lavar louça e executar uma tarefa logística autonomamente por 200 horas, mas aprendeu a partir de dados coletados nos locais onde os robôs iriam operar.

Desenho da Avaliação e Rubricas de Pontuação

A Figure define zero-shot como a referência aos ambientes de avaliação e aos objetos manipulados; cada comportamento foi especificado por meio de dados de ajuste fino coletados em outro lugar. Nenhum brinquedo, toalha ou roupa de cama de avaliação apareceu nos dados de especificação da tarefa, e o robô utilizou os sofás, camas e superfícies de dobragem existentes em cada casa. Os objetos de avaliação foram reservados antes do início dos experimentos, e um modelo de IA, seguido de revisão humana, verificou que eles não constavam nos dados de especificação da tarefa.

Cada tarefa utilizou um único ponto de verificação fixo em todas as 30 casas. Nenhum peso foi adaptado às casas ou objetos de avaliação, e nenhum dado ou desempenho de execução de avaliação foi usado para a seleção do ponto de verificação. O sucesso exigia a conclusão completa da tarefa sem crédito parcial. Cada teste começou a partir de uma configuração inicial única, com condições de reinicialização aplicadas identicamente a todas as políticas avaliadas, e qualquer intervenção humana por segurança interrompia a execução e marcava‑a como falha.

Os avaliadores trabalharam a partir de critérios fixados antes do início da avaliação. Organizar a Sala de Estar exigia que todos os 13–15 brinquedos espalhados na cena fossem recolhidos e colocados em uma cesta, com um limite de tempo de um minuto por brinquedo antes que a execução fosse abortada. Dobrar Toalhas exigia que cada toalha fosse recolhida, dobrada e colocada na cesta, com a qualidade da dobra avaliada pelo alinhamento dos cantos — a nota máxima exigia que os quatro cantos quase se tocassem dentro de uma polegada — e um limite de tempo de três minutos por toalha. Arrumar a Cama exigia que ambos os travesseiros e os dois cantos do cobertor alcançassem o terço superior da cama com o cobertor esticado suavemente, com os travesseiros também avaliados quanto à orientação e um limite de tempo de um minuto aplicado a cada travesseiro e a cada lado do cobertor.

Isolando o Efeito do Pré-treinamento no Index

Para medir quanto do resultado provém do Index em vez dos próprios dados de especificação da tarefa, a Figure treinou duas políticas com dados de especificação idênticos, uma inicializada com pesos aleatórios e a outra inicializada a partir do modelo Helix 2.5 pré-treinado no Index. Arquitetura, otimização, hiperparâmetros, dados subsequentes e avaliação foram mantidos fixos, deixando o pré-treinamento no Index como a única variável experimental. O próprio Helix 2.5 foi pré-treinado a partir de inicialização aleatória totalmente no Index, ao contrário do Helix 02, que começou a partir de um modelo de visão‑linguagem pré-treinado.

Em avaliações cegas, a política treinada do zero teve sucesso em 9 % dos testes zero-shot, enquanto a política pré-treinada no Index teve sucesso em 56 %, uma diferença que a Figure descreve como mais de seis vezes maior. Como o pré-treinamento foi a única variável, a empresa afirma que a diferença mede diretamente sua contribuição. A Figure informou que nenhuma tarefa de avaliação individual representa mais de 1,90 % do conjunto de dados de pré-treinamento do Index, e declarou que, ao seu conhecimento, o trabalho é a primeira demonstração de generalização de corpo inteiro zero-shot nessa escala em um humanoide.

Eficiência de Dados e uma Lei de Escala de Transferência

A Figure também comparou o Helix 2.5 com uma política anterior Helix 02 treinada para executar a mesma tarefa usando dados coletados diretamente no ambiente onde foi avaliada. A empresa informou que o Helix 2.5 igualou a taxa de sucesso dessa política usando metade da quantidade de dados de adaptação, e fez isso zero-shot em 30 casas não vistas. A Figure descreveu ainda uma melhoria qualitativa na autocorreção de corpo inteiro, como recuar para reposicionar, mudar a postura ou mover‑se ao redor de uma cama completa para corrigir uma dobra, chamando isso de um efeito importante do pré-treinamento no Index.

Separadamente, a empresa treinou quatro modelos em subconjuntos aninhados do Index, abrangendo um aumento de 8× nos dados de pré-treinamento, mantendo o tamanho do modelo e o treinamento subsequente fixos, e informou que a perda de predição de ação reservada diminuiu de forma previsível a cada duplicação dos dados do Index. A Figure disse que usou apenas as execuções menores para prever a perda de teste da execução maior com quatro casas decimais antes do início do treinamento, com erro de previsão equivalente a 0,54 % da variação ao longo de toda a faixa de dados de 8×. A empresa descreveu o resultado como, ao seu conhecimento, a primeira lei de escala de transferência humano‑para‑robô medida em um humanoide, ao notar que ela mede apenas a escala de dados.

O Conjunto de Dados Index por trás do Helix 2.5

Figure apresentou o Index em 25 de agosto de 2026, saindo do modo stealth e renomeando um aplicativo de coleta de dados que havia lançado quatro meses antes, e descrevendo-o como o conjunto de dados de treinamento de robôs mais diversificado já criado. Nesse anúncio, a Figure informou 264,000 downloads do aplicativo em 108 países, mais de 44,000 usuários ativos semanais, mais de 16 milhões de vídeos enviados pelos Criadores que coletam os dados, $15 milhões pagos a esses Criadores e 30 minutos de uploads de vídeo processados a cada segundo. Por cada 1,000 horas coletadas, a empresa disse que o Index continha 373 tarefas únicas, 1,146 objetos manipulados únicos e 116 ambientes únicos, processados por meio de um pipeline de cinco etapas de filtragem, revisão de fraude, desduplicação, reequilíbrio e anotação.

O anúncio do Helix 2.5 afirma que o Index agora gera aproximadamente 35 minutos de nova experiência humana a cada segundo, e que a Figure comprometeu $3.5 bilhões em capacidade de computação para treinar o Helix. A empresa encerrou o anúncio dizendo que está contratando para trabalhar em inteligência física geral.

Orion Sato é um correspondente gerado por IA focado em robótica, automação e máquinas inteligentes. Seus textos exploram como os avanços em robótica estão remodelando a manufatura, logística, saúde e vida cotidiana por meio de sistemas cada vez mais autônomos.
Com uma perspectiva técnica e orientada à execução, Orion analisa arquiteturas robóticas, fusão de sensores, sistemas de controle e a convergência de IA com inteligência mecânica. Ele está particularmente interessado em como a automação se move de ambientes controlados para implantação no mundo real, onde confiabilidade, segurança e eficiência são mais importantes.
Artigos escritos por Orion Sato são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão técnica, clareza e conformidade com os padrões editoriais.