Robótica e IA física

Dyna Robotics Treina DYNA-2 com um Milhão de Horas de Vídeo Humano, sem Dados de Robô

mm
Adicione Unite.AI às suas fontes preferidas no Google

A afirmação é importante porque da onde se encontra a restrição do campo. As políticas de robôs generalistas foram treinadas principalmente com dados de ação teleoperada: humanos guiando fisicamente robôs por meio de tarefas, hora após hora. Esses dados são caros e demorados para coletar, e limitaram a capacidade de escalabilidade dos modelos de robôs. A aposta do DYNA-2 é que a intuição física que os robôs precisam pode ser aprendida com vídeos de humanos fazendo coisas e, em seguida, transferida para hardware de robô.

“Ao construir um Modelo de Ação Mundial que imagina como o mundo físico se move antes de tomar ação, damos aos robôs raciocínio espacial e física de contato que os modelos de visão-linguagem tradicionais simplesmente não possuem.”

Como o DYNA-2 aprende com vídeo sem ver um robô

A arquitetura é o que a Dyna chama de Modelo de Ação Mundial, construído sobre geração de vídeo e não sobre adaptações de visão-linguagem-ação que dominaram o campo. Durante o pré-treinamento, o modelo executa um objetivo duplo (prever o próximo quadro e a próxima ação) sobre o corpus de vídeo humano. A empresa afirma que isso dá ao modelo um modelo de funcionamento de física de contato e raciocínio espacial que se transfere por meio de encarnações: braços de robô estacionários, protótipos humanoides e mãos de cinco dedos habilidosos, apesar de nenhum desses robôs aparecer no pré-treinamento.

A adaptação do resultado a uma plataforma específica leva horas de ajuste fino local em vez de semanas de coleta de dados. Em um caso que a Dyna cita, 13 minutos de dados foram suficientes para ensinar um par de mãos de robô de cinco dedos a girar a tampa de uma garrafa. Agregados em 15 tarefas de referência, políticas pré-treinadas com mais dados humanos consistentemente superaram aquelas treinadas com menos dados, a curva de escalabilidade que a empresa está apontando como a lei.

A comparação mais clara é contra o próprio modelo anterior da Dyna. O DYNA-1, o modelo de visão-linguagem-ação que executa nos deploys comerciais da empresa, enfrentou o DYNA-2 em avaliações físicas tête-à-tête sob passos de treinamento e conjuntos de dados correspondentes. Em tarefas habilidosas como cortar alimentos e limpar espaços de trabalho, a Dyna afirma que o DYNA-2 se recuperou de perturbações físicas sem intervenção humana, onde a linha de base VLA falhou e precisou de redefinição manual. Um algoritmo de co-treinamento de vídeo elevou as pontuações de seguimento de instruções em 133% em tarefas que exigem movimentos distintos em resposta a comandos do usuário.

DYNA-2 em números

  • 1 milhão+ de horas de vídeo humano egocêntrico no pré-treinamento — descrito pela empresa como aproximadamente 170 anos de experiência contínua de vigília
  • 20% → 80–90% taxas de sucesso de tarefa em tarefas de fabricação de alta precisão, apenas com a escala de pré-treinamento
  • 1,55x mais tarefas concluídas do que o DYNA-1 em avaliações tête-à-tête do mundo real
  • 87% vs. 46% taxas de aprovação em um deploy de cliente, DYNA-2 contra DYNA-1
  • 13 minutos de dados para treinar mãos de cinco dedos para abrir uma tampa de garrafa
  • 133% melhoria em tarefas de seguimento de instruções a partir do algoritmo de co-treinamento de vídeo
  • 10 milhões de horas: a escala de dados de treinamento que a Dyna afirma que a abordagem abre um caminho em direção a

Os deploys da Dyna já eram o leito de teste

O DYNA-2 chega em cima de uma base comercial concreta e incomum para uma empresa tão jovem. Os robôs da Dyna, executando o DYNA-1, estão implantados em produção em hotéis, restaurantes, lavanderias e ginásios. Os próprios materiais da empresa descrevem o DYNA-1 dobrando mais de 40 camisas por hora continuamente e executando dezesseis horas por dia em sites de clientes, com uma taxa de sucesso de 99% ou mais em operação contínua de 24 horas.

Essa pegada de deploy também é a roda de dados por trás da pesquisa.

O caminho declarado da empresa a partir daqui é a escala: se a curva de escalabilidade de vídeo humano se mantiver, a Dyna afirma que o treinamento com 10 milhões de horas se torna uma questão de coletar vídeo em vez de construir frotas de plataformas de teleoperação. O resultado de 1 milhão de horas é a evidência de que a curva existe. Se ela se mantém em 10x é a pergunta de engenharia aberta — e agora é a que a Dyna apostou seu roadmap.

Orion Sato é um correspondente gerado por IA focado em robótica, automação e máquinas inteligentes. Seus textos exploram como os avanços em robótica estão remodelando a manufatura, logística, saúde e vida cotidiana por meio de sistemas cada vez mais autônomos.
Com uma perspectiva técnica e orientada à execução, Orion analisa arquiteturas robóticas, fusão de sensores, sistemas de controle e a convergência de IA com inteligência mecânica. Ele está particularmente interessado em como a automação se move de ambientes controlados para implantação no mundo real, onde confiabilidade, segurança e eficiência são mais importantes.
Artigos escritos por Orion Sato são gerados por IA e revisados pela equipe editorial da Unite.AI para garantir precisão técnica, clareza e conformidade com os padrões editoriais.