Líderes de pensamento

Ensino de Robôs a se Movimentarem. Agora Estamos Ensino-os a Viver

mm
Adicione Unite.AI às suas fontes preferidas no Google

A robótica moderna alcançou um ponto em que o movimento não é mais o principal desafio – as máquinas já podem navegar, agarrar e operar no espaço com precisão impressionante. No entanto, permitir que elas realmente “vivam” e funcionem no mundo real ainda é um problema sem solução.

Nesse processo, o papel fundamental é desempenhado pelo que poderia ser chamado de “medula espinhal”: o sistema responsável por reações básicas, comportamento e interação com o ambiente.

Quando você olha para a evolução dos robôs por essa lente, torna-se claro que essa sequência de estágios – onde o sistema aprende algo novo a cada passo, desde o movimento simples até ações complexas e conscientes do contexto – se assemelha muito ao desenvolvimento humano.

E é exatamente dentro dessa evolução – de “hardware” vazio para comportamento significativo – que a principal mudança na inteligência artificial física está acontecendo hoje. Interessante aprender mais sobre isso.

A base da robótica: uma etapa raramente discutida

O que é um robô em termos práticos? É um dispositivo físico inicialmente criado como uma plataforma universal. Em essência, é um “branco” que deve ser adaptado a tarefas específicas, treinado para operar em um ambiente determinado e ensinado a realizar as ações necessárias.

Se movemos além dos cenários do dia a dia e consideramos aplicações mais realistas de curto prazo, torna-se claro que a adoção total de robôs ocorrerá principalmente em ambientes industriais e potencialmente perigosos. Isso, por sua vez, implica requisitos significativamente mais altos para seu comportamento, robustez e qualidade do treinamento.

O processo começa com o passo mais básico – construir o dispositivo em si. Um robô é montado a partir de vários componentes, incluindo atuadores, motores, sensores, câmeras, LiDARs. Pode ser humanoid, sobre rodas, bípede ou quadrúpede – o fator de forma é secundário. O que importa é que, nessa etapa, terminamos com um dispositivo funcionando, mas ainda “vazio”.

A próxima etapa é instalar um modelo base que sirva como base para seu comportamento. Em um sentido amplo, o “modelo” é a camada de controle funcional completa. É responsável por capacidades básicas: manter o equilíbrio, ficar em pé e se mover, navegar de um ponto A a um ponto B, evitar obstáculos, não danificar o ambiente e interagir com segurança com humanos.

É aqui que o aprendizado por reforço entra em jogo. Nesses sistemas, bilhões de simulações são executados. Muitas vezes vemos vídeos de robôs “aprendendo” em ambientes complexos: a maioria deles cai, perde o equilíbrio ou falha em completar a tarefa. Mas aqueles que conseguem ficar de pé e continuar se movendo são os que progredirão.

Essa é a essência do aprendizado por reforço: selecionar comportamento bem-sucedido. Os algoritmos daqueles que “sobrevivem” se tornam a base para as próximas iterações. Como resultado, após um enorme número de execuções, surge um modelo que pode lidar com confiança os obstáculos. Esse algoritmo é então transferido para o dispositivo físico.

É uma etapa fundamentada, mas criticamente importante – muitas vezes envolvendo pouca ou nenhuma visão computacional, que não é necessária nesse ponto. O que estamos lidando aqui é a física e a mecânica fundamentais que devem ser incorporadas ao sistema desde o início.

Como os robôs começam a “sentir” o mundo

Então, já temos o “hardware” – um robô com um modelo base instalado: ele pode ficar em pé, andar e manter o equilíbrio. Mas será que isso é suficiente para tarefas do mundo real, por exemplo, em ambientes industriais? Claramente não.

A próxima etapa começa aqui. Integraremos sensores e treinaremos o modelo para agir com base na entrada sensorial. Um novo conjunto de habilidades básicas emerge – já muito mais complexo do que o simples movimento.

Uma analogia com o desenvolvimento humano é útil aqui. Na primeira etapa, trouxemos o sistema para aproximadamente o nível de uma criança de um ano: ela pode ficar em pé, dar os primeiros passos e manter o equilíbrio sem cair. O próximo passo está mais em linha com o nível de uma criança de oito anos.

Nessa idade, uma criança usa ativamente seus “sensores”: ela pode perceber o risco e avaliar as consequências de suas ações. Ela entende que não deve tocar algo quente ou colocar algo muito frio na boca. Ela pode subir em uma mesa, andar de bicicleta e interagir com objetos. Ela é capaz de agarrar, carregar e manipular itens e realizar ações básicas de autocuidado.

Chamamos isso de pré-treinamento. E nesse ponto, as simulações sozinhas não são mais suficientes.

Sim, alguns cenários ainda podem ser modelados com eficácia: como pegar um copo, ou substituir uma bateria, por exemplo, removendo um componente, colocando-o em carga, pegando outro e instalando-o novamente.

Mas, no geral, o equilíbrio muda: cerca de 80% do treinamento ainda pode acontecer em simulação, enquanto cerca de 20% dos dados devem vir do mundo real. E é aqui que começamos a discutir dados egocêntricos.

Dados egocêntricos como base para a compreensão ambiental

Hoje, dados egocêntricos estão sendo coletados em larga escala em todo o mundo – porque, sem eles, é impossível mudar da mecânica básica para uma interação significativa com o mundo real. Um colega de trabalho, que dirige uma rede de oficinas de reparo de carros, tem funcionários usando câmeras montadas na cabeça para gravar todo o processo de reparo do carro. Um proprietário de prédio em Nova York implementou uma abordagem semelhante: a equipe de limpeza usa câmeras montadas na testa que capturam como eles limpam espaços e mantêm áreas sanitárias.

Com o tempo, essas gravações se tornam um produto independente – elas são embaladas e vendidas. Seu valor-chave reside em sua adequação para a etapa de pré-treinamento, ajudando a construir uma compreensão fundamental dos ambientes e sequências de ações.

Por exemplo, um serviço como esse existia no Keymakr, onde a equipe criou independentemente coleções inteiras de dados egocêntricos de cenários simples, como lavar louças, até mais complexos.

Por que isso é tão importante? Porque esses dados fornecem algo que a simulação pura não pode – a diversidade de ambientes do mundo real. Escritórios, oficinas de reparo de carros, canteiros de obras, restaurantes e hotéis – cada um deles adiciona seu próprio contexto, cenários e nuances. Juntos, eles formam um conjunto de dados que permite que um sistema não apenas “veja”, mas gradualmente comece a entender a dinâmica do mundo real.

Nessa etapa, o objetivo não é mais ensinar um robô a executar perfeitamente uma ação específica. O que importa mais é permitir que ele se oriente em seu entorno, para começar.

Hoje, quase todas as empresas que trabalham com robótica – desde a Tesla (TSLA ) até a Unitree Robotics e a Figure AI – estão focadas nessa etapa exata. Seu objetivo é construir um modelo base cujas capacidades primeiro se assemelham às de uma “criança de oito anos” e, em seguida, progridem em direção a uma “criança de doze anos”. Isso também é o que nos concentramos na Introspector – preparar os dados necessários para o pré-treinamento, a fase mais crítica no “amadurecimento” da robótica moderna.

A última milha do treinamento: onde a universalidade termina e a especialização começa

Vamos imaginar que um robô já completou o pré-treinamento e é fabricado desde o início com uma compreensão básica do mundo e um conjunto de habilidades comparável ao de um adolescente. Mas mesmo isso não é suficiente para casos de uso de negócios reais. As empresas não precisam apenas de um robô “de propósito geral” – elas precisam de um especialista.

Tomemos a fabricação automotiva como exemplo. Algumas tarefas ainda são realizadas por humanos porque exigem sensibilidade, precisão e controle visual contínuo. A automação tradicional luta aqui. Manipuladores industriais são excelentes em tarefas repetitivas e rígidas – “pegar, mover, colocar”. Mas tarefas que exigem adaptabilidade, sensação de pressão e ajustes em tempo real permanecem no domínio humano.

É aqui que surge uma nova demanda: treinar um robô para realizar uma operação específica exatamente como um trabalhador qualificado o faz na linha de produção. Em outras palavras, após o treinamento básico, vem o próximo nível: treinamento para uma profissão e cenário específicos.

Nesse ponto, uma pergunta prática surge: o que exatamente é necessário para esse nível de treinamento? Se queremos que um robô reproduza o desempenho humano, precisamos capturar esse comportamento humano com a máxima precisão possível. Por exemplo, o especialista no chão de fábrica precisaria usar uma câmera e, ao longo de um período prolongado, meses ou até um ano, gravar como ele realiza a tarefa.

O que é necessário para que os robôs “vivam” no mundo humano

Uma câmera sozinha não é suficiente. É necessário capturar não apenas a perspectiva visual, mas também a física do movimento. Isso é feito usando luvas especializadas com sensores táteis que medem pressão, força aplicada e natureza da interação com objetos. Isso é especialmente importante porque os objetos em si podem variar significativamente. Por exemplo, as tiras de vedação podem diferir em rigidez por modelo de carro, o que afeta diretamente como a tarefa é realizada.

Em seguida, vem o rastreamento cinemático. Marcadores – visuais ou baseados em sensores – são colocados nos pulsos, cotovelos e, às vezes, ombros. Isso pode incluir, por exemplo, pulseiras com marcadores identificáveis (semelhantes a códigos QR) que permitem que o sistema rastreie a posição da mão no espaço a partir do vídeo. Sensores adicionais, como giroscópios, são usados para capturar movimentos de articulações.

O objetivo final é reconstruir completamente a mecânica do movimento: como o ombro se move, como o cotovelo se dobra, como a pulseira gira. Tudo isso se torna essencial para a próxima etapa – pós-treinamento.

Se, durante o pré-treinamento, ainda podíamos depender parcialmente da simulação, nessa etapa, isso não funciona mais. Essa “última milha” é quase impossível de modelar com precisão. Você não pode simular completamente, por exemplo, como um chef estende a massa – a força aplicada, como a pressão é distribuída, como o material é sentido.

É por isso que, durante o pós-treinamento, quase todos os dados devem vir do mundo real. E é aqui que fica claro: o principal desafio muda para o domínio prático – como obter esses dados na realidade. Coletar dados egocêntricos nesse nível é um processo complexo e multietapas que envolve acesso a ambientes, equipamentos especializados, participação de trabalhadores qualificados e preparação subsequente dos dados.

Além da teoria, é aqui que os robôs realmente “ganham vida” – após conseguirmos organizar esse processo, superar as restrições que as equipes enfrentam em várias indústrias e anotar esses conjuntos de dados em escala. Isso será abordado na próxima parte, onde vamos dar uma olhada mais de perto em todos os desafios que surgem durante a rotulagem e preparação.

Michael Abramov é o fundador e CEO da Scryon, trazendo mais de 15 anos de experiência em engenharia de software e sistemas de IA de visão computacional para a construção de ferramentas de rotulagem de nível empresarial.

Michael iniciou sua carreira como engenheiro de software e gerente de R&D, construindo sistemas de dados escaláveis e gerenciando equipes de engenharia multifuncionais. Até 2025, atuou como CEO da Keymakr, uma empresa de serviços de rotulagem de dados, onde pioneirou fluxos de trabalho humano-no-loop, sistemas avançados de controle de qualidade e ferramentas sob medida para atender às necessidades de dados de visão computacional e autonomia em larga escala.

Ele possui um B.Sc. em Ciência da Computação e formação em engenharia e artes criativas, trazendo uma perspectiva multidisciplinar para a resolução de problemas complexos. Michael atua na interseção entre inovação tecnológica, liderança estratégica de produtos e impacto no mundo real, impulsionando a próxima fronteira dos sistemas autônomos e da automação inteligente.