Líderes de pensamento

Ensino de RobÃīs a se Movimentarem. Agora Estamos Ensino-os a Viver

mm
Adicione Unite.AI às suas fontes preferidas no Google

A robÃģtica moderna alcançou um ponto em que o movimento nÃĢo ÃĐ mais o principal desafio – as mÃĄquinas jÃĄ podem navegar, agarrar e operar no espaço com precisÃĢo impressionante. No entanto, permitir que elas realmente “vivam” e funcionem no mundo real ainda ÃĐ um problema sem soluçÃĢo.

Nesse processo, o papel fundamental ÃĐ desempenhado pelo que poderia ser chamado de “medula espinhal”: o sistema responsÃĄvel por reaçÃĩes bÃĄsicas, comportamento e interaçÃĢo com o ambiente.

Quando vocÊ olha para a evoluçÃĢo dos robÃīs por essa lente, torna-se claro que essa sequÊncia de estÃĄgios – onde o sistema aprende algo novo a cada passo, desde o movimento simples atÃĐ açÃĩes complexas e conscientes do contexto – se assemelha muito ao desenvolvimento humano.

E ÃĐ exatamente dentro dessa evoluçÃĢo – de “hardware” vazio para comportamento significativo – que a principal mudança na inteligÊncia artificial física estÃĄ acontecendo hoje. Interessante aprender mais sobre isso.

A base da robÃģtica: uma etapa raramente discutida

O que ÃĐ um robÃī em termos prÃĄticos? É um dispositivo físico inicialmente criado como uma plataforma universal. Em essÊncia, ÃĐ um “branco” que deve ser adaptado a tarefas específicas, treinado para operar em um ambiente determinado e ensinado a realizar as açÃĩes necessÃĄrias.

Se movemos alÃĐm dos cenÃĄrios do dia a dia e consideramos aplicaçÃĩes mais realistas de curto prazo, torna-se claro que a adoçÃĢo total de robÃīs ocorrerÃĄ principalmente em ambientes industriais e potencialmente perigosos. Isso, por sua vez, implica requisitos significativamente mais altos para seu comportamento, robustez e qualidade do treinamento.

O processo começa com o passo mais bÃĄsico – construir o dispositivo em si. Um robÃī ÃĐ montado a partir de vÃĄrios componentes, incluindo atuadores, motores, sensores, cÃĒmeras, LiDARs. Pode ser humanoid, sobre rodas, bípede ou quadrÚpede – o fator de forma ÃĐ secundÃĄrio. O que importa ÃĐ que, nessa etapa, terminamos com um dispositivo funcionando, mas ainda “vazio”.

A prÃģxima etapa ÃĐ instalar um modelo base que sirva como base para seu comportamento. Em um sentido amplo, o “modelo” ÃĐ a camada de controle funcional completa. É responsÃĄvel por capacidades bÃĄsicas: manter o equilíbrio, ficar em pÃĐ e se mover, navegar de um ponto A a um ponto B, evitar obstÃĄculos, nÃĢo danificar o ambiente e interagir com segurança com humanos.

É aqui que o aprendizado por reforço entra em jogo. Nesses sistemas, bilhÃĩes de simulaçÃĩes sÃĢo executados. Muitas vezes vemos vídeos de robÃīs “aprendendo” em ambientes complexos: a maioria deles cai, perde o equilíbrio ou falha em completar a tarefa. Mas aqueles que conseguem ficar de pÃĐ e continuar se movendo sÃĢo os que progredirÃĢo.

Essa ÃĐ a essÊncia do aprendizado por reforço: selecionar comportamento bem-sucedido. Os algoritmos daqueles que “sobrevivem” se tornam a base para as prÃģximas iteraçÃĩes. Como resultado, apÃģs um enorme nÚmero de execuçÃĩes, surge um modelo que pode lidar com confiança os obstÃĄculos. Esse algoritmo ÃĐ entÃĢo transferido para o dispositivo físico.

É uma etapa fundamentada, mas criticamente importante – muitas vezes envolvendo pouca ou nenhuma visÃĢo computacional, que nÃĢo ÃĐ necessÃĄria nesse ponto. O que estamos lidando aqui ÃĐ a física e a mecÃĒnica fundamentais que devem ser incorporadas ao sistema desde o início.

Como os robÃīs começam a “sentir” o mundo

EntÃĢo, jÃĄ temos o “hardware” – um robÃī com um modelo base instalado: ele pode ficar em pÃĐ, andar e manter o equilíbrio. Mas serÃĄ que isso ÃĐ suficiente para tarefas do mundo real, por exemplo, em ambientes industriais? Claramente nÃĢo.

A prÃģxima etapa começa aqui. Integraremos sensores e treinaremos o modelo para agir com base na entrada sensorial. Um novo conjunto de habilidades bÃĄsicas emerge – jÃĄ muito mais complexo do que o simples movimento.

Uma analogia com o desenvolvimento humano ÃĐ Ãštil aqui. Na primeira etapa, trouxemos o sistema para aproximadamente o nível de uma criança de um ano: ela pode ficar em pÃĐ, dar os primeiros passos e manter o equilíbrio sem cair. O prÃģximo passo estÃĄ mais em linha com o nível de uma criança de oito anos.

Nessa idade, uma criança usa ativamente seus “sensores”: ela pode perceber o risco e avaliar as consequÊncias de suas açÃĩes. Ela entende que nÃĢo deve tocar algo quente ou colocar algo muito frio na boca. Ela pode subir em uma mesa, andar de bicicleta e interagir com objetos. Ela ÃĐ capaz de agarrar, carregar e manipular itens e realizar açÃĩes bÃĄsicas de autocuidado.

Chamamos isso de prÃĐ-treinamento. E nesse ponto, as simulaçÃĩes sozinhas nÃĢo sÃĢo mais suficientes.

Sim, alguns cenÃĄrios ainda podem ser modelados com eficÃĄcia: como pegar um copo, ou substituir uma bateria, por exemplo, removendo um componente, colocando-o em carga, pegando outro e instalando-o novamente.

Mas, no geral, o equilíbrio muda: cerca de 80% do treinamento ainda pode acontecer em simulaçÃĢo, enquanto cerca de 20% dos dados devem vir do mundo real. E ÃĐ aqui que começamos a discutir dados egocÊntricos.

Dados egocÊntricos como base para a compreensÃĢo ambiental

Hoje, dados egocÊntricos estÃĢo sendo coletados em larga escala em todo o mundo – porque, sem eles, ÃĐ impossível mudar da mecÃĒnica bÃĄsica para uma interaçÃĢo significativa com o mundo real. Um colega de trabalho, que dirige uma rede de oficinas de reparo de carros, tem funcionÃĄrios usando cÃĒmeras montadas na cabeça para gravar todo o processo de reparo do carro. Um proprietÃĄrio de prÃĐdio em Nova York implementou uma abordagem semelhante: a equipe de limpeza usa cÃĒmeras montadas na testa que capturam como eles limpam espaços e mantÊm ÃĄreas sanitÃĄrias.

Com o tempo, essas gravaçÃĩes se tornam um produto independente – elas sÃĢo embaladas e vendidas. Seu valor-chave reside em sua adequaçÃĢo para a etapa de prÃĐ-treinamento, ajudando a construir uma compreensÃĢo fundamental dos ambientes e sequÊncias de açÃĩes.

Por exemplo, um serviço como esse existia no Keymakr, onde a equipe criou independentemente coleçÃĩes inteiras de dados egocÊntricos de cenÃĄrios simples, como lavar louças, atÃĐ mais complexos.

Por que isso ÃĐ tÃĢo importante? Porque esses dados fornecem algo que a simulaçÃĢo pura nÃĢo pode – a diversidade de ambientes do mundo real. EscritÃģrios, oficinas de reparo de carros, canteiros de obras, restaurantes e hotÃĐis – cada um deles adiciona seu prÃģprio contexto, cenÃĄrios e nuances. Juntos, eles formam um conjunto de dados que permite que um sistema nÃĢo apenas “veja”, mas gradualmente comece a entender a dinÃĒmica do mundo real.

Nessa etapa, o objetivo nÃĢo ÃĐ mais ensinar um robÃī a executar perfeitamente uma açÃĢo específica. O que importa mais ÃĐ permitir que ele se oriente em seu entorno, para começar.

Hoje, quase todas as empresas que trabalham com robÃģtica – desde a Tesla atÃĐ a Unitree Robotics e a Figure AI – estÃĢo focadas nessa etapa exata. Seu objetivo ÃĐ construir um modelo base cujas capacidades primeiro se assemelham às de uma “criança de oito anos” e, em seguida, progridem em direçÃĢo a uma “criança de doze anos”. Isso tambÃĐm ÃĐ o que nos concentramos na Introspector – preparar os dados necessÃĄrios para o prÃĐ-treinamento, a fase mais crítica no “amadurecimento” da robÃģtica moderna.

A Última milha do treinamento: onde a universalidade termina e a especializaçÃĢo começa

Vamos imaginar que um robÃī jÃĄ completou o prÃĐ-treinamento e ÃĐ fabricado desde o início com uma compreensÃĢo bÃĄsica do mundo e um conjunto de habilidades comparÃĄvel ao de um adolescente. Mas mesmo isso nÃĢo ÃĐ suficiente para casos de uso de negÃģcios reais. As empresas nÃĢo precisam apenas de um robÃī “de propÃģsito geral” – elas precisam de um especialista.

Tomemos a fabricaçÃĢo automotiva como exemplo. Algumas tarefas ainda sÃĢo realizadas por humanos porque exigem sensibilidade, precisÃĢo e controle visual contínuo. A automaçÃĢo tradicional luta aqui. Manipuladores industriais sÃĢo excelentes em tarefas repetitivas e rígidas – “pegar, mover, colocar”. Mas tarefas que exigem adaptabilidade, sensaçÃĢo de pressÃĢo e ajustes em tempo real permanecem no domínio humano.

É aqui que surge uma nova demanda: treinar um robÃī para realizar uma operaçÃĢo específica exatamente como um trabalhador qualificado o faz na linha de produçÃĢo. Em outras palavras, apÃģs o treinamento bÃĄsico, vem o prÃģximo nível: treinamento para uma profissÃĢo e cenÃĄrio específicos.

Nesse ponto, uma pergunta prÃĄtica surge: o que exatamente ÃĐ necessÃĄrio para esse nível de treinamento? Se queremos que um robÃī reproduza o desempenho humano, precisamos capturar esse comportamento humano com a mÃĄxima precisÃĢo possível. Por exemplo, o especialista no chÃĢo de fÃĄbrica precisaria usar uma cÃĒmera e, ao longo de um período prolongado, meses ou atÃĐ um ano, gravar como ele realiza a tarefa.

O que ÃĐ necessÃĄrio para que os robÃīs “vivam” no mundo humano

Uma cÃĒmera sozinha nÃĢo ÃĐ suficiente. É necessÃĄrio capturar nÃĢo apenas a perspectiva visual, mas tambÃĐm a física do movimento. Isso ÃĐ feito usando luvas especializadas com sensores tÃĄteis que medem pressÃĢo, força aplicada e natureza da interaçÃĢo com objetos. Isso ÃĐ especialmente importante porque os objetos em si podem variar significativamente. Por exemplo, as tiras de vedaçÃĢo podem diferir em rigidez por modelo de carro, o que afeta diretamente como a tarefa ÃĐ realizada.

Em seguida, vem o rastreamento cinemÃĄtico. Marcadores – visuais ou baseados em sensores – sÃĢo colocados nos pulsos, cotovelos e, às vezes, ombros. Isso pode incluir, por exemplo, pulseiras com marcadores identificÃĄveis (semelhantes a cÃģdigos QR) que permitem que o sistema rastreie a posiçÃĢo da mÃĢo no espaço a partir do vídeo. Sensores adicionais, como giroscÃģpios, sÃĢo usados para capturar movimentos de articulaçÃĩes.

O objetivo final ÃĐ reconstruir completamente a mecÃĒnica do movimento: como o ombro se move, como o cotovelo se dobra, como a pulseira gira. Tudo isso se torna essencial para a prÃģxima etapa – pÃģs-treinamento.

Se, durante o prÃĐ-treinamento, ainda podíamos depender parcialmente da simulaçÃĢo, nessa etapa, isso nÃĢo funciona mais. Essa “Última milha” ÃĐ quase impossível de modelar com precisÃĢo. VocÊ nÃĢo pode simular completamente, por exemplo, como um chef estende a massa – a força aplicada, como a pressÃĢo ÃĐ distribuída, como o material ÃĐ sentido.

É por isso que, durante o pÃģs-treinamento, quase todos os dados devem vir do mundo real. E ÃĐ aqui que fica claro: o principal desafio muda para o domínio prÃĄtico – como obter esses dados na realidade. Coletar dados egocÊntricos nesse nível ÃĐ um processo complexo e multietapas que envolve acesso a ambientes, equipamentos especializados, participaçÃĢo de trabalhadores qualificados e preparaçÃĢo subsequente dos dados.

AlÃĐm da teoria, ÃĐ aqui que os robÃīs realmente “ganham vida” – apÃģs conseguirmos organizar esse processo, superar as restriçÃĩes que as equipes enfrentam em vÃĄrias indÚstrias e anotar esses conjuntos de dados em escala. Isso serÃĄ abordado na prÃģxima parte, onde vamos dar uma olhada mais de perto em todos os desafios que surgem durante a rotulagem e preparaçÃĢo.

Michael Abramov ÃĐ o fundador e CEO da Introspector, trazendo mais de 15 anos de experiÊncia em engenharia de software e sistemas de visÃĢo computacional de IA para a construçÃĢo de ferramentas de rotulagem de nível empresarial.

Michael começou sua carreira como engenheiro de software e gerente de P&D, construindo sistemas de dados escalÃĄveis e gerenciando equipes de engenharia multifuncionais. AtÃĐ 2025, ele atuou como CEO da Keymakr, uma empresa de serviços de rotulagem de dados, onde ele pioneirou fluxos de trabalho humanos no loop, sistemas de QA avançados e ferramentas personalizadas para atender às necessidades de dados de visÃĢo computacional e autonomia em larga escala.

Ele possui um B.Sc. em CiÊncia da ComputaçÃĢo e uma formaçÃĢo em engenharia e artes criativas, trazendo uma lente multidisciplinar para resolver problemas difíceis. Michael vive na interseçÃĢo da inovaçÃĢo tecnolÃģgica, liderança de produto estratÃĐgica e impacto no mundo real, impulsionando a prÃģxima fronteira dos sistemas autÃīnomos e automaçÃĢo inteligente.