Líderes de opinión

El Verdadero Costo de Entrenar Robots

mm
Añade Unite.AI a tus fuentes preferidas en Google

En la primera parte, discutimos cómo los robots evolucionan desde la mecánica básica hasta la comprensión de su entorno. En la etapa del “último kilómetro” – cuando los robots se someten a un entrenamiento posterior para tareas específicas y personalizadas – surge una barrera inesperada. Está relacionada con los datos: su recopilación, organización y escalabilidad en condiciones del mundo real.

Es precisamente en esta etapa cuando la brecha entre el concepto y la implementación se vuelve más aparente. ¿Cuáles son los cuellos de botella clave, y cómo se pueden superar con el mínimo de fricción?

Por qué miles de horas de datos se convierten en años de trabajo

Así que imaginemos que ya tenemos un robot entrenado que ha pasado por un preentrenamiento. Puede navegar por su entorno, moverse, evitar obstáculos y interactuar con objetos. Es como un “niño de diez años” que es generalmente capaz de actuar de manera independiente. El siguiente paso es enseñarle a realizar acciones específicas bajo condiciones específicas, por ejemplo, instalar paneles de vidrio y tiras de sellado en una línea de producción automotriz.

Al principio, la tarea parece más sencilla. Implica dominar un solo escenario, y el volumen de datos requerido es significativamente menor que durante el preentrenamiento. Mientras que el entrenamiento fundamental puede requerir cientos de miles de horas, el entrenamiento posterior puede tomar solo miles. Pero estos números son engañosos.

Cuando se traducen en tiempo real, el proceso revela su verdadera complejidad. Bajo un horario de trabajo estándar, una persona trabaja alrededor de 160 horas al mes. Sin embargo, esto no significa que todo ese tiempo se pueda utilizar para grabar.

En la práctica, ocurren interrupciones constantes: las baterías se agotan, las cámaras se desplazan, los sensores fallan. Cuanto más compleja sea la configuración del equipo, mayor es la probabilidad de problemas. Incluso un simple fallo como sensores en un guante que dejan de funcionar puede detener el proceso y resultar en tiempo perdido.

Como resultado, la velocidad real de recopilación de datos es 2-3 veces menor. Una hora de grabación de alta calidad puede requerir hasta tres horas de trabajo real. Esto cambia radicalmente el cálculo: 5.000 horas de datos se traducen en aproximadamente 15.000 horas de trabajo.

Capas y capas de complejidad

Durante el preentrenamiento, puede ser suficiente darle a una persona una cámara y pedirle que grabe actividades cotidianas. En esta etapa, sin embargo, se requiere acceso a un entorno específico, como una fábrica, un sitio de construcción o una instalación de producción especializada.

Esto introduce inmediatamente restricciones prácticas. Por ejemplo, en un sitio de construcción, los trabajadores deben usar cascos de seguridad, lo que significa que se debe desarrollar equipo especializado: cascos con cámaras integradas que sean resistentes al polvo, la humedad y el impacto.

Luego viene el acceso al sitio en sí. Se deben hacer acuerdos con los propietarios del sitio, obtener permisos y negociar condiciones. Esto casi siempre implica costos adicionales: las empresas esperan compensación, y los trabajadores esperan ser pagados por su participación.

El seguro y el cumplimiento de la seguridad también se convierten en preocupaciones críticas. Si el equipo no cumple con los estándares requeridos, el seguro puede ser invalidado, lo que obliga a reestructurar todo el proceso.

Incluso a nivel de operaciones diarias, persisten los desafíos. Las cámaras deben ser encendidas, monitoreadas y mantenidas. Los trabajadores operan con guantes y en condiciones duras. El equipo se ensucia, se desgasta y se rompe. Una cámara puede apagarse después de unos minutos, y la persona puede no darse cuenta.

Esto crea la necesidad de que los participantes se entrenen a sí mismos: deben entender cómo usar el equipo. Además, se requiere una supervisión continua: alguien debe asegurarse de que la grabación esté en curso y de que los dispositivos estén funcionando correctamente.

Desde el video crudo hasta los datos de entrenamiento

Después de la grabación, comienza la siguiente etapa: recopilación de datos, carga, estructuración, validación de la calidad y etiquetado.

Cualquier dato crudo consiste en señales de video y sensores. Para convertirlo en material de entrenamiento, debe ser estructurado: los objetos deben ser identificados, las acciones capturadas y los estados, movimientos e interacciones con el entorno descritos. Aquí es donde entra en juego la anotación. Una pregunta lógica surge: ¿cuál es el estándar de oro para dicho flujo de trabajo de anotación?

En algunos casos, cajas de delimitación simples son suficientes para identificar objetos en un marco. En otros, se requiere anotación temporal para describir secuencias de acciones en el tiempo. En ciertos escenarios, se utilizan puntos clave y modelos esqueléticos para capturar el movimiento del cuerpo. En casos más complejos, se necesitan mallas 3D o seguimiento de la pose de la mano para representar con precisión la mecánica de interacción. A menudo se integran sensores adicionales, como acelerómetros, para capturar la dinámica del movimiento y la fuerza aplicada.

Proyectos como estos también requieren a menudo la escalabilidad del equipo. La etiquetado es una tarea grande y compleja en sí misma, que requiere tiempo, experiencia y recursos humanos sustanciales. Aquí es donde entran en juego los proveedores de soluciones de datos con equipos de anotación internos. Como Keymakr, que ha demostrado ser particularmente efectivo gracias a su capacidad para escalar equipos para adaptarse a cualquier volumen de datos, desde un solo especialista hasta cientos de anotadores.

No hay un enfoque correcto para el entrenamiento todavía

La industria todavía se encuentra en una fase exploratoria, ya que no hay consenso sobre qué combinación de datos produce los mejores resultados. Muchos enfoques se validan empíricamente porque funcionan en experimentos específicos. Como resultado, diferentes equipos continúan confiando en diferentes tecnologías, moldeadas por su propia experiencia, tareas y restricciones.

En niveles académicos y aplicados, esto conduce a la fragmentación: laboratorios y empresas se mueven en diferentes direcciones. La situación es reminiscente de los primeros días de la conducción autónoma, cuando Tesla (TSLA ) apostó por un enfoque de visión solo sin LiDAR, mientras que la mayoría de los demás jugadores eligieron LiDAR como sensor principal.

Hoy en día, los sistemas basados en LiDAR tienden a demostrar un rendimiento más estable, aunque el enfoque de Tesla sigue evolucionando. La diferencia es que en la conducción autónoma, el mercado ha madurado en gran medida: han surgido arquitecturas estables, se entienden bien las limitaciones y se ha acumulado una gran experiencia.

En contraste, para la Inteligencia Artificial Física y el entrenamiento de modelos similares, este nivel de madurez aún no se ha alcanzado. El mercado todavía se está formando, faltan estándares y gran parte del progreso se impulsa mediante la experimentación. Nuevos métodos para entrenar modelos, mejorar la eficiencia y adaptarse a escenarios del mundo real siguen surgiendo, lo que sugiere que los avances más importantes en este campo aún están por venir.

El ser humano como un sistema de refuerzo

La anotación no existe en aislamiento, ni solo para el modelo. Sirve como una herramienta para el ingeniero que construye ese modelo. A través de ella, formaliza la realidad, identifica parámetros clave y define las reglas de comportamiento del sistema.

La tarea del ingeniero es enseñar al sistema a realizar acciones correctamente en condiciones del mundo real. Por ejemplo, un escenario básico puede consistir en cuatro acciones: recoger un vaso, encender el grifo, llenarlo y apagar el grifo. Pero en la realidad, se produce una desviación: el vaso se desborda.

En ese momento, se espera que el modelo complete el escenario y realice acciones adicionales: detener el flujo de agua, ajustar el nivel de agua y prevenir el derrame. Esto es lógica de comportamiento basada en la comprensión contextual.

El ingeniero sigue un ciclo: anotar datos, entrenar el modelo, probarlo. Si el sistema funciona, se confirma la hipótesis. Si no, comienza el análisis.

En algún momento, puede quedar claro que el modelo falta un parámetro importante, como el nivel de llenado del vaso. Anteriormente, los datos pueden haber incluido anotaciones para objetos (vaso, grifo, manija) y acciones (abrir, llenar, cerrar), pero faltaban anotaciones para el estado, como el grado de llenado.

Entonces se agrega una nueva capa al proceso: anotar el nivel de llenado, seguido de la formalización, por ejemplo, definiendo cualquier cosa por encima del 85% como un estado crítico.

Esto conduce a la siguiente iteración de entrenamiento. Puedes tener cientos de tales iteraciones.

Nadie asume que el sistema funcionará correctamente de inmediato. Por el contrario, el proceso se construye alrededor de aproximaciones sucesivas: primero, se crea una versión base; luego se prueba en condiciones reales o casi reales; se identifican las brechas; y se refina el sistema. Esto es algo que discuto a menudo con clientes en Introspector, con quienes recorremos todo el viaje de Inteligencia Artificial Física juntos.

En un cierto punto, se logra el resultado deseado. Pero su valor no radica solo en que el sistema comience a funcionar, sino en la experiencia acumulada que permite reproducir este resultado de manera más predecible.

La economía que todos olvidan

En el último año o así, he notado que el mayor error que cometen las empresas al trabajar con datos egocéntricos tiene poco que ver con la tecnología.

El problema principal es en realidad subestimar la economía del proyecto.

En la etapa de la idea, la tecnología ocupa el centro del escenario: qué modelos utilizar, cómo entrenarlos y qué enfoques aplicar. Se estudia, se investiga, se discuten arquitecturas y se prueban hipótesis. Esto es natural: la tecnología parece ser la parte más tangible y obvia del problema.

Pero mucho menos a menudo en esta etapa los equipos preguntan una pregunta directa y práctica: ¿cuánto costará?

Cuando un proyecto pasa de la teoría a la implementación, se hace evidente que detrás de cada modelo hay decenas de miles de horas de datos. Recopilar estos datos requiere tiempo, acceso a entornos reales y la participación de especialistas. La anotación agrega otra capa de complejidad y costo. Como resultado, los números finales a menudo son mucho más altos de lo que se esperaba inicialmente.

Esto no significa que tales proyectos no deban perseguirse. Por el contrario, son lo que impulsa a la industria hacia adelante.

Pero lo que importa es entender la escala del desafío desde el principio. Reconocer que en el entrenamiento de modelos, detrás de cada algoritmo asombroso hay un trabajo de datos complejo y exigente en recursos.

Incluso las ideas fuertes fallan al llegar a la implementación completa cuando los costos de los datos comienzan a ascender bien por encima de siete cifras.

Y quizás el cambio más importante que está sucediendo en la robótica hoy en día está relacionado con esta comprensión. El futuro de estos sistemas estará definido por lo “inteligentes” que sean y por cómo se construye de manera efectiva y precisa toda la canalización de datos, desde la recopilación hasta la interpretación final.

Michael Abramov es el fundador y CEO de Scryon, aportando más de 15 años de experiencia en ingeniería de software y sistemas de IA de visión por computadora para crear herramientas de etiquetado de nivel empresarial.

Michael comenzó su carrera como ingeniero de software y gerente de I+D, construyendo sistemas de datos escalables y gestionando equipos de ingeniería multifuncionales. Hasta 2025, se desempeñó como CEO de Keymakr, una empresa de servicios de etiquetado de datos, donde impulsó flujos de trabajo humano-en-el-bucle, sistemas avanzados de control de calidad y herramientas a medida para respaldar necesidades de datos de visión por computadora y autonomía a gran escala.

Posee una Licenciatura en Ciencias de la Computación y una formación en ingeniería y artes creativas, aportando una visión multidisciplinaria para resolver problemas complejos. Michael se encuentra en la intersección de la innovación tecnológica, el liderazgo estratégico de productos y el impacto real, impulsando la próxima frontera de los sistemas autónomos y la automatización inteligente.