Robótica e IA física
Científicos de la computación utilizan el refuerzo positivo para enseñar a los robots
Los científicos de la computación de la Universidad Johns Hopkins han desplegado la técnica de entrenamiento de refuerzo positivo, que se utiliza comúnmente para entrenar a animales como perros, en un robot para que pueda enseñarse nuevos trucos. Entre esas nuevas habilidades se encontraba la capacidad de apilar bloques.
El robot se llama Spot, y según los investigadores, puede aprender habilidades en días que tradicionalmente tardan alrededor de un mes.
Refuerzo Positivo
El refuerzo positivo se utilizó por el equipo para aumentar el conjunto de habilidades del robot. La velocidad a la que el equipo pudo hacer esto hace que sea más fácil para este tipo de robots ser desplegados en el mundo real.
El trabajo se publicó en IEEE Robotics and Automation Letters, titulado “¡Buen robot! Aprendizaje de refuerzo eficiente para tareas visuales de varios pasos con transferencia de simulación a realidad.”
Andrew Hundt es un estudiante de doctorado que trabaja en la Universidad Johns Hopkins y es el autor principal de la investigación.
“La pregunta aquí era cómo hacer que el robot aprenda una habilidad”, dijo. “He tenido perros, así que sé que los premios funcionan y esa fue la inspiración para diseñar el algoritmo de aprendizaje.”
Una de las razones por las que el refuerzo positivo funciona en las computadoras es que no tienen cerebros intuitivos, lo que significa que son básicamente una tela en blanco en la que se puede proyectar cualquier cosa. En otras palabras, deben aprender todo desde cero. Uno de los métodos de aprendizaje más efectivos para las computadoras es el ensayo y error, algo que los robóticos aún están trabajando hoy en día.
Esto es exactamente lo que los investigadores hicieron cuando crearon un sistema de recompensas para el robot, similar al proceso de entrenar a un perro dándole golosinas. La diferencia es que el robot recibe puntos numéricos cuando completa una tarea correctamente.
https://www.youtube.com/watch?v=dvxqjJBWFD4
Habilidades Aprendidas
Cuando se trataba de aprender a apilar bloques, el robot tuvo que aprender a centrarse en acciones constructivas. En el método, Spot el robot recibió puntos más altos cuando completó comportamientos correctos durante la pila de bloques. Por el contrario, no ganó nada por comportamientos incorrectos. Ganó la mayor cantidad de puntos al completar una pila de cuatro bloques con el último bloque en la parte superior.
Los investigadores vieron un gran éxito en este método, con el robot aprendiendo en días lo que hubiera tomado semanas en el pasado. Al entrenar a un robot simulado, el equipo redujo el tiempo de práctica antes de pasar al robot Spot.
“El robot quiere la puntuación más alta”, dijo Hundt. “Aprende rápidamente el comportamiento correcto para obtener la mejor recompensa. De hecho, solía tomar un mes de práctica para que el robot alcanzara una precisión del 100%. Podimos hacerlo en dos días.”
Además de aprender a apilar bloques, el robot también utilizó el refuerzo positivo para aprender otras tareas, como jugar un juego de navegación simulado.
“Al principio, el robot no tiene idea de lo que está haciendo, pero mejora y mejora con cada práctica. Nunca se rinde y sigue intentando apilar y puede completar la tarea el 100% de las veces”, dijo Hundt.
Algunas de las posibles aplicaciones de este método incluyen entrenar a robots domésticos para completar ciertas tareas, así como mejorar a los vehículos autónomos.
“Nuestro objetivo es desarrollar eventualmente robots que puedan realizar tareas complejas en el mundo real, como la ensambladura de productos, el cuidado de los ancianos y la cirugía”, dijo Hager. “No sabemos actualmente cómo programar tareas como esas, el mundo es demasiado complejo. Pero trabajos como este nos muestran que hay promesa en la idea de que los robots pueden aprender a realizar tales tareas del mundo real de manera segura y eficiente.












