Robótica e IA física

Científicos de la computación utilizan el refuerzo positivo para enseñar a los robots

mm
Añade Unite.AI a tus fuentes preferidas en Google

Los científicos de la computación de la Universidad Johns Hopkins han desplegado la técnica de entrenamiento de refuerzo positivo, que se utiliza comúnmente para entrenar a animales como perros, en un robot para que pueda enseñarse nuevos trucos. Entre esas nuevas habilidades se encontraba la capacidad de apilar bloques.

El robot se llama Spot, y según los investigadores, puede aprender habilidades en días que tradicionalmente tardan alrededor de un mes.

Refuerzo Positivo

El refuerzo positivo se utilizó por el equipo para aumentar el conjunto de habilidades del robot. La velocidad a la que el equipo pudo hacer esto hace que sea más fácil para este tipo de robots ser desplegados en el mundo real.

El trabajo se publicó en IEEE Robotics and Automation Letters, titulado “¡Buen robot! Aprendizaje de refuerzo eficiente para tareas visuales de varios pasos con transferencia de simulación a realidad.

Andrew Hundt es un estudiante de doctorado que trabaja en la Universidad Johns Hopkins y es el autor principal de la investigación.

“La pregunta aquí era cómo hacer que el robot aprenda una habilidad”, dijo. “He tenido perros, así que sé que los premios funcionan y esa fue la inspiración para diseñar el algoritmo de aprendizaje.”

Una de las razones por las que el refuerzo positivo funciona en las computadoras es que no tienen cerebros intuitivos, lo que significa que son básicamente una tela en blanco en la que se puede proyectar cualquier cosa. En otras palabras, deben aprender todo desde cero. Uno de los métodos de aprendizaje más efectivos para las computadoras es el ensayo y error, algo que los robóticos aún están trabajando hoy en día.

Esto es exactamente lo que los investigadores hicieron cuando crearon un sistema de recompensas para el robot, similar al proceso de entrenar a un perro dándole golosinas. La diferencia es que el robot recibe puntos numéricos cuando completa una tarea correctamente.

https://www.youtube.com/watch?v=dvxqjJBWFD4

Habilidades Aprendidas

Cuando se trataba de aprender a apilar bloques, el robot tuvo que aprender a centrarse en acciones constructivas. En el método, Spot el robot recibió puntos más altos cuando completó comportamientos correctos durante la pila de bloques. Por el contrario, no ganó nada por comportamientos incorrectos. Ganó la mayor cantidad de puntos al completar una pila de cuatro bloques con el último bloque en la parte superior.

Los investigadores vieron un gran éxito en este método, con el robot aprendiendo en días lo que hubiera tomado semanas en el pasado. Al entrenar a un robot simulado, el equipo redujo el tiempo de práctica antes de pasar al robot Spot.

“El robot quiere la puntuación más alta”, dijo Hundt. “Aprende rápidamente el comportamiento correcto para obtener la mejor recompensa. De hecho, solía tomar un mes de práctica para que el robot alcanzara una precisión del 100%. Podimos hacerlo en dos días.”

Además de aprender a apilar bloques, el robot también utilizó el refuerzo positivo para aprender otras tareas, como jugar un juego de navegación simulado.

“Al principio, el robot no tiene idea de lo que está haciendo, pero mejora y mejora con cada práctica. Nunca se rinde y sigue intentando apilar y puede completar la tarea el 100% de las veces”, dijo Hundt.

Algunas de las posibles aplicaciones de este método incluyen entrenar a robots domésticos para completar ciertas tareas, así como mejorar a los vehículos autónomos.

“Nuestro objetivo es desarrollar eventualmente robots que puedan realizar tareas complejas en el mundo real, como la ensambladura de productos, el cuidado de los ancianos y la cirugía”, dijo Hager. “No sabemos actualmente cómo programar tareas como esas, el mundo es demasiado complejo. Pero trabajos como este nos muestran que hay promesa en la idea de que los robots pueden aprender a realizar tales tareas del mundo real de manera segura y eficiente.

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.