Robótica e IA física

Robots capaces de aprender tareas complicadas con pocas demostraciones

mm
Añade Unite.AI a tus fuentes preferidas en Google

En uno de los últimos avances en el campo de la robótica, investigadores de la Universidad del Sur de California (USC) han desarrollado un sistema en el que los robots pueden aprender tareas complicadas con solo unas pocas demostraciones. Incluso más impresionante es que algunas de estas demostraciones pueden ser imperfectas.

La investigación se presentó en la Conferencia de Aprendizaje de Robots (CoRL) el 18 de noviembre, con el título “Aprendizaje de demostraciones utilizando Lógica Temporal de Señales”.

El Sistema

La calidad de cada demostración se mide para que el sistema pueda aprender de sus éxitos y fracasos. A diferencia de los métodos actuales, que requieren al menos 100 demostraciones para enseñar una tarea específica, el nuevo sistema requiere solo unas pocas. De manera intuitiva, la forma en que estos robots aprenden es similar a la forma en que los humanos aprenden unos de otros. Por ejemplo, los humanos observan y aprenden de otros que completan tareas con éxito o de manera imperfecta.

Aniruddh Puranic es el autor principal de la investigación y estudiante de doctorado en ciencias de la computación en la Escuela de Ingeniería Viterbi de la USC.

“Muchos sistemas de aprendizaje automático y de aprendizaje por refuerzo requieren grandes cantidades de datos y cientos de demostraciones – necesitas que un humano demuestre una y otra vez, lo que no es factible”, dijo Puranic.

“Además, la mayoría de las personas no tienen conocimientos de programación para indicar explícitamente qué debe hacer el robot, y un humano no puede demostrar todo lo que un robot necesita saber”, continuó. “¿Qué pasa si el robot se encuentra con algo que no ha visto antes? Esto es un desafío clave”.

Los investigadores utilizaron “lógica temporal de señales” o STL para determinar la calidad de las demostraciones, clasificándolas y creando recompensas inherentes.

Hay dos razones principales por las que los investigadores decidieron utilizar STL:

  1. Al aprender a través de demostraciones, los robots pueden recoger imperfecciones o incluso comportamientos peligrosos y acciones no deseadas.
  2. Las demostraciones pueden diferir en calidad dependiendo del usuario que las proporciona, y algunas demostraciones son mejores indicadores de comportamiento deseado que otras.

Al desarrollar el sistema de esta manera, el robot puede aprender de las demostraciones imperfectas, incluso si no cumplen con los requisitos lógicos. En otras palabras, llega a su propia conclusión sobre la precisión o el éxito.

Stefanos Nikolaidis es coautor y profesor asistente de ciencias de la computación en la USC Viterbi.

“Digamos que los robots aprenden de diferentes tipos de demostraciones – podría ser una demostración práctica, videos o simulaciones – si hago algo que es muy peligroso, los enfoques estándar harán una de dos cosas: o bien, las descartarán por completo, o peor aún, el robot aprenderá lo incorrecto”, dice Nikolaidis.

“En contraste, de una manera muy inteligente, este trabajo utiliza algún razonamiento común en forma de lógica para entender qué partes de la demostración son buenas y cuáles no”, continúa. “En esencia, esto es exactamente lo que también hacen los humanos”.

Lógica Temporal de Señales

Los robots pueden razonar sobre resultados actuales y futuros a través de STL, que es un lenguaje simbólico matemático expresivo. Anteriormente, la investigación se basaba en “lógica temporal lineal”.

Jyo Deshmukh es un ex ingeniero de Toyota y profesor asistente de ciencias de la computación en la USC.

“Cuando entramos en el mundo de los sistemas ciberfísicos, como robots y coches autónomos, donde el tiempo es crucial, la lógica temporal lineal se vuelve un poco engorrosa, porque razona sobre secuencias de valores verdadero/falso para variables, mientras que STL permite razonar sobre señales físicas”, dice Deshmukh.

El equipo de investigadores se sorprendió por el nivel de éxito del sistema.

“En comparación con un algoritmo de última generación, que se utiliza ampliamente en aplicaciones de robótica, se puede ver una diferencia de un orden de magnitud en la cantidad de demostraciones necesarias”, dice Nikolaidis.

Según los investigadores, los sistemas podrían aprender de simuladores de conducción y eventualmente de videos. El siguiente paso es probarlo en robots reales, ya que las pruebas iniciales se realizaron en un simulador de juegos. El sistema será útil para aplicaciones como las que se encuentran en entornos domésticos, almacenes y rovers de exploración espacial.

“Si queremos que los robots sean buenos compañeros de equipo y ayuden a las personas, primero deben aprender y adaptarse a las preferencias humanas de manera muy eficiente”, dice Nikolaidis. “Nuestro método proporciona eso”.

Alex dirige las operaciones de noticias impulsadas por IA de Unite.AI, combinando periodismo, investigación y automatización para respaldar una cobertura oportuna y escalable de la inteligencia artificial. Su trabajo ayuda a garantizar que los desarrollos emergentes de IA se presenten de manera eficiente, al tiempo que se mantienen los estándares editoriales de la publicación.