Modelos y plataformas de IA
Las dificultades de la IA para dominar Minecraft a través del aprendizaje por imitación

Durante los últimos meses, Microsoft (MSFT ) y otras empresas que investigan el aprendizaje automático han desafiado a equipos de desarrolladores de IA a crear un sistema de IA que pueda jugar Minecraft y encontrar un diamante dentro del juego. Según informa la BBC, aunque las plataformas de IA han logrado dominar el ajedrez y el Go, han tenido dificultades para dominar una tarea en Minecraft.
El desafío de Minecraft de Microsoft se llamaba MineRL, y los resultados de la competencia se anunciaron formalmente en la reciente conferencia NeurIPS. La intención de la competencia era entrenar a una IA a través de un enfoque de “aprendizaje por imitación”. El aprendizaje por imitación es un método en el que una IA se entrena mediante la observación. El aprendizaje por imitación pretende permitir que los sistemas de IA aprendan acciones observando a los humanos realizar esas acciones, aprendiendo a través de la observación. El aprendizaje por imitación, en comparación con el aprendizaje por refuerzo, es una forma mucho menos costosa en términos computacionales y sustancialmente más eficiente de entrenar a una IA.
El aprendizaje por refuerzo a menudo requiere muchos ordenadores potentes conectados en red y cientos o miles de horas de entrenamiento para ser efectivo en una tarea. En contraste, una IA entrenada con un método de aprendizaje por imitación puede entrenarse mucho más rápido, ya que la IA ya tiene una base de conocimientos para trabajar gracias a los operadores humanos que la han precedido.
El aprendizaje por imitación tiene aplicaciones prácticas en el entrenamiento de una IA donde la IA no puede explorar de manera segura hasta que figure out las acciones correctas. Tales escenarios incluirían el entrenamiento de un vehículo autónomo, ya que el coche no podría simplemente deambular por una calle hasta que haya aprendido los comportamientos deseables. Utilizar los datos de un demostrador humano para entrenar al vehículo podría potencialmente hacer que el proceso sea más rápido y seguro.
El acto de encontrar un diamante en Minecraft requiere realizar muchos pasos en secuencia, como cortar árboles para hacer herramientas, explorar las cuevas que contienen los diamantes y encontrar realmente un diamante dentro de la cueva. A pesar de la complejidad de la tarea, un jugador humano familiarizado con el juego debería ser capaz de obtener un diamante en unos 20 minutos.
Se presentaron más de 660 agentes de IA diferentes a la competencia, pero ni uno solo de los agentes de IA pudo encontrar un diamante. Los datos proporcionados para entrenar a la IA fueron un conjunto de datos que contenía más de 60 millones de fotogramas de juego recopilados de muchos jugadores humanos. Las ubicaciones de los diamantes se randomizan cuando se inicia una instancia del juego, lo que significa que las IA no pueden simplemente buscar donde los jugadores humanos encontraron los diamantes. En otras palabras, las IA necesitan formar una comprensión de cómo los conceptos, como hacer herramientas, usar herramientas, explorar y encontrar recursos, están vinculados entre sí.
A pesar de que ninguno de los agentes de IA pudo encontrar con éxito un diamante, el equipo de organización aún se sintió complacido con los resultados de la competencia, y se aprendió mucho del experimento. La investigación que los equipos de IA llevaron a cabo puede ayudar a avanzar en el campo de la IA, encontrando alternativas a las estrategias de aprendizaje por refuerzo.
El aprendizaje por refuerzo a menudo ofrece un rendimiento superior al aprendizaje por imitación, con un éxito notable del aprendizaje por refuerzo siendo AlphaGo de DeepMind. Sin embargo, como se mencionó anteriormente, el aprendizaje por refuerzo requiere recursos informáticos masivos, lo que limita su uso por parte de organizaciones que no pueden permitirse procesadores a gran escala.
William Guss, estudiante de doctorado en la Universidad Carnegie Mellon y organizador principal de la competencia, explicó a la BBC que el desafío MineRL estaba destinado a investigar alternativas a la IA computacionalmente intensiva. Dijo Guss:
“…Lanzar una gran cantidad de cálculos a los problemas no es necesariamente la forma correcta para que nosotros, como campo, empujemos el estado del arte… Funciona directamente en contra de la democratización del acceso a estos sistemas de aprendizaje por refuerzo, y deja la capacidad de entrenar a agentes en entornos complejos a las corporaciones con grandes cantidades de cálculo.”












