Modelos y plataformas de IA

DeepMind y Google Brain Buscan MÃĐtodos para Mejorar la Eficiencia del Aprendizaje por Refuerzo

mm
AÃąade Unite.AI a tus fuentes preferidas en Google

Los sistemas de aprendizaje por refuerzo pueden ser potentes y robustos, capaces de realizar tareas extremadamente complejas a travÃĐs de miles de iteraciones de entrenamiento. Aunque los algoritmos de aprendizaje por refuerzo pueden permitir comportamientos sofisticados y ocasionalmente sorprendentes, llevan mucho tiempo en entrenarse y requieren grandes cantidades de datos. Estos factores hacen que las tÃĐcnicas de aprendizaje por refuerzo sean bastante ineficientes, y recientemente los equipos de investigaciÃģn de Alphabet (GOOG ) (GOOGL ) DeepMind y Google Brain han intentado encontrar mÃĐtodos mÃĄs eficientes para crear sistemas de aprendizaje por refuerzo.

SegÚn VentureBeat, el grupo de investigaciÃģn combinado propuso recientemente mÃĐtodos para hacer que el entrenamiento de aprendizaje por refuerzo sea mÃĄs eficiente. Una de las mejoras propuestas fue un algoritmo llamado Adaptive Behavior Policy Sharing (ABPS), mientras que la otra fue un marco llamado Universal Value Function Approximators (UVFA). ABPS permite que los grupos de agentes de inteligencia artificial compartan sus experiencias seleccionadas adaptativamente, mientras que UVFA permite que esos agentes investiguen simultÃĄneamente políticas de exploraciÃģn dirigidas.

ABPS estÃĄ diseÃąado para agilizar la personalizaciÃģn de hiperparÃĄmetros al entrenar un modelo. ABPS hace que encontrar los hiperparÃĄmetros Ãģptimos sea mÃĄs rÃĄpido al permitir que varios agentes con diferentes hiperparÃĄmetros compartan sus experiencias de política de comportamiento. Para ser mÃĄs precisos, ABPS permite que los agentes de aprendizaje por refuerzo seleccionen acciones de las acciones que una política ha considerado aceptables y luego se les otorga una recompensa y observaciÃģn basada en el estado siguiente.

Los agentes de refuerzo de inteligencia artificial se entrenan con varias combinaciones de hiperparÃĄmetros posibles, como la tasa de decaimiento y la tasa de aprendizaje. Al entrenar un modelo, el objetivo es que el modelo converja en la combinaciÃģn de hiperparÃĄmetros que le da el mejor rendimiento, y en este caso, aquellos que tambiÃĐn mejoran la eficiencia de los datos. La eficiencia se aumenta al entrenar a muchos agentes al mismo tiempo y eligiendo el comportamiento de solo un agente para ser desplegado durante el siguiente paso de tiempo. La política que tiene el agente objetivo se utiliza para muestrear acciones. Las transiciones se registran en un espacio compartido, y este espacio se evalÚa constantemente para que la selecciÃģn de la política no tenga que ocurrir tan a menudo. Al final del entrenamiento, se elige un conjunto de agentes y los agentes con mejor rendimiento se seleccionan para someterse a la implementaciÃģn final.

En cuanto a UVFA, intenta abordar uno de los problemas comunes del aprendizaje por refuerzo, que es que los agentes con refuerzo dÃĐbil a menudo no aprenden tareas. UVFA intenta resolver el problema haciendo que el agente aprenda un conjunto separado de políticas de explotaciÃģn y exploraciÃģn al mismo tiempo. Separar las tareas crea un marco que permite que las políticas de exploraciÃģn sigan explorando el entorno mientras que las políticas de explotaciÃģn siguen intentando maximizar la recompensa para la tarea actual. Las políticas de exploraciÃģn de UVFA sirven como una arquitectura de referencia que seguirÃĄ mejorando incluso si no hay recompensas naturales que se estÃĐn encontrando. En tal condiciÃģn, se aproxima una funciÃģn que corresponde a recompensas intrínsecas, lo que impulsa a los agentes a explorar todos los estados en un entorno, incluso si a menudo regresan a estados familiares.

Como explicÃģ VentureBeat, cuando se utiliza el marco UVFA, las recompensas intrínsecas del sistema se otorgan directamente al agente como entradas. El agente mantiene un registro de una representaciÃģn de todas las entradas (como recompensas, acciones y estados) durante un episodio determinado. El resultado es que la recompensa se conserva en el tiempo y la política del agente estÃĄ al menos algo informada por ella en todo momento.

Esto se logra mediante la utilizaciÃģn de un mÃģdulo de “novedad episÃģdica” y un mÃģdulo de “novedad de por vida”. La funciÃģn del primer mÃģdulo es mantener la memoria episÃģdica actual y asignar los hallazgos actuales a la representaciÃģn mencionada anteriormente, lo que permite que el agente determine una recompensa intrínseca episÃģdica para cada paso de entrenamiento. DespuÃĐs, el estado vinculado a la observaciÃģn actual se agrega a la memoria. Mientras tanto, el mÃģdulo de novedad de por vida es responsable de influir en la frecuencia con la que el agente explora a lo largo de muchos episodios.

SegÚn los equipos de Alphabet/Google, las nuevas tÃĐcnicas de entrenamiento ya han demostrado el potencial para una mejora sustancial al entrenar un sistema de aprendizaje por refuerzo. UVFA pudo duplicar el rendimiento de algunos de los agentes base que jugaron varios juegos de Atari. Mientras tanto, ABPS pudo aumentar el rendimiento en algunos de los mismos juegos de Atari, disminuyendo la variabilidad entre los agentes con mejor rendimiento en aproximadamente un 25%. El algoritmo entrenado con UVFA pudo lograr una alta puntuaciÃģn en Pitfall por sí solo, sin características de demostraciones humanas diseÃąadas.

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.