Modelos y plataformas de IA
DeepMind y Google Brain Buscan MÃĐtodos para Mejorar la Eficiencia del Aprendizaje por Refuerzo

Los sistemas de aprendizaje por refuerzo pueden ser potentes y robustos, capaces de realizar tareas extremadamente complejas a travÃĐs de miles de iteraciones de entrenamiento. Aunque los algoritmos de aprendizaje por refuerzo pueden permitir comportamientos sofisticados y ocasionalmente sorprendentes, llevan mucho tiempo en entrenarse y requieren grandes cantidades de datos. Estos factores hacen que las tÃĐcnicas de aprendizaje por refuerzo sean bastante ineficientes, y recientemente los equipos de investigaciÃģn de Alphabet (GOOG ) (GOOGL ) DeepMind y Google Brain han intentado encontrar mÃĐtodos mÃĄs eficientes para crear sistemas de aprendizaje por refuerzo.
SegÚn VentureBeat, el grupo de investigaciÃģn combinado propuso recientemente mÃĐtodos para hacer que el entrenamiento de aprendizaje por refuerzo sea mÃĄs eficiente. Una de las mejoras propuestas fue un algoritmo llamado Adaptive Behavior Policy Sharing (ABPS), mientras que la otra fue un marco llamado Universal Value Function Approximators (UVFA). ABPS permite que los grupos de agentes de inteligencia artificial compartan sus experiencias seleccionadas adaptativamente, mientras que UVFA permite que esos agentes investiguen simultÃĄneamente polÃticas de exploraciÃģn dirigidas.
ABPS estÃĄ diseÃąado para agilizar la personalizaciÃģn de hiperparÃĄmetros al entrenar un modelo. ABPS hace que encontrar los hiperparÃĄmetros Ãģptimos sea mÃĄs rÃĄpido al permitir que varios agentes con diferentes hiperparÃĄmetros compartan sus experiencias de polÃtica de comportamiento. Para ser mÃĄs precisos, ABPS permite que los agentes de aprendizaje por refuerzo seleccionen acciones de las acciones que una polÃtica ha considerado aceptables y luego se les otorga una recompensa y observaciÃģn basada en el estado siguiente.
Los agentes de refuerzo de inteligencia artificial se entrenan con varias combinaciones de hiperparÃĄmetros posibles, como la tasa de decaimiento y la tasa de aprendizaje. Al entrenar un modelo, el objetivo es que el modelo converja en la combinaciÃģn de hiperparÃĄmetros que le da el mejor rendimiento, y en este caso, aquellos que tambiÃĐn mejoran la eficiencia de los datos. La eficiencia se aumenta al entrenar a muchos agentes al mismo tiempo y eligiendo el comportamiento de solo un agente para ser desplegado durante el siguiente paso de tiempo. La polÃtica que tiene el agente objetivo se utiliza para muestrear acciones. Las transiciones se registran en un espacio compartido, y este espacio se evalÚa constantemente para que la selecciÃģn de la polÃtica no tenga que ocurrir tan a menudo. Al final del entrenamiento, se elige un conjunto de agentes y los agentes con mejor rendimiento se seleccionan para someterse a la implementaciÃģn final.
En cuanto a UVFA, intenta abordar uno de los problemas comunes del aprendizaje por refuerzo, que es que los agentes con refuerzo dÃĐbil a menudo no aprenden tareas. UVFA intenta resolver el problema haciendo que el agente aprenda un conjunto separado de polÃticas de explotaciÃģn y exploraciÃģn al mismo tiempo. Separar las tareas crea un marco que permite que las polÃticas de exploraciÃģn sigan explorando el entorno mientras que las polÃticas de explotaciÃģn siguen intentando maximizar la recompensa para la tarea actual. Las polÃticas de exploraciÃģn de UVFA sirven como una arquitectura de referencia que seguirÃĄ mejorando incluso si no hay recompensas naturales que se estÃĐn encontrando. En tal condiciÃģn, se aproxima una funciÃģn que corresponde a recompensas intrÃnsecas, lo que impulsa a los agentes a explorar todos los estados en un entorno, incluso si a menudo regresan a estados familiares.
Como explicÃģ VentureBeat, cuando se utiliza el marco UVFA, las recompensas intrÃnsecas del sistema se otorgan directamente al agente como entradas. El agente mantiene un registro de una representaciÃģn de todas las entradas (como recompensas, acciones y estados) durante un episodio determinado. El resultado es que la recompensa se conserva en el tiempo y la polÃtica del agente estÃĄ al menos algo informada por ella en todo momento.
Esto se logra mediante la utilizaciÃģn de un mÃģdulo de ânovedad episÃģdicaâ y un mÃģdulo de ânovedad de por vidaâ. La funciÃģn del primer mÃģdulo es mantener la memoria episÃģdica actual y asignar los hallazgos actuales a la representaciÃģn mencionada anteriormente, lo que permite que el agente determine una recompensa intrÃnseca episÃģdica para cada paso de entrenamiento. DespuÃĐs, el estado vinculado a la observaciÃģn actual se agrega a la memoria. Mientras tanto, el mÃģdulo de novedad de por vida es responsable de influir en la frecuencia con la que el agente explora a lo largo de muchos episodios.
SegÚn los equipos de Alphabet/Google, las nuevas tÃĐcnicas de entrenamiento ya han demostrado el potencial para una mejora sustancial al entrenar un sistema de aprendizaje por refuerzo. UVFA pudo duplicar el rendimiento de algunos de los agentes base que jugaron varios juegos de Atari. Mientras tanto, ABPS pudo aumentar el rendimiento en algunos de los mismos juegos de Atari, disminuyendo la variabilidad entre los agentes con mejor rendimiento en aproximadamente un 25%. El algoritmo entrenado con UVFA pudo lograr una alta puntuaciÃģn en Pitfall por sà solo, sin caracterÃsticas de demostraciones humanas diseÃąadas.












