Modelos y plataformas de IA
DeepMind Crea un Inteligencia Artificial que Reproduce Recuerdos como el Hipocampo
El cerebro humano a menudo recuerda recuerdos pasados (aparentemente) sin provocación. A medida que pasamos nuestro día, tenemos destellos espontáneos de memoria de nuestras vidas. Si bien la conjuración espontánea de recuerdos ha sido de interés para los neurocientíficos durante mucho tiempo, la empresa de investigación de inteligencia artificial DeepMind publicó recientemente un artículo que detalla cómo una de sus inteligencias artificiales replicó este extraño patrón de recuerdo.
La conjuración de recuerdos en el cerebro, la reproducción neural, está estrechamente vinculada con el hipocampo. El hipocampo es una formación con forma de caballito de mar en el cerebro que pertenece al sistema límbico, y se asocia con la formación de nuevos recuerdos, así como con las emociones que desencadenan los recuerdos. Las teorías actuales sobre el papel de los hipocampos (hay uno en cada hemisferio del cerebro) establecen que diferentes regiones del hipocampo son responsables del manejo de diferentes tipos de recuerdos. Por ejemplo, se cree que la memoria espacial se maneja en la región posterior del hipocampo.
Según informó Jesús Rodríguez, el Dr. John O’Keefe es responsable de muchas contribuciones a nuestra comprensión del hipocampo, incluyendo las células “de lugar” del hipocampo. Las células de lugar en el hipocampo se activan por estímulos en un entorno específico. Por ejemplo, experimentos en ratas mostraron que neuronas específicas se activaban cuando las ratas corrían por ciertas secciones de una pista. Los investigadores continuaron monitoreando a las ratas incluso cuando estaban descansando, y encontraron que las mismas pautas de neuronas que denotaban una sección de la pista se activaban, aunque a una velocidad acelerada. Las ratas parecían estar reproduciendo los recuerdos de la pista en sus mentes.
En humanos, recordar recuerdos es una parte importante del proceso de aprendizaje, pero cuando se intenta habilitar la inteligencia artificial para que aprenda, es difícil recrear el fenómeno.
El equipo de DeepMind se esforzó por recrear el fenómeno de recuerdo utilizando el aprendizaje por refuerzo. Los algoritmos de aprendizaje por refuerzo funcionan obteniendo retroalimentación de sus interacciones con el entorno que los rodea, recibiendo recompensas cada vez que toman acciones que los acercan al objetivo deseado. En este contexto, el agente de aprendizaje por refuerzo registra eventos y luego los reproduce en momentos posteriores, con el sistema siendo reforzado para mejorar la eficiencia con la que recuerda experiencias pasadas.
DeepMind agregó la reproducción de experiencias a un algoritmo de aprendizaje por refuerzo utilizando un búfer de reproducción que reproduciría recuerdos/experiencias grabadas al sistema en momentos específicos. Algunas versiones del sistema tenían las experiencias reproducidas en órdenes aleatorias, mientras que otros modelos tenían órdenes de reproducción preseleccionadas. Mientras los investigadores experimentaban con el orden de reproducción para los agentes de refuerzo, también experimentaban con diferentes métodos de reproducción de las experiencias en sí.
Hay dos métodos principales que se utilizan para proporcionar a los algoritmos de refuerzo experiencias recordadas. Estos métodos son el método de reproducción de imaginación y el método de reproducción de película. El artículo de DeepMind utiliza una analogía para describir ambas estrategias:
“Supongamos que llegas a casa y, para tu sorpresa y decepción, descubres agua acumulada en tus hermosas pisos de madera. Al entrar en la sala de comedor, encuentras un jarrón roto. Luego escuchas un gemido y miras hacia la puerta del patio para ver a tu perro con una mirada muy culpable”.
Según Rodríguez, el método de reproducción de imaginación no registra los eventos en el orden en que se experimentaron. En su lugar, se infiere una causa probable entre los eventos. Los eventos se infieren en función de la comprensión del agente del mundo. Mientras tanto, el método de reproducción de película almacena recuerdos en el orden en que ocurrieron los eventos y reproduce la secuencia de estímulos: “agua derramada, jarrón roto, perro”. El orden cronológico de los eventos se conserva.
La investigación en el campo de la neurociencia implica que el método de reproducción de película es integral para la creación de asociaciones entre conceptos y la conexión de neuronas entre eventos. Sin embargo, el método de reproducción de imaginación podría ayudar al agente a crear nuevas secuencias cuando razona por analogía. Por ejemplo, el agente podría razonar que si un barril es a aceite como un jarrón es a agua, un barril podría ser derramado por un robot de fábrica en lugar de un perro. De hecho, cuando DeepMind investigó más a fondo las posibilidades del método de reproducción de imaginación, encontraron que su agente de aprendizaje era capaz de crear secuencias impresionantes e innovadoras al tener en cuenta experiencias anteriores.
La mayor parte del progreso actual en el área de la memoria de aprendizaje por refuerzo se está haciendo con la estrategia de película, aunque los investigadores han comenzado recientemente a hacer progresos con la estrategia de imaginación. La investigación sobre ambos métodos de memoria de inteligencia artificial no solo puede permitir un mejor desempeño de los agentes de aprendizaje por refuerzo, sino que también puede ayudarnos a obtener nuevas ideas sobre cómo podría funcionar la mente humana.












