Modelos y plataformas de IA

DeepMind descubre una técnica de entrenamiento de IA que también puede funcionar en nuestro cerebro

mm
Añade Unite.AI a tus fuentes preferidas en Google

DeepMind acaba de publicar un artículo en el que detalla cómo un nuevo tipo de aprendizaje de refuerzo podría explicar cómo funcionan las vías de recompensa en el cerebro humano. Según un informe de NewScientist, el método de entrenamiento de aprendizaje automático se llama aprendizaje de refuerzo distribuido y los mecanismos detrás de él parecen explicar de manera plausible cómo se libera la dopamina por las neuronas en el cerebro.

La neurociencia y la informática tienen una larga historia juntas. Ya en 1951, Marvin Minsky utilizó un sistema de recompensas y castigos para crear un programa de computadora capaz de resolver un laberinto. Minsky se inspiró en el trabajo de Iván Pávlov, un fisiólogo que demostró que los perros podían aprender a través de una serie de recompensas y castigos. El nuevo artículo de DeepMind añade a la historia entrelazada de la neurociencia y la informática al aplicar un tipo de aprendizaje de refuerzo para obtener información sobre cómo podrían funcionar las neuronas de dopamina.

Cuando una persona o animal está a punto de realizar una acción, los conjuntos de neuronas en su cerebro responsables de la liberación de dopamina hacen una predicción sobre cuán gratificante será la acción. Una vez que se ha realizado la acción y se han hecho evidentes las consecuencias (recompensas) de esa acción, el cerebro libera dopamina. Sin embargo, esta liberación de dopamina se escala de acuerdo con el tamaño del error de predicción. Si la recompensa es mayor o mejor de lo esperado, se desencadena un aumento más fuerte de dopamina. Por el contrario, una recompensa peor conduce a una liberación de menos dopamina. La dopamina sirve como una función correctiva que hace que las neuronas ajusten sus predicciones hasta que converjan en las recompensas reales que se obtienen. Esto es muy similar a cómo funcionan los algoritmos de aprendizaje de refuerzo.

En 2017, los investigadores de DeepMind lanzaron una versión mejorada de un algoritmo de aprendizaje de refuerzo comúnmente utilizado, y este método de aprendizaje superior pudo mejorar el rendimiento en muchas tareas de aprendizaje de refuerzo. El equipo de DeepMind pensó que los mecanismos detrás del nuevo algoritmo podrían utilizarse para explicar mejor cómo funcionan las neuronas de dopamina en el cerebro humano.

En contraste con los algoritmos de aprendizaje de refuerzo más antiguos, el algoritmo más nuevo de DeepMind representa las recompensas como una distribución. Los enfoques de aprendizaje de refuerzo más antiguos representaban las recompensas estimadas como un solo número que representaba el resultado promedio esperado. Este cambio permitió que el modelo representara de manera más precisa las recompensas posibles y funcionara mejor como resultado. El rendimiento superior del nuevo método de entrenamiento llevó a los investigadores de DeepMind a investigar si las neuronas de dopamina en el cerebro humano operan de manera similar.

Para investigar el funcionamiento de las neuronas de dopamina, DeepMind trabajó junto con Harvard para investigar la actividad de las neuronas de dopamina en ratones. Los investigadores hicieron que los ratones realizaran varias tareas y les dieron recompensas basadas en el lanzamiento de dados, grabando cómo se disparaban sus neuronas de dopamina. Diferentes neuronas parecían predecir diferentes resultados potenciales, liberando diferentes cantidades de dopamina. Algunas neuronas predecían resultados más bajos que la recompensa real, mientras que algunas predecían recompensas más altas que la recompensa real. Después de graficar la distribución de las predicciones de recompensa, los investigadores encontraron que la distribución de las predicciones era bastante cercana a la distribución de recompensa real. Esto sugiere que el cerebro sí utiliza un sistema distributivo al hacer predicciones y ajustar predicciones para que se ajusten mejor a la realidad.

El estudio podría informar tanto a la neurociencia como a la informática. El estudio apoya el uso del aprendizaje de refuerzo distribuido como un método para crear modelos de IA más avanzados. Más allá de eso, podría tener implicaciones para nuestras teorías sobre cómo opera el cerebro en cuanto a los sistemas de recompensa. Si las neuronas de dopamina están distribuidas y algunas son más pesimistas u optimistas que otras, entender estas distribuciones podría alterar cómo abordamos aspectos de la psicología como la salud mental y la motivación.

Según un informe de MIT Technology Review, Matt Botvinik, el director de investigación de neurociencia en DeepMind, explicó la importancia de los hallazgos en una rueda de prensa. Botvinik dijo:

“Si el cerebro lo está utilizando, probablemente sea una buena idea. Nos dice que esta es una técnica computacional que puede escalarse en situaciones del mundo real. Va a encajar bien con otros procesos computacionales. Nos da una nueva perspectiva sobre lo que sucede en nuestros cerebros durante la vida cotidiana”

Bloguero y programador con especialidades en Machine Learning y Deep Learning temas. Daniel espera ayudar a otros a utilizar el poder de la IA para el bien social.