Modèles et plateformes d’IA

DeepMind crée un IA qui rejoue les mémoires comme l’hippocampe

mm
Ajouter Unite.AI à vos sources préférées sur Google

Le cerveau humain rappelle souvent des mémoires passées (apparemment) sans y être invité. Au fur et à mesure que nous allons dans notre journée, nous avons des éclairs de mémoire de notre vie. Bien que cette conjuration spontanée de mémoires ait longtemps intéressé les neuroscientifiques, la société de recherche en IA DeepMind a récemment publié un article détaillant comment un de leurs IA a reproduit ce modèle étrange de rappel.

La conjuration de mémoires dans le cerveau, la répétition neuronale, est étroitement liée à l’hippocampe. L’hippocampe est une formation en forme de cheval marin dans le cerveau qui appartient au système limbique, et il est associé à la formation de nouvelles mémoires, ainsi qu’aux émotions que les mémoires suscitent. Les théories actuelles sur le rôle de l’hippocampe (il y en a un dans chaque hémisphère du cerveau), indiquent que différentes régions de l’hippocampe sont responsables de la gestion de différents types de mémoires. Par exemple, la mémoire spatiale est censée être gérée dans la région postérieure de l’hippocampe.

Comme le rapporte Jesus Rodriguez, le Dr John O’Keefe est responsable de nombreuses contributions à notre compréhension de l’hippocampe, notamment les cellules “de lieu” de l’hippocampe. Les cellules de lieu dans l’hippocampe sont déclenchées par des stimuli dans un environnement spécifique. Par exemple, des expériences sur des rats ont montré que des neurones spécifiques s’activaient lorsqu’ils couraient dans certaines parties d’une piste. Les chercheurs ont continué à surveiller les rats même lorsqu’ils étaient au repos, et ils ont constaté que les mêmes modèles de neurones indiquant une partie du labyrinthe s’activaient, bien qu’ils s’activent à une vitesse accélérée. Les rats semblaient rejouer les mémoires du labyrinthe dans leur esprit.

Chez les humains, rappeler des mémoires est une partie importante du processus d’apprentissage, mais lorsqu’on essaie de permettre à un IA d’apprendre, il est difficile de recréer le phénomène.

L’équipe de DeepMind a tenté de recréer le phénomène de rappel en utilisant l’apprentissage par renforcement. Les algorithmes d’apprentissage par renforcement fonctionnent en obtenant des rétroactions de leurs interactions avec l’environnement qui les entoure, en étant récompensés chaque fois qu’ils prennent des actions qui les rapprochent de l’objectif souhaité. Dans ce contexte, l’agent d’apprentissage par renforcement enregistre des événements, puis les rejoue à des moments ultérieurs, le système étant renforcé pour améliorer son efficacité à rappeler les expériences passées.

DeepMind a ajouté la répétition d’expériences à un algorithme d’apprentissage par renforcement en utilisant un tampon de répétition qui rejouerait les mémoires/expériences enregistrées au système à des moments spécifiques. Certaines versions du système faisaient rejouer les expériences dans des ordres aléatoires, tandis que d’autres modèles avaient des ordres de lecture prédéfinis. Alors que les chercheurs expérimentaient avec l’ordre de lecture pour les agents de renforcement, ils expérimentaient également avec différentes méthodes de répétition des expériences elles-mêmes.

Il existe deux méthodes principales utilisées pour fournir des expériences rappelées aux algorithmes de renforcement. Ces méthodes sont la méthode de répétition par imagination et la méthode de répétition par film. L’article de DeepMind utilise une analogie pour décrire les deux stratégies :

“Supposons que vous rentriez chez vous et, à votre surprise et à votre désarroi, vous découvriez de l’eau qui s’accumule sur vos beaux planchers en bois. En entrant dans la salle à manger, vous trouvez un vase brisé. Puis vous entendez un gémissement et vous jetez un coup d’œil par la porte du patio pour voir votre chien qui a l’air très coupable.”

Comme le rapporte Rodriguez, la méthode de répétition par imagination ne reproduit pas les événements dans l’ordre où ils ont été vécus. Au lieu de cela, une cause probable entre les événements est déduite. Les événements sont déduits sur la base de la compréhension de l’agent du monde. En revanche, la méthode de répétition par film stocke les mémoires dans l’ordre dans lequel les événements se sont produits, et rejoue la séquence de stimuli – “eau renversée, vase brisé, chien”. L’ordre chronologique des événements est préservé.

Les recherches dans le domaine des neurosciences impliquent que la méthode de répétition par film est essentielle à la création d’associations entre des concepts et à la connexion de neurones entre les événements. Cependant, la méthode de répétition par imagination pourrait aider l’agent à créer de nouvelles séquences lorsqu’il raisonne par analogie. Par exemple, l’agent pourrait raisonner que si un tonneau est à l’huile ce qu’un vase est à l’eau, un tonneau pourrait être renversé par un robot d’usine au lieu d’un chien. En effet, lorsque DeepMind a approfondi les possibilités de la méthode de répétition par imagination, ils ont constaté que leur agent d’apprentissage était capable de créer des séquences impressionnantes et innovantes en tenant compte des expériences précédentes.

La plupart des progrès actuels réalisés dans le domaine de la mémoire d’apprentissage par renforcement sont faits avec la stratégie de film, bien que les chercheurs aient récemment commencé à faire des progrès avec la stratégie d’imagination. La recherche sur les deux méthodes de mémoire IA ne peut pas seulement permettre de meilleures performances aux agents d’apprentissage par renforcement, mais elle peut également nous aider à acquérir de nouvelles connaissances sur la façon dont l’esprit humain pourrait fonctionner.

Blogueur et programmeur avec des spécialités en Machine Learning et Deep Learning sujets. Daniel espère aider les autres à utiliser le pouvoir de l'IA pour le bien social.