Modelos e plataformas de IA

A DeepMind Cria um AI que Repete Memórias como o Hipocampo

mm
Adicione Unite.AI às suas fontes preferidas no Google

O cérebro humano muitas vezes recupera memórias passadas (aparentemente) sem motivo. À medida que passamos o dia, temos lampejos espontâneos de memória da nossa vida. Embora a conjuração espontânea de memórias tenha sido de longo interesse para os neurocientistas, a empresa de pesquisa de IA DeepMind publicou recentemente um artigo detalhando como um de seus AIs replicou esse padrão estranho de recuperação.

A conjuração de memórias no cérebro, replay neural, está intimamente ligada ao hipocampo. O hipocampo é uma formação em forma de cavalo-marinho no cérebro que pertence ao sistema límbico e está associado à formação de novas memórias, bem como às emoções que as memórias despertam. As teorias atuais sobre o papel dos hipocampos (há um em cada hemisfério do cérebro) afirmam que diferentes regiões do hipocampo são responsáveis pelo tratamento de diferentes tipos de memórias. Por exemplo, acredita-se que a memória espacial seja tratada na região posterior do hipocampo.

Conforme relatado por Jesus Rodriguez, Dr. John O’Keefe é responsável por muitas contribuições para nossa compreensão do hipocampo, incluindo as células “de lugar” do hipocampo. As células de lugar no hipocampo são acionadas por estímulos em um ambiente específico. Por exemplo, experimentos em ratos mostraram que neurônios específicos seriam ativados quando os ratos corriam por certas partes de uma pista. Os pesquisadores continuaram a monitorar os ratos, mesmo quando estavam descansando, e descobriram que os mesmos padrões de neurônios que denotavam uma parte do labirinto seriam ativados, embora a uma velocidade acelerada. Os ratos pareciam estar reproduzindo as memórias do labirinto em suas mentes.

Em humanos, lembrar memórias é uma parte importante do processo de aprendizado, mas quando se tenta permitir que a IA aprenda, é difícil recriar o fenômeno.

A equipe da DeepMind se esforçou para recriar o fenômeno de recuperação usando aprendizado por reforço. Algoritmos de aprendizado por reforço funcionam obtendo feedback de suas interações com o ambiente ao seu redor, recebendo recompensas sempre que tomam ações que os aproximam do objetivo desejado. Nesse contexto, o agente de aprendizado por reforço registra eventos e, em seguida, os reproduz em momentos posteriores, com o sistema sendo reforçado para melhorar a eficiência com que ele acaba lembrando experiências passadas.

A DeepMind adicionou a reprodução de experiências a um algoritmo de aprendizado por reforço usando um buffer de reprodução que reproduziria memórias/experiências registradas para o sistema em momentos específicos. Algumas versões do sistema tinham as experiências reproduzidas em ordens aleatórias, enquanto outros modelos tinham ordens de reprodução pré-selecionadas. Enquanto os pesquisadores experimentavam com a ordem de reprodução para os agentes de reforço, eles também experimentaram com diferentes métodos de reproduzir as experiências em si.

Há dois métodos principais usados para fornecer algoritmos de reforço com experiências lembradas. Esses métodos são o método de reprodução de imaginação e o método de reprodução de filme. O artigo da DeepMind usa uma analogia para descrever ambas as estratégias:

“Suponha que você chega em casa e, para sua surpresa e desgosto, descobre água se acumulando em seus lindos pisos de madeira. Ao entrar na sala de jantar, você encontra um vaso quebrado. Em seguida, você ouve um gemido e olha para a porta do pátio e vê seu cão com uma aparência muito culpada.”

Conforme relatado por Rodriguez, o método de reprodução de imaginação não registra os eventos na ordem em que foram experimentados. Em vez disso, uma causa provável entre os eventos é inferida. Os eventos são inferidos com base na compreensão do agente do mundo. Enquanto isso, o método de reprodução de filme armazena memórias na ordem em que os eventos ocorreram e reproduz a sequência de estímulos – “água derramada, vaso quebrado, cão”. A ordem cronológica dos eventos é preservada.

Pesquisas no campo da neurociência implicam que o método de reprodução de filme é integral para a criação de associações entre conceitos e a conexão de neurônios entre eventos. No entanto, o método de reprodução de imaginação pode ajudar o agente a criar novas sequências quando ele raciocina por analogia. Por exemplo, o agente pode raciocinar que, se um barril é para óleo como um vaso é para água, um barril pode ser derramado por um robô de fábrica em vez de um cão. De fato, quando a DeepMind investigou mais a fundo as possibilidades do método de reprodução de imaginação, eles descobriram que seu agente de aprendizado foi capaz de criar sequências impressionantes e inovadoras, considerando experiências anteriores.

A maioria do progresso atual sendo feito na área de memória de aprendizado por reforço está sendo feito com a estratégia de filme, embora os pesquisadores tenham começado recentemente a fazer progressos com a estratégia de imaginação. A pesquisa sobre ambos os métodos de memória de IA não apenas pode permitir um melhor desempenho dos agentes de aprendizado por reforço, mas também pode nos ajudar a obter novas informações sobre como a mente humana pode funcionar.

Blogueiro e programador com especialidades em Machine Learning e Deep Learning tópicos. Daniel espera ajudar os outros a usar o poder da IA para o bem social.