Mô hình và nền tảng AI
DeepMind Tạo Ra Trí Tuệ Nhân Tạo Phát lại ký ức giống như Hippocampus
Não bộ con người thường nhớ lại những ký ức trong quá khứ (dường như) không có nguyên nhân. Khi chúng ta đi qua ngày, chúng ta có những tia nhớ lại từ cuộc sống. Mặc dù sự nhớ lại này đã được các nhà khoa học thần kinh quan tâm trong một thời gian dài, nhưng gần đây, công ty nghiên cứu trí tuệ nhân tạo DeepMind đã xuất bản một bài báo mô tả cách một trí tuệ nhân tạo của họ sao chép lại mô hình nhớ lại này.
Sự nhớ lại ký ức trong não, sự phát lại thần kinh, được gắn chặt với hippocampus. Hippocampus là một cấu trúc hình ngựa biển trong não thuộc hệ thống limbic, và nó được liên kết với việc tạo ra những ký ức mới, cũng như những cảm xúc mà ký ức gây ra. Các lý thuyết hiện tại về vai trò của hippocampus (có một hippocampus ở mỗi bán cầu não), cho rằng các vùng khác nhau của hippocampus chịu trách nhiệm xử lý các loại ký ức khác nhau. Ví dụ, ký ức không gian được cho là được xử lý ở vùng sau của hippocampus.
Como được Jesus Rodriguez báo cáo, Tiến sĩ John O’Keefe đã có nhiều đóng góp cho sự hiểu biết của chúng ta về hippocampus, bao gồm cả các tế bào “nơi” của hippocampus. Các tế bào này trong hippocampus được kích hoạt bởi các kích thích trong một môi trường cụ thể. Ví dụ, các thí nghiệm trên chuột cho thấy các neuron cụ thể sẽ hoạt động khi chuột chạy qua các phần nhất định của một đường đua. Các nhà nghiên cứu tiếp tục theo dõi chuột ngay cả khi chúng đang nghỉ ngơi, và họ phát hiện ra rằng các mẫu neuron giống nhau chỉ ra một phần của mê cung sẽ hoạt động, mặc dù chúng hoạt động với tốc độ nhanh hơn. Chuột dường như đang phát lại ký ức về mê cung trong tâm trí của chúng.
Ở người, việc nhớ lại ký ức là một phần quan trọng của quá trình học tập, nhưng khi cố gắng cho phép trí tuệ nhân tạo học tập, nó rất khó để tái tạo hiện tượng này.
Đội ngũ DeepMind đã cố gắng tái tạo hiện tượng nhớ lại này bằng cách sử dụng học tăng cường. Các thuật toán học tăng cường hoạt động bằng cách nhận phản hồi từ các tương tác với môi trường xung quanh, và được thưởng khi chúng thực hiện các hành động đưa chúng đến gần mục tiêu mong muốn. Trong trường hợp này, tác nhân học tăng cường ghi lại các sự kiện và sau đó phát lại chúng vào các thời điểm sau, với hệ thống được tăng cường để cải thiện hiệu quả trong việc nhớ lại các trải nghiệm trong quá khứ.
DeepMind đã thêm việc phát lại các trải nghiệm vào một thuật toán học tăng cường bằng cách sử dụng một bộ đệm phát lại sẽ phát lại các ký ức/trải nghiệm đã ghi lại cho hệ thống tại các thời điểm cụ thể. Một số phiên bản của hệ thống có các trải nghiệm được phát lại theo thứ tự ngẫu nhiên, trong khi các mô hình khác có thứ tự phát lại được chọn trước. Trong khi các nhà nghiên cứu thực nghiệm với thứ tự phát lại cho các tác nhân tăng cường, họ cũng thực nghiệm với các phương pháp phát lại các trải nghiệm khác nhau.
Có hai phương pháp chính được sử dụng để cung cấp cho các thuật toán tăng cường các trải nghiệm được nhớ lại. Các phương pháp này là phương pháp phát lại tưởng tượng và phương pháp phát lại phim. Bài báo của DeepMind sử dụng một ẩn dụ để mô tả cả hai chiến lược này:
“Giả sử bạn về nhà và, để ngạc nhiên và thất vọng, bạn phát hiện ra nước đang tích tụ trên sàn gỗ đẹp của bạn. Bước vào phòng ăn, bạn tìm thấy một chiếc vase bị vỡ. Sau đó bạn nghe thấy một tiếng khóc, và bạn nhìn ra cửa sổ patio để thấy con chó của bạn trông rất tội lỗi.”
Theo như Rodriguez báo cáo, phương pháp phát lại tưởng tượng không ghi lại các sự kiện theo thứ tự chúng được trải qua. Thay vào đó, một nguyên nhân có thể giữa các sự kiện được suy diễn. Các sự kiện được suy diễn dựa trên sự hiểu biết của tác nhân về thế giới. Trong khi đó, phương pháp phát lại phim lưu trữ các ký ức theo thứ tự chúng xảy ra, và phát lại chuỗi các kích thích – “nước tràn, vase vỡ, chó”. Thứ tự thời gian của các sự kiện được bảo tồn.
Nghiên cứu từ lĩnh vực khoa học thần kinh cho thấy rằng phương pháp phát lại phim là rất quan trọng trong việc tạo ra các mối liên hệ giữa các khái niệm và kết nối giữa các neuron giữa các sự kiện. Tuy nhiên, phương pháp phát lại tưởng tượng có thể giúp tác nhân tạo ra các chuỗi mới khi nó suy luận bằng cách tương tự. Ví dụ, tác nhân có thể suy luận rằng nếu một thùng chứa dầu là như một vase chứa nước, một thùng chứa dầu có thể bị đổ bởi một robot nhà máy thay vì một con chó. Thực sự, khi DeepMind nghiên cứu sâu hơn về các khả năng của phương pháp phát lại tưởng tượng, họ phát hiện ra rằng tác nhân học tập của họ có thể tạo ra các chuỗi ấn tượng, sáng tạo bằng cách xem xét các trải nghiệm trước đó.
Phần lớn tiến bộ hiện tại trong lĩnh vực học tăng cường trí nhớ đang được thực hiện với chiến lược phát lại phim, mặc dù các nhà nghiên cứu gần đây đã bắt đầu đạt được tiến bộ với chiến lược tưởng tượng. Nghiên cứu về cả hai phương pháp trí nhớ nhân tạo không chỉ có thể cho phép các tác nhân học tăng cường hoạt động tốt hơn, mà còn giúp chúng ta có được cái nhìn sâu sắc mới về cách bộ não con người có thể hoạt động.












