Mô hình và nền tảng AI
DeepMind Phát Hiện Kỹ Thuật Đào Tạo Trí Tuệ Nhân Tạo Có Thể Hoạt Động Trong Não Bộ Của Chúng Ta
DeepMind vừa mới xuất bản một bài báo chi tiết về cách một loại học tăng cường mới có thể giải thích cách các con đường phần thưởng trong não bộ con người hoạt động. Theo NewScientist, phương pháp đào tạo học máy này được gọi là học tăng cường phân phối và các cơ chế đằng sau nó dường như giải thích một cách hợp lý cách dopamine được释放 bởi các neuron trong não.
Khoa học thần kinh và khoa học máy tính có một lịch sử lâu dài cùng nhau. Từ năm 1951, Marvin Minsky đã sử dụng một hệ thống phần thưởng và trừng phạt để tạo ra một chương trình máy tính có thể giải quyết một mê cung. Minsky được truyền cảm hứng từ công việc của Ivan Pavlov, một nhà sinh lý học đã chứng minh rằng chó có thể học thông qua một loạt phần thưởng và trừng phạt. Bài báo mới của Deepmind bổ sung thêm vào lịch sử gắn kết của khoa học thần kinh và khoa học máy tính bằng cách áp dụng một loại học tăng cường để hiểu rõ hơn về cách các neuron dopamine có thể hoạt động.
Bất cứ khi nào một người hoặc động vật chuẩn bị thực hiện một hành động, các tập hợp neuron trong não của họ chịu trách nhiệm giải phóng dopamine sẽ dự đoán mức độ phần thưởng của hành động đó. Một khi hành động đã được thực hiện và hậu quả (phần thưởng) của hành động đó trở nên rõ ràng, não sẽ giải phóng dopamine. Tuy nhiên, việc giải phóng dopamine này được điều chỉnh theo kích thước của lỗi dự đoán. Nếu phần thưởng lớn hơn / tốt hơn dự kiến, một sự gia tăng mạnh mẽ của dopamine sẽ được kích hoạt. Ngược lại, một phần thưởng tồi tệ hơn sẽ dẫn đến ít dopamine được giải phóng. Dopamine đóng vai trò là một chức năng sửa lỗi giúp các neuron điều chỉnh dự đoán của chúng cho đến khi chúng hội tụ vào phần thưởng thực tế được kiếm. Điều này rất giống với cách các thuật toán học tăng cường hoạt động.
Năm 2017, các nhà nghiên cứu của DeepMind đã phát hành một phiên bản nâng cao của một thuật toán học tăng cường thường được sử dụng, và phương pháp học này vượt trội đã có thể tăng cường hiệu suất trên nhiều nhiệm vụ học tăng cường. Đội ngũ DeepMind nghĩ rằng các cơ chế đằng sau thuật toán mới có thể được sử dụng để giải thích tốt hơn cách các neuron dopamine hoạt động trong não bộ con người.
Ngược lại với các thuật toán học tăng cường cũ, thuật toán mới của DeepMind đại diện cho phần thưởng dưới dạng phân phối. Các phương pháp học tăng cường cũ đại diện cho phần thưởng ước tính dưới dạng một số duy nhất đại diện cho kết quả trung bình dự kiến. Sự thay đổi này cho phép mô hình đại diện chính xác hơn về các phần thưởng có thể xảy ra và thực hiện tốt hơn như một kết quả. Hiệu suất vượt trội của phương pháp đào tạo mới đã thúc đẩy các nhà nghiên cứu của DeepMind điều tra xem liệu các neuron dopamine trong não bộ con người có hoạt động theo cách tương tự hay không.
Để điều tra hoạt động của các neuron dopamine, DeepMind đã hợp tác với Harvard để nghiên cứu hoạt động của các neuron dopamine ở chuột. Các nhà nghiên cứu đã cho chuột thực hiện các nhiệm vụ khác nhau và cho chúng phần thưởng dựa trên việc tung xúc xắc, ghi lại cách các neuron dopamine của chúng hoạt động. Các neuron khác nhau dường như dự đoán các kết quả có thể khác nhau, giải phóng các lượng dopamine khác nhau. Một số neuron dự đoán thấp hơn phần thưởng thực tế trong khi một số neuron dự đoán phần thưởng cao hơn phần thưởng thực tế. Sau khi biểu đồ phân phối dự đoán phần thưởng, các nhà nghiên cứu đã tìm thấy rằng phân phối dự đoán khá gần với phân phối phần thưởng thực sự. Điều này cho thấy não bộ thực sự sử dụng một hệ thống phân phối khi tạo dự đoán và điều chỉnh dự đoán để phù hợp hơn với thực tế.
Nghiên cứu này có thể cung cấp thông tin cho cả khoa học thần kinh và khoa học máy tính. Nghiên cứu ủng hộ việc sử dụng học tăng cường phân phối như một phương pháp tạo ra các mô hình trí tuệ nhân tạo tiên tiến hơn. Ngoài ra, nó có thể có ý nghĩa đối với các lý thuyết của chúng ta về cách não bộ hoạt động liên quan đến hệ thống phần thưởng. Nếu các neuron dopamine được phân phối và một số neuron bi quan hoặc lạc quan hơn các neuron khác, việc hiểu các phân phối này có thể thay đổi cách chúng ta tiếp cận các khía cạnh của tâm lý như sức khỏe tâm thần và động lực.
Theo MIT Technology View, Matt Botvinik, giám đốc nghiên cứu khoa học thần kinh tại DeepMind, đã giải thích tầm quan trọng của những phát hiện tại một buổi họp báo. Botvinik nói:
“Nếu não bộ đang sử dụng nó, thì đó có lẽ là một ý tưởng hay. Nó cho chúng ta biết rằng đây là một kỹ thuật tính toán có thể mở rộng trong các tình huống thực tế. Nó sẽ phù hợp với các quá trình tính toán khác. Nó cung cấp cho chúng ta một quan điểm mới về những gì đang xảy ra trong não bộ của chúng ta trong cuộc sống hàng ngày”












