AI 모델 및 플랫폼

딥마인드, 뇌의 보상 경로와 유사한 AI 학습 기법 개발

mm
Unite.AI를 Google의 선호 소스에 추가

딥마인드가 최근에 발표한 논문에서는 강화 학습의 새로운 유형이 인간의 뇌에서 보상 경로를 어떻게 작동시키는지 설명할 수 있는 가능성을 제시했다. 뉴사이언티스트의 보도에 따르면, 이 기계 학습 훈련 방법은 분포 강화 학습이라고 불리며, 그背後의 메커니즘은 도파민을 분비하는 신경 세포가 어떻게 작동하는지 설명할 수 있다.

신경 과학과 컴퓨터 과학은 오랜 역사를 가지고 있다. 1951년 마빈 민스키는 보상과 처벌의 시스템을 사용하여 미로를 풀 수 있는 컴퓨터 프로그램을 만들었다. 민스키는 이반 파블로프의 연구에서 영감을 받았는데, 파블로프는 개가 보상과 처벌을 통해 학습할 수 있음을 보여주었다. 딥마인드의 새로운 논문은 신경 과학과 컴퓨터 과학의 역사에 새로운 장을 추가하며, 강화 학습의 한 유형을 적용하여 도파민 신경 세포가 어떻게 작동하는지에 대한 통찰력을 제공한다.

언제一个人이나 동물이 행동을 취할 때, 도파민을 분비하는 신경 세포는 행동의 보상이 얼마나 될지 예측한다. 행동이 완료되고 보상이 명백해지면, 뇌는 도파민을 분비한다. 그러나 이 도파민 분비는 예측 오차에 따라 조정된다. 보상이 예상보다 크면 도파민 분비가 더 강해진다. 반대로, 보상이 더 나쁨으로써 도파민 분비가 줄어든다. 도파민은 예측을 조정하여 실제 보상에 근접하도록 하는 교정 함수로 작동한다. 이것은 강화 학습 알고리즘이 작동하는 방식과 매우 유사하다.

2017년 딥마인드 연구진은 강화 학습 알고리즘의 개선된 버전을 발표했으며, 이 새로운 학습 방법은 많은 강화 학습 작업에서 성능을 향상시켰다. 딥마인드 팀은 새로운 알고리즘의 메커니즘을 사용하여 인간의 뇌에서 도파민 신경 세포가 어떻게 작동하는지 더 잘 설명할 수 있을 것이라고 생각했다.

구식 강화 학습 알고리즘과 달리, 딥마인드의 새로운 알고리즘은 보상을 분포로 나타낸다. 구식 강화 학습 접근 방식은 예상 보상을 단일 숫자로 나타내었으며, 평균 예상 결과를 나타낸다. 이 변경으로 모델은 가능한 보상을 더 정확하게 나타낼 수 있으며, 결과적으로 성능이 향상되었다. 새로운 훈련 방법의 우수한 성능으로 인해 딥마인드 연구진은 도파민 신경 세포가 인간의 뇌에서 유사한 방식으로 작동하는지 조사하기로 결정했다.

도파민 신경 세포의 작동을 조사하기 위해, 딥마인드는 하버드와 협력하여 마우스의 도파민 신경 세포 활동을 연구했다. 연구진은 마우스에게 다양한 작업을 수행하게 했으며, 주사위를 굴려 보상을 주었고, 도파민 신경 세포가 어떻게 발화하는지 기록했다. 다른 신경 세포는 다른 결과를 예측하며, 다른 양의 도파민을 분비했다. 일부 신경 세포는 실제 보상보다 낮은 결과를 예측하는 반면, 일부 신경 세포는 실제 보상보다 높은 결과를 예측했다. 보상 예측의 분포를 그래프화한 결과, 예측 분포가 실제 보상 분포와 kháใกล운 것으로 나타났다. 이것은 뇌가 예측과 예측 조정을 위해 분포 시스템을 사용한다는 것을 시사한다.

이 연구는 신경 과학과 컴퓨터 과학 모두에 영향을 미칠 수 있다. 이 연구는 분포 강화 학습을 더 발전된 AI 모델을 생성하는 방법으로 지원한다. 또한, 뇌의 보상 시스템에 대한 우리의 이론에 영향을 미칠 수 있다. 도파민 신경 세포가 분포되어 있으며, 일부는 다른 신경 세포보다 더 비관적 또는 낙관적일 수 있다면, 이러한 분포를 이해하는 것은 심리학의 측면에서 정신 건강과 동기 부여를 다루는 방식에 영향을 미칠 수 있다.

MIT 테크놀로지 리뷰의 보도에 따르면, 딥마인드의 신경 과학 연구 책임자 매트 보트비닉은 기자 회견에서 발견의 중요성을 설명했다. 보트비닉은 다음과 같이 말했다.

“뇌가 사용한다면, 그것은 좋은 아이디어일 것이다. 이것은 계산 기법이 실제 상황에서 확장될 수 있음을 알려준다. 이것은 다른 계산 과정과 잘 맞을 것이다. 이것은 우리가 일상 생활에서 뇌가 어떻게 작동하는지에 대한 새로운 관점을 제공한다”

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.