AI 모델 및 플랫폼
딥마인드와 구글 브레인이 강화 학습의 효율성을 개선하는 방법 개발에 목표를 두고 있다.

강화 학습 시스템은 매우 강력하고 견고하여, 수천 번의 반복적인 훈련을 통해 매우 복잡한 작업을 수행할 수 있다. 강화 학습 알고리즘은 정교하고 때로는 놀라운 행동을 가능하게 하지만, 훈련에 오랜 시간이 걸리고大量의 데이터가 필요하다. 이러한 요인으로 인해 강화 학습 기술은 비교적 비효율적이며, 최근에 알파벳의 딥마인드와 구글 브레인의 연구 팀은 강화 학습 시스템을 생성하는更加 효율적인 방법을 찾기 위해 노력하고 있다.
VentureBeat에 따르면, 결합된 연구 그룹은 최근에 강화 학습 훈련을更加 효율적으로 만들기 위한 방법을 제안했다. 하나의 제안된 개선은 적응형 행동 정책 공유(Adaptive Behavior Policy Sharing, ABPS)라는 알고리즘으로, 다른 하나는 보편적 가치 함수 근사자(Universal Value Function Approximators, UVFA)라는 프레임워크이다. ABPS는 인공 지능 에이전트가 적응적으로 선택된 경험을 공유할 수 있게 하며, UVFA는 에이전트가 동시에 방향성 탐색 정책을 조사할 수 있게 한다.
ABPS는 모델을 훈련할 때 하이퍼파라미터를 조정하는 것을 가속화하기 위한 것이다. ABPS는 여러 개의 다른 에이전트가 서로 다른 하이퍼파라미터를 가지고 행동 정책 경험을 공유할 수 있게 함으로써, 최적의 하이퍼파라미터를 찾는 것을更加 빠르게 한다. 더 구체적으로, ABPS는 강화 학습 에이전트가 정책이 허용한 행동 중에서 행동을 선택하고, 이후에 보상과 관찰을 받는 방식으로 작동한다.
인공 지능 강화 에이전트는 다양한 하이퍼파라미터의 조합으로 훈련된다. 모델을 훈련할 때, 목표는 모델이 최상의 성능을 내는 하이퍼파라미터의 조합으로 수렴하는 것이다. 이 경우, 데이터 효율성을 더욱提高하는 하이퍼파라미터이다. 효율성을提高하는 방법은 여러 개의 에이전트를 동시에 훈련하고, 다음 시간 단계에서 배치할 에이전트의 행동을 선택하는 것이다. 목표 에이전트의 정책을 사용하여 행동을 샘플링한다. 전환은 공유 공간에 로깅되고, 이 공간은不断으로 평가되어 정책 선택이 빈번하게 발생하지 않도록 한다. 훈련의 끝에, 에이전트의 앙상블이 선택되고, 최상의 성능을 내는 에이전트가 최종 배치되기 위해 선택된다.
UVFA의 경우, 강화 학습의 일반적인 문제 중 하나인, 약한 강화 에이전트가 작업을 학습하지 않는 문제를 해결하려고 한다. UVFA는 에이전트가 동시에 탐색과 활용 정책을 학습하도록 함으로써 이 문제를 해결하려고 한다. 작업을 분리하면, 탐색 정책이 환경을 계속 탐색하는 동안, 활용 정책이 현재 작업의 보상을 최대화하도록 하는 프레임워크가 생성된다. UVFA의 탐색 정책은 기준선 아키텍처로 작동하며, 자연스러운 보상이 발견되지 않더라도 계속해서 향상된다. 이러한 경우, 내재적 보상을近似하는 함수가 생성되어, 에이전트가 환경의 모든 상태를 탐색하도록 유도한다.
VentureBeat에 따르면, UVFA 프레임워크가 작동할 때, 시스템의 내재적 보상이 에이전트에 직접 입력된다. 에이전트는 특정 에피소드 동안의 모든 입력(예: 보상, 행동, 상태)의 표현을 계속 추적한다. 결과적으로, 보상은 시간이 지남에 따라 보존되고, 에이전트의 정책은 항상 어느 정도 정보를 갖는다.
이것은 “에피소드 نوف티”와 “생애 노브티” 모듈을 사용하여 달성된다. 첫 번째 모듈의 기능은 현재 에피소드 메모리를 보유하고, 이전에 언급한 표현에 현재 발견을 매핑하여, 에이전트가 훈련의 각 단계에서 내재적 에피소드 보상을 결정하도록 하는 것이다. 이후에, 현재 관찰과 연결된 상태가 메모리에 추가된다. 한편, 생애 노브티 모듈은 여러 에피소드에 걸쳐 에이전트가 탐색하는 빈도를影响하는 역할을 한다.
알파벳/구글 팀에 따르면, 새로운 훈련 기술은 이미 강화 학습 시스템을 훈련하는 데 있어 상당한 개선의 가능성을 보여주었다. UVFA는 일부 기초 에이전트의 성능을 두 배로提高할 수 있었다. 한편, ABPS는 일부 동일한 아타리 게임에서 성능을提高하고, 최상의 성과를 내는 에이전트 간의 분산을 약 25% 줄일 수 있었다. UVFA 훈련 알고리즘은 피트폴에서 높은 점수를 혼자 달성할 수 있었으며, 인간 데모의 공학적 특징이不存在했다.












