AI 기초

딥 강화 학습이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

딥 강화 학습이란 무엇인가?

인공지능 생성의 또 다른 일반적인 형태는 강화 학습입니다. 일반적인 강화 학습과 달리, 딥 강화 학습은 깊은 학습과 강화 학습의 최선의 측면을 결합함으로써驚人的한 결과를 도출할 수 있습니다. 딥 강화 학습이 작동하는 방식을 자세히 살펴보겠습니다.

딥 강화 학습에 뛰어들기 전에, 정형 강화 학습이 어떻게 작동하는지_refresh하는 것이 좋습니다. 강화 학습에서, 목표 지향 알고리즘은 시도와 오류를 통해 설계되며, 최상의 결과를 도출하는 행동을 최적화합니다. 강화 학습 알고리즘이 훈련될 때, 알고리즘은 미래에 취할 행동에 영향을 미치는 “보상” 또는 “벌칙”을 받습니다. 알고리즘은 시스템에 가장 많은 보상을 제공하는 행동 세트를 찾으려고 합니다.

강화 학습 알고리즘은 매우 강력합니다. 거의 모든 작업에 적용될 수 있으며, 환경에서 유연하고 동적으로 학습할 수 있으며, 가능한 행동을 발견할 수 있습니다.

딥 강화 학습 개요

사진: Megajuice via Wikimedia Commons, CC 1.0 (https://commons.wikimedia.org/wiki/File:Reinforcement_learning_diagram.svg)

딥 강화 학습에서, 환경은 일반적으로 이미지로 표현됩니다. 이미지에는 특정 시점의 환경이 캡처됩니다. 에이전트는 이미지를 분석하고 이미지에서 관련 정보를 추출하여 행동을 결정합니다. 딥 강화 학습은 일반적으로 가치 기반 학습과 정책 기반 학습의 두 가지 기술 중 하나를 사용합니다.

가치 기반 학습 기술은 합성곱 신경망과 Deep-Q-Network와 같은 알고리즘과 아키텍처를 사용합니다. 이러한 알고리즘은 이미지를 그레이스케일로 변환하고 불필요한 이미지 부분을 자르기 위해 작동합니다. 이후, 이미지에는 다양한 합성곱과 풀링 연산이 적용되어 가장 관련된 이미지 부분을 추출합니다. 중요한 이미지 부분은 에이전트가 취할 수 있는 행동의 Q-값을 계산하는 데 사용됩니다. Q-값은 에이전트의 최선의 행동을 결정하는 데 사용됩니다. 초기 Q-값이 계산된 후, 가장 정확한 Q-값을 결정하기 위해 역전파가 수행됩니다.

정책 기반 방법은 에이전트가 취할 수 있는 행동의 수가 매우 높을 때 사용됩니다. 이러한 상황에서는 각 행동의 Q-값을 계산하는 것이 비현실적입니다. 정책 기반 접근 방식은 개별 행동의 함수 값을 계산하지 않고, 대신 정책을 직접 학습합니다. 정책 그라디언트와 같은 기술을 통해 정책을 학습합니다.

정책 그라디언트는 에이전트의 이전 경험을 기반으로 행동의 확률을 계산합니다. 가장 가능성이 높은 행동이 선택됩니다. 이 과정은 평가 기간의 끝까지 반복되며, 보상은 에이전트에게 주어집니다. 보상이 처리된 후, 네트워크의 매개변수는 역전파를 통해 업데이트됩니다.

Q-러닝이란 무엇인가?

Q-러닝은 딥 강화 학습의 중요한 부분입니다. Q-러닝 시스템이 작동하는 방식을 자세히 살펴보겠습니다.

마르코프 의사 결정 과정

마르코프 의사 결정 과정. 사진: waldoalvarez via Pixabay, Pixbay License (https://commons.wikimedia.org/wiki/File:Markov_Decision_Process.svg)

에이전트가 일련의 작업을 수행하고 목표를 달성하려면, 에이전트는 상태와 이벤트의 시퀀스를 처리할 수 있어야 합니다. 에이전트는 초기 상태에서 시작하여 일련의 행동을 취하여 최종 상태에 도달해야 합니다. 초기 상태와 최종 상태 사이에는大量의 상태가 존재할 수 있습니다. 모든 상태에 대한 정보를 저장하는 것은 비현실적이거나 불가능합니다. 따라서 시스템은 가장 관련된 상태 정보만을 저장해야 합니다. 이는 마르코프 의사 결정 과정으로 구현됩니다. 마르코프 의사 결정 과정은 현재 상태와 이전 상태에 대한 정보만을 저장합니다.

딥 Q-러닝

모델이 학습 환경의 상태에 대한 정보에 접근할 수 있게 되면, Q-값을 계산할 수 있습니다. Q-값은 행동의 총 보상입니다.

Q-값은 일련의 보상으로 계산됩니다. 즉시 보상, 현재 상태와 행동에 따라 계산됩니다. 다음 상태의 Q-값도 계산되며, 그 다음 상태의 Q-값도 계산됩니다. 이러한 Q-값은 에이전트의 최선의 행동을 결정하는 데 사용됩니다. 초기 Q-값이 계산된 후, 가장 정확한 Q-값을 결정하기 위해 역전파가 수행됩니다.

딥 Q-러닝은 Q-값 함수를 추정하기 위해 신경망을 사용합니다. 신경망은 상태를 입력으로 받으며, 모든 가능한 행동에 대한 Q-값을 출력합니다.

딥 Q-러닝은 과거의 경험을 저장하고 Q-네트워크의 최대 출력을 계산하며, 현재 값과 이론적인 최대 값의 차이를 계산하는 손실 함수를 사용합니다.

딥 강화 학습 vs 딥 러닝

딥 강화 학습과 일반적인 딥 러닝의 주요 차이점은 입력이不断으로 변경된다는 것입니다. 이는 일반적인 딥 러닝에서 발생하지 않습니다. 어떻게하면 학습 모델이不断으로 변경되는 입력과 출력을 처리할 수 있을까요?

본질적으로, 예측 값과 목표 값의 차이를 계산하기 위해 두 개의 신경망을 사용할 수 있습니다. 하나의 네트워크는 목표 값을 추정하고, 다른 네트워크는 예측을 담당합니다. 목표 네트워크의 매개변수는 모델이 학습함에 따라 업데이트됩니다. 각각의 네트워크의 출력은 함께 결합되어 차이를 계산합니다.

정책 기반 학습

정책 기반 학습 접근 방식은 Q-값 기반 접근 방식과 다르게 작동합니다. Q-값 접근 방식은 상태와 행동에 대한 가치 함수를 생성하는 반면, 정책 기반 방법은 행동을 선택하는 정책을 직접 최적화합니다.

정책 그라디언트

딥 강화 학습의 정책은 두 가지 범주 중 하나에 속합니다. 결정론적 정책은 상태를 행동으로 매핑하는 반면, 확률론적 정책은 행동에 대한 확률 분포를 반환합니다.

결정론적 정책은 행동의 결과에 대한 불확실성이 없을 때 사용됩니다. 즉, 환경이 결정론적일 때 사용됩니다. 반면에, 확률론적 정책은 행동의 결과에 대한 불확실성이 있을 때 사용됩니다. 일반적으로, 강화 학습 시나리오는 불확실성을 포함하므로 확률론적 정책이 사용됩니다.

정책 그라디언트 접근 방식은 Q-러닝 접근 방식보다 몇 가지 장점이 있습니다. 정책 기반 방법은 최적의 매개변수에 더 빨리 수렴하며, 더 안정적으로 수렴합니다. 정책 그라디언트를 따라가면 최선의 매개변수를 결정할 수 있습니다. 반면에, 가치 기반 방법은 작은 행동 값의 변경이 행동과 관련된 매개변수에 큰 영향을 미칠 수 있습니다.

정책 그라디언트는 높은 차원 행동 공간에서 더 잘 작동합니다. 행동의 수가非常 많을 때, 딥 Q-러닝은 모든 행동에 대한 점수를 할당해야 하므로 계산적으로 비현실적입니다. 그러나 정책 기반 방법에서는 매개변수가 시간에 따라 업데이트되며, 모델이 수렴함에 따라 최선의 매개변수의 수가 빠르게 줄어듭니다.

정책 그라디언트는 확률론적 정책을 구현할 수 있습니다. 이는 가치 기반 정책과 달리, 탐색-활용 트레이드오프를 구현할 필요가 없습니다.

정책 그라디언트의 주요 단점은 최적의 매개변수를 찾는 동안 국지적인 최적값에 빠질 수 있다는 것입니다.

정책 점수 함수

모델의 성능을 최적화하는 정책은 점수 함수 J(θ)를 최대화하도록 설계됩니다. 점수 함수는 정책의 품질을 측정하는 데 사용됩니다. 정책의 매개변수 θ를 최적화하여 최선의 정책을 찾을 수 있습니다. 먼저, 정책 보상을 예상하여 목표를 설정합니다. 정책 보상을 계산하여 최적화할 수 있습니다. 정책 점수 함수는 예상 정책 보상을 계산하는 데 사용됩니다.

정책 그라디언트 상승

그라디언트 상승은 매개변수를 최적의 위치로 이동하는 데 사용됩니다. 사진: Public Domain (https://commons.wikimedia.org/wiki/File:Gradient_ascent_(surface).png)

정책 점수 함수를 사용하여 예상 정책 보상을 계산한 후, 점수 함수 J(θ)를 최대화하는 매개변수 θ를 찾을 수 있습니다. 그라디언트 상승은 점수 함수를 최대화하는 데 사용됩니다. 그라디언트 상승은 딥 러닝의 그라디언트 하강과 유사하지만, 우리는 증가를 최적화합니다. 이는 점수가 오류가 아니라 최대화하고자 하는 값이기 때문입니다. 정책 그라디언트 정리는 정책에 대한 그라디언트를 추정하는 데 사용됩니다.

딥 강화 학습 요약

요약하면, 딥 강화 학습은 강화 학습과 깊은 신경망을 결합합니다. 딥 강화 학습은 두 가지 기술을 사용합니다. 딥 Q-러닝과 정책 그라디언트입니다.

딥 Q-러닝 방법은 상태에서 행동을 취할 때의 보상을 예측하는 데 사용됩니다. 정책 그라디언트 접근 방식은 행동 공간을 최적화하여 행동을 예측합니다. 정책 기반 딥 강화 학습은 결정론적 또는 확률론적 정책을 사용합니다. 결정론적 정책은 상태를 행동으로 매핑하는 반면, 확률론적 정책은 행동에 대한 확률 분포를 생성합니다.

블로거이자 프로그래머로 Machine Learning Deep Learning 주제에 전문가입니다. 다니엘은 다른 사람들이 AI의 힘을 사회적善으로 사용하는 것을 돕기를 희망합니다.