AI 기초
강화 학습이란 무엇인가?
강화 학습(RL)은 에이전트가 환경과 상호작용하면서 행동 방법을 학습하는 머신러닝 프레임워크입니다. 각 행동 후에 환경이 변하고 보상이 반환될 수 있습니다. 에이전트의 목표는 다음 행동의 보상만이 아니라 기대되는 누적 보상을 최대화하는 정책을 학습하는 것입니다.
강화 학습은 의사결정이 시간에 따라 진행되고 하나의 행동이 이후 상황에 영향을 미칠 때 사용됩니다. 이는 각 학습 예제마다 목표 답을 제공하는 데이터셋을 사용하는 지도 학습과 개념적으로 다릅니다.
핵심 요점
- 강화 학습 문제는 에이전트, 환경, 상태, 행동, 보상, 그리고 정책을 포함합니다.
- 긍정적 강화와 부정적 강화는 모두 행동을 증가시키며, 처벌은 행동을 감소시킵니다.
- 에이전트는 익숙하지 않은 행동을 탐색하는 것과 이미 효과가 입증된 행동을 활용하는 것 사이에서 균형을 맞춰야 합니다.
- 가치 기반, 정책 기반, 액터-크리틱, 모델 기반, 그리고 오프라인 방법은 각각 다른 강화 학습 환경을 해결합니다.

강화 학습의 구성 요소
많은 강화 학습 문제는 마코프 결정 과정(MDP)으로 모델링됩니다. MDP는 다음을 포함합니다:
- 상태: 현재 상황을 설명하는 정보.
- 행동: 에이전트가 선택할 수 있는 옵션.
- 전이: 행동 후 상태가 어떻게 변하는지.
- 보상: 전이에 의해 즉시 제공되는 피드백.
- 정책: 행동을 선택하는 에이전트의 전략.
- 할인 계수: 미래 보상이 즉시 보상에 비해 얼마나 크게 고려되는지.
상태는 세계에 대한 모든 정보를 드러낼 필요는 없습니다. 중요한 정보가 숨겨져 있을 경우 문제는 부분 관측 가능(partially observable)하게 되며, 에이전트는 메모리나 믿음 상태(belief state)가 필요할 수 있습니다.
강화는 처벌과 동일하지 않다
이 용어는 행동 심리학에서 유래되었습니다. 긍정적 강화는 행동이 더 자주 일어나도록 하는 결과를 추가합니다. 부정적 강화는 불쾌한 상황을 제거하여 행동이 더 자주 일어나게 합니다. 행동을 덜 일어나게 하기 위한 벌칙은 처벌이며, 부정적 강화와는 다릅니다.
머신러닝에서는 실무자들이 긍정적 보상, 부정적 보상, 비용, 벌칙 등에 대해 직접 언급하는 경우가 많습니다. 핵심은 이러한 신호가 에이전트가 최대화하려는 반환(return)에 어떻게 영향을 미치는가입니다.
반환, 가치 및 신용 할당
보상은 하나의 전이를 설명합니다. 반환(return)은 시간에 따라 보상을 결합하며, 일반적으로 먼 미래에 도착하는 보상은 할인합니다. 상태 가치 함수(state-value function)는 상태에서 기대되는 반환을 추정하고, 행동 가치 함수(action-value function)는 해당 상태에서 특정 행동을 취했을 때 기대되는 반환을 추정합니다.
이로 인해 신용 할당(credit-assignment) 문제가 발생합니다: 유용한 결과가 훨씬 나중에 나타난다면, 어느 이전 행동이 공을 받아야 할까요? 강화 학습 알고리즘은 이 관계를 추정하는 방식이 서로 다릅니다.
몬테카르로와 시계열 차분 학습
몬테카르로 방법은 에피소드가 끝난 후 전체 샘플링된 반환을 통해 학습합니다. 시계열 차분(TD) 방법은 관측된 보상과 다음에 올 것에 대한 추정치를 결합하여 최종 결과 전에 추정치를 업데이트합니다. 따라서 TD 학습은 현재 가치 추정값을 기반으로 부트스트랩합니다.
어느 한 쪽이 보편적으로 더 좋다고 할 수 없습니다. 몬테카르로 목표는 샘플링된 정책 하에서 편향이 없지만 변동성이 크고 에피소드가 완료되어야 합니다. TD 방법은 온라인 및 연속 작업에서 학습할 수 있지만, 부트스트랩된 목표가 편향을 도입합니다.
탐색 vs 활용
탐색은 가치가 불확실한 행동을 시도함으로써 정보를 수집합니다. 활용은 현재 가장 높은 반환을 제공할 것으로 믿어지는 행동을 선택합니다. 탐색을 전혀 하지 않는 에이전트는 열악한 전략에 머물 수 있고, 활용을 전혀 하지 않는 에이전트는 학습한 내용을 활용하지 못합니다.
간단한 전략으로는 ε-탐욕(epsilon-greedy) 행동 선택, 신뢰도 기반 탐색, 엔트로피 보너스, 내재 보상 방법 등이 있습니다. 안전이 중요한 환경에서는 무제한 탐색이 허용되지 않을 수 있으므로 시뮬레이션, 제약조건, 오프라인 데이터, 혹은 인간 감독이 중요해집니다.
주요 강화 학습 접근법
가치 기반 방법
Q-학습 및 관련 알고리즘은 행동 가치를 학습하고 높은 가치의 행동을 선택함으로써 정책을 도출합니다. 딥 강화 학습은 상태 공간이 표로 표현하기에 너무 클 때 가치 함수나 정책을 근사하기 위해 신경망을 사용합니다.
정책 그라디언트 방법
정책 그라디언트 방법은 기대 반환을 향상시키기 위해 매개변수화된 정책을 직접 조정합니다. 연속 행동 및 확률적 정책에 유용하지만, 그라디언트 추정치의 변동성이 클 수 있습니다.
액터-크리틱 방법
액터는 행동을 선택하고, 크리틱은 가치를 추정하며 학습 신호를 제공합니다. 이는 직접적인 정책 최적화와 가치 추정을 결합한 방식입니다.
모델 기반 및 모델 프리 RL
모델 기반 시스템은 전이와 보상의 모델을 학습하거나 사용하여 계획을 수립합니다. 모델 프리 시스템은 환경을 명시적으로 모델링하지 않고 가치나 정책을 학습합니다. 모델 기반 방법은 경험을 효율적으로 활용할 수 있지만, 학습된 모델의 오류가 계획을 오도할 수 있습니다.
오프라인 강화 학습
오프라인 강화 학습은 학습 중 새로운 상호작용을 수집하는 대신 고정된 데이터셋으로부터 학습합니다. 이는 탐색 비용이나 위험을 줄일 수 있지만, 데이터에 충분히 나타나지 않은 행동을 과대평가하지 않도록 해야 합니다.
RLHF와 인간 선호
인간 피드백을 통한 강화 학습(RLHF)은 선호 데이터를 사용해 보상 신호를 학습하거나 정책을 직접 최적화합니다. 이는 언어 모델의 행동을 인간 판단에 맞추는 데 활용되었습니다. 선호 최적화가 진실성이나 안전성을 보장하는 것은 아니며, 결과는 피드백을 제공한 사람, 판단하도록 요청된 내용, 그리고 목표 설계 방식에 따라 달라집니다.
제한 사항
강화 학습은 방대한 수의 상호작용을 필요로 하고, 학습 중 불안정하게 동작하며, 보상 함수의 의도치 않은 단축 경로를 이용할 수 있습니다. 평가가 어려운 이유는 결과가 무작위 시드와 환경 세부 사항에 따라 달라질 수 있기 때문입니다. 좋은 실천 방법으로는 다중 실행, 투명한 기준선, 제한된 목표, 분포 외 테스트, 그리고 보상 해킹을 감시하는 것이 포함됩니다.
RL 문제 설계: 상태, 행동, 보상 및 시간 범위
강화 학습은 순차적인 의사결정을 모델링합니다. 환경은 관측값을 생성하고, 에이전트는 정책에 따라 행동을 선택하며, 전이는 보상과 다음 관측값을 제공합니다. 마코프 결정 과정은 상태에 미래 전이와 보상을 예측하는 데 필요한 정보가 포함된다고 가정합니다; 부분 관측 가능성은 메모리, 믿음 상태, 혹은 순환 구조를 필요로 합니다. 할인은 지연된 결과의 가중치를 조절하고, 에피소드형과 연속형 작업은 서로 다른 반환 정의를 요구합니다. 부적절한 상태나 행동 설계는 해결 가능한 목표를 학습 불가능하게 만들 수 있습니다.
보상 설계는 행동을 간접적으로 지정하며 실패의 주요 원인입니다. 대리 보상이 악용될 수 있습니다: 속도에 보상을 주는 에이전트는 안전을 무시할 수 있고, 작업 완료 시에만 보상을 받는 에이전트는 학습 신호가 부족할 수 있습니다. 실제 요구사항에 기반한 제약조건과 종료 규칙을 추가하고, 보상 민감도를 테스트하며, 의도치 않은 전략이 있는지 궤적을 검사하십시오. 탐색 방법은 정보 수집과 현재 지식 활용 사이의 균형을 맞춥니다. 오프 정책 데이터는 샘플 효율성을 높일 수 있지만, 행동 정책과 목표 정책 간의 불일치는 이를 위해 설계된 알고리즘이 필요합니다.
평가, 시뮬레이션 및 안전한 배포
가치 기반 방법은 상태나 행동에 대한 기대 반환을 추정하고, 정책 그라디언트 방법은 매개변수화된 정책을 최적화하며, 액터-크리틱 방법은 두 가지를 모두 학습합니다. 모델 기반 강화 학습은 전이 역학을 학습하거나 사용해 계획을 세웁니다. 적절한 방법군은 행동 유형, 데이터, 시뮬레이터 정확도, 시간 범위, 안정성 요구사항에 따라 달라집니다. 휴리스틱, 지도 학습, 제어 이론 기반 기준선과 비교하십시오. 평균 및 최악 상황 반환, 제약 위반, 샘플 효율성, 환경 변화에 대한 견고성, 시드 간 변동성을 평가하고, 가장 좋은 학습 곡선만을 선택하지 마십시오.
온라인 탐색은 의료, 금융, 로봇공학, 인프라 분야에서 허용되지 않을 수 있습니다. 가능한 경우 시뮬레이션이나 기록된 데이터로 학습하고, 시뮬레이터와 현실 사이의 격차를 정량화하며, 보지 못한 행동에 대한 지원이 없기 때문에 오프 정책 평가를 신중히 사용하십시오. 배포 시 행동, 속도, 자원, 작동 영역을 제한하고, 중요한 선택에 인간 승인을 포함하며, 안전 제어기나 차단 장치를 제공해야 합니다. 에이전트가 점수를 높이면서도 의도된 목표에 해를 끼칠 수 있으므로 보상을 실제 결과와 함께 모니터링하십시오. 환경, 정책, 보상이 변경된 후 재검증하십시오.
실제 예시: 강화 학습을 활용한 에너지 제어
건물 운영자는 온도, 점유율, 날씨, 장비 상태, 전기 요금을 모델링하고, 행동은 안전한 설정값 조정으로 제한합니다. 보상은 쾌적성, 에너지, 수요 요금, 장비 제약을 결합하지만, 실제 쾌적성 위반은 별도로 평가되어 보상 최적화가 해를 숨길 수 없습니다. 과거 제어와 모델 예측 제어가 기준선으로 제공됩니다. 학습은 무작위 날씨, 센서 노이즈, 장비 효율을 포함한 보정된 시뮬레이터를 사용합니다.
건물에 영향을 주기 전에 정책은 실시간 관측값에 대해 행동 없이 실행됩니다. 엔지니어는 궤적, 제약 여유, 그리고 휴일, 폭염, 정전, 센서 결함 시 행동을 점검합니다. 배포 시 행동 속도와 범위를 제한하고 기존 안전 제어기를 유지합니다. 인간은 언제든지 개입할 수 있습니다. 모니터링은 에너지와 쾌적성을 동일 기간과 비교하고, 개입 기록을 남기며, 위반, 예상치 못한 사이클링, 모델 불일치가 정의된 임계값을 초과하면 롤백합니다.
구현 증거 및 운영 준비성
프로덕션 단계의 결정은 성공적인 시연만으로는 충분하지 않습니다. 대상 사용자, 운영 환경, 입력·출력, 의존성, 책임자, 그리고 각 중요한 실패의 결과를 정의하십시오. 튜닝 전에 재현 가능한 기준선과 버전 관리된 평가 세트를 마련합니다. 일반 사례, 경계 조건, 형식이 잘못되었거나 누락된 입력, 분포 변화, 의존성 장애, 오용, 그리고 서비스가 부족할 가능성이 높은 그룹이나 환경을 테스트합니다. 작업 품질을 보정·불확실성, 지연, 처리량, 자원 비용, 접근성, 프라이버시, 보안과 함께 측정합니다. 모든 변환 및 임계값을 기록해 독립 검토자가 결과를 재현하고 매력적인 프로토타입과 증거를 구분할 수 있도록 합니다.
출시 전에 릴리스, 예외, 변경, 롤백, 폐기에 대한 권한을 지정하십시오. 단계적 롤아웃을 사용하고 안전한 백업을 유지하며, 의도적으로 삽입한 실패를 통해 모니터링을 검증합니다. 운영 텔레메트리는 입력 품질, 출력 동작, 모델·규칙 버전, 의존성 상태, 인간 개입, 확인된 결과를 보여주어야 하며 불필요한 민감 데이터는 수집하지 않아야 합니다. 알림 임계값과 대응 담당자를 정의하고, 오프라인 성능이 지속될 것이라 가정하지 말고 배포 후 실제 증거를 검토하십시오. 데이터 소스, 사용자, 모델, 공급업체, 정책, 하드웨어, 목표가 변경될 때마다 재평가하십시오. 유지되는 시스템은 문서화된 복구 절차, 사고 학습, 삭제·보존 절차, 그리고 시스템을 중단하거나 교체해야 하는 명확한 시점을 필요로 합니다.












