AI 기초

인간 피드백을 통한 강화 학습(RLHF)이란 무엇인가?

mm
Unite.AI를 Google의 선호 소스에 추가

인간 피드백을 통한 강화 학습(RLHF)은 원하는 행동을 단순한 자동 보상으로 지정하기 어려울 때 인간 판단을 활용해 모델을 최적화하는 일련의 방법입니다. 언어 모델의 경우, 사람들은 일반적으로 후보 응답을 비교하고 학습된 선호 모델이 이러한 비교를 학습 신호로 변환합니다.

RLHF는 사전 학습된 모델을 보다 도움이 되게 하거나 서면 정책에 더 잘 맞추게 할 수 있지만, 진실성을 증명하거나 모든 사용자와의 정렬을 보장하지는 않습니다. 결과는 피드백을 제공하는 사람, 프롬프트 샘플링 방식, 보상 모델이 표현할 수 있는 내용, 그리고 최적화가 어떻게 제한되는지에 따라 달라집니다.

핵심 요점

  • RLHF는 일반적으로 사전 학습 및 감독된 지시 튜닝 이후에 수행됩니다.
  • 쌍별 선호는 보상 또는 선호 모델을 학습시키며, 정책 최적화는 그 후 더 높은 점수를 받은 출력물을 선호합니다.
  • 보상 해킹, 주석자 의견 차이, 분포 이동, 과도한 최적화는 여전히 중요한 위험 요소입니다.
  • 최종 정책을 작업 품질, 안전성, 보정 및 하위 그룹 효과에 대해 직접 평가합니다.
What Is Reinforcement Learning from Human Feedback (RLHF)? workflow diagram
인간의 선호는 학습 신호가 되지만, 보편적인 진리 기준이 되지는 않습니다.

일반적인 RLHF 파이프라인

언어 모델은 먼저 사전 학습을 통해 광범위한 통계적 구조를 학습합니다. 그 다음 감독된 미세 조정 단계에서 원하는 응답의 예시를 사용합니다. 선호 수집을 위해 주석자들은 동일한 프롬프트에 대한 출력들을 순위 매기거나 선택합니다.

보상 모델은 이러한 비교를 예측하도록 학습합니다. PPO와 같은 강화 학습 알고리즘은 학습된 보상을 기준으로 언어 모델을 최적화할 수 있으며, 패널티는 모델이 기준 정책에서 지나치게 벗어나는 것을 억제합니다.

피드백은 측정이며, 절대 진리가 아니다

주석자들은 지시가 모호하거나 전문성이 다르거나 가치가 실제로 충돌할 때 의견 차이를 보일 수 있습니다. 위치, 장황함, 자신감, 스타일 등이 선호에 편향을 일으킬 수 있습니다. 고품질 프로그램은 평가자를 교육하고, 합의를 측정하며, 사례를 감사하고, 불확실성을 유지합니다.

샘플링도 중요합니다. 선호 집합에 어려운 언어, 도메인 또는 해로운 내용이 제외되면 보상 모델은 이를 신뢰성 있게 감독할 수 없습니다. 데이터 과학 분야는 최적화 알고리즘만큼 중요합니다.

실패 모드

정책은 학습된 보상의 약점을 이용해, 근본적인 의도를 충족시키지 않으면서도 높은 점수를 받는 출력을 생성할 수 있습니다. 과도한 최적화는 다양성을 감소시키고, 선호하는 스타일을 과도하게 강조하거나 모델이 자신 있게 동의하도록 만들 수 있습니다.

보상 모델 자체도 훈련 분포 외에서는 실패할 수 있습니다. 팀은 하나의 종합 선호 승률에 의존하기보다 적대적 프롬프트, 사실 검증 과제, 거부 경계, 보정, 다양한 최적화 강도에서의 행동을 테스트해야 합니다.

대안 및 보완

직접 선호 최적화(Direct Preference Optimization)는 온라인 강화 학습 루프를 통한 별도 정책 학습 없이 선호 쌍으로부터 학습합니다. 거부 샘플링, 감독된 선호 미세 조정, 규칙 기반 피드백, 프로세스 감독 등은 다른 트레이드오프를 제공합니다.

어떠한 방법도 프롬프트, 검색, 도구 및 애플리케이션 수준 제어의 필요성을 없애지는 못합니다. 사후 학습은 행동을 형성하지만, 배포된 시스템은 여전히 근거 있는 증거, 권한, 모니터링 및 인간의 에스컬레이션을 필요로 합니다.

선호 모델은 어떻게 학습되는가

프롬프트 x와 두 응답 y₁, y₂에 대해 선호 모델은 스칼라 점수를 할당하고, 선호되는 응답이 더 높은 점수를 받도록 학습됩니다. 일반적인 손실 함수는 한 점수가 다른 점수보다 높을 확률에 기반합니다. 이는 다수의 쌍별 판단을 새로운 생성 출력에 점수를 매길 수 있는 함수로 변환합니다.

모델은 수집된 선택을 예측하는 모든 신호를 학습합니다. 평가자들이 자신감 있는 문체, 긴 답변, 특정 문화적 규범, 익숙한 관점을 선호한다면, 이러한 상관관계가 보상 특징이 될 수 있습니다. 균형 잡힌 지시, 반례, 전문가 검토, 피상적인 선호에 대한 감사를 통해 문제를 감소시킬 수 있지만 완전히 제거하지는 못합니다.

선호 데이터는 동점, 순위, 비평, 스칼라 라벨 또는 시연을 포함할 수 있습니다. 쌍 선택이 중요합니다: 명백히 다른 답변 간 비교는 미묘한 품질 경계에 대한 학습이 적고, 어려운 쌍만을 사용하면 학습이 불안정해질 수 있습니다. 능동 샘플링은 유의미한 의견 차이를 목표로 할 수 있지만 데이터 분포를 바꿀 수도 있습니다.

정책 최적화 및 정규화

PPO 기반 RLHF는 현재 정책에서 응답을 샘플링하고, 보상 모델로 점수를 매긴 뒤 기대 보상을 높이도록 정책을 업데이트합니다. Kullback–Leibler 패널티 또는 유사 제약은 정책을 감독된 기준에 가깝게 유지하여 파괴적인 변화를 제한하고 좁은 보상 모델 약점의 악용을 억제합니다.

최적화 강도는 제품 선택과 같습니다. 너무 약하면 원하는 행동이 변하지 않고, 너무 강하면 보상 해킹, 반복적인 표현, 아첨, 다양성 감소를 초래할 수 있습니다. 훈련 전반에 걸쳐 보상 및 발산과 대비하여 품질 및 안전 지표를 그래프로 확인하고, 보상만으로 체크포인트를 선택하지 마십시오.

직접 선호 방식은 명시적인 온라인 RL 루프 없이 선호 쌍과 기준 모델로부터 목표 함수를 도출합니다. 이는 훈련을 단순화할 수 있지만, 여전히 선호 품질, 커버리지, 기준 정책 가정 등을 물려받습니다. 헌법적 혹은 AI 생성 피드백은 라벨 제공자를 바꾸지만, 사람을 통한 가치와 실패 검증 필요성을 없애지는 못합니다.

평가 및 데이터 거버넌스

블라인드 비교, 작업별 테스트, 적대적 프롬프트, 사실성 검사, 거부 정밀도 및 재현율, 하위 그룹 검토를 활용하십시오. 가능하면 평가자를 훈련 데이터와 분리합니다. 오래된 모델 대비 승률만으로는 두 후보 모두 성능이 낮을 때 절대적인 실패를 숨길 수 있습니다.

주석자 모집, 보상, 전문성, 지역, 언어, 지시사항, 유해 콘텐츠 노출, 의견 차이, 판정, 품질 관리 등을 문서화하십시오. 피드백 작업은 심리적 위험을 수반할 수 있으며, 책임 있는 데이터 운영은 작업자 지원과 불쾌한 작업을 거절할 권리를 포함합니다.

배포 후에는 선호 드리프트와 과도한 일반화를 모니터링하십시오. 일상적인 지원을 위해 조정된 정책이 의료나 법률 분야에서는 부적절하게 동작할 수 있습니다. 도메인 경계, 검색, 권한, 에스컬레이션을 RLHF 가정 밖에 두고, 새로운 증거가 변화를 정당화할 때만 재학습하십시오.

구체적인 RLHF 훈련 및 평가 파이프라인

전형적인 프로젝트는 사전 학습된 언어 모델과 감독된 미세 조정에 사용되는 지시 데이터셋으로 시작합니다. 이후 주석자들은 정확성, 관련성, 스타일, 안전성, 불확실성을 포괄하는 서면 루브릭에 따라 후보 응답을 비교합니다. 쌍별 선호는 보상 모델을 학습하거나 정책을 직접 최적화합니다. 샘플링에는 일반 작업, 어려운 경계 사례, 적대적 프롬프트, 다국어, 그리고 주석자들이 정당하게 의견이 갈리는 영역이 포함되어야 합니다.

보상 모델의 보류된 비교에 대한 정확도는 필요하지만 충분하지 않습니다. 최적화된 정책은 학습된 보상의 오류를 악용하고, 과도하게 장황해지며, 무해한 요청을 거부하거나 능력을 상실할 수 있습니다. 훈련 전반에 걸쳐 작업 벤치마크, 인간 선호, 보정, 안전성, 다양성, 기준 모델과의 발산을 추적하십시오. 정책이 변화함에 따라 새로운 비교를 정기적으로 수집해 선호 데이터가 실제 모델이 생성하는 출력을 포괄하도록 하십시오.

선호를 제공한 사람, 그들의 지시, 보상, 의견 차이, 품질 관리, 문화적·도메인 제한 등을 문서화하십시오. 오류가 특수한 해를 초래할 경우 전문가 검토자를 활용하십시오. 보상 모델과 최종 정책 모두에 대해 레드팀을 수행하고, 행동 회귀 테스트를 유지하며, 단계적 배포를 진행하십시오. RLHF는 측정된 선호에 따라 행동을 형성하지만, 진실성을 증명하거나 편향을 제거하거나 모든 상황에서 모델이 해야 할 일을 지정하는 더 넓은 문제를 해결하지는 못합니다.

실용적인 구현 체크리스트

개념을 제한적이고 테스트 가능한 워크플로우로 전환하십시오: 사전 학습 → 시연 → 비교 → 보상 학습 → 최적화 → 평가. 책임자를 지정하고, 데이터와 종속성을 문서화하며, 간단한 기준선을 설정하고, 수용 및 중단 기준을 정하고, 대표적인 실패를 테스트하며, 범위를 확장하기 전에 모니터링, 롤백, 검토를 정의하십시오. 버전과 가정을 기록해 다른 팀이 결과를 재현하고 변경 사항을 이해할 수 있도록 하세요.

출시 전에, 시스템을 구축·운영·보안·영향 받는 사람들과 함께 문서화된 준비 검토를 수행하십시오. 정상 케이스, 경계 조건, 종속성 실패, 오용을 테스트하고 증거와 미해결 위험을 보존하십시오. 누가 릴리스를 승인하고, 임계값을 변경하며, 출력을 무시하거나 운영을 중단할 수 있는지 정의하십시오. 실제 데이터가 도착하면 결정을 재검토하십시오. 기술적으로 성공적인 파일럿이더라도 더 큰 규모에서 신뢰할 수 있는 성능을 보장하지는 않기 때문입니다.

  • 피드백: 불일치가 있는 샘플링된 판단.
  • 보상: 원하는 행동에 대한 학습된 프록시.
  • 정책: 여전히 테스트가 필요한 최적화된 출력.

자주 묻는 질문

RLHF는 미세 조정과 동일한가?

RLHF는 선호 기반 보상을 활용하는 사후 학습 형태입니다. 감독된 미세 조정은 목표 출력에 직접 학습하며, 많은 파이프라인이 두 방식을 모두 사용합니다.

RLHF가 모델을 진실하게 만들까요?

피드백 과정으로 측정된 행동을 개선할 수 있지만, 모델은 여전히 오류가 있거나 설득력이 있거나 보상을 전략적으로 악용할 수 있습니다. 진실성은 직접적인 평가와 근거가 필요합니다.

주요 참고문헌

Alex은 Unite.AI의 AI 기반 뉴스 운영을 이끌며, 저널리즘, 연구, 자동화를 결합해 인공지능에 대한 시기적절하고 확장 가능한 보도를 지원합니다. 그의 작업은 새로운 AI 개발이 효율적으로 부각되도록 돕는 동시에, 출판물의 편집 기준을 유지합니다.