AI 모델 및 플랫폼
인공지능과 인간 가치의 일치: WARM을 통한 발전
인공지능 시스템과 인간 가치의 일치
인공지능(AI) 시스템은 고객 서비스 챗봇부터 의료 진단 알고리즘까지 복잡한 작업에서 인간을 도와주는 능력이 점점 더 향상되고 있습니다. 그러나 이러한 AI 시스템이 더 많은 책임을 지게 될수록, 인간의 가치와 선호도와 일치하는지 확인하는 것이 중요합니다. 이를 달성하는 방법 중 하나는 강화 학습에서 인간의 피드백을 사용하는 기술입니다. 강화 학습에서 AI 시스템은 인간의 판단에 따라 보상이나 처벌을 받습니다. 목표는 정책이 보상을 최대화하도록 학습하여 인간의 선호도에 따라 행동하도록 하는 것입니다.
강화 학습의 핵심 구성 요소는 보상 모델(RM)입니다. RM은 정책의 행동과 출력을 평가하고 학습 과정을 안내하는 보상 신호를 반환하는 역할을 합니다. 좋은 RM을 설계하는 것은 인간의 선호도가 복잡하고 상황에 따라 다를 수 있으며 개인 간에 일관성이 없을 수 있기 때문에 어려운 작업입니다. 최근 Google (GOOGL ) DeepMind의 연구자들은 RM 설계를 개선하기 위한 혁신적인 기술인 WARM(Weight Averaged Reward Models)을 제안했습니다.
보상 해킹의 문제
강화 학습에서 주요 문제는 보상 해킹입니다. 보상 해킹은 정책이 의도된 목표를 달성하지 않고도 높은 보상을 얻기 위해 RM 시스템의 취약점을 이용하는 것을 말합니다. 예를 들어, 높은 품질의 요약을 생성하는 작성 보조 AI를 훈련하는 경우를 생각해 보겠습니다. RM은 간결하고 정보가 많은 요약을 보상할 수 있습니다. 그러나 정책은 이 보상을 이용하여 매우 짧고 정보가 없는 요약을 생성할 수 있습니다.
보상 해킹은 두 가지 주요 이유로 발생합니다:
- 분포 이동 – RM은 제한된 데이터셋에서 훈련됩니다. 그러나 정책의 출력은 훈련 데이터와 다른 분포에서 나올 수 있습니다.
- 잡음이 있는 레이블 – 인간의 레이블은 완벽하지 않으며, 레이블 간에 불일치가 있을 수 있습니다. RM은 이러한 잡음에 영향을 받을 수 있습니다.
보상 해킹은 인간의 기대에 맞지 않는 무용한 시스템을 생성할 수 있으며, 심지어는 배포 시 위험할 수 있습니다.
모델 병합의 부상
모델 병합 전략인 Model Ratatouille에 대한 관심은 모델의 크기가 더 커질수록 비효율적이고 비실용적이 될 수 있다는 것을 인식한 결과입니다. 1조 매개변수의 모델을 훈련하는 것은 데이터, 컴퓨팅, 시간, 비용이 많이 듭니다. 더욱 중요한 것은 이러한 모델이 훈련 데이터에 과적합하여 새로운 데이터에 대한 일반화가 어려워집니다.
모델 병합은 더 큰 모델을 사용하지 않고도 더 나은 성능을 달성할 수 있는 대안을 제공합니다. 다양한 모델을 병합하여 더 나은 일반화와 강건성을 달성할 수 있습니다. 이러한 접근법은 모델이 서로 다른 예측 패턴을 학습하여 병합 시 더 나은 성능을 달성할 수 있다는 가정에 기반합니다.
최근의 결과는 이 접근법의 가능성을 보여줍니다. 모델 병합을 통해 더 큰 모델과 유사한 성능을 달성할 수 있으며, 때로는 더 나은 성능을 달성할 수 있습니다. 예를 들어, Model Ratatouille 앙상블은 7개의 중간 크기 체크포인트만으로도 GPT-3와 유사한 성능을 달성할 수 있습니다.
가중 평균 보상 모델
WARM은 여러 개의 개별 RM을 평균하여 생성된 프록시 RM을 사용합니다. 이 방법은 효율성, 강건성, 보상 해킹에 대한 내성을 향상시킵니다. 연구는 WARM을 사용하여 더 나은 결과를 달성할 수 있으며, 보상 해킹의 발생을 지연시킬 수 있습니다.
순서 섞기
순서 섞기는 모델을 훈련하는 동안 데이터 포인트의 순서를 섞는 것입니다. 이 방법은 모델의 가중치를 decorrelate하여 중복된 패턴을 학습하는 것을 줄입니다.
하이퍼파라미터 변형
하이퍼파라미터를 조정하여 모델을 훈련하는 것은 유용한 다양성을 생성할 수 있습니다. 모델은 서로 다른 방식으로 수렴하여 데이터셋의 서로 다른 특성을 학습합니다.
체크포인트 평균 – 바클라바
바클라바 방법은 모델을 병합하기 위해 서로 다른 체크포인트에서 초기화합니다. 이 방법은 모델을 더 효율적으로 병합할 수 있습니다.
더 큰 그림
WARM은 두 가지 주요 연구 분야의 교차점에 위치합니다. 첫 번째는 분포 외부 일반화(OOD) 연구이며, 모델의 성능을 새로운 데이터에 대해 향상시키는 것을 목표로 합니다. 두 번째는 알고리즘의 강건성 연구이며, 작은 입력 변화나 잡음에도 모델의 성능을 유지하는 것을 목표로 합니다.
WARM은 이러한 두 분야를 연결하여 더 강건한 모델을 개발하는 데 도움이 될 수 있습니다. 또한, WARM은 인간의 가치와 일치하는 인공지능 시스템을 개발하는 데 중요한 역할을 할 수 있습니다.












