AI 모델 및 플랫폼
제피르-7B: 허깅페이스의 하이퍼 최적화된 대규모 언어 모델, 미스트랄 7B를 기반으로 구축됨
소개
대규모 언어 모델(LLM)의 발전은 특히 챗봇과 유사한 애플리케이션 개발에 큰 영향을 미쳤습니다. LLaMA와 같은 모델의 출시 이후, 효율적인 미세 조정, 확장된 프롬프트 처리, 검색 보강 생성(RAG), 양자화에 대한 연구가 증가했습니다.
LLaMA 모델은 미세 조정과 프롬프트.contextualization에 새로운 시대를 열었으며, MosaicML의 MPT, Together AI의 RedPajama-INCITE, TII의 Falcon, Meta의 Llama 2와 같은 후속 모델을 가능하게 했습니다. 각 모델은 전체 LLM의 기능과 범위를 향상시키는 고유한 기능을 제공합니다.
파리에서 설립된 미스트랄 AI는 전 구글 딥마인드와 메타 직원을 고용하여 미스트랄 7B와 같은 첫 번째 제품으로 이름을 알렸습니다.
미스트랄 7B의 강점은 효율성에 있습니다. Llama 2와 같은 동등한 모델보다 더 적은 계산需求으로 유사한 또는 향상된 기능을 제공합니다.
특히 지침 태스크에 최적화된 미스트랄 7B Instruct는 허깅페이스와 같은 플랫폼에서 같은 크기의 다른 모델을 능가하고, 거의 두 배의 매개변수를 가진 모델과 경쟁적으로 수행합니다.
이것을 기반으로 허깅페이스는 제피르 7B 알파를 소개했습니다. 이는 미스트랄 7B를 미세 조정하여 훨씬 더 큰 채팅 모델의 능력을 초과할 수 있으며, 일부 태스크에서는 GPT-4와 경쟁할 수 있음을 보여주었습니다. “알파”는 시작에 불과했으며, 제피르 7B 베타가 곧 뒤를 이었습니다.
이 기사는 제피르-7B가 인간 지침과 상응하는 능력을 정련하기 위해 더 큰 모델의 힘을 어떻게 활용하는지 탐구할 것입니다. 이는 지식 증류라는 기술을 통해 가능해졌습니다. 이 방법은 더 작은 모델을 더 큰 모델에서 학습한 복잡한 패턴으로 훈련하여 훈련 요구 사항을 줄이면서 언어 모델링 능력을 유지합니다. 우리는 허깅페이스의 지식 증류 접근 방식을 자세히 살펴보겠습니다.
지식 증류
제피르-7B와 같은 모델을 개발하는 데 중요한 혁신은 증류 감독 미세 조정(dSFT)입니다. 이 방법은 더 큰, 더 능숙한 “교사” 모델의 출력을 사용하여 더 작은 “학생” 모델을 훈련하여 정확도를 향상시킵니다. 증류는 다양한 태스크에서 오픈 모델을 개선하지만, 교사 모델과 비교하여 성능 격차는 여전히 존재합니다.
지식 증류는 머신 러닝에서 컴팩트 모델인 “학생”이 더 큰, 더 복잡한 “교사” 모델의 성능을 복제하도록 가르치는 방법입니다. 이 기술을 통해 학생 모델은 이전에는 불가능했던 태스크를 수행할 수 있습니다. 교사가 학습한 세련된 패턴을 전송하여 학생 모델이 더 나은 성능을 발휘할 수 있습니다.
학생 모델은 교사 모델이 생성한 출력 확률 또는 특징에 훈련되며, 최종 예측뿐만 아니라 이러한 출력을 일치시키는 데 중점을 둡니다. 이렇게 하면 학생 모델이 교사의 세련된 의사 결정 프로세스를 학습할 수 있으며, 종종 원래 데이터만으로 훈련할 때보다 더 나은 성능을 발휘합니다.
과거에 지식 증류는 힌턴의 원래 증류 네트워크와 같은 모델에서 사용되었으며, 최근에는 DistilBERT와 같은 NLP 모델에서 사용되었습니다. DistilBERT는 BERT 모델을 더 작은, 더 빠른 버전으로 증류하여 원래 언어 이해 능력의 대부분을 유지합니다. TinyBERT는 모바일 또는 에지 디바이스를 위한 크기와 속도를 최적화하는 또 다른 예입니다.
제피르-7B의 경우, 지식 증류는 더 작은 7B 매개변수 모델에 더 큰 모델의 능력을 주입하는 데 사용됩니다. 이를 통해 제피르-7B는 성능과 효율성 사이에서 균형을 이루며, 계산 리소스가 제한된 환경에서 품질을 희생하지 않으면서 상호작용과 이해의 질을 유지할 수 있습니다.
제피르-7B를 개발하는 과정에서 연구자들은 완전히 증류를 통해 작은 오픈 LLM을 정렬하는 도전을 해결했습니다. 그들은 인간 주석이 필요 없는 AI 피드백을 사용하여 선호도 데이터를 생성하는 증류 직접 선호 최적화(dDPO)라는 접근 방식을 도입했습니다. 이 방법은 모델 훈련에 필요한 시간과 리소스를 크게 줄입니다.
제피르-7B 구축
dDPO를 검증하기 위해 연구자들은 미스트랄-7B 모델을 기반으로 제피르-7B를 구축했습니다. 이 과정에는 세 단계가 포함되었습니다:
- .UltraChat 데이터셋을 사용한 dSFT: 증류 감독 미세 조정(dSFT)은 더 큰, 더 능숙한 “교사” 모델의 출력을 사용하여 더 작은 “학생” 모델을 훈련하는 고급 방법입니다. 이는 원래 LLM을 사용자 프롬프트에 응답하도록 훈련하는 것을 시작으로, 모델 자체가 지침과 응답을 생성하는 자기 지침 접근 방식을 사용합니다.
- .UltraFeedback에서 AI 피드백 데이터 통합: 이 데이터는 모델의 응답을 정련하는 데 중요했습니다. 이 단계에서는 모델이 다양한 프롬프트(예: 초콜릿 브라우니 만드는 방법)에 대한 응답을 생성하고, 더 발전된 모델인 GPT-4가 이 응답을 평가합니다.
- dDPO 적용: 마지막 단계인 증류 직접 선호 최적화(dDPO)는 dSFT 모델을 선호 응답의 확률을 최대화하여 정련합니다. 이는 보상 함수 rθ(x, y)를 사용하여 최적의 LLM 정책 π*와 원래 정책 πdSFT를 기반으로 합니다.
제피르-7B는 인간 피드백으로 정렬된 70B 매개변수 모델과 비교할 수 있는 성능을 달성했습니다. 학술 벤치마크와 대화 능력 모두에서 탁월한 성능을 발휘하며, 모델 개발에서 선호도 학습의 효과를 강조합니다. 추가 탐색을 위해 모델, 코드 및 지침은 허깅페이스 깃허브 저장소에서 사용할 수 있습니다.
의도 정렬의 도전
LLM에 대한 주목할 만한 문제는 인간 의도와의 정렬입니다. 이전 모델은 사용자 선호도와 일치하지 않는 응답을 생성하여 부정확하거나 관련이 없는 답변을 생성했습니다. 그러나 MT-Bench 및 AlpacaEval과 같은 최근 벤치마크는 이 측면을 정량화하고 개선하는 데 도움이 되었습니다.
평가 방법
제피르 7B의 평가에는 모델의 대화 능력을 평가하는 벤치마크에 대한 철저한 테스트가 포함되었습니다:
- MT-Bench: 이 다회전 벤치마크는 모델이 8개 도메인에 걸쳐 160개의 질문에 답하도록 요구합니다. 각 응답은 GPT-4에 의해 평가되며, 모델의 최종 점수는 두 라운드의 질문에 대한 평균을 반영합니다.
- AlpacaEval: 이 단일 회전 벤치마크에서는 모델이 다양한 주제에 대한 805개의 질문에 대한 답변을 생성해야 합니다. 여기서 모델의 유용성이 중점적으로 평가되며, GPT-4가 비교적 승리율을 결정하기 위해 답변을 평가합니다.
추가로, 제피르 7B는 대화 능력에 직접적인 평가가 아닌 모델의 추론 및 진실성에 대한 통찰력을 제공하는 오픈 LLM 리더보드에서 테스트되었습니다.
제피르 7B는 다양한 오픈 및 사유 모델과 비교되었으며, 각 모델의 크기, 정렬 방법(dSFT 또는 dDPO), 성능 점수를 평가했습니다. 제피르 7B는 MT-Bench 및 AlpacaEval에서 새로운 벤치마크를 설정했으며, 더 큰 모델과 경쟁적인 성능을 보여 dDPO의 훈련에서 효과를 입증했습니다.
SFT 및 DPO 훈련 단계는 여러 에포크와 최적의 성능을 위한 미세 조정 학습률 및 배치 크기를 포함하여 신중하게 구성되었습니다. 최종 제피르 모델은 과적합에 저항성이 뛰어나고 실제 작업 및 학술 벤치마크에서 향상된 것으로 나타났습니다.
데이터셋 및 결과
사용된 데이터셋
성능 및 결과
아래 차트는 제피르 7B의 다양한 태스크 범주에서 GPT-3.5-turbo, Claude 1, GPT-4, Llama-2-70b-chat와 같은 다른 모델과 비교한 성능을 보여줍니다. 범주는 글쓰기, 인문학, 역할 놀이, 추론, STEM, 추출, 코딩 및 수학을 포함할 수 있습니다.
차트에서 제피르 7B가 뛰어난 도메인과 상대적으로 약한 도메인을 식별할 수 있습니다. 예를 들어, 제피르의 라인이 글쓰기 축에서 다른 모델보다 더 멀리 확장된다면, 제피르가 글쓰기에서 특히 강하다는 것을 의미합니다. 반면에 수학 축에서 라인이 중앙에 더 가깝다면, 제피르가 수학 문제를 해결하는 데 상대적으로 약하다는 것을 나타낼 수 있습니다.
레이더 차트는 제피르 7B의 강점과 약점을 식별하는 데 도움이 되며, GPT-4와 같은 더 큰 모델 및 Llama-2-70b-chat와 같은 전문 모델과 비교하여 제피르 7B의 위치를 시각적으로 나타냅니다.
MT-Bench 및 AlpacaEval 벤치마크에서 다양한 언어 모델을 비교합니다. 모델은 크기, 정렬 방법(dSFT 또는 dDPO) 및 성능 점수에 따라 평가됩니다. 제피르 7B는 두 벤치마크에서 높은 점수를 기록하여 정렬된 응답을 생성하는 데의 효과를 보여줍니다.
결론
결론적으로, 제피르-7B의 개발은 샘플링 기반 방법에 의존하지 않고도 대규모 언어 모델(LLM)의 대화 능력을 더 작은 모델로 증류하고 정렬할 수 있음을 보여줍니다. AI 피드백을 사용한 직접 선호 최적화를 통해 제피르-7B는 미스트랄-7B의 강력한 기반을 활용하여 7B 매개변수 채팅 모델의 새로운 벤치마크를 설정하며, 오픈 소스 모델이 효과적으로 인간의 의도와 상호작용할 수 있음을展示합니다.
그러나 이 연구에는 제한이 있습니다. 벤치마크에 대한 평가에서 GPT-4를 사용하는 것은 GPT-4에서 증류된 모델을 선호할 수 있으며, 정확한 응답을 선호하는 모델을 더욱 선호할 수 있습니다. 또한 이 방법을 더 큰 모델로 확장하고 성능 향상에 미치는 영향에 대한 추가 연구가 필요합니다. 이러한 제한은 지속적인 혁신과 편향되지 않은 평가 방법의 개발 필요성을 강조합니다.
이 연구를 넘어서, 더 작은 모델이 더 큰 모델과 같은 수준의 성능을 발휘할 수 있는 잠재력은 AI를 더 접근하기 쉽고 효율적으로 사용할 수 있도록 해주어 다양한 애플리케이션에서 활용할 수 있습니다. 제피르-7B의 성공은 오픈 소스 모델에 대한 추가 탐색을 장려하며, 협력 연구와 개발을 통해 AI의 발전을 가속화할 수 있습니다.
















