AI 모델 및 플랫폼

MPT-30B: 모자이크ML, GPT-3를 능가하는 새로운 LLM으로 NLP의 한계를 확장하다

mm
Unite.AI를 Google의 선호 소스에 추가

모자이크ML생성적 인공지능 회사로, AI 배포 및 확장 솔루션을 제공합니다. 최근에 출시한 대규모 언어 모델(Large Language Model, LLM) MPT-30B는 AI 커뮤니티에서 큰 반향을 일으키고 있습니다.

모자이크ML의 LLM 여정은 2023년 5월 MPT-7B(모자이크 프리트레이닝 트랜스포머, Mosaic Pretrained Transformer) 출시로 시작되었습니다. 이는 세 가지 변형을 갖고 있습니다:

  1. MPT-7B-StoryWriter-65k+ (장형 스토리 생성을 위한)
  2. MPT-7B-Instruct (단문 지시를 위한)
  3. MPT-7B-Chat (대화 생성을 위한)

이 모델들은 오픈소스 특성, 상업적 사용 가능성, 확장된 컨텍스트 윈도우를 처리하는 예외적인 능력으로 인해 ML 커뮤니티에서 큰 성공을 거두었습니다.

가장 중요한 것은, 이 모델이 다른 비교 가능한 모델들(LLaMA-7B, StableLM 7B 등)과 동등하거나 일부 경우에는 능가하는 성능을 보였습니다. 6월까지 MPT-7B 시리즈는 300만 번 이상 다운로드되었습니다. 6월 22일, 모자이크ML은 MPT-30B를 출시하여 오픈소스 기초 모델의 기준을 더욱 높였습니다.

MPT-30B: GPT-3를 능가하는 강력한 LLM

MPT-30B는 GPT-3-175B보다 더 강력한 오픈소스 및 상업적 라이선스를 가진 디코더 기반 LLM입니다. 이는 GPT-3의 17%인 30B 파라미터만을 사용하여 GPT-3를 능가하는 성능을 보입니다. 여기에는 MPT-30B와 GPT-3의 비교가 있습니다.

MPT-30B는 이전 MPT-7B 모델을 기반으로 합니다. 이는 유사한 크기의 모델에 비해 계산적으로 효율적인 훈련을 제공합니다. 예를 들어, LLaMA-30B는 MPT-30B보다 약 1.44배 더 많은 FLOPs 예산을 사용했습니다. 반면 Falcon-40B는 MPT-30B보다 1.27배 더 높은 FLOPs 예산을 가지고 있었습니다. 여기에는 MPT-30B의 이전 모델보다 다양한 작업에서 개선된 모습이 나타납니다.

MPT-30B의 특별한 기능은 다음과 같습니다:

8k 토큰 컨텍스트 윈도우

LLM의 컨텍스트 윈도우는 모델이 출력을 생성하기 전에 고려할 수 있는 토큰의 범위를 말합니다. MPT-30B는 훈련 시 8000개의 토큰을 갖는 컨텍스트 윈도우를 가지고 있었습니다. 이는 1T 토큰을 2k 토큰 시퀀스로 훈련한 후, 추가적인 50B 토큰을 8k 토큰 시퀀스로 훈련했습니다(약 6000 단어).

ALiBi 지원

이 기능을 설명하기 위해 다음과 같은 질문을 고려해 보십시오:

MPT-30B는 어떻게 훈련된 시퀀스보다 더 긴 시퀀스를 이해하고 예측할 수 있을까요?

MPT-30B는 ALiBi(Attention with Linear Biases) 기술을 사용하여 더 긴 시퀀스를 이해하고 컨텍스트 윈도우를 8k 토큰을 넘어 확장할 수 있습니다.

포지셔널 임베딩을 계산하는 대신, ALiBi는 키 토큰과 쿼리 토큰 사이의 어텐션 점수를 계산합니다. 키 토큰과 쿼리 토큰이 가까이 있을수록 페널티는 낮지만, 그렇지 않을 경우에는 더 높습니다. 따라서, 트랜스포머 아키텍처는 긴 입력 시퀀스에 대해 외삽할 수 있습니다.

FlashAttention을 통한 효율적인 추론 및 훈련 성능

어텐션, 즉 입력 시퀀스의 관련 부분에 집중하는 것은 트랜스포머의 중요한 구성 요소입니다. 그러나 이는 느리고 메모리 집약적일 수 있습니다. 특히, 긴 텍스트 시퀀스를 처리할 때입니다.

FlashAttention은 코넬 대학교의 연구자들이 제안한 접근 방식으로, MPT-30B의 이 문제를 해결합니다. 타일링 기법을 사용하여, FlashAttention은 모델이 메모리에서 읽거나 쓰는 횟수를 줄여서 처리 속도를 높입니다. 따라서, 모델은 최첨단 FlashAttention 기술과 NVIDIA의 FasterTransformer 최적화 라이브러리를 사용하여 효율적인 훈련 및 추론을 제공합니다.

훈련 및 배포의 용이성

개발자는 MPT-30B를 처음부터 훈련하거나 모자이크ML의 체크포인트를 사용하여 더 빠른 배포를 할 수 있습니다. 또한, 특정 데이터셋에 대한 도메인 특정 사용 사례를 위한 微调이 가능합니다.

모델의 크기는 단일 GPU, 특히 1xA100-80GB에서 16비트 정밀도 또는 1xA100-40GB에서 8비트 정밀도로 효율적인 배포를 가능하게 하도록 선택되었습니다. 이는 모델이 이러한 GPU의 메모리 제한 내에서 작동하도록 설계되었다는 것을 의미합니다.

코딩 능력

MPT-30B는 예외적인 코딩 능력을 제공합니다. HumanEval은 오픈AI에서发布한 164개의 수작성 프로그래밍 문제가 포함된 데이터셋입니다. HumanEval 데이터셋에서, 모델은 목적을 위한 LLM 모델, 즉 StarCoder 시리즈를 능가합니다.

MPT-30B-Instruct 및 MPT-30B-Chat: 미세 조정된 변형

MPT-30B-Instruct

LLM은 주로 지시, 질문 응답, 텍스트 요약, 언어 번역 등에 사용됩니다. MPT-30B-Instruct는 상업적으로 사용 가능한(상업적 CC-By-SA-3.0 라이선스를 유지) MPT-30B의 변형으로, 지시를 따르는 작업을 위한 微调을 위해 특별히 설계되었습니다. 微调에 사용된 데이터셋은 다음과 같습니다:

  1. FLAN
  2. P3
  3. Alpaca
  4. Dolly-15k

Dolly 데이터셋은 추가적으로 Anthropic의 Helpful and Harmless 데이터셋을 사용하여 지시 微调을 위해 보강되었습니다. 또한, 데이터 보강을 위해 다양한 데이터셋이 사용되었습니다:

  1. CompetitionMath
  2. GradeSchoolMath
  3. DialogSum
  4. DuoRC
  5. QASPER
  6. QuALITY
  7. SummScreen
  8. Spider

MPT-30B-Chat

MPT-30B-Chat은 대화 생성을 위한 MPT-30B의 微调된 버전입니다. 이는 비상업적 사용만을 허용하는 CC-By-NC-SA-4.0 라이선스로 출시된 연구 산물입니다. 모델은 다양한 언어 데이터셋을 사용하여 微调되었습니다:

  1. Airoboros/GPT4-1.2
  2. Baize
  3. Camel
  4. GPTeacher
  5. Guanaco
  6. LongCoversations
  7. ShareGPT
  8. WizardLM

LLM은 수십억 달러의 생성적 인공지능 시장의 큰 부분을 차지하고 있으며, 이는 ChatGPT가 지난해 랜드스케이프를 혁신적으로 바꾼 이후 매우 짧은 시간에 엄청난 성장을 경험했습니다. MPT 패밀리는 이 혁신의 중요한 부분입니다. 가까운 미래에는 MPT 패밀리보다 더 강력하고 효율적인 오픈소스 모델을 상업적으로 이용할 수 있을 것으로 기대됩니다.

최신 인공지능 뉴스를 보려면 unite.ai를 방문하세요.

Haziqa는 AI 및 SaaS 회사들을 위한 기술 콘텐츠 작성에 광범위한 경험을 가진 데이터 과학자입니다.