AI 모델 및 플랫폼

미스트랄 AI의 최신 Mixture of Experts (MoE) 8x7B 모델

mm
Unite.AI를 Google의 선호 소스에 추가

미스트랄 AI는 파리 기반의 오픈 소스 모델 스타트업으로, 대규모 언어 모델(LLM)인 MoE 8x7B를 단순한 토렌트 링크를 통해 공개함으로써 규범을 도전했습니다. 이것은 구글의 전통적인 접근 방식과는 대조를 이루며, AI 커뮤니티 내에서 대화를 불러일으키고 흥분을 자극합니다.

미스트랄 AI의 릴리스 접근 방식은 항상 비전통적이었습니다. 종종 논문, 블로그 또는 보도 자료와 같은 일반적인 동반자를 생략하고, 그들의 전략은 AI 커뮤니티의 주목을 끌기 위해 독특하게 효과적이었습니다.

최근에, 회사는 $2 억 달러의 평가를 달성했습니다. 이는 안드레센 호로위츠가 주도하는 자금 조달 라운드에 따른 것으로, 유럽 역사상 가장 큰 $1.18 억 달러의 시드 라운드를 기록했습니다. 자금 조달 성공을 넘어서, 미스트랄 AI는 오픈 소스 AI에 대한 규제를 줄이기 위해 EU AI 법안을 둘러싼 논의에 적극적으로 참여하고 있습니다.

MoE 8x7B가 주목받는 이유

“缩小된 GPT-4″로 묘사되는 Mixtral 8x7B는 8개의 전문가로 구성된 Mixture of Experts (MoE) 프레임워크를 사용합니다. 각 전문가는 111B 파라미터를 가지고 있으며, 55B 공유 주목 파라미터와 결합되어 모델당 총 166B 파라미터를 제공합니다. 이 설계 선택은 중요하며, 각 토큰의 추론에 두 개의 전문가만 참여할 수 있도록 허용하여, 더 효율적이고 집중적인 AI 처리로의 전환을 강조합니다.

Mixtral의 주요 특징 중 하나는 32,000 토큰의 광범위한 컨텍스트를 관리할 수 있는 능력으로, 복잡한 작업을 처리하기 위한 충분한 범위를 제공합니다. 모델의 다국어 기능에는 영어, 프랑스어, 이탈리아어, 독일어 및 스페인어를 포함한 강력한 지원이 포함되어 있으며, 글로벌 개발자 커뮤니티를 지원합니다.

Mixtral의 사전 훈련에는 오픈 웹에서 소스된 데이터가 포함되며, 전문가와 라우터 모두를 위한 동시 훈련 접근 방식이 사용됩니다. 이 방법은 모델이 단순히 파라미터 공간에서 크기만큼이나 데이터의 세부 사항에 미세하게 조정된다는 것을 보장합니다.

Mixtral 8x7B는 인상적인 점수를 달성합니다

Mixtral 8x7B는 인상적인 점수를 달성합니다

Mixtral 8x7B는 LLaMA 2 70B와 GPT-3.5를 능가하며, 특히 MBPP 작업에서 60.7%의 성공률을 보이며, 특히 두드러집니다. 또한, 지시를 따르는 모델을 위한 MT-Bench와 같은 엄격한 벤치마크에서 Mixtral 8x7B는 인상적인 점수를 달성하며, 거의 GPT-3.5와 일치합니다.

Mixture of Experts (MoE) 프레임워크 이해

Mixture of Experts (MoE) 모델은 최근 몇 년 동안 상태-of-the-아트 언어 모델에 통합됨으로써 주목을 받고 있습니다. 그러나 이 아이디어는 실제로 수년 전의 기초적인 개념에 뿌리를 두고 있습니다. 이 아이디어의 기원을 통해 시맨틱 연구 논문을 다시 살펴보겠습니다.

MoE 개념

Mixture of Experts (MoE)는 신경망 아키텍처에서 패러다임의 전환을 나타냅니다. 전통적인 모델은 모든 유형의 데이터를 처리하기 위해 단일의 동질적인 네트워크를 사용하는 반면, MoE는 더 전문적이고 모듈식인 접근 방식을 채택합니다. 이것은 여러 ‘전문가’ 네트워크로 구성되며, 각 네트워크는 특정 유형의 데이터 또는 작업을 처리하도록 설계되며, 동적으로 입력 데이터를 가장 적합한 전문가에게 направ는 ‘게이팅 네트워크’에 의해 감독됩니다.

재귀 언어 모델 내에 포함된 Mixture of Experts (MoE) 레이어

재귀 언어 모델 내에 포함된 Mixture of Experts (MoE) 레이어 (소스)

 

위의 이미지는 언어 모델 내에 포함된 MoE 레이어의 고수준 뷰를 제공합니다. 본질적으로, MoE 레이어는 여러 피드 포워드 서브 네트워크로 구성되며, 각 서브 네트워크는 ‘전문가’로 불리며, 데이터의 다른 측면을 처리하도록 특화될 수 있습니다. 게이팅 네트워크는 다이어그램에서 강조 표시된 것으로, 입력 데이터를 처리하기 위해 어느 전문家的 조합을 사용할지 결정합니다. 이 조건부 활성화는 네트워크가 계산 요구 없이 용량을 크게 증가시킬 수 있도록 합니다.

MoE 레이어의 기능

실제로, 게이팅 네트워크는 입력을 평가하고(다이어그램에서 G(x)로 표시됨) 특정 입력에 대한 출력을 계산하기 위해 몇몇 전문가를 선택합니다. 이 선택은 게이팅 네트워크의 출력에 의해 조정되며, 효과적으로 각 전문家的 기여를 최종 출력으로 결정합니다. 예를 들어, 다이어그램에 표시된 것처럼, 각 특정 입력 토큰에 대한 출력을 계산하기 위해 두 개의 전문가만 선택될 수 있으며, 이는 필요한 곳에 계산 리소스를 집중시키는 효율적인 프로세스를 만듭니다.

 

MoE 레이어가 포함된 트랜스포머 인코더 (소스)

두 번째 이미지는 MoE 레이어가 포함된 트랜스포머 인코더와 전통적인 트랜스포머 인코더를 대조합니다. 트랜스포머 아키텍처는 언어 관련 작업에서 그 효율성이 널리 알려져 있으며, 전통적으로는 자기 주의와 피드 포워드 레이어가 순차적으로 쌓여 있습니다. MoE 레이어의 도입은 피드 포워드 레이어를 대체하여, 모델이 용량에 대해 더 효과적으로 확장할 수 있도록 합니다.

증강 모델에서, MoE 레이어는 여러 장치에 걸쳐 샤딩되어 있으며, 모델 병렬 접근 방식을示しています. 이는 매우 큰 모델을 훈련하고 배포할 때 중요하며, 계산 부하와 메모리 요구 사항을 GPU 또는 TPU와 같은 장치 클러스터에 분산시킬 수 있도록 합니다. 이 샤딩은 수십억 개의 파라미터를 갖는 모델을 효율적으로 훈련하고 배포하는 데 필수적입니다.

LLM에 대한 MoE의 희소 접근법 및 지시 튜닝

LLM을 위한 희소 Mixture-of-Experts (MoE)“라는 논문은 대규모 언어 모델(LLM)을 개선하기 위한 혁신적인 접근 방식에 대해 논의합니다. 이는 Mixture of Experts 아키텍처와 지시 튜닝 기술을 통합하는 것입니다.

이것은 MoE 모델이 일반적인 사전 훈련과 작업별 미세 조정 사이의 불일치로 인해, 동일한 계산 능력의 밀도 모델보다 작업별 미세 조정에서 성능이 떨어지는 일반적인 도전을 강조합니다.

지시 튜닝은 모델을 자연어 지시를 더 잘 따르도록 미세 조정하는 훈련 방법론입니다. 이는 모델의 사전 훈련된 표현을 지시를 따르도록 더 잘 맞추어, 작업 성능을 크게 향상시킵니다.

연구원들은 세 가지 실험 설정에서 연구를 수행했으며, MoE 모델이 초기에 작업별 미세 조정에서 밀도 모델보다 성능이 떨어진다는 것을 보여주었습니다. 그러나 지시 튜닝을 적용하면 MoE 모델이 특히 작업별 미세 조정을 추가로 보충할 때 밀도 모델을 능가한다는 것을示しました. 이는 지시 튜닝이 MoE 모델이 하위 작업에서 밀도 모델을 능가하기 위해 필수적인 단계임을示합니다.

MoE에 대한 지시 튜닝의 효과

MoE에 대한 지시 튜닝의 효과

이것은 또한 FLAN-MOE32B라는 모델을 도입하며, 이러한 개념의 성공적인 적용을 보여줍니다. 특히, FLAN-PALM62B라는 밀도 모델을 능가하며, 벤치마크 작업에서 더 나은 성능을 보여주며, 동시에 계산 리소스의 3분의 1만을 사용합니다. 이는 지시 튜닝과 함께 희소 MoE 모델이 LLM의 효율성과 성능에 대한 새로운 기준을 설정할 수 있는 잠재력을示합니다.

실제 시나리오에서 Mixture of Experts 구현

MoE 모델의 다용도성은 다양한 응용 분야에 적합합니다:

  • 자연어 처리 (NLP): MoE 모델은 인간 언어의 세부 사항과 복잡성을 더 효과적으로 처리할 수 있습니다. 따라서 고급 NLP 작업에 이상적입니다.
  • 이미지 및 비디오 처리: 고해상도 처리가 필요한 작업에서 MoE는 이미지 또는 비디오 프레임의 다양한 측면을 처리할 수 있습니다. 이는 품질과 처리 속도 모두를 향상시킵니다.
  • 사용자 정의 AI 솔루션: 비즈니스와 연구자는 MoE 모델을 특정 작업에 맞추어 사용자 정의할 수 있습니다. 이는 더 집중적이고 효과적인 AI 솔루션을 제공합니다.

도전과 고려 사항

MoE 모델은 여러 가지 이점을 제공하지만, 또한 고유한 도전을 제시합니다:

  • 훈련 및 튜닝의 복잡성: MoE 모델의 분산 특성은 훈련 과정을 복잡하게 만들 수 있으며, 전문가와 게이팅 네트워크의 튜닝을 신중하게 조정해야 합니다.
  • 리소스 관리: 여러 전문가에 걸쳐 계산 리소스를 효율적으로 관리하는 것이 MoE 모델의 이점을 최대화하는 데 중요합니다.

신경망에 MoE 레이어를 통합하는 것은, 특히 언어 모델의 경우, 이전에 계산 제약으로 인해 불가능했던 크기로 모델을 확장하는 길을 제공합니다. MoE 레이어에서 가능한 조건부 계산은 계산 리소스를 더 효율적으로 분배할 수 있도록 허용하여, 더 큰, 더 능력있는 모델을 훈련할 수 있습니다. 우리가 AI 시스템에서 더 많은 것을 요구할수록, MoE를 갖춘 트랜스포머와 같은 아키텍처는 다양한 도메인에서 복잡하고 대규모 작업을 처리하기 위한 표준이 될 가능성이 있습니다.

지난 5년 동안私は Machine Learning과 Deep Learning의 매혹적인 세계에 몰두해 왔습니다.私の熱情と専門知識は私を50以上의多様한 소프트웨어 엔지니어링 프로젝트에 기여하게 했으며, 특히 AI/ML에 중점을 두었습니다.私の継続的な 호기심은 또한私를自然어 처리로 끌어들였습니다.私は이 분야를さらに 탐구하기를熱望합니다.