AI 모델 및 플랫폼
BlackMamba: 상태 공간 모델을 위한 전문가 混合
대형 언어 모델(LLM)의 개발, 특히 디코더 전용 트랜스포머 모델에서 xây dựng된 것은 자연어 처리(NLP) 영역과 강화 학습, 시계열 분석, 이미지 처리 등을 포함한 다양한 딥 러닝 응용 프로그램을 발전시키는 데 중요한 역할을 했습니다. 그러나 이러한 디코더 전용 트랜스포머 모델에서 구축된 LLM은 확장 가능성과 강력한 성능에도 불구하고 여전히重大한 약점을 가지고 있습니다. 트랜스포머에서 파생된 LLM의 주목할 만한 특징인 주의 메커니즘은 추론과 훈련 중에 높은 계산 리소스가 필요하며, 시퀀스 길이와 관련하여 메모리와 FLOPs가 필요합니다. 이러한 높은 계산 요구는 트랜스포머 모델의 컨텍스트 길이를 제한하며, 자동 재생성 작업의 비용을比例적으로 증가시키고, 연속적인 데이터 스트림에서 학습하고 무제한 시퀀스 처리 능력을 방해합니다.
최근에, 상태 공간 모델(SSM)은 큰 규모의 벤치마크에서 트랜스포머 아키텍처 모델과 경쟁하며 시퀀스 길이와 관련하여 선형 시간 복잡도를 달성했습니다. 또한 최근 출시된 상태 공간 모델인 Mamba는 언어 모델링과 긴 시퀀스 처리 작업에서 훌륭한 성능을 보여주었습니다.同時に, 전문가 混合(MoE) 모델도 추론과 훈련의 지연과 계산 비용을 크게 줄이면서도 높은 성능을 보여주었습니다. Mamba와 MoE 모델을 기반으로, 본 문서에서는 BlackMamba라는 새로운 아키텍처에 대해 논의할 것입니다. BlackMamba는 Mamba 상태 공간 모델과 MoE 모델을 결합하여 두 프레임워크의 이점을 활용합니다. BlackMamba에 대한 실험에서는 기존의 Mamba 프레임워크와 트랜스포머 기준을超越하는 훈련 FLOPs와 추론 능력을 보여주었습니다. BlackMamba 프레임워크의卓越한 성능은 Mamba와 MoE 프레임워크의 능력을 효과적으로 결합하여, MoE의 빠르고 비용 효율적인 추론과 Mamba의 선형 복잡도 생성을 제공할 수 있습니다.
본 문서는 BlackMamba 프레임워크를 깊이 있게 다루고 있습니다. 우리는 프레임워크의 메커니즘, 방법론, 아키텍처 및 상태 오프 더 아트 이미지 및 비디오 생성 프레임워크와의 비교에 대해 탐구할 것입니다. 시작해 보겠습니다.
BlackMamba : 상태 공간 모델을 위한 전문가 混合 소개
대형 언어 모델(LLM)의 발전, 특히 디코더 전용 트랜스포머 아키텍처에서 xây dựng된 것은 자연어 처리(NLP) 영역과 강화 학습, 시계열 분석, 이미지 처리 등을 포함한 다양한 딥 러닝 응용 프로그램을 발전시키는 데 중요한 역할을 했습니다. 그러나 이러한 디코더 전용 트랜스포머 모델에서 구축된 LLM은 확장 가능성과 강력한 성능에도 불구하고 여전히重大한 약점을 가지고 있습니다. 트랜스포머에서 파생된 LLM의 주목할 만한 특징인 주의 메커니즘은 추론과 훈련 중에 높은 계산 리소스가 필요하며, 시퀀스 길이와 관련하여 메모리와 FLOPs가 필요합니다. 이러한 높은 계산 요구는 트랜스포머 모델의 컨텍스트 길이를 제한하며, 자동 재생성 작업의 비용을比例적으로 증가시키고, 연속적인 데이터 스트림에서 학습하고 무제한 시퀀스 처리 능력을 방해합니다.
최근 몇 년 동안, 상태 공간 모델(SSM)과 전문가 混合(MoE) 모델이 트랜스포머 아키텍처 모델의 대안으로 등장했습니다. 상태 공간 모델의 주요 이점은 트랜스포머 아키텍처 모델과 비교하여 시퀀스 길이와 관련하여 선형 계산 복잡도를 제공하는 것입니다. 이는 상태 공간 모델이 트랜스포머 아키텍처 모델보다 더 큰 시퀀스를 처리할 수 있으며, 자동 재생성 작업의 비용을 줄일 수 있습니다. 최근 개발된 상태 공간 모델인 Mamba와 RetNet은 효율적인 긴 시퀀스 추론과 훈련을 보여주었으며, 트랜스포머와 유사한 확장 특성을 가진 언어 모델링 작업에서 경쟁적인 성능을 보여주었습니다.另一方面, 전문가 混合(MoE) 모델은 추론과 훈련의 지연과 계산 비용을 크게 줄이면서도 높은 성능을 보여주었습니다.
이러한 아키텍처의 발전은 전통적인 트랜스포머와 비교하여 많은 이점을 제공하며, 더 나은 발전 방향을 제시합니다. 우리는 Mamba와 MoE 모델을 결합하여 BlackMamba라는 새로운 아키텍처를 제안합니다. BlackMamba는 Mamba 상태 공간 모델과 MoE 모델을 결합하여 두 프레임워크의 이점을 활용합니다. BlackMamba에 대한 실험에서는 기존의 Mamba 프레임워크와 트랜스포머 기준을超越하는 훈련 FLOPs와 추론 능력을 보여주었습니다.
BlackMamba : 아키텍처와 방법론
상태 공간 모델
상태 공간 모델은 시퀀스 길이와 관련하여 선형 계산 복잡도를 제공하는 모델입니다. 상태 공간 모델의 아키텍처는 트랜스포머 아키텍처와는 다르게, 재귀 신경망과 합성 신경망과 더 유사합니다. 상태 공간 모델은 연속적인 동적 시스템에서 영감을 받아, 1차원 함수를 암시적인 잠재 공간으로 매핑합니다. 선형 동적 시스템은 연관적 또는 합성 스캔을 사용하여 병렬 계산을 효율적으로 수행할 수 있습니다.
전문가 混合 모델
전문가 混合(MoE) 모델은 추론과 훈련의 지연과 계산 비용을 크게 줄이면서도 높은 성능을 보여주었습니다. 전문가 混合 모델은 토큰을 특정한 멀티 레이어 퍼셉트론(MLP) 전문가로 направляет. 이상적으로, 각 전문가는 특정한 입력을 처리하도록 설계되며, 라우팅 메커니즘은 각 토큰에 가장 적합한 전문가를 결정합니다. 이러한 접근법은 모델의 전체 매개변수 수와 비교하여 계산 비용을 줄이면서도 높은 성능을 유지할 수 있습니다.
아키텍처
BlackMamba는 표준 트랜스포머 모델을 사용하며, 멀티 레이어 퍼셉트론(MLP) 블록과 주의 블록이 순차적으로 추가됩니다. BlackMamba는 멀티 레이어 퍼셉트론 블록을 라우팅 전문가 레이어로 대체하며, 주의 레이어를 Mamba 상태 공간 모델 레이어로 대체합니다. BlackMamba 프레임워크의 아키텍처는 다음 그림에示されて 있습니다.
훈련과 데이터셋
BlackMamba 모델은 300억 토큰 이상의 데이터셋에서 훈련되며, SwiGLU 활성화 함수를 사용합니다. BlackMamba 프레임워크는 8개의 전문가를 사용하며, 이는 메모리 용량과 추론 비용 사이의 적절한 균형을 제공합니다. 사용된 데이터셋은 기존 오픈 소스 데이터셋의 혼합으로 구성되며, Starcoder, SlimPajama, Pile 등이 포함됩니다. 다음 표는 각 데이터셋의 가중치를示しています. 전체 데이터셋에는 1.8조 토큰이 있습니다.
BlackMamba : 결과
BlackMamba와 Mamba를 비교하기 위해, 두 모델은 동일한 훈련 매개변수와 동일한 훈련 데이터에서 훈련되었습니다. BlackMamba 프레임워크는 추론 시간과 훈련 FLOPs에서 Mamba와 트랜스포머 모델을超越했습니다. 다음 그림은 초기 1토큰 프롬프트에서 자동 재생성으로 시퀀스를 생성하는 시간을 시퀀스 길이의 함수로示しています.

さらに, BlackMamba 프레임워크는 전문가 混合과 Mamba 모델의 이점을 결합하여, 트랜스포머 모델, 순수한 Mamba 모델, 전문가 混합 모델과 비교하여 추론 시간을 크게 줄일 수 있습니다. 또한, BlackMamba 프레임워크의 추론 이점은 시퀀스 길이와 비례합니다. 다음 그림은 340백만과 640백만 매개변수를 가진 BlackMamba 모델에 할당된 토큰 수를示しています. 대부분의 레이어는 전문가 할당 문제를 해결하기 위한 개선된 Sinkhorn 알고리즘을 구현하여 높은 전문가 균형을 보여줍니다.

다음 표는 BlackMamba 프레임워크의 평가 점수를 다른 오픈 소스 사전 훈련 언어 모델과 비교하여示しています. BlackMamba 프레임워크는 대부분의 기준에서 경쟁하고超越하는 것을 보여줍니다. 또한, BlackMamba를超越하는 모델은 훨씬 더 많은 매개변수를 가지고 있으며, 성능 격차는 최소화되어 있습니다.

최종 생각
본 문서에서는 BlackMamba라는 새로운 아키텍처에 대해 논의했습니다. BlackMamba는 Mamba 상태 공간 모델과 전문가 混合 모델을 결합하여 두 프레임워크의 이점을 활용합니다. BlackMamba에 대한 실험에서는 기존의 Mamba 프레임워크와 트랜스포머 기준을超越하는 훈련 FLOPs와 추론 능력을 보여주었습니다. BlackMamba 프레임워크의卓越한 성능은 Mamba와 MoE 프레임워크의 능력을 효과적으로 결합하여, 전문가 混合의 빠르고 비용 효율적인 추론과 Mamba의 선형 복잡도 생성을 제공할 수 있습니다.












