AI 모델 및 플랫폼
MoE-LLaVA: 전문가混合모델을 이용한 대규모 비전언어모델의 확장
최근의 대규모 비전언어모델(LVLM)의 발전은 이러한 프레임워크의 성능을 크게 향상시킨다는 것을 보여주었습니다. LVLM, 즉 MiniGPT, LLaMA 등은 시각적 투영 레이어와 이미지 인코더를 아키텍처에 통합하여卓越한 능력을 발휘했습니다. 이러한 구성 요소를 구현함으로써 LVLM은 대규모 언어 모델(LLM)의 시각적 인식 능력을 향상시킵니다. 성능을进一步 향상시키기 위해 모델의 크기와 매개변수의 수를 증가시키고 데이터셋의 규모를 확대할 수 있습니다.
InternVL과 같은 모델은 이미지 인코더를 60억 매개변수 이상으로 확장했으며, 다른 모델은 LVLM의 백엔드를 130억 매개변수로 확장하여 다양한 작업에서卓越한 성능을 달성했습니다. IDEFICS는 800억 매개변수 이상의 LVLM을 훈련했습니다. 이러한 확장 방법은 340억, 700억, 또는 1,000억 매개변수 이상의 매개변수로 사전 훈련된 LLM의 성능과 일치하거나 초과했습니다. 그러나 확장은 단점이 있습니다. 훈련 및 추론 비용을 크게 증가시킵니다. 이는 모든 매개변수가 계산의 각 토큰에 활성화되어야 하므로 높은 계산需求과 따라서 높은 비용이 발생하기 때문입니다.
이 기사에서는 MoE-LLaVA, 즉 전문가混合모델(MoE) 기반의 희소한 LVLM 아키텍처에 대해 논의합니다. MoE-LLaVA는 LVLM을 위한 효과적인 훈련 전략인 MoE-Tuning을 사용합니다. MoE-Tuning은 다중 모드 희소성 학습에서 성능 저하를 혁신적으로 해결하여 매개변수의 수가 많지만 훈련 및 추론 비용이 일관된 모델을 생성합니다. MoE-LLaVA 아키텍처는 배포 중에 최상위 전문가만 활성화하고 나머지 전문가를 비활성화하도록 설계되었습니다.
MoE-LLaVA 프레임워크를 살펴보겠습니다. 그 메커니즘, 방법론, 아키텍처, 그리고 주요 이미지 및 비디오 생성 프레임워크와의 비교를 살펴보겠습니다.
MoE-LLaVA: 대규모 비전언어모델을 경제적으로 확장
대규모 비전언어모델은 시각적 투영 레이어와 이미지 인코더를 사용하여 모델의 크기를 증가시킵니다. MiniGPT-4, InternGPT, InternVL 등은 이러한 접근 방식을 사용하여 성능을 향상시켰습니다. 실제 응용 프로그램에서 높은 품질의 훈련 데이터를 사용하여 대규모 언어 모델 또는 대규모 비전언어모델을 확장하는 것은 모델의 성능을 향상시키기 위해 종종 필요합니다. 그러나 모델의 크기를 확장하면 훈련 및 추론 비용이 증가하고, 모델을 병렬 장치에서 동시에 배포하는 복잡성과 효율성이 증가합니다. 이러한 비용과 계산 요구의 주요 이유는 모델 내의 모든 매개변수가 각 토큰에 대해 계산을 요구하기 때문입니다.
반면에, 희소한 MoE 또는 전문가混合모델은 데이터를 고정된 활성화 매개변수로 처리하여 프레임워크를 확장하는 효과적인 접근 방식을 보여주었습니다. 그러나 LLM을 직접 희소한 LVLM으로 변환하는 것은 어려울 수 있습니다. MoE-LLaVA 프레임워크는 이러한 문제를 해결하기 위해 MoE-Tuning이라는 3단계 훈련 전략을 도입했습니다.

위의 그림에서 볼 수 있듯이, MoE-Tuning 프로세스는 첫 번째 단계에서 다중층 퍼셉트론(MLP)을 사용하여 시각적 토큰을 대규모 언어 모델에 적응시킵니다. 두 번째 단계에서 프레임워크는 전체 매개변수를 훈련하여 대규모 비전언어모델에 일반적인 다중 모드 이해 능력을 제공합니다. 세 번째 단계에서 프레임워크는 전문가 초기화 가중치를 위해 FFN(피드 포워드 네트워크)을 복제하고, 전문가混合레이어만 훈련합니다. 전반적인 훈련 프로세스는 LVLM 초기화에서 희소한 전문가混合모델로의渐进적인 전환을 도와줍니다.
MoE-LLaVA 모델은 다중 희소 경로로 구성되며, 프레임워크는 이러한 경로를 사용하여 각 토큰을 서로 다른 전문가에게 할당합니다. 토큰은 활성화된 전문가에 의해 집합적으로 처리되며, 비활성 경로는 침묵합니다. 프레임워크는 전문가混合인코더 레이어를 반복적으로 쌓아 더 큰 및 더 강력한 LVLM을 위한 희소한 경로를 제공합니다.

MoE-LLaVA 프레임워크는 활성화된 매개변수의 수와 유사한 모델을 능가하며, POPE 오브젝트 환상 벤치마크에서 큰 차이로卓越한 성능을 보여줍니다. 또한, MoE-LLaVA 프레임워크는 2.2억 매개변수를 사용하여 InternVL-Chat-19B 프레임워크와 비교하여 약 8배의 활성화된 매개변수를 사용하여 유사한 성능을 달성합니다.
강력한 대규모 언어 모델은 일반화 및 지시 능력과 함께 대규모 비전언어모델에 구현되었습니다. 초기 LLM인 BLIP은 시각적 신호를 시퀀스로 변환하여 다중 레이어를 사용하여 성공적으로 시각을 언어 모델에 적응시켰습니다. 최근 연구에서는 지시 데이터셋을 확장하고, 이미지 해상도를 증가시키고, 훈련 전략을 최적화하고, 입력을 정렬하고, 이미지 인코더를 향상시키는 등 모델의 성능을 향상시키기 위한 방법을 구현했습니다. 이러한 접근 방식은 시각적 이해 능력을 강화하여 대규모 비전언어모델을 강력하게 만듭니다. 그러나 이러한 모델을 확장하는 데 따른 계산 비용은 종종 매우 높습니다. MoE-LLaVA 프레임워크는 이러한 문제를 해결하기 위해 MoE 모델의 능력을 활용하여 대규모 비전언어모델 연구를 더 경제적으로 만듭니다.
MoE-LLaVA: 방법론 및 아키텍처
MoE-LLaVA 프레임워크의 핵심에는 시각적 투영 레이어, 비전 인코더, MoE 블록, 다중 스택된 LLM 블록, 및 단어 임베딩 레이어가 있습니다.

아키텍처
다음 표는 MoE-LLaVA 프레임워크의 자세한 구성입니다.

RGB 이미지의 경우, 비전 인코더는 이미지에서 시각적 토큰 시퀀스를 얻기 위해 처리합니다. 시각적 투영 레이어는 시각적 토큰 시퀀스를 입력 이미지에 매핑합니다. 텍스트 입력은 단어 임베딩 레이어에 의해 처리되어 시퀀스 토큰을 얻습니다.同時に, MoE-LLaVA 프레임워크는 텍스트 및 시각적 토큰을 연결하고, 이를 LLM에 공급합니다. 그러나 프레임워크는 시각적 투영 레이어만 대규모 언어 모델과 함께 훈련하며, FFN 또는 피드 포워드 네트워크와 다중 헤드 셀프 어텐션 레이어로 구성됩니다. 마지막으로, 프레임워크는 각 블록에 잔차 연결과 레이어 정규화를 적용합니다.
続けて, MoE-LLaVA 프레임워크는 FFN 또는 피드 포워드 네트워크를 복제하여 전문가 앙상블을 초기화합니다. 라우터는 선형 레이어로, 각 토큰이 각 전문가에 할당될 확률을 예측합니다. 각 토큰은 최대 확률을 가진 상위 k개의 전문가에 의해 처리되며, 가중 합은 라우터의 확률에 기반한 소프트맥스 결과에 따라 계산됩니다.
MoE-Tuning
MoE-Tuning은 3단계 훈련 전략으로, 첫 번째 단계에서 다중층 퍼셉트론을 사용하여 시각적 토큰을 대규모 언어 모델에 적응시킵니다. 두 번째 단계에서 프레임워크는 전체 매개변수를 훈련하여 대규모 비전언어모델에 일반적인 다중 모드 이해 능력을 제공합니다. 세 번째 단계에서 프레임워크는 전문가 초기화 가중치를 위해 FFN을 복제하고, 전문가混合레이어만 훈련합니다.
단계 1
첫 번째 단계에서는 이미지 토큰을 대규모 언어 모델에 적응시키는 것이 주 목표입니다. MoE-LLaVA 프레임워크는 다중층 퍼셉트론을 사용하여 이미지 토큰을 언어 모델의 입력 도메인에 투영하고, 이미지 패치를 가상 텍스트 토큰으로 처리합니다. 이 단계에서 MoE-LLaVA 프레임워크는 언어 모델을 이미지에 대한 설명을 하도록 훈련하며, 이 단계에서는 LLM에 MoE 레이어를 적용하지 않습니다.
단계 2
두 번째 단계에서 MoE-LLaVA 프레임워크는 다중 모드 지시 데이터를 사용하여 모델의 능력과 제어 가능성을 향상시키려고 합니다. MoE-LLaVA 프레임워크는 텍스트 인식 및 논리적 이미지 추론과 같은 더 복잡한 지시를 사용하여 LLM을 다중 모드 이해 능력을 갖춘 LVLM으로 변환합니다. 전통적으로, 이 단계에서 다중 모드 이해 능력을 갖춘 모델의 훈련이 완료됩니다. 그러나 MoE-LLaVA 프레임워크는 LLM을 LVLM으로 변환하는 과정에서 희소성을 동시에 적용하는 데 어려움을遇했습니다. 이러한 어려움을 해결하기 위해 프레임워크는 두 번째 단계의 가중치를 다음 단계의 초기화로 사용하여 희소 모델의 학습 어려움을 완화하려고 합니다.
단계 3
세 번째 단계에서 모델은 피드 포워드 네트워크를 여러 번 복제하여 전문가 초기화를 수행합니다. 프레임워크는 텍스트 및 이미지 토큰을 전문가混合레이어에 공급하고, 라우터는 토큰과 전문가 간의 일치하는 가중치를 계산합니다. 각 토큰은 최대 확률을 가진 상위 k개의 전문가에 의해 처리되며, 가중 합은 라우터의 확률에 기반한 소프트맥스 결과에 따라 계산됩니다. 최상위 전문가가 활성화되면 모델은 나머지 전문가를 비활성화합니다. 이러한 접근 방식은 MoE-LLaVA 프레임워크에 무한한 희소 경로를 제공하여 모델에 광범위한 능력을 제공합니다.
MoE-LLaVA: 결과 및 실험
MoE-LLaVA 프레임워크는 CLIP-Large를 비전 인코더로 사용하며, 다중층 퍼셉트론은 2개의 레이어로 구성되며, GELU 활성화 레이어가 두 레이어 사이에 있습니다. 기본적으로, 프레임워크는 피드 포워드 네트워크와 전문가混合레이어의 교대 사용을 사용합니다. 즉, 전문가混合레이어는 총 레이어의 50%를 구성합니다. 다음 표에는 MoE-LLaVA 프레임워크를 훈련 및 평가하기 위해 사용된 다양한 데이터셋과 샘플 크기가 포함되어 있습니다.

제로샷 이미지 질문 답변
다음 그림은 MoE-LLaVA가 소프트 라우터를 기반으로 하는 LVLM의 희소 모델임을 보여줍니다. 프레임워크는 5개의 이미지 질문 답변 벤치마크에서 평가되었으며,卓越한 이미지 이해 능력을 보여주며, 5개의 벤치마크에서 LLaVA 1.5 프레임워크와 비교하여 유사한 성능을 제공합니다.

오브젝트 환상 평가
오브젝트 환상을 평가하기 위해 MoE-LLaVA 프레임워크는 POPE 평가 파이프라인을 사용합니다. 결과는 다음 표에示されて 있습니다. 모든 프레임워크 중에서 MoE-LLaVA가 가장 강력한 결과를 보여주며, 입력 이미지와 일관된 오브젝트를 생성하는 능력을 나타냅니다. 또한, MoE-LLaVA 프레임워크는_yes 비율을 잘 균형합니다. 이는 희소 모델이 주어진 질문에 대한 정확한 피드백을 제공하는 능력을 나타냅니다.

다음 이미지는 전문가 로딩의 분포를 보여줍니다. 불연속선은 모달리티 또는 전문가 간의 토큰의 균형된 분포를 나타냅니다. 첫 번째 그림은 전문가 내의 작업량을示します. 나머지 이미지는 다양한 모달리티에 대한 전문가의 성능을示합니다.

さらに, 다음 그림은 다양한 전문가 간의 모달리티의 분포를示します.

최종 생각
이 기사에서 우리는 MoE-LLaVA, 즉 전문가混合모델을 사용하여 대규모 비전언어모델을 확장하는 방법에 대해 논의했습니다. MoE-LLaVA 모델은 다중 희소 경로로 구성되며, 프레임워크는 이러한 경로를 사용하여 각 토큰을 서로 다른 전문가에게 할당합니다. 토큰은 활성화된 전문가에 의해 집합적으로 처리되며, 비활성 경로는 침묵합니다. MoE-LLaVA 프레임워크는 전문가混合인코더 레이어를 반복적으로 쌓아 더 큰 및 더 강력한 LVLM을 위한 희소한 경로를 제공합니다. MoE-Tuning 전략은 다중 모드 희소성 학습에서 성능 저하를 혁신적으로 해결하여 매개변수의 수가 많지만 훈련 및 추론 비용이 일관된 모델을 생성합니다. MoE-LLaVA 프레임워크의 아키텍처는 배포 중에 최상위 전문가만 활성화하고 나머지 전문가를 비활성화하도록 설계되었습니다.












