AI 모델 및 플랫폼

유니모에: 전문가混合을 통한 통합 멀티모달 대규모 언어 모델 확장

mm
Unite.AI를 Google의 선호 소스에 추가

최근 멀티모달 대규모 언어 모델(MLLM)의 아키텍처와 성능에 대한 발전은 확장 가능한 데이터와 모델의 중요성을 강조했습니다. 이러한 접근 방식은 성능을 향상시키지만 훈련과 추론 프로세스에 상당한 계산 비용이 발생하여 실제 적용과 사용성이 제한됩니다. 여러 해에 걸쳐, 전문가 혼합(MoE) 모델은 효율적으로 이미지-텍스트 및 대규모 언어 모델을 확장하는 성공적인 대안 접근 방식으로 등장했습니다. 전문가 혼합 모델은 계산 비용이 크게 줄어들고 강력한 성능을 보입니다. 그러나 이러한 모델의 장점에도 불구하고, 대규모 언어 모델을 확장하는 데 иде적인 접근 방식은 아닙니다. 이는 전문가가 적고 모달리티가 제한적이기 때문입니다.

현재 접근 방식의 한계를 극복하고 대규모 언어 모델을 효율적으로 확장하기 위해, 이 기사에서는 전문가 혼합(MoE) 아키텍처를 사용하는 통합 멀티모달 대규모 언어 모델인 유니모에(Uni-MoE)에 대해 논의합니다. 유니모에 프레임워크는 다양한 모달리티와 전문가를 처리할 수 있는 능력을 갖추고 있습니다. 또한 유니모에 프레임워크는 대규모 언어 모델 내에서 전문가 혼합 아키텍처를 구현하여 훈련과 추론 프로세스를 더 효율적으로 만듭니다. 이를 위해 전문가 수준의 모델 병렬성과 데이터 병렬성을 사용합니다. 또한 일반화와 전문가 협력을 강화하기 위해, 유니모에 프레임워크는 세 가지 프로세スの 조합인 점진적 훈련 전략을 제시합니다. 첫째, 유니모에 프레임워크는 다양한 크로스 모달리티 데이터를 사용하여 크로스 모달리티 정렬을 달성합니다. 둘째, 유니모에 프레임워크는 크로스 모달리티 지침 데이터를 사용하여 모달리티별 전문가를 훈련하여 각 전문家的 전문성을 그들의 영역에서 향상시킵니다. 마지막으로, 유니모에 모델은 混합 멀티모달 지침 데이터에 대한 로라(Low-Rank Adaptation) 학습 기술을 구현하여 모델을 조정합니다.

이 기사는 유니모에 프레임워크를 깊이 다루고, 메커니즘, 방법론, 아키텍처 및 상태 오토 프레임워크와의 비교를 탐구합니다. 따라서 시작해 봅시다.

유니모에: 통합 멀티모달 대규모 언어 모델 확장

최근 몇 년 동안, 오픈소스 멀티모달 대규모 언어 모델(LLaMA, InstantBlip 등)의 발전은 이미지-텍스트 이해 작업에서 상당한 성공과 발전을 보여주었습니다. 또한 AI 커뮤니티는 전통적인 이미지-텍스트 패러다임을 넘어 이미지, 텍스트, 오디오, 비디오 등 다양한 모달리티를 수용할 수 있는 통합 멀티모달 대규모 언어 모델을 구축하기 위해 적극적으로 노력하고 있습니다. 오픈소스 커뮤니티에서 멀티모달 대규모 언어 모델의 능력을 향상시키기 위한 일반적인 접근 방식은 비전 기초 모델의 크기를 증가시키고, 이를 대규모 언어 모델과 통합하며, 다양한 멀티모달 데이터셋을 사용하여 지침 튜닝을 향상시키는 것입니다. 이러한 발전은 멀티모달 대규모 언어 모델이 여러 모달리티를 처리하고推論하는 능력이 증가하고 있음을 보여주며, 이는 멀티모달 지침 데이터와 모델 확장의 중요성을 강조합니다.

모델을 확장하는 것은 성과를 내는 검증된 접근 방식이지만, 훈련과 추론 프로세스에 상당한 계산 비용이 발생합니다.

계산 비용의 높은 오버헤드를 극복하기 위해, 오픈소스 커뮤니티는 대규모 언어 모델에서 전문가 혼합(MoE) 아키텍처를 통합하여 훈련과 추론 효율성을 향상시키고 있습니다. 멀티모달 대규모 언어 모델과 달리 모든 입력에 대해 모든 매개변수를 사용하여 밀도 계산 접근 방식을 사용하는 것과는 달리, 전문가 혼합 아키텍처는 각 입력에 대해 전문가 매개변수의 하위 집합만 활성화하므로 계산 비용을 줄입니다. 따라서 전문가 혼합 접근 방식은 모델 효율성을 향상시키는 가치 있는 경로로 나타납니다. 기존 연구는 텍스트 전용 및 텍스트-이미지 대규모 모델의 구축에서 전문가 혼합 모델의 성공적인 구현과 통합을 강조했습니다. 그러나 연구자들은 아직 통합 멀티모달 대규모 언어 모델을 구축하기 위한 전문가 혼합 아키텍처의 잠재력을 완전히 탐구하지 못했습니다.

유니모는 다양한 모달리티를 해석하고 관리하기 위해 전문가 혼합 모델을 사용하는 멀티모달 대규모 언어 모델입니다. 다음 이미지는 유니모 프레임워크가 모달리티별 인코더를 사용하여 다양한 모달리티의 인코딩을 얻고, 이러한 인코딩을 대규모 언어 모델의 언어 표현 공간으로 매핑하는 것을 보여줍니다. 이러한 커넥터는 훈련 가능한 트랜스포머 모델과 선형 투영을 포함하며, 고정된 인코더의 출력 표현을 증류하고 투영합니다. 유니모 프레임워크는 затем 대규모 언어 모델의 내부 블록에 전문가 혼합 계층을 도입합니다. 각 전문가 혼합 기반 블록에는 모든 모달리티에 걸쳐 공유되는 자체 주의 계층, 토큰 수준에서 전문성을 할당하는 희소 라우터 및 피드포워드 네트워크 기반의 다양한 전문가가 있습니다. 이러한 접근 방식으로 인해 유니모 프레임워크는 음성, 오디오, 텍스트, 비디오, 이미지 등 다양한 모달리티를 이해할 수 있으며, 추론 중에 부분 매개변수만 활성화하면 됩니다.

또한 전문가 협력과 일반화를 향상시키기 위해, 유니모 프레임워크는 세 단계 훈련 전략을 구현합니다. 첫 번째 단계에서, 프레임워크는 언어 모델의 언어 공간에서 통일된 모달리티 표현을 사용하여 커넥터를 훈련합니다. 두 번째 단계에서, 유니모 모델은 크로스 모달리티 데이터셋을 사용하여 모달리티별 전문가를 훈련하여 각 전문家的 전문성을 향상시킵니다. 세 번째 단계에서, 유니모 프레임워크는 이러한 훈련된 전문가를 전문가 혼합 계층에 통합하고, 混합 멀티모달 지침 데이터를 사용하여 전체 유니모 프레임워크를 훈련합니다. 훈련 비용을进一步 줄이기 위해, 유니모 프레임워크는 자체 주의 계층과 사전 훈련된 전문가를 미세 조정하기 위해 로라 학습 접근 방식을 사용합니다.

유니모: 방법론 및 아키텍처

유니모 프레임워크의 기본 동기는 멀티모달 대규모 언어 모델의 훈련과 추론 비용이 높고, 전문가 혼합 모델의 효율성입니다. 또한 전문가 혼합 아키텍처를 사용하여 효율적이고 강력한 통합 멀티모달 대규모 언어 모델을 구축하는 가능성을 탐구합니다. 다음 그림은 유니모 프레임워크의 아키텍처를 보여주며, 이는 다양한 모달리티에 대한 개별 인코더와 해당 모달리티 커넥터를 포함합니다.

유니모 프레임워크는 затем 전문가 혼합 아키텍처를 대규모 언어 모델 블록과 통합합니다. 이는 훈련과 추론 프로세스의 효율성을 향상시키기 위한 중요한 단계입니다. 유니모 프레임워크는 희소 라우팅 메커니즘을 구현하여 이를 달성합니다. 유니모 프레임워크의 전체 훈련 프로세스는 세 단계로 나뉩니다: 크로스 모달리티 정렬, 모달리티별 전문가 훈련, 및 混합 멀티모달 지침 데이터셋을 사용하여 유니모 조정. 다양한 모달 입력을 언어 형식으로 변환하기 위해, 유니모 프레임워크는 사전 훈련된 비주얼 언어 프레임워크인 LLaVA를 기반으로 구축됩니다. LLaVA 기본 모델은 CLIP을 시각 인코더로 사용하며, 이미지 특징을 소프트 이미지 토큰으로 변환하는 선형 투영 레이어를 포함합니다. 또한 비디오 콘텐츠를 처리하기 위해, 유니모 프레임워크는 각 비디오에서 8개의 대표 프레임을 선택하고, 평균 풀링을 통해 이러한 프레임을 비디오 토큰으로 변환합니다. 오디오 작업을 위해, 유니모 프레임워크는 두 개의 인코더(BEATs 및 Whisper 인코더)를 사용하여 특징 추출을 향상시킵니다. 모델은 오디오 특징 벡터와 고정 길이 음성을 증류하고, 선형 투영 레이어를 통해 음성 토큰과 소프트 오디오로 매핑합니다.

훈련 전략

유니모 프레임워크는 모델의 점진적 개발을 위한 훈련 전략을 도입합니다. 이 훈련 전략은 다양한 전문家的 고유한 능력을 활용하고, 전문가 협력 효율성을 향상시키며, 프레임워크의 일반화를 강화하기 위해 시도합니다. 훈련 프로세스는 세 단계로 나뉩니다: 크로스 모달리티 정렬, 모달리티별 전문가 훈련, 및 混합 멀티모달 지침 데이터셋을 사용하여 유니모 조정.

단계 1: 크로스 모달리티 정렬

첫 번째 단계에서, 유니모 프레임워크는 다양한 모달리티와 언어 간의 연결을 설정하려고 합니다. 유니모 프레임워크는 커넥터를 구축하여 이를 달성합니다. 첫 번째 훈련 단계의 주요 목표는 생성 엔트로피 손실을 최소화하는 것입니다.유니모 프레임워크 내에서, 언어 모델은 다양한 모달리티의 입력에 대한 설명을 생성하도록 최적화되며, 모델은 커넥터만을 훈련합니다. 이는 유니모 프레임워크가 다양한 모달리티를 통합 언어 프레임워크 내에서 통합할 수 있도록 합니다.

단계 2: 모달리티별 전문가 훈련

두 번째 단계에서, 유니모 프레임워크는 모달리티별 전문가를 개발하는 데 중점을 둡니다. 모델은 모달리티별 전문가를 크로스 모달리티 데이터셋을 사용하여 훈련합니다. 주요 목표는 각 전문家的 전문성을 향상시키며, 전문가 혼합 시스템의 전체 성능을 향상시키는 것입니다. 또한 유니모 프레임워크는 피드포워드 네트워크를 모달리티의 특성과 더密接하게 일치시키기 위해 조정합니다. 생성 엔트로피 손실을 핵심 메트릭으로 사용하여 훈련합니다.

단계 3: 유니모 조정

세 번째이자 마지막 단계에서, 유니모 프레임워크는 두 번째 훈련 단계에서 전문가가 조정한 가중치를 전문가 혼합 계층에 통합합니다. 유니모 프레임워크는 混합 멀티모달 지침 데이터를 사용하여 混합 언어 모델을 미세 조정합니다. 다음 이미지는 훈련 프로세스의 진행 상황을 반영하는 손실 곡선을 보여줍니다.

전문가 혼합 구성의 비교 분석은 두 번째 훈련 단계에서 모델이 전문가를 미세 조정한 후, 混합 멀티모달 데이터셋에서 안정성과 수렴 속도가 향상된다는 것을 보여주었습니다. 또한 텍스트, 이미지, 오디오, 비디오 등 복잡한 멀티모달 데이터를 포함하는 작업에서, 유니모 프레임워크는 4개의 전문가를 사용할 때 2개의 전문가를 사용할 때보다 더 일관된 훈련 성능과 손실 변동성을 감소시켰습니다.

유니모: 실험 및 결과

다음 표는 유니모 프레임워크의 아키텍처 사양을 요약합니다. 유니모 프레임워크의 주요 목표는 LLaMA-7B 아키텍처를 기반으로 모델 크기를 확장하는 것입니다.

다음 표는 유니모 프레임워크의 설계와 최적화를 보여주며, 이는 전문가 混합 아키텍처를 사용하여 모델의 능력을 향상시키는 데 도움이 됩니다. 이러한 작업은 MLP 계층의 능력을 향상시키는 데 중요하며, 이러한 전문 지식을 모델 성능을 향상시키기 위해 활용합니다. 유니모 프레임워크는 8개의 단일 모달리티 전문가 작업을 수행하여 다양한 훈련 방법론의 차이점을 강조합니다.

모델은 다양한 벤치마크에 대한 다양한 모델 변형의 성능을 평가하며, 이는 2개의 비디오 이해, 3개의 오디오 이해, 5개의 음성 관련 작업을 포함합니다. 먼저 모델은 음성-이미지 및 음성-텍스트 작업을 이해하는 능력에 대해 테스트되며, 결과는 다음 표에 포함됩니다.

기존 기준 모델은 음성 이해 작업에서 열등한 결과를 보여주며, 이는 이미지-음성 추론 작업의 성능에도 영향을 미칩니다. 결과는 전문가 混합 아키텍처를 도입함으로써 混합 멀티모달 데이터셋에서 일반화를 향상시킬 수 있음을 나타냅니다. 다음 표는 이미지-텍스트 이해 작업에 대한 실험 결과를 보여줍니다. 유니모 모델의 최고 결과는 기준선을 평균 4점으로超过합니다.

최종 생각

이 기사에서, 우리는 전문가 混합 아키텍처를 사용하는 통합 멀티모달 대규모 언어 모델인 유니모에 대해 논의했습니다. 유니모 프레임워크는 대규모 언어 모델 내에서 전문가 混합 아키텍처를 구현하여 훈련과 추론 프로세스를 더 효율적으로 만듭니다. 또한 일반화와 전문가 협력을 향상시키기 위해, 유니모 프레임워크는 세 가지 프로세스의 조합인 점진적 훈련 전략을 제시합니다. 첫째, 유니모 프레임워크는 다양한 크로스 모달리티 데이터를 사용하여 크로스 모달리티 정렬을 달성합니다. 둘째, 유니모 프레임워크는 크로스 모달리티 지침 데이터를 사용하여 모달리티별 전문가를 훈련하여 각 전문家的 전문성을 향상시킵니다. 마지막으로, 유니모 모델은 混합 멀티모달 지침 데이터에 대한 로라 학습 기술을 구현하여 모델을 조정합니다.

전문직으로서의 엔지니어, 마음으로서의 작가입니다. Kunal은 AI와 ML에 대한 깊은 사랑과 이해를 가진 기술 작가로, 이러한 분야의 복잡한 개념을 흥미롭고 정보적인 문서를 통해 단순화하는데 헌신하고 있습니다.