AI 모델 및 플랫폼
이글: 다중 인코더를 사용한 멀티모달 대규모 언어 모델의 디자인 공간 탐색
멀티모달 대규모 언어 모델(MLLM)의 복잡한 시각 정보 해석 능력은 중요한 연구 분야입니다. 최근 연구에 따르면, 강화된 시각 인식은 환각을 줄이고 문서 분석과 같은 해상도 민감한 작업의 성능을 향상시킵니다. 여러 최근의 MLLM은 다중 인코더를 사용하여 이를 달성합니다. 그러나 이러한 접근 방식의 체계적인 비교와 자세한 절단 연구는 전문가 선택과 다중 인코더 통합과 같은 중요한 측면에서 부족합니다. 이 기사에서는 다중 인코더와 해상도를 사용한 MLLM의 디자인 공간에 대한 광범위한 탐색을 제공합니다. 이글 프레임워크는 다중 인코더를 사용하여 멀티모달 대규모 언어 모델의 디자인 공간을 탐색하려고 시도합니다. 발견된 내용은 다양한 기존 전략에 공통되는 몇 가지 기본 원칙을 보여주며, 간결하지만 효과적인 디자인 접근 방식을 제공합니다. 이글은 단순히 보충적인 다중 인코더의 시각 토큰을 연결하는 것이 더 복잡한 혼합 아키텍처나 전략만큼 효과적임을 발견했습니다. 또한, 이글은 언어 토큰과 시각 집중 인코더 간의 간격을 메우기 위해 사전 정렬을 도입하여 모델의 일관성을 향상시킵니다. 결과적으로 생성된 MLLM 이글은 주요 MLLM 벤치마크에서 다른 주요 오픈소스 모델을 초과합니다.
이글의 연구는 멀티모달 대규모 언어 모델(MLLM)의 일반적인 아키텍처 디자인과 관련이 있습니다. 이전에 언급된 대표적인 오픈소스 연구 외에도 다른 주목할만한 MLLM 패밀리는 MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini, Llama 3.1 등을 포함합니다. 시각 신호가 언어 모델에 통합되는 방식에 따라 MLLM은 크로스 모달 주의 모델과 프리픽스 튜닝 모델로 나눌 수 있습니다. 전자는 언어 모델의 다양한 레이어에서 시각 정보를 주입하는 반면, 후자는 시각 토큰을 언어 토큰 시퀀스의 일부로 취급하고 직접 텍스트 임베딩과 함께 附加합니다. 이글 모델은 LLaVA 스타일의 멀티모달 아키텍처를 따르는 프리픽스 튜닝 패밀리입니다.
이글의 연구는 MLLM을 위한 시각 인코더 디자인 개선에 중점을 둔 연구와密接 관련되어 있습니다. 초기 연구에서는 일반적으로 CLIP 및 EVA-CLIP과 같은 시각-언어 정렬 작업에서 사전 훈련된 시각 인코더를 채택했습니다. 시각-언어 작업을 개선하기 위해 더 나은 디자인, 더 큰 모델 크기 및 더 효과적인 훈련 레시피를 갖춘 더 강력한 시각 인코더인 SigLIP 및 InternVL이 제안되었습니다. 모델이 일반적으로 저해상도 이미지에서 사전 훈련되고 미세한 세부를 인코딩할 수 없는 경우가 많기 때문에, 더 높은 해상도 적응은 일반적으로 MLLM 입력 해상도를 증가시키기 위해 수행됩니다. 더 높은 해상도 적응 외에도 LLaVA-NeXT, LLaVA-UHD, Monkey, InternLM-XComposer 및 InternVL과 같은 모델은 이미지 처리를 위해 타일링 또는 적응 타일링을 사용합니다. 이러한 접근 방식은 추가 시각 전문가를 도입하여 더 높은 해상도를 처리할 수 있게 하지만, 타일링 기술과 다소 다르지만, 둘 다 호환 가능하며 결합할 수 있습니다.
이글: 다중 인코더를 사용한 멀티모달 대규모 언어 모델의 디자인 공간 탐색
대규모 언어 모델(LLM)의 성공은 시각 인식 능력을 활성화하여 실제 세계에서 볼 수 있게 하고, 이해하고, 추론할 수 있도록 하는 데 관심을 집중시켰습니다. 이러한 멀티모달 대규모 언어 모델(MLLM)의 핵심에는 일반적으로 이미지에서 시각 토큰을 생성하고 텍스트 임베딩과 함께 附加하는 디자인으로 구성된 시각 인코더가 있습니다. CLIP은 일반적으로 시각 인코더로 선택되며, 시각 표현이 텍스트 공간과 사전 훈련된 이미지-텍스트 쌍으로 정렬되기 때문입니다. 아키텍처, 훈련 레시피 및 시각 토큰이 언어 모델에 주입되는 방식에 따라 주목할만한 MLLM 패밀리는 Flamingo, BLIP, PaLI, PaLM-E 및 LLaVA를 포함합니다. 이러한 모델은 일반적으로 상대적으로 낮은 입력 해상도를 유지하며, 이는 사전 훈련된 시각 인코더 및 LLM 시퀀스 길이의 제한으로 인해 발생합니다. 이글의 연구는 다중 시각 인코더를 사용하여 개선된 인식을 사용하는 모델과密接 관련되어 있습니다. Mini-Gemini 및 LLaVA-HR은 고해상도 시각 특징을 저해상도 시각 토큰으로 융합하는 것을 제안합니다.
예를 들어, Mousi 및 Brave와 같은 모델은 다양한 시각 인코더에서 시각 토큰을 채널 또는 토큰 방향으로 연결합니다. RADIO는 다중 교사 증류 방법을 사용하여 다양한 시각 인코더의 능력을 단일 모델로 통일합니다. MoAI, IVE 및 Prismer는 OCR, 감지 또는 깊이 추정과 같은 시각 전문가의 출력을 사용하여 추가 정보를 제공합니다. MoVA는 주어진 이미지 및 지침에 따라 최적의 시각 모델을 할당하기 위한 라우팅 네트워크를 설계합니다.
최근 연구에 따르면, 더 강력한 시각 인코더 디자인은 MLLM의 환각을 줄이고 OCR과 같은 해상도 민감한 작업의 성능을 향상시키는 데 중요합니다. 몇몇 연구는 시각 인코더의 능력을 향상시키는 데 중점을 두고 있으며, 이는 사전 훈련 데이터 및 매개변수를 확대하거나 이미지의 저해상도 패치로 나누는 것을 포함합니다. 그러나 이러한 접근 방식은 일반적으로大量의 훈련 자원을 필요로 합니다. 효율적이면서 강력한 전략은 다양한 작업 및 입력 해상도에서 사전 훈련된 시각 인코더를 혼합하는 것입니다. 이러한 “시각 전문가 混合” 접근 방식은 효과적임이 입증되었습니다. 그러나 이러한 디자인 공간에 대한 자세한 연구 및 엄격한 절단은 여전히 부족합니다. 주요 질문은 다음과 같습니다. 어떤 시각 인코더 조합을 선택해야 합니까? 어떻게 다른 전문가를 융합해야 합니까? 어떻게 다중 시각 인코더와 함께 훈련 전략을 조정해야 합니까?
이러한 질문에 답하기 위해, 이글은 시각 인코더 混合 디자인 공간을 체계적으로 조사합니다. 이 디자인 공간의 탐색에는 다음 단계가 포함됩니다. 1) 다양한 시각 인코더 벤치마크 및 더 높은 해상도 적응 검색, 2) 시각 인코더 융합 전략 간의 “사과와 사과” 비교, 3) 다중 시각 인코더의 최적 조합 식별, 4) 시각 전문가 사전 정렬 및 데이터 混合 개선.

이글의 연구는 다양한 작업 및 해상도에서 사전 훈련된 시각 인코더의 성능을 다룹니다. 라운드 로빈 접근 방식을 사용하여, 이글은 기본 CLIP 인코더에서 시작하여 각 라운드에서 가장 좋은 성능을 제공하는 추가 전문가를 선택합니다.
이글의 연구는 다중 시각 인코더를 사용하는 MLLM의 첫 번째 연구는 아니지만, 체계적인 연구는 몇 가지 주요 발견을 이끌어냅니다.
- MLLM 훈련 중에 시각 인코더를 잠금 해제하는 것이 중요합니다. 이는 LLaVA 및 기타 모델과 달리, 시각 인코더를 일반적으로 동결하는 관행과 대조됩니다.
- 몇몇 최근에 제안된 융합 전략은显著한 이점을 보여주지 않습니다. 대신, 직접 채널 연결은 간단하지만 경쟁력 있는 융합 전략으로 나타납니다.
- 추가 시각 전문가를 통합하면 일관된 이점이 있습니다. 이는 단일 인코더를 확대하는 것 외에도 MLLM 인식을 체계적으로 향상시키는 데 약속하는 경로입니다. 시각 인코더를 잠금 해제할 때 이러한 개선은 특히 두드러집니다.
- 사전 정렬 단계는 중요합니다. 이글은 동결된 LLM과 함께 개별적으로 미세 조정된 비 텍스트 정렬 시각 전문가의 사전 정렬 단계를 도입합니다. 이 단계는 MLLM 성능을显著하게 향상시킵니다.
이글: 방법론 및 아키텍처
이전의 방법과 달리, 이글의 목표는 다중 시각 인코더를 융합하기 위한 최소한의 디자인을 식별하는 것입니다. 이글은 기본 CLIP 인코더를 다양한 아키텍처, 사전 훈련 작업 및 해상도를 갖춘 시각 전문가 집합으로 확장합니다. 이러한 전문가와 함께, 이글은 다양한 융합 아키텍처 및 방법을 비교하고 다중 인코더와 함께 훈련 전략을 최적화하는 방법을 탐색합니다.

이글은 모든 발견을 결합하고 다중 시각 인코더와 다양한 해상도 및 도메인 지식을 갖춘 접근 방식을 확장합니다. LLaVA-1.5와 동일한 사전 훈련 데이터를 사용하여, 이글은 595k 이미지-텍스트 쌍으로 구성된 데이터에서 시작합니다. 이후, 이글은 지도 미세 조정 데이터를 수집하여 멀티모달 대화로 변환합니다.
모델은 이미지-텍스트 쌍으로 구성된 데이터에서 1 에포크 동안 배치 크기 256으로 사전 훈련됩니다. 이때, 전체 모델은 동결되고, 프로젝터 레이어만 업데이트됩니다. 두 번째 단계에서, 모델은 지도 미세 조정 데이터에서 1 에포크 동안 배치 크기 128으로 미세 조정됩니다. 이글은 Vicuna-7B를 기본 언어 모델로 사용합니다. 학습률은 첫 번째 단계에서 1e-3, 두 번째 단계에서 2e-5로 설정됩니다.
더 강력한 CLIP 인코더
이글은 CLIP 모델에서 시작합니다. CLIP 모델은 많은 MLLM에서 주요 선택으로 사용됩니다. CLIP 모델은 멀티모달 작업을 향상시키는 것으로 알려져 있지만, 그 한계도 잘 문서화되어 있습니다. 예를 들어, 많은 기존 MLLM은 CLIP의 사전 훈련된 해상도(예: 224 × 224 또는 336 × 336)를 입력 해상도로 사용합니다. 이러한 경우, 인코더는 일반적으로 OCR 및 문서 이해와 같은 해상도 민감한 작업에 중요한 미세한 세부를 캡처하는 데 어려움을 겪습니다.

입력 해상도를 증가시키기 위한 일반적인 접근 방식은 타일링입니다. 여기서 입력 이미지는 타일로 나누어지며 개별적으로 인코딩됩니다. 더 간단한 방법은 입력 해상도를 직접 확대하고 필요에 따라 비전 트랜스포머 모델의 위치 임베딩을 보간하는 것입니다. 이글은 이러한 두 가지 접근 방식을 동결 및 미동결된 시각 인코더와 다양한 해상도에서 비교합니다.
이글: 실험 및 결과
이글은 다중 시각 인코더와 다양한 해상도 및 도메인 지식을 갖춘 접근 방식을 확장합니다. 이글은 Vicuna-v1.5-7B, Llama3-8B 및 Vicuna-v1.5-13B를 언어 모델로 사용합니다. 시각 인코더의 경우, 섹션 2.6의 결과에 따라, 이글 모델은 Eagle-X4 및 Eagle-X5로 표시됩니다.
시각 질문 답변 작업
이글은 세 가지 시각 질문 답변 벤치마크(GQA, VQAv2 및 VizWiz)에서 모델을 비교합니다. 아래 표에 표시된 대로, Eagle-X5는 GQA 및 VQAv2에서 최첨단 성능을 달성합니다.

OCR 및 차트 이해 작업
이글은 OCRBench, TextVQA 및 ChartQA에서 모델을 벤치마크합니다. 위의 표에 표시된 대로, 이글은 TextVQA에서 경쟁자들을 크게 앞섭니다.
아래 그림은 OCR 및 문서 이해 예시를 보여줍니다. 고해상도 적응 및 다중 시각 전문가 통합을 통해, 이글은 이미지 내的小한 텍스트를 식별하고 사용자 지침에 따라 정보를 정확하게 추출할 수 있습니다.

멀티모달 벤치마크 평가
이글은 MLLM의 다양한 벤치마크에서 모델을 평가합니다. 이러한 벤치마크는 MME, MMBench, SEED, MathVista, MMMU, ScienceQA 및 POPE를 포함합니다.

최종 생각
이글은 다중 시각 인코더를 사용한 멀티모달 대규모 언어 모델의 디자인 공간에 대한 심층적인 분석입니다. 이전 연구와 달리, 이글은 체계적인 디자인 선택이 중요하다는 것을 발견하고, 유용한 기술을 발견합니다. 단계적으로, 이글은 개별 시각 인코더의 훈련 레시피를 최적화하고, 확장 가능하고 효율적인 융합 방법을 식별하며, 다양한 도메인 지식을 갖춘 시각 인코더를渐進적으로 결합합니다. 결과는 기본 디자인 공간 고려의 중요성을 강조합니다.












