Mô hình và nền tảng AI
EAGLE: Khám phá Không gian Thiết kế cho Mô hình Ngôn ngữ Lớn Đa phương thức với Hỗn hợp Mã hóa
Khả năng diễn giải chính xác thông tin hình ảnh phức tạp là một焦 điểm quan trọng của mô hình ngôn ngữ lớn đa phương thức (MLLMs). Các nghiên cứu gần đây cho thấy rằng việc tăng cường nhận thức thị giác đáng kể giảm thiểu các ảo giác và cải thiện hiệu suất trên các nhiệm vụ nhạy cảm với độ phân giải, chẳng hạn như nhận dạng ký tự quang học và phân tích tài liệu. Một số MLLM gần đây đạt được điều này bằng cách sử dụng hỗn hợp mã hóa thị giác. Mặc dù chúng đã thành công, nhưng vẫn còn thiếu so sánh hệ thống và nghiên cứu cắt giảm chi tiết về các khía cạnh quan trọng, chẳng hạn như lựa chọn chuyên gia và tích hợp nhiều chuyên gia thị giác. Bài viết này cung cấp một cuộc khám phá rộng rãi về không gian thiết kế cho MLLM sử dụng hỗn hợp mã hóa thị giác và độ phân giải, khuôn khổ Eagle nhằm khám phá không gian thiết kế cho mô hình ngôn ngữ lớn đa phương thức với hỗn hợp mã hóa. Các phát hiện cho thấy một số nguyên tắc cơ bản chung cho các chiến lược hiện có, dẫn đến một phương pháp thiết kế hiệu quả nhưng tinh gọn. Eagle phát hiện ra rằng việc đơn giản nối các token thị giác từ một tập hợp các mã hóa thị giác bổ sung là hiệu quả như các kiến trúc trộn phức tạp hơn hoặc chiến lược. Ngoài ra, Eagle giới thiệu Pre-Alignment để bắc cầu giữa các mã hóa tập trung vào thị giác và token ngôn ngữ, tăng cường sự nhất quán của mô hình. Gia đình MLLM kết quả, Eagle, vượt qua các mô hình mở khác trên các tiêu chuẩn MLLM chính.
Công việc của Eagle liên quan đến thiết kế kiến trúc chung của mô hình ngôn ngữ lớn đa phương thức (MLLMs). Ngoài dòng nghiên cứu mở đại diện được đề cập trước đó, các gia đình MLLM đáng chú ý khác bao gồm, nhưng không giới hạn ở, MiniGPT-4, Lynx, Otter, QwenVL, CogVLM, VILA, GPT-4V, Gemini và Llama 3.1. Tùy thuộc vào cách tín hiệu thị giác được tích hợp vào mô hình ngôn ngữ, MLLM có thể được phân loại rộng rãi thành “chú ý đa phương thức” và “prefix-tuning”. Loại trước tiên tiêm thông tin thị giác vào các lớp khác nhau của LLM sử dụng chú ý đa phương thức, trong khi loại sau coi các token thị giác là một phần của chuỗi token ngôn ngữ và trực tiếp thêm chúng với các bản nhúng văn bản. Mô hình của Eagle thuộc họ prefix-tuning bằng cách theo kiến trúc đa phương thức LLaVA.
Công việc của Eagle cũng liên quan chặt chẽ đến nghiên cứu tập trung vào việc cải thiện thiết kế mã hóa thị giác cho MLLM. Các công việc ban đầu thường áp dụng mã hóa thị giác được đào tạo trước trên các nhiệm vụ căn chỉnh thị giác-ngôn ngữ như CLIP và EVA-CLIP. Các mã hóa thị giác mạnh hơn, chẳng hạn như SigLIP và InternVL, đã được đề xuất để tăng cường các nhiệm vụ thị giác-ngôn ngữ với thiết kế tốt hơn, kích thước mô hình lớn hơn và các công thức đào tạo hiệu quả hơn. Vì các mô hình thường được đào tạo trước trên hình ảnh độ phân giải thấp và có thể thiếu khả năng mã hóa các chi tiết tinh tế, việc thích nghi độ phân giải cao hơn thường được thực hiện để tăng độ phân giải đầu vào của MLLM.
EAGLE: Sử dụng Hỗn hợp Mã hóa để Khám phá Không gian Thiết kế cho MLLM
Sự thành công của mô hình ngôn ngữ lớn (LLM) đã tạo ra sự quan tâm đáng kể trong việc cho phép khả năng nhận thức thị giác của chúng, cho phép chúng nhìn, hiểu và suy luận trong thế giới thực. Ở cốt lõi của các mô hình ngôn ngữ lớn đa phương thức (MLLM) này là một thiết kế điển hình nơi các hình ảnh được chuyển đổi thành một loạt các token thị giác bởi các mã hóa thị giác và thêm vào các bản nhúng văn bản. CLIP thường được chọn làm mã hóa thị giác vì đại diện thị giác của nó được căn chỉnh với không gian văn bản bằng cách đào tạo trước trên các cặp hình ảnh-văn bản.
Eagle bắt đầu cuộc khám phá với mô hình CLIP, vì nó đã trở thành sự lựa chọn chính cho nhiều MLLM. Mặc dù các mô hình CLIP được biết đến với việc tăng cường các nhiệm vụ đa phương thức, nhưng hạn chế của chúng cũng đã được ghi nhận. Ví dụ, nhiều MLLM hiện có thường sử dụng độ phân giải được đào tạo trước của CLIP (chẳng hạn như 224 × 224 hoặc 336 × 336) làm độ phân giải đầu vào của chúng.
Để xử lý độ phân giải đầu vào tăng, một cách tiếp cận phổ biến là chia hình ảnh thành các ô và mã hóa riêng biệt. Một phương pháp đơn giản hơn là tăng trực tiếp độ phân giải đầu vào và nội suy các bản nhúng vị trí của mô hình biến đổi thị giác nếu cần. Eagle so sánh hai phương pháp này với các mã hóa thị giác bị đóng băng và không bị đóng băng trên các độ phân giải khác nhau, với kết quả được chứa trong bảng trên.
Eagle: Phương pháp và Kiến trúc
Không giống như các phương pháp trước đó tập trung vào các mô hình trộn mới hoặc kiến trúc giữa các mã hóa thị giác, mục tiêu của Eagle là xác định một thiết kế tối giản để kết hợp các mã hóa thị giác, được hỗ trợ bởi các nghiên cứu cắt giảm chi tiết và loại bỏ các thành phần không cần thiết.
Mã hóa CLIP Mạnh hơn
Eagle bắt đầu cuộc khám phá với mô hình CLIP, vì nó đã trở thành sự lựa chọn chính cho nhiều MLLM. Mặc dù các mô hình CLIP được biết đến với việc tăng cường các nhiệm vụ đa phương thức, nhưng hạn chế của chúng cũng đã được ghi nhận.
Eagle: Thử nghiệm và Kết quả
Sau khi phát triển các chiến lược một cách tỉ mỉ, Eagle đã thiết lập các nguyên tắc sau cho mô hình: (1) tích hợp nhiều chuyên gia thị giác với công thức đào tạo được tối ưu hóa; (2) kết hợp nhiều chuyên gia thị giác thông qua việc nối kênh trực tiếp; (3) đào tạo trước các chuyên gia thị giác riêng biệt thông qua căn chỉnh trước.
Nhiệm vụ Trả lời Câu hỏi Thị giác
Eagle so sánh chuỗi mô hình trên ba tiêu chuẩn trả lời câu hỏi thị giác, bao gồm GQA, VQAv2 và VizWiz.
Nhiệm vụ OCR và Hiểu Biết Biểu đồ
Để đánh giá khả năng OCR, tài liệu và hiểu biết biểu đồ của Eagle, mô hình được chuẩn hóa trên OCRBench, TextVQA và ChartQA.
Đánh giá Tiêu chuẩn Đa phương thức
Eagle được đánh giá trên bảy tiêu chuẩn cho MLLM để chứng minh khả năng của nó từ các góc độ khác nhau, bao gồm MME, MMBench, SEED, MathVista, MMMU, ScienceQA và POPE.
Lời Kết
Trong bài viết này, chúng tôi đã thảo luận về Eagle, một phân tích sâu về không gian thiết kế cho việc tích hợp mã hóa thị giác vào mô hình ngôn ngữ lớn đa phương thức. Không giống như các công việc trước đó tập trung vào thiết kế mô hình trộn mới, Eagle phát hiện ra rằng các lựa chọn thiết kế hệ thống quan trọng và khám phá ra một loạt các kỹ thuật hữu ích. Bước từng bước, Eagle tối ưu hóa công thức đào tạo của từng mã hóa thị giác riêng lẻ, xác định một phương pháp kết hợp hiệu quả và có thể mở rộng, và dần dần kết hợp các mã hóa thị giác với kiến thức lĩnh vực khác nhau. Các kết quả cho thấy tầm quan trọng quan trọng của các cân nhắc không gian thiết kế cơ bản.












