Mô hình và nền tảng AI

MoE-LLaVA: Hỗn hợp các Chuyên gia cho Mô hình Ngôn ngữ Hình ảnh Lớn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Những tiến bộ gần đây trong Mô hình Ngôn ngữ Hình ảnh Lớn (LVLMs) đã chỉ ra rằng việc mở rộng đáng kể các khuôn khổ này sẽ tăng cường hiệu suất trên nhiều nhiệm vụ hạ nguồn. LVLMs, bao gồm MiniGPT, LLaMA và các mô hình khác, đã đạt được khả năng đáng kể bằng cách tích hợp các lớp dự án hình ảnh và mã hóa hình ảnh vào kiến trúc của chúng. Bằng cách thực hiện các thành phần này, LVLMs tăng cường khả năng nhận thức hình ảnh của Mô hình Ngôn ngữ Lớn (LLMs). Hiệu suất có thể được cải thiện thêm bằng cách tăng kích thước mô hình và số lượng tham số, cũng như mở rộng quy mô dữ liệu.

Mô hình như InternVL đã mở rộng mã hóa hình ảnh lên hơn 6 tỷ tham số, trong khi những mô hình khác đã mở rộng phần backend của LVLMs lên 13 tỷ tham số, đạt được hiệu suất vượt trội trên nhiều nhiệm vụ. IDEFICS đã đào tạo một LVLM với hơn 80 tỷ tham số. Những phương pháp mở rộng này đã匹配 hoặc vượt qua hiệu suất của LLMs được đào tạo trước trên hơn 34, 70 hoặc thậm chí 100 tỷ tham số. Tuy nhiên, việc mở rộng có một nhược điểm: nó làm tăng đáng kể chi phí đào tạo và suy luận. Điều này là do nó yêu cầu tất cả các tham số phải được kích hoạt cho mỗi token trong tính toán, dẫn đến nhu cầu tính toán cao và do đó, chi phí cao hơn.

Bài viết này thảo luận về MoE-LLaVA, một kiến trúc LVLM dựa trên Mixture of Experts (MoE) thưa thớt, sử dụng một chiến lược đào tạo hiệu quả, MoE-Tuning, cho LVLMs. MoE-Tuning giải quyết một cách sáng tạo sự suy giảm hiệu suất trong học thưa thớt đa phương thức, dẫn đến một mô hình với số lượng tham số lớn nhưng chi phí đào tạo và suy luận nhất quán. Kiến trúc MoE-LLaVA được thiết kế để chỉ kích hoạt các chuyên gia hàng đầu trong quá trình triển khai, trong khi giữ các chuyên gia còn lại không hoạt động.

Chúng tôi sẽ khám phá khuôn khổ MoE-LLaVA, kiểm tra cơ chế, phương pháp, kiến trúc và cách nó so sánh với các khuôn khổ hình ảnh và video hàng đầu.

MoE-LLaVA: Mở rộng Mô hình Ngôn ngữ Hình ảnh Lớn một cách Tiết kiệm

Ngoài việc tận dụng các lớp dự án hình ảnh và mã hóa hình ảnh, Mô hình Ngôn ngữ Hình ảnh Lớn cũng mở rộng kích thước mô hình bằng cách tăng số lượng tham số để tăng cường hiệu suất của mô hình. Một số ví dụ đáng chú ý về Mô hình Ngôn ngữ Hình ảnh Lớn đã theo đuổi cách tiếp cận này để tăng cường hiệu suất của chúng là MiniGPT-4, InternGPT, InternVL và các mô hình khác. Trong các ứng dụng thực tế, việc mở rộng một Mô hình Ngôn ngữ Lớn hoặc Mô hình Ngôn ngữ Hình ảnh Lớn với dữ liệu đào tạo chất lượng cao thường trở thành một nhu cầu để cải thiện hiệu suất của mô hình. Mặc dù việc mở rộng kích thước mô hình có cải thiện hiệu suất, nhưng nó cũng làm tăng chi phí tính toán của việc đào tạo và triển khai mô hình, và làm tăng thêm sự phức tạp và hiệu quả của việc triển khai mô hình trên các thiết bị song song đồng thời. Một lý do chính đằng sau việc tăng chi phí đào tạo và suy luận cùng với nhu cầu tính toán là mỗi token trong khuôn khổ đòi hỏi tính toán với mọi tham số trong mô hình, được gọi là mô hình dày đặc.

Mặt khác, mô hình MoE hoặc Mixture of Expert thưa thớt đã chứng minh việc mở rộng khuôn khổ hiệu quả bằng cách xử lý dữ liệu với sự giúp đỡ của các tham số được kích hoạt cố định, một cách tiếp cận đã được áp dụng rộng rãi trong lĩnh vực Xử lý Ngôn ngữ Tự nhiên. Tuy nhiên, việc sử dụng Mixture of Expert để đào tạo trực tiếp Mô hình Ngôn ngữ Hình ảnh Lớn thưa thớt là một thách thức vì việc chuyển đổi LLMs sang LVLMs và làm thưa thớt mô hình đồng thời dẫn đến sự suy giảm hiệu suất đáng kể. Để thực hiện Mixture of Models để mở rộng LLMs và LVLMs, điều quan trọng là phải khởi tạo LVLM cho việc làm thưa thớt trước. Để đạt được điều này, khuôn khổ MoE-LLaVA giới thiệu MoE-Tuning, một chiến lược đào tạo đơn giản nhưng hiệu quả gồm ba giai đoạn.

Như được hiển thị trong hình trên, quá trình MoE-Tuning đầu tiên đào tạo một MLP hoặc một Multilayer Perceptron thích nghi với các token hình ảnh với một Mô hình Ngôn ngữ Lớn trong giai đoạn đầu. Khuôn khổ sau đó đào tạo tất cả các tham số của LLM để trao quyền cho Mô hình Ngôn ngữ Hình ảnh Lớn với khả năng hiểu đa phương thức chung. Cuối cùng, trong giai đoạn thứ ba, khuôn khổ nhân bản FFN hoặc Feed Forward Network như trọng số khởi tạo cho các chuyên gia và chỉ đào tạo các lớp Mixture of Expert. Tổng thể, quá trình đào tạo giúp chuyển đổi dần mô hình thưa thớt từ khởi tạo LVLM sang một hỗn hợp của mô hình chuyên gia thưa thớt.

Với quá trình đào tạo được bao phủ, hãy để chúng tôi tập trung vào MoE-LLaVA, một khuôn khổ cơ bản cho Mô hình Ngôn ngữ Hình ảnh Lớn với Mixture of Expert models tích hợp các router có thể học và mô hình MoE. Tại lõi của mô hình MoE-LLaVA, bao gồm nhiều đường dẫn thưa thớt, và khuôn khổ sử dụng các đường dẫn này để phân phối mỗi token đến các chuyên gia khác nhau thông qua router có thể học. Các token sau đó được xử lý tập thể bởi các chuyên gia được kích hoạt trong khi giữ các đường dẫn không hoạt động im lặng. Khuôn khổ sau đó xếp chồng các lớp mã hóa Mixture of Expert lặp đi lặp lại để cung cấp một đường dẫn thưa thớt đến một Mô hình Ngôn ngữ Hình ảnh Lớn lớn hơn và mạnh mẽ hơn.

Nhờ cách tiếp cận được thực hiện bởi khuôn khổ MoE-LLaVA, nó có thể vượt qua các mô hình có số lượng tham số được kích hoạt tương tự và vượt qua chúng với một khoảng cách lớn trên chuẩn mực POPE về ảo giác đối tượng, mặc dù chỉ có 2,2 tỷ tham số. Hơn nữa, khuôn khổ MoE-LLaVA với 2,2 tỷ tham số có thể đạt được hiệu suất tương đương với khuôn khổ InternVL-Chat-19B với gần 8 lần số lượng tham số được kích hoạt.

Các Mô hình Ngôn ngữ Lớn mạnh mẽ với khả năng tổng quát hóa và tuân theo hướng dẫn mạnh mẽ đã được thực hiện để Mô hình Ngôn ngữ Hình ảnh Lớn. Các LLM đầu tiên như BLIP đã mã hóa tín hiệu hình ảnh vào một chuỗi các token hình ảnh, cho phép chúng thích nghi với tầm nhìn thành công bằng cách sử dụng nhiều lớp dự án. Đồng thời, các công việc gần đây tập trung vào việc cải thiện hiệu suất của mô hình bằng cách thực hiện các phương pháp như mở rộng tập dữ liệu điều chỉnh hướng dẫn, tăng độ phân giải của hình ảnh, tối ưu hóa chiến lược đào tạo, căn chỉnh đầu vào, cải thiện mã hóa hình ảnh và nhiều hơn nữa. Những cách tiếp cận này đã giúp trao quyền cho LVLMs với khả năng hiểu hình ảnh mạnh mẽ bằng cách mở rộng tập dữ liệu điều chỉnh hướng dẫn hình ảnh và quy mô mô hình. Hơn nữa, một số LVLMs cũng có khả năng hiểu hình ảnh tinh tế như hiểu vùng và đa vùng cùng với khả năng nền tảng pixel. Tuy nhiên, chi phí tính toán đi kèm với việc mở rộng dữ liệu hình ảnh dày đặc và mô hình thường rất cao, điều này làm cho nó khó khăn để thực hiện. Mặt khác, khuôn khổ MoE-LLaVA nhằm mục đích làm cho nghiên cứu LVLM trở nên tiết kiệm hơn bằng cách tận dụng khả năng của mô hình MoE.

MoE-LLaVA: Phương pháp và Kiến trúc

Tại lõi của khuôn khổ MoE-LLaVA, bao gồm một lớp dự án hình ảnh, một mã hóa hình ảnh, các khối MoE, nhiều khối LLM xếp chồng và một lớp nhúng từ.

Kiến trúc

Bảng sau tóm tắt các cấu hình chi tiết của khuôn khổ MoE-LLaVA.

Đối với một hình ảnh RGB cho trước, mã hóa hình ảnh xử lý hình ảnh để thu được một chuỗi các token hình ảnh với một lớp dự án hình ảnh ánh xạ chuỗi token hình ảnh đến hình ảnh đầu vào. Đầu vào văn bản được xử lý bởi lớp nhúng từ, sau đó ánh xạ để thu được chuỗi token. Đồng thời, khuôn khổ MoE-LLaVA liên kết các token văn bản và hình ảnh lại với nhau và cung cấp chúng cho LLM. Tuy nhiên, khuôn khổ chỉ đào tạo lớp dự án hình ảnh với mô hình ngôn ngữ lớn bao gồm FFN hoặc các lớp tự chú ý đa đầu. Cuối cùng, khuôn khổ áp dụng các kết nối dư và chuẩn hóa lớp cho mỗi khối.

Tiếp theo, khuôn khổ MoE-LLaVA nhân bản FFN hoặc các mạng nơ-ron tiến hành từ giai đoạn thứ hai để tạo thành một tập hợp các chuyên gia như một bước khởi tạo. Router, là một lớp tuyến tính, dự đoán xác suất của mỗi token được phân配 cho mỗi chuyên gia. Mỗi token được xử lý bởi các chuyên gia hàng đầu với xác suất tối đa và tính toán tổng trọng số dựa trên kết quả softmax của xác suất. Khi các chuyên gia hàng đầu được kích hoạt, mô hình tắt các chuyên gia còn lại, một cách tiếp cận trang bị cho khuôn khổ MoE-LLaVA với vô số đường dẫn thưa thớt, do đó trang bị mô hình với một loạt các khả năng.

MoE-Tuning

MoE-Tuning là một chiến lược đào tạo đơn giản nhưng hiệu quả gồm ba giai đoạn, đầu tiên đào tạo một MLP hoặc một Multilayer Perceptron thích nghi với các token hình ảnh với một Mô hình Ngôn ngữ Lớn trong giai đoạn đầu. Khuôn khổ sau đó đào tạo tất cả các tham số của LLM để trao quyền cho Mô hình Ngôn ngữ Hình ảnh Lớn với khả năng hiểu đa phương thức chung. Cuối cùng, trong giai đoạn thứ ba, khuôn khổ nhân bản FFN hoặc Feed Forward Network như trọng số khởi tạo cho các chuyên gia và chỉ đào tạo các lớp Mixture of Expert.

Giai đoạn 1

Trong giai đoạn đầu, mục tiêu chính là thích nghi với các token hình ảnh với mô hình ngôn ngữ lớn, cho phép LLM hiểu các thể hiện trong hình ảnh. Khuôn khổ MoE-LLaVA sử dụng một multilayer perceptron để ánh xạ các token hình ảnh vào miền đầu vào của mô hình ngôn ngữ lớn và coi các bản vá hình ảnh như các token văn bản giả. Trong giai đoạn này, khuôn khổ MoE-LLaVA đào tạo LLM để mô tả hình ảnh và không áp dụng các lớp MoE cho LLM trong giai đoạn này.

Giai đoạn 2

Trong giai đoạn thứ hai, khuôn khổ MoE-LLaVA cố gắng tăng cường khả năng và kiểm soát của khuôn khổ bằng cách điều chỉnh mô hình với dữ liệu hướng dẫn đa phương thức. Khuon khổ MoE-LLaVA đạt được điều này bằng cách điều chỉnh LLM để trở thành một LVLM với khả năng hiểu đa phương thức. Khuôn khổ sử dụng các hướng dẫn phức tạp hơn, bao gồm nhận dạng văn bản và nhiệm vụ lý luận hình ảnh logic đòi hỏi mô hình phải có khả năng đa phương thức mạnh mẽ hơn. Thông thường, quá trình đào tạo cho các mô hình dày đặc được coi là hoàn thành bằng bước này. Tuy nhiên, khuôn khổ MoE-LLaVA gặp phải thách thức khi chuyển đổi LLM thành một LVLM đồng thời với việc làm thưa thớt LVLM. Để đối phó với thách thức này, khuôn khổ sử dụng trọng số từ giai đoạn này như trọng số khởi tạo cho giai đoạn tiếp theo trong một nỗ lực nhằm giảm bớt khó khăn học tập của mô hình thưa thớt.

Giai đoạn 3

Trong giai đoạn thứ ba, mô hình nhân bản mạng nơ-ron tiến hành nhiều lần để khởi tạo các chuyên gia như một thủ tục khởi tạo. Sau đó, khuôn khổ cung cấp các token văn bản và hình ảnh vào các lớp Mixture of Expert, sau đó router tính toán trọng số phù hợp giữa các chuyên gia và mỗi token. Mỗi token sau đó được xử lý bởi các chuyên gia hàng đầu với tổng trọng số được tính toán bằng cách tính tổng trọng số dựa trên trọng số của router. Khi các chuyên gia hàng đầu được kích hoạt, mô hình tắt các chuyên gia còn lại, một cách tiếp cận trang bị cho khuôn khổ MoE-LLaVA với vô số đường dẫn thưa thớt, do đó trang bị mô hình với một loạt các khả năng.

MoE-LLaVA: Kết quả và Thử nghiệm

Khuôn khổ MoE-LLaVA sử dụng CLIP-Large làm mã hóa hình ảnh với Multilayer Perceptron bao gồm hai lớp với một lớp kích hoạt GELU nằm giữa. Theo mặc định, khuôn khổ sử dụng sự thay thế xen kẽ của các mạng nơ-ron tiến hành với các lớp Mixture of Expert, có nghĩa là các lớp Mixture of Expert chiếm 50% tổng số lớp. Bảng sau chứa các tập dữ liệu khác nhau cùng với kích thước mẫu được sử dụng để đào tạo và đánh giá khuôn khổ MoE-LLaVA.

Trả lời Câu hỏi Hình ảnh Zero-Shot

Hình sau minh họa rằng MoE-LLaVA là một mô hình thưa thớt với một router mềm dựa trên LVLM. Khuôn khổ được đánh giá trên 5 chuẩn mực trả lời câu hỏi hình ảnh và như có thể quan sát được, khuôn khổ MoE-LLaVA thể hiện khả năng hiểu hình ảnh đáng kể và cung cấp hiệu suất tương đương với khuôn khổ LLaVA 1.5 hiện đại trên năm chuẩn mực khác nhau.

Đánh giá Ảo giác Đối tượng

Để đánh giá ảo giác đối tượng, khuôn khổ MoE-LLaVA sử dụng đường ống đánh giá POPE, một phương pháp hỏi dựa trên bỏ phiếu và kết quả được minh họa trong bảng sau. Như có thể quan sát được, trong số tất cả các khuôn khổ, MoE-LLaVA cung cấp kết quả mạnh nhất, chỉ ra khả năng của khuôn khổ trong việc tạo ra các đối tượng nhất quán với hình ảnh đầu vào. Ngoài ra, cũng đáng chú ý rằng khuôn khổ MoE-LLaVA cân bằng tỷ lệ có/không tốt, chỉ ra khả năng của mô hình thưa thớt trong việc cung cấp phản hồi chính xác cho câu hỏi cho trước.

Hình sau chứa phân phối tải của chuyên gia, nơi các đường đứt nét đại diện cho một phân phối cân bằng của token giữa các chuyên gia hoặc phương thức. Hình đầu tiên minh họa tải trong các chuyên gia trong khi các hình còn lại minh họa hiệu suất của chuyên gia đối với các phương thức khác nhau.

Hơn nữa, hình sau minh họa phân phối phương thức trên các chuyên gia khác nhau.

Suy nghĩ Cuối cùng

Trong bài viết này, chúng ta đã thảo luận về MoE-LLaVA, một khuôn khổ cơ bản cho Mô hình Ngôn ngữ Hình ảnh Lớn với Mixture of Expert models tích hợp các router có thể học và mô hình MoE. Tại lõi của mô hình MoE-LLaVA, bao gồm nhiều đường dẫn thưa thớt, và khuôn khổ sử dụng các đường dẫn này để phân phối mỗi token đến các chuyên gia khác nhau thông qua router có thể học. Các token sau đó được xử lý tập thể bởi các chuyên gia được kích hoạt trong khi giữ các đường dẫn không hoạt động im lặng. Khuôn khổ sau đó xếp chồng các lớp mã hóa Mixture of Expert lặp đi lặp lại để cung cấp một đường dẫn thưa thớt đến một Mô hình Ngôn ngữ Hình ảnh Lớn lớn hơn và mạnh mẽ hơn. Chiến lược MoE-Tuning giải quyết một cách sáng tạo sự suy giảm hiệu suất trong học thưa thớt đa phương thức, dẫn đến một mô hình với số lượng tham số lớn nhưng chi phí đào tạo và suy luận nhất quán. Kiến trúc của khuôn khổ MoE-LLaVA được thiết kế để chỉ kích hoạt các chuyên gia hàng đầu trong quá trình triển khai, trong khi giữ các chuyên gia còn lại không hoạt động.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.