Mô hình và nền tảng AI

Mini-Gemini: Tăng tốc Mô hình Ngôn ngữ Hình ảnh Đa phương thức

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Các tiến bộ trong mô hình ngôn ngữ lớn đã đẩy nhanh đáng kể sự phát triển của xử lý ngôn ngữ tự nhiên, hoặc NLP. Việc giới thiệu khuôn khổ transformer đã chứng minh là một cột mốc, tạo điều kiện cho sự phát triển của một làn sóng mới các mô hình ngôn ngữ, bao gồm OPT và BERT, thể hiện sự hiểu biết ngôn ngữ sâu sắc. Hơn nữa, sự ra đời của GPT, hoặc Mô hình Transformer được đào tạo trước, đã giới thiệu một mô hình mới với mô hình tự hồi quy và thiết lập một phương pháp mạnh mẽ cho dự đoán và tạo ngôn ngữ. Sự xuất hiện của các mô hình ngôn ngữ như GPT-4, ChatGPT, Mixtral, LLaMA và các mô hình khác đã thúc đẩy sự tiến hóa nhanh chóng, với mỗi mô hình thể hiện hiệu suất được cải thiện trong các nhiệm vụ liên quan đến xử lý ngôn ngữ phức tạp. Trong số các phương pháp hiện có, điều chỉnh hướng dẫn đã nổi lên như một kỹ thuật quan trọng để tinh chỉnh đầu ra của các mô hình ngôn ngữ lớn được đào tạo trước, và việc tích hợp các mô hình này với các công cụ cụ thể cho các nhiệm vụ trực quan đã nhấn mạnh sự thích ứng và mở ra cánh cửa cho các ứng dụng trong tương lai. Những ứng dụng này mở rộng vượt ra ngoài xử lý dựa trên văn bản truyền thống của LLMs để bao gồm các tương tác đa phương thức.

Hơn nữa, sự hội tụ của xử lý ngôn ngữ tự nhiên và mô hình tầm nhìn đã dẫn đến sự ra đời của VLMs, hoặc Mô hình Ngôn ngữ Hình ảnh, kết hợp mô hình ngôn ngữ và tầm nhìn để đạt được sự hiểu biết và lý luận xuyên modal. Sự tích hợp và ra đời của mô hình ngôn ngữ và tầm nhìn đã đóng vai trò quan trọng trong việc thúc đẩy các nhiệm vụ đòi hỏi cả xử lý ngôn ngữ và hiểu biết trực quan. Sự xuất hiện của các mô hình cách mạng như CLIP đã bắc cầu khoảng cách giữa các nhiệm vụ tầm nhìn và mô hình ngôn ngữ, chứng minh tính khả thi và tính thực tiễn của các ứng dụng xuyên modal. Các khuôn khổ mới hơn như LLaMA và BLIP tận dụng dữ liệu hướng dẫn được thiết kế để tạo ra các chiến lược hiệu quả, thể hiện khả năng mạnh mẽ của mô hình. Ngoài ra, việc kết hợp các mô hình ngôn ngữ lớn với đầu ra hình ảnh là trọng tâm của nghiên cứu đa phương thức gần đây, với các phương pháp mới có thể bỏ qua việc tạo trực tiếp bằng cách sử dụng phương pháp truy xuất hình ảnh để tạo ra đầu ra hình ảnh và văn bản xen kẽ.

Với điều đó được nói, và mặc dù sự tiến bộ nhanh chóng trong các mô hình ngôn ngữ hình ảnh đã tạo điều kiện cho lý luận cơ bản và đối thoại trực quan, vẫn còn một khoảng cách hiệu suất đáng kể giữa các mô hình tiên tiến như GPT-4 và mô hình ngôn ngữ hình ảnh. Mini-Gemini là một nỗ lực để thu hẹp khoảng cách giữa mô hình ngôn ngữ hình ảnh và các mô hình tiên tiến hơn bằng cách khai thác tiềm năng của VLMs để có hiệu suất tốt hơn từ ba khía cạnh: tạo ra VLM, dữ liệu chất lượng cao và token trực quan độ phân giải cao. Để tăng cường token trực quan, khuôn khổ Mini-Gemini đề xuất sử dụng một bộ mã hóa trực quan bổ sung để tinh chỉnh độ phân giải cao mà không tăng số lượng token trực quan. Khuôn khổ Mini-Gemini còn xây dựng một tập dữ liệu chất lượng cao trong nỗ lực thúc đẩy sự hiểu biết chính xác về hình ảnh và tạo ra lý luận. Tổng thể, khuôn khổ Mini-Gemini cố gắng khai thác tiềm năng của mô hình ngôn ngữ hình ảnh và nhằm mục đích trao quyền cho các khuôn khổ hiện có với khả năng lý luận hình ảnh, hiểu biết và tạo ra đồng thời. Bài viết này nhằm mục đích bao gồm khuôn khổ Mini-Gemini một cách sâu sắc, và chúng tôi khám phá cơ chế, phương pháp luận, kiến trúc của khuôn khổ cùng với so sánh với các khuôn khổ hiện đại. Vì vậy, hãy bắt đầu.

Mini-Gemini: Tăng tốc Mô hình Ngôn ngữ Hình ảnh Đa phương thức

Trong nhiều năm, các mô hình ngôn ngữ lớn đã phát triển, và hiện nay chúng tự hào về khả năng đa phương thức đáng kể, và đang trở thành một phần quan trọng của các mô hình ngôn ngữ hình ảnh hiện đại. Tuy nhiên, vẫn còn một khoảng cách giữa hiệu suất đa phương thức của các mô hình ngôn ngữ lớn và mô hình ngôn ngữ hình ảnh với nghiên cứu gần đây đang tìm cách kết hợp tầm nhìn với các mô hình ngôn ngữ lớn bằng cách sử dụng hình ảnh và video. Đối với các nhiệm vụ tầm nhìn, độ phân giải hình ảnh là một yếu tố quan trọng để thể hiện môi trường xung quanh với các ảo giác trực quan tối thiểu. Để bắc cầu khoảng cách này, các nhà nghiên cứu đang phát triển các mô hình để cải thiện sự hiểu biết trực quan trong các mô hình ngôn ngữ hình ảnh hiện tại, và hai phương pháp phổ biến nhất là: tăng độ phân giải và tăng số lượng token trực quan. Mặc dù việc tăng số lượng token trực quan với hình ảnh độ phân giải cao hơn có thể tăng cường sự hiểu biết trực quan, nhưng sự tăng cường này thường đi kèm với nhu cầu tính toán tăng cao và chi phí liên quan, đặc biệt là khi xử lý nhiều hình ảnh. Hơn nữa, khả năng của các mô hình hiện có, chất lượng dữ liệu hiện có và tính áp dụng vẫn còn thiếu thốn cho quá trình phát triển tăng tốc, khiến các nhà nghiên cứu phải đặt câu hỏi, “làm thế nào để tăng tốc phát triển của mô hình ngôn ngữ hình ảnh với chi phí chấp nhận được”?

Khuôn khổ Mini-Gemini là một nỗ lực để trả lời câu hỏi này khi nó cố gắng khám phá tiềm năng của mô hình ngôn ngữ hình ảnh từ ba khía cạnh: tạo ra VLM, dữ liệu chất lượng cao và token trực quan độ phân giải cao. Đầu tiên, khuôn khổ Mini-Gemini thực hiện kiến trúc ConvNet để tạo ra các ứng viên độ phân giải cao một cách hiệu quả, tăng cường chi tiết trực quan trong khi duy trì số lượng token trực quan cho mô hình ngôn ngữ lớn. Khuôn khổ Mini-Gemini kết hợp các tập dữ liệu chất lượng cao công khai trong nỗ lực tăng cường chất lượng dữ liệu và tích hợp những cải tiến này với các mô hình tạo ra và mô hình ngôn ngữ lớn hiện đại với nỗ lực tăng cường hiệu suất của VLMs và cải thiện trải nghiệm người dùng. Chiến lược đa diện được thực hiện bởi khuôn khổ Mini-Gemini cho phép nó khám phá các khả năng ẩn của mô hình ngôn ngữ hình ảnh và đạt được những tiến bộ đáng kể với các hạn chế tài nguyên rõ ràng.

Nói chung, khuôn khổ Mini-Gemini sử dụng mô hình bất kỳ đến bất kỳ vì nó có thể xử lý cả văn bản và hình ảnh làm đầu vào và đầu ra. Cụ thể, khuôn khổ Mini-Gemini giới thiệu một đường ống hiệu quả để tăng cường token trực quan cho hình ảnh đầu vào và bao gồm một hệ thống mã hóa kép gồm hai mã hóa: mã hóa đầu tiên là cho hình ảnh độ phân giải cao, trong khi mã hóa thứ hai là cho mã hóa trực quan chất lượng thấp. Trong quá trình suy luận, các mã hóa hoạt động trong một cơ chế chú ý, nơi mã hóa độ phân giải thấp tạo ra các truy vấn trực quan, trong khi mã hóa độ phân giải cao cung cấp khóa và giá trị để tham khảo. Để tăng cường chất lượng dữ liệu, khuôn khổ Mini-Gemini thu thập và tạo ra nhiều dữ liệu hơn dựa trên nguồn công khai, bao gồm hướng dẫn định hướng nhiệm vụ, dữ liệu liên quan đến tạo ra và phản hồi độ phân giải cao, với số lượng và chất lượng tăng cao cải thiện hiệu suất và khả năng của mô hình. Hơn nữa, khuôn khổ Mini-Gemini hỗ trợ tạo ra văn bản và hình ảnh đồng thời nhờ tích hợp mô hình ngôn ngữ hình ảnh với các mô hình tạo ra tiên tiến.

Mini-Gemini: Phương pháp luận và Kiến trúc

Ở cốt lõi, khuôn khổ Mini-Gemini là một khái niệm đơn giản, và bao gồm ba thành phần.

  1. Khuôn khổ sử dụng mã hóa tầm nhìn kép để cung cấp mã hóa trực quan độ phân giải thấp và ứng viên độ phân giải cao.
  2. Khuôn khổ đề xuất thực hiện khai thác thông tin patch để thực hiện khai thác ở cấp độ patch giữa các truy vấn trực quan độ phân giải thấp và các vùng độ phân giải cao.
  3. Khuôn khổ Mini-Gemini sử dụng mô hình ngôn ngữ lớn để kết hợp văn bản với hình ảnh cho cả tạo ra và hiểu biết đồng thời.

Mã hóa tầm nhìn kép

Khuôn khổ Mini-Gemini có thể xử lý cả đầu vào văn bản và hình ảnh, với tùy chọn xử lý chúng riêng lẻ hoặc kết hợp. Như được chứng minh trong hình ảnh sau, khuôn khổ Mini-Gemini bắt đầu quá trình bằng cách sử dụng nội suy tuyến tính để tạo ra một hình ảnh độ phân giải thấp từ hình ảnh độ phân giải cao tương ứng.

Sau đó, khuôn khổ xử lý các hình ảnh này và mã hóa chúng thành một mã hóa trực quan đa lưới trong hai luồng hình ảnh song song. Cụ thể hơn, khuôn khổ Mini-Gemini duy trì đường ống truyền thống cho luồng độ phân giải thấp và sử dụng Transformer trực quan được đào tạo trước bởi CLIP để mã hóa mã hóa trực quan, cho phép mô hình giữ lại mối quan hệ tầm nhìn dài giữa các patch trực quan cho các tương tác tiếp theo trong mô hình ngôn ngữ lớn. Đối với luồng độ phân giải cao, khuôn khổ Mini-Gemini áp dụng mã hóa dựa trên CNN hoặc Mạng nơ-ron tích hợp để xử lý hình ảnh độ phân giải cao một cách hiệu quả và thích ứng.

Khai thác thông tin patch

Với mã hóa tầm nhìn kép tạo ra mã hóa độ phân giải thấp và tính năng độ phân giải cao, khuôn khổ Mini-Gemini đề xuất thực hiện khai thác thông tin patch với mục đích mở rộng tiềm năng của mô hình ngôn ngữ hình ảnh với token trực quan được tăng cường. Để duy trì số lượng token trực quan cho hiệu quả trong mô hình ngôn ngữ lớn, khuôn khổ Mini-Gemini lấy mã hóa trực quan độ phân giải thấp làm truy vấn và nhằm mục đích thu thập các gợi ý trực quan liên quan từ các ứng viên tính năng độ phân giải cao, với khuôn khổ lấy bản đồ tính năng độ phân giải cao làm khóa và giá trị.

Như được chứng minh trong hình ảnh trên, công thức bao gồm quá trình tinh chỉnh và tổng hợp các gợi ý trực quan, dẫn đến việc tạo ra token trực quan tiên tiến cho quá trình xử lý mô hình ngôn ngữ lớn tiếp theo. Quá trình này đảm bảo rằng khuôn khổ có thể giới hạn việc khai thác cho mỗi truy vấn đến vùng phụ tương ứng trong bản đồ tính năng độ phân giải cao với số lượng tính năng pixel, dẫn đến hiệu quả tăng cao. Nhờ thiết kế này, khuôn khổ Mini-Gemini có thể trích xuất chi tiết tính năng độ phân giải cao mà không tăng số lượng token trực quan và duy trì sự cân bằng giữa tính toán khả thi và sự phong phú của chi tiết.

Tạo văn bản và hình ảnh

Khuôn khổ Mini-Gemini kết hợp token trực quan và token văn bản đầu vào làm đầu vào cho mô hình ngôn ngữ lớn để tạo ra tự hồi quy. Không giống như các mô hình ngôn ngữ hình ảnh truyền thống, khuôn khổ Mini-Gemini hỗ trợ tạo văn bản chỉ và tạo văn bản-hình ảnh làm đầu vào và đầu ra, tức là bất kỳ đến bất kỳ, và nó là kết quả của khả năng hiểu biết và lý luận hình ảnh-văn bản vượt trội, khuôn khổ Mini-Gemini có thể tạo ra hình ảnh chất lượng cao. Không giống như các công việc gần đây tập trung vào khoảng cách miền giữa mã hóa văn bản của mô hình tạo ra và mô hình ngôn ngữ lớn, khuôn khổ Mini-Gemini cố gắng tối ưu hóa khoảng cách trong miền của các gợi ý ngôn ngữ bằng cách dịch các hướng dẫn người dùng thành gợi ý chất lượng cao tạo ra hình ảnh liên quan đến ngữ cảnh trong mô hình khuếch tán ẩn. Hơn nữa, để hiểu rõ hơn về việc tinh chỉnh hướng dẫn và sự sắp xếp xuyên modal, khuôn khổ Mini-Gemini thu thập mẫu từ các tập dữ liệu chất lượng cao công khai và sử dụng khuôn khổ GPT-4 turbo để xây dựng một tập dữ liệu 13K theo hướng dẫn để hỗ trợ tạo hình ảnh.

Mini-Gemini: Thử nghiệm và Kết quả

Để đánh giá hiệu suất của nó, khuôn khổ Mini-Gemini được khởi tạo với khuôn khổ ConvNext-L được đào tạo trước cho mã hóa tầm nhìn độ phân giải cao và với Transformer trực quan được đào tạo trước bởi CLIP cho mã hóa tầm nhìn độ phân giải thấp. Để đảm bảo hiệu quả đào tạo, khuôn khổ Mini-Gemini giữ cố định hai mã hóa tầm nhìn và tối ưu hóa các bộ chiếu của khai thác thông tin patch ở tất cả các giai đoạn và tối ưu hóa mô hình ngôn ngữ lớn trong giai đoạn tinh chỉnh hướng dẫn.

Bảng sau so sánh hiệu suất của khuôn khổ Mini-Gemini với các mô hình hiện đại trên các thiết lập khác nhau và cũng xem xét các mô hình riêng tư. Như có thể quan sát, khuôn khổ Mini-Gemini vượt trội so với các khuôn khổ hiện có trên một loạt các mô hình ngôn ngữ lớn một cách nhất quán ở độ phân giải bình thường và thể hiện hiệu suất vượt trội khi được cấu hình với Gemma-2B trong danh mục mô hình hiệu quả. Hơn nữa, khi các mô hình ngôn ngữ lớn hơn được sử dụng, khả năng mở rộng của khuôn khổ Mini-Gemini trở nên rõ ràng.

Để đánh giá hiệu suất của nó trên độ phân giải cao và token trực quan mở rộng, các thí nghiệm được thực hiện với kích thước đầu vào 672 cho mã hóa tầm nhìn độ phân giải thấp và 1536 cho mã hóa tầm nhìn. Như đã đề cập trước đó, mục đích chính của mã hóa tầm nhìn độ phân giải cao là cung cấp thông tin ứng viên độ phân giải cao. Như có thể quan sát, khuôn khổ Mini-Gemini cung cấp hiệu suất vượt trội khi so sánh với các khuôn khổ hiện đại.

Hơn nữa, để đánh giá khả năng hiểu biết trực quan của khuôn khổ Mini-Gemini trong các tình huống thực tế, các nhà phát triển áp dụng mô hình này vào nhiều nhiệm vụ lý luận và hiểu biết khác nhau như được chứng minh trong hình ảnh sau. Như có thể quan sát, khuôn khổ Mini-Gemini có thể giải quyết nhiều nhiệm vụ phức tạp nhờ việc thực hiện khai thác thông tin patch và dữ liệu chất lượng cao. Nhưng điều ấn tượng hơn là khuôn khổ Mini-Gemini thể hiện sự chú ý đến chi tiết vượt ra ngoài khả năng nhận dạng đơn thuần và mô tả các yếu tố phức tạp một cách chi tiết.

Hình sau cung cấp một đánh giá toàn diện về khả năng tạo ra của khuôn khổ Mini-Gemini.

Khi so sánh với các mô hình gần đây như ChatIllusion và AnyGPT, khuôn khổ Mini-Gemini thể hiện khả năng hiểu biết đa phương thức mạnh mẽ hơn, cho phép nó tạo ra văn bản đến hình ảnh với các chú thích phù hợp với hướng dẫn đầu vào tốt hơn và dẫn đến câu trả lời hình ảnh đến văn bản với sự tương đồng khái niệm mạnh mẽ hơn. Điều ấn tượng hơn là khuôn khổ Mini-Gemini thể hiện khả năng tạo ra nội dung chất lượng cao bằng cách sử dụng hướng dẫn đa phương thức của con người chỉ với dữ liệu đào tạo văn bản, một khả năng minh họa cho khả năng giải thích ngữ nghĩa mạnh mẽ và sự sắp xếp hình ảnh-văn bản của Mini-Gemini.

Thoughts Cuối cùng

Trong bài viết này, chúng tôi đã thảo luận về Mini-Gemini, một khuôn khổ mạnh mẽ và tinh gọn cho mô hình ngôn ngữ hình ảnh đa phương thức. Mục tiêu chính của khuôn khổ Mini-Gemini là khai thác các khả năng tiềm ẩn của mô hình ngôn ngữ hình ảnh bằng cách sử dụng dữ liệu chất lượng cao, thiết kế chiến lược và phạm vi chức năng mở rộng. Mini-Gemini là một nỗ lực để thu hẹp khoảng cách giữa mô hình ngôn ngữ hình ảnh và các mô hình tiên tiến hơn bằng cách khai thác tiềm năng của VLMs để có hiệu suất tốt hơn từ ba khía cạnh: tạo ra VLM, dữ liệu chất lượng cao và token trực quan độ phân giải cao. Để tăng cường token trực quan, khuôn khổ Mini-Gemini đề xuất sử dụng một bộ mã hóa trực quan bổ sung để tinh chỉnh độ phân giải cao mà không tăng số lượng token trực quan. Khuôn khổ Mini-Gemini còn xây dựng một tập dữ liệu chất lượng cao trong nỗ lực thúc đẩy sự hiểu biết chính xác về hình ảnh và tạo ra lý luận. Tổng thể, khuôn khổ Mini-Gemini cố gắng khai thác tiềm năng của mô hình ngôn ngữ hình ảnh và nhằm mục đích trao quyền cho các khuôn khổ hiện có với khả năng lý luận hình ảnh, hiểu biết và tạo ra đồng thời.

Kunal Kejriwal là một kỹ sư backend chuyên về Python, PostgreSQL, Redis và hạ tầng đám mây trên GCP và AWS. Với ba năm kinh nghiệm trong việc xây dựng và mở rộng các hệ thống sản xuất, anh viết về cơ sở hạ tầng AI, các hệ thống phân tán và kiến trúc triển khai các khối tải học máy.