Mô hình và nền tảng AI
MiniGPT-5: Tạo nội dung đa phương tiện bằng cách sử dụng các mã thông báo tạo
Trong những năm gần đây, các mô hình ngôn ngữ lớn (LLM) đã thu hút sự chú ý của các nhà phát triển AI trên toàn thế giới nhờ những đột phá trong xử lý ngôn ngữ tự nhiên (NLP). Những mô hình này đã thiết lập các tiêu chuẩn mới trong việc tạo văn bản và hiểu biết. Tuy nhiên, mặc dù đã có tiến bộ trong việc tạo văn bản, việc tạo ra hình ảnh phù hợp với các câu chuyện văn bản vẫn còn là một thách thức. Để giải quyết vấn đề này, các nhà phát triển đã giới thiệu một phương pháp mới để tạo nội dung đa phương tiện bằng cách sử dụng “các mã thông báo tạo” để kết nối giữa văn bản và hình ảnh.
Nền tảng của MiniGPT-5 là một chiến lược đào tạo hai giai đoạn tập trung vào việc tạo ra dữ liệu đa phương tiện không cần mô tả. Hơn nữa, để tăng cường tính toàn vẹn của mô hình, mô hình này kết hợp một hệ thống hướng dẫn phân loại miễn phí để tăng cường hiệu quả của các mã thông báo tạo trong việc tạo hình ảnh. Trong giai đoạn đầu, khuôn khổ MiniGPT-5 đã thể hiện hiệu suất mạnh mẽ và cải thiện đáng kể so với mô hình baseline Divter được đào tạo trên tập dữ liệu MMDialog và đã liên tục thể hiện khả năng tạo ra các đầu ra đa phương tiện tương đương và thậm chí vượt trội trong các đánh giá của con người trên tập dữ liệu VIST.
MiniGPT5: Giới thiệu
Với sự phát triển gần đây của các khuôn khổ LLM và các ứng dụng dựa trên các khuôn khổ này, việc tích hợp tính năng đa phương tiện đã trở thành một lĩnh vực phổ biến và quan trọng, cung cấp nhiều ứng dụng từ công cụ tạo nội dung tiên tiến đến các tác nhân đối thoại đa phương tiện. Với sự nghiên cứu và phát triển liên tục, các mô hình ngôn ngữ và tầm nhìn đang ở giai đoạn có thể tạo ra cả văn bản và dữ liệu hình ảnh một cách mượt mà. Khả năng của LLM trong việc tạo ra dữ liệu đa phương tiện sẽ giúp tăng cường tương tác trong các lĩnh vực khác nhau, bao gồm thương mại điện tử, truyền thông và thực tế ảo.

Cuối cùng, mục tiêu là cho phép các mô hình tổng hợp, nhận biết và phản hồi một cách nhất quán và logic bằng cách sử dụng cả văn bản và hình ảnh, đóng vai trò quan trọng trong việc hài hòa luồng thông tin và tạo ra các câu chuyện logic và nhất quán. Việc đạt được sự kết hợp giữa văn bản và hình ảnh là điều cần thiết để có các tương tác đa phương tiện mượt mà và tương tác trong LLM, và cuối cùng là đạt được việc tạo nội dung đa phương tiện.
- Mặc dù các LLM hiện tại rất hiệu quả và mạnh mẽ trong việc tạo văn bản và xử lý cặp hình ảnh-văn bản, chúng không tạo ra hình ảnh một cách thỏa mãn.
- Việc phát triển các mô hình tầm nhìn và ngôn ngữ phụ thuộc nhiều vào dữ liệu tập trung vào chủ đề, khiến cho việc tạo ra hình ảnh phù hợp với văn bản trở nên khó khăn.
- Cuối cùng, cần phải tìm ra các chiến lược hiệu quả hơn khi tăng cường khả năng của LLM, đặc biệt là khi thực hiện các nhiệm vụ hạ nguồn.
Khuôn khổ MiniGPT-5, một kỹ thuật tạo nội dung đa phương tiện xen kẽ, giới thiệu khái niệm về “các mã thông báo tạo” để giải quyết các thách thức trên. Khuôn khổ này đề xuất một phương pháp mới để tạo ra dữ liệu đa phương tiện bằng cách kết hợp các mô hình ngôn ngữ lớn với các kỹ thuật khuếch tán ổn định bằng cách sử dụng các mã thông báo hình ảnh đặc biệt.

Tuy nhiên, điều phân biệt mô hình MiniGPT-5 với các khuôn khổ hiện có là các giai đoạn chung của khuôn khổ này không bao gồm các chú thích cụ thể cho từng lĩnh vực. Hơn nữa, để đảm bảo rằng văn bản và hình ảnh tạo ra phù hợp với nhau, khuôn khổ MiniGPT-5 triển khai một chiến lược dual-loss và một phương pháp đào tạo hai giai đoạn tiên tiến.
Để cung cấp cho bạn một bản tóm tắt nhanh, khuôn khổ MiniGPT-5
- Đề xuất một phương pháp sử dụng các mã hóa đa phương tiện để tạo ra các đầu ra ngôn ngữ và hình ảnh xen kẽ.
- Đề xuất một chiến lược đào tạo hai giai đoạn để tạo ra các đầu ra đa phương tiện không cần mô tả và bao gồm hướng dẫn phân loại miễn phí trong quá trình đào tạo.
Mô hình MiniGPT-5 được lấy cảm hứng từ các nghiên cứu và công việc trước đây trong các lĩnh vực
- Tạo hình ảnh từ văn bản: Để chuyển đổi các mô tả văn bản thành hình ảnh tương ứng.
- Mô hình ngôn ngữ lớn đa phương tiện: Sử dụng các mô hình ngôn ngữ lớn được đào tạo trước để khám phá các ứng dụng và hiệu quả của chúng trong việc tạo ra dữ liệu đa phương tiện.
- Tạo nội dung đa phương tiện với mô hình ngôn ngữ lớn: Để tăng cường khả năng của mô hình ngôn ngữ lớn trong việc tạo ra dữ liệu ngôn ngữ và hình ảnh.
MiniGPT-5: Phương pháp, Kiến trúc và Khuôn khổ
Để tích hợp các mô hình ngôn ngữ lớn với khả năng tạo nội dung đa phương tiện, mô hình MiniGPT-5 giới thiệu một khuôn khổ nhằm kết hợp các mô hình tạo hình ảnh từ văn bản và các mô hình ngôn ngữ lớn đa phương tiện. Khuôn khổ MiniGPT-5 cũng giới thiệu các “mã thông báo tạo” để giải quyết các vấn đề trên.
Giai đoạn Đầu vào Đa phương tiện
Các phát triển gần đây của các mô hình ngôn ngữ lớn đã mang lại khả năng hiểu biết đa phương tiện cho các mô hình này, cho phép xử lý hình ảnh như một đầu vào tuần tự. Khuôn khổ MiniGPT-5 sử dụng các mã thông báo tạo đặc biệt để tạo ra các tính năng hình ảnh.
Mã hóa Đa phương tiện
Mô hình mã hóa hình ảnh được đào tạo trước trong khuôn khổ MiniGPT-5 chuyển đổi mỗi hình ảnh đầu vào thành một tính năng, và mỗi mã thông báo văn bản được nhúng như một vector. Các tính năng đầu vào được tạo ra khi các mã thông báo này được kết hợp với nhau.
Thêm Mã thông báo Tạo vào Mô hình Ngôn ngữ Lớn
Truyền thống, từ vựng của mô hình ngôn ngữ lớn chỉ bao gồm các mã thông báo văn bản. Vì vậy, các nhà phát triển khuôn khổ MiniGPT-5 đã phải bắc cầu giữa các mô hình tạo và truyền thống. Khuôn khổ này giới thiệu một tập hợp các mã thông báo đặc biệt vào từ vựng của mô hình ngôn ngữ lớn.
PEFT hoặc Đào tạo Tiên tiến Hiệu quả
PEFT hoặc Đào tạo Tiên tiến Hiệu quả là một khái niệm quan trọng được sử dụng để đào tạo các mô hình ngôn ngữ lớn. Tuy nhiên, ứng dụng của PEFT trong các môi trường đa phương tiện vẫn còn hạn chế. Khuôn khổ MiniGPT-5 sử dụng Đào tạo Tiên tiến Hiệu quả trên mã hóa của khuôn khổ MiniGPT-4 để đào tạo mô hình hiểu các hướng dẫn hoặc lệnh tốt hơn.
Tạo Đầu ra Đa phương tiện
Để căn chỉnh mô hình tạo với các mã thông báo tạo chính xác, khuôn khổ MiniGPT-5 tạo ra một mô块 ánh xạ compact để khớp các chiều và kết hợp các tổn thất giám sát, bao gồm tổn thất khuếch tán tiềm ẩn và tổn thất không gian văn bản. Tổn thất khuếch tán tiềm ẩn căn chỉnh các tính năng hình ảnh phù hợp với các mã thông báo trực tiếp, trong khi tổn thất không gian văn bản giúp mô hình học các vị trí chính xác của các mã thông báo.
Tạo Không gian Văn bản
Khuôn khổ MiniGPT-5 sử dụng phương pháp mô hình hóa ngôn ngữ thông thường để tạo ra cả mã thông báo và văn bản trong không gian văn bản cùng nhau. Trong quá trình đào tạo, các nhà phát triển thêm mã thông báo vào vị trí của hình ảnh thực tế và đào tạo mô hình để dự đoán mã thông báo trong quá trình tạo văn bản.
Ánh xạ Tính năng Mã thông báo cho Tạo Hình ảnh
Sau khi tạo không gian văn bản, khuôn khổ căn chỉnh trạng thái đầu ra ẩn với không gian tính năng có điều kiện của mô hình tạo hình ảnh từ văn bản. Khuôn khổ cũng hỗ trợ một mô-đun ánh xạ tính năng bao gồm một mô hình MLP hai lớp, một trình giải mã tính năng có thể học được và một mô hình chuyển đổi mã hóa-giải mã bốn lớp.
Tạo Hình ảnh với LDM hoặc Mô hình Khuếch tán Tiềm ẩn
Để tạo ra hình ảnh cần thiết trong quá trình làm sạch, khuôn khổ sử dụng các tính năng ánh xạ như đầu vào có điều kiện. Khuôn khổ cũng sử dụng Mô hình Khuếch tán Tiềm ẩn để hướng dẫn, và trong quá trình đào tạo, hình ảnh thực tế đầu tiên được chuyển đổi thành một tính năng tiềm ẩn bằng cách sử dụng một mô hình VAE được đào tạo trước.
Phương pháp toàn diện được triển khai bởi khuôn khổ MiniGPT-5 cho phép các nhà phát triển có hiểu biết sâu sắc về việc tạo ra cả nội dung văn bản và hình ảnh, sử dụng các mã thông báo đặc biệt, tận dụng khả năng của các mô hình được đào tạo trước và sử dụng các kỹ thuật đào tạo sáng tạo.
MiniGPT-5: Đào tạo và Kết quả
Khi làm việc trên khuôn khổ MiniGPT-5, các nhà phát triển đã quan sát thấy rằng việc đào tạo trên một tập dữ liệu văn bản và hình ảnh xen kẽ hạn chế có thể dẫn đến hình ảnh có chất lượng thấp và không phù hợp. Để giải quyết vấn đề này, các nhà phát triển đã áp dụng hai chiến lược đào tạo khác nhau.
- Bao gồm việc kết hợp các kỹ thuật hướng dẫn phân loại miễn phí để tăng cường hiệu quả của các mã thông báo tạo trong quá trình khuếch tán.
- Chiến lược thứ hai được chia thành hai giai đoạn
- Giai đoạn đào tạo trước ban đầu tập trung vào việc căn chỉnh các tính năng thô.
- Giai đoạn tinh chỉnh giúp việc học tính năng.
Hướng dẫn Phân loại Miễn phí
Ý tưởng đầu tiên tận dụng hướng dẫn phân loại miễn phí cho việc tạo nội dung đa phương tiện xuất phát từ việc tăng cường sự nhất quán và logic giữa hình ảnh và văn bản tạo ra. Phương pháp này quan sát thấy rằng bằng cách đào tạo trên cả việc tạo không điều kiện và có điều kiện với việc bỏ qua điều kiện, mô hình tạo có thể đạt được kết quả có điều kiện tốt hơn.
Chiến lược Đào tạo Hai Giai đoạn
Do sự thay đổi đáng kể giữa việc tạo hình ảnh và văn bản, khuôn khổ MiniGPT-5 sử dụng một chiến lược đào tạo hai giai đoạn.
- Giai đoạn căn chỉnh đơn phương.
- Giai đoạn học đa phương tiện.
Ban đầu, khuôn khổ căn chỉnh các tính năng tạo hình ảnh với tính năng mã thông báo trong các tập dữ liệu hình ảnh và văn bản đơn. Trong giai đoạn này, khuôn khổ cho phép mô hình ngôn ngữ lớn tạo ra mã thông báo bằng cách sử dụng các chú thích như đầu vào.
Khi giai đoạn căn chỉnh đơn phương được thực hiện thành công, mô hình có thể tạo ra hình ảnh cho các mô tả văn bản đơn, nhưng gặp khó khăn trong việc tạo nội dung đa phương tiện xen kẽ, bao gồm cả văn bản và hình ảnh. Để giải quyết vấn đề này, các nhà phát triển đã tinh chỉnh khuôn khổ MiniGPT-5 bằng cách sử dụng các tham số PEFT bằng cách sử dụng các tập dữ liệu đa phương tiện xen kẽ như VIST.
MiniGPT-5: Benchmark và Kết quả
Để đánh giá hiệu suất của khuôn khổ trong việc tạo nội dung đa phương tiện một cách toàn diện, đội phát triển MiniGPT-5 đã so sánh hiệu suất của nó với các mô hình baseline khác, bao gồm Divter, GILL và mô hình tạo đơn phương được tinh chỉnh.

Khuôn khổ MiniGPT-5 nhận ra rằng đầu ra đa phương tiện có thể có ý nghĩa theo ngữ cảnh, nhưng có thể khác với thực tế. Vì vậy, khuôn khổ này cũng kết hợp đầu vào của con người để đánh giá và đánh giá hiệu suất của mô hình. Tổng thể, hiệu quả của khuôn khổ MiniGPT-5 trong các nhiệm vụ đa phương tiện được đo lường từ ba góc độ.
- Tính nhất quán của Ngôn ngữ: Đánh giá xem nội dung tạo ra có phù hợp với ngữ cảnh một cách mượt mà.
- Chất lượng Hình ảnh: Đánh giá hoặc đánh giá sự liên quan và rõ ràng của hình ảnh tạo ra.
- Tính nhất quán Đa phương tiện: Xác định xem đầu ra kết hợp giữa văn bản và hình ảnh có phù hợp với ngữ cảnh ban đầu.
Đánh giá Bước Cuối VIST
Trong giai đoạn đầu của các thí nghiệm, khuôn khổ MiniGPT-5 nhằm tạo ra hình ảnh tương ứng và bảng dưới đây tóm tắt kết quả thu được từ cài đặt này.

Như có thể thấy, khuôn khổ MiniGPT-5 trong cả ba cài đặt có thể vượt trội so với khuôn khổ SD2 được tinh chỉnh, nhấn mạnh hiệu quả của đường ống MiniGPT-5.

Hình ảnh trên so sánh hiệu suất của khuôn khổ MiniGPT-5 với khuôn khổ MiniGPT-4 được tinh chỉnh trên các chỉ số hiệu suất S-BERT, Rouge-L và Meteor. Kết quả chỉ ra rằng việc sử dụng các mã thông báo tạo không ảnh hưởng tiêu cực đến hiệu suất của khuôn khổ khi thực hiện các nhiệm vụ hiểu biết đa phương tiện. Kết quả cũng chứng minh rằng khuôn khổ MiniGPT-5 có khả năng sử dụng các đầu vào đa phương tiện dài để tạo ra hình ảnh chất lượng cao và nhất quán mà không ảnh hưởng đến khả năng hiểu biết đa phương tiện của mô hình ban đầu.

Bảng trên so sánh hiệu suất của ba khuôn khổ trên 5.000 mẫu cho việc tạo nội dung đa phương tiện từ các góc độ Tính nhất quán Đa phương tiện, Chất lượng Hình ảnh và Tính nhất quán Ngôn ngữ. Như có thể thấy, khuôn khổ MiniGPT-5 vượt trội so với hai mô hình baseline khác trong hơn 70% trường hợp. Mặt khác, bảng dưới đây chứng minh hiệu suất của khuôn khổ MiniGPT-5 trên tập dữ liệu xác thực CC3M cho việc tạo ra hình ảnh đơn. Nhờ vào hạn chế dữ liệu, các nhà phát triển đã tìm thấy một khoảng cách cho việc căn chỉnh mã thông báo khi sử dụng với Khuếch tán Ổn định. Mặc dù hạn chế này, khuôn khổ MiniGPT-5 vẫn vượt trội so với khuôn khổ baseline hiện tại GILL trên tất cả các chỉ số.


Kết luận
Trong bài viết này, chúng ta đã thảo luận về MiniGPT-5, một kỹ thuật tạo nội dung đa phương tiện xen kẽ bằng cách sử dụng “các mã thông báo tạo” để tận dụng khả năng của các mô hình ngôn ngữ lớn trong việc tạo ra dữ liệu đa phương tiện. Chúng ta đã thảo luận về các thành phần và kiến trúc chính của khuôn khổ MiniGPT-5 cùng với các kết quả cho thấy sự cải thiện đáng kể về hiệu suất và hiệu quả so với các mô hình baseline và mô hình hiện tại. MiniGPT-5 nhằm mục đích thiết lập một tiêu chuẩn mới trong lĩnh vực tạo nội dung đa phương tiện và giải quyết các thách thức mà các mô hình trước đây gặp phải khi cố gắng giải quyết cùng một vấn đề.












