Mô hình và nền tảng AI
YOLO-World: Phát Hiện Đối Tượng Mở Ngôn Từ Trong Thời Gian Thực
Phát hiện đối tượng đã trở thành một thách thức cơ bản trong ngành trí tuệ nhân tạo, với các ứng dụng trong lĩnh vực robot, hiểu hình ảnh, phương tiện tự động và nhận dạng hình ảnh. Trong những năm gần đây, các công trình đột phá trong lĩnh vực trí tuệ nhân tạo, đặc biệt là thông qua các mạng nơ-ron sâu, đã thúc đẩy đáng kể việc phát hiện đối tượng. Tuy nhiên, các mô hình này có từ vựng cố định, chỉ giới hạn trong việc phát hiện đối tượng trong 80 danh mục của bộ dữ liệu COCO. Giới hạn này xuất phát từ quá trình đào tạo, nơi các bộ phát hiện đối tượng được đào tạo để nhận ra chỉ các danh mục cụ thể, do đó hạn chế khả năng áp dụng của chúng.
Để vượt qua điều này, chúng tôi giới thiệu YOLO-World, một phương pháp đổi mới nhằm nâng cao khả năng của khuôn khổ YOLO (You Only Look Once) với khả năng phát hiện đối tượng mở ngôn từ. Điều này được thực hiện bằng cách đào tạo trước khuôn khổ trên các bộ dữ liệu lớn và thực hiện phương pháp mô hình hóa ngôn ngữ-hình ảnh. Cụ thể, YOLO-World sử dụng một mạng lưới聚 hợp đường dẫn ngôn ngữ-hình ảnh có thể tái tham số hóa (RepVL-PAN) và tổn thất tương phản ngôn ngữ-hình ảnh để thúc đẩy sự tương tác giữa thông tin ngôn ngữ và hình ảnh. Thông qua RepVL-PAN và tổn thất tương phản ngôn ngữ-hình ảnh, YOLO-World có thể phát hiện chính xác và hiệu quả một loạt các đối tượng trong môi trường không có dữ liệu đào tạo, thể hiện hiệu suất đáng kể trong việc phân đoạn và phát hiện đối tượng mở ngôn từ.
Bài viết này nhằm cung cấp một hiểu biết sâu sắc về nền tảng kỹ thuật, kiến trúc mô hình, quá trình đào tạo và các kịch bản ứng dụng của YOLO-World. Hãy cùng khám phá.
YOLO-World: Phát Hiện Đối Tượng Mở Ngôn Từ Trong Thời Gian Thực
YOLO hoặc You Only Look Once là một trong những phương pháp phổ biến nhất cho việc phát hiện đối tượng hiện đại trong ngành trí tuệ nhân tạo. Nổi tiếng với tốc độ và hiệu suất đáng kinh ngạc, sự ra đời của cơ chế YOLO đã cách mạng hóa cách máy móc diễn giải và phát hiện đối tượng cụ thể trong hình ảnh và video trong thời gian thực. Các khuôn khổ phát hiện đối tượng truyền thống thực hiện một phương pháp phát hiện đối tượng hai bước: trong bước đầu tiên, khuôn khổ đề xuất các vùng có thể chứa đối tượng, và khuôn khổ phân loại đối tượng trong bước tiếp theo. Khuôn khổ YOLO tích hợp hai bước này vào một mô hình mạng nơ-ron đơn, một phương pháp cho phép khuôn khổ nhìn vào hình ảnh chỉ một lần để dự đoán đối tượng và vị trí của nó trong hình ảnh, và do đó, tên YOLO hoặc You Only Look Once.
Hơn nữa, khuôn khổ YOLO xử lý việc phát hiện đối tượng như một vấn đề hồi quy, và dự đoán trực tiếp các xác suất lớp và hộp giới hạn từ hình ảnh đầy đủ trong một cái nhìn đơn. Việc thực hiện phương pháp này không chỉ tăng tốc độ của quá trình phát hiện, mà còn tăng cường khả năng của mô hình để khái quát hóa từ dữ liệu phức tạp và đa dạng, làm cho nó trở thành một lựa chọn phù hợp cho các ứng dụng hoạt động trong thời gian thực như lái xe tự động, phát hiện tốc độ hoặc nhận dạng biển số.
Tiếp theo, các mô hình ngôn ngữ-hình ảnh gần đây sử dụng kiến thức từ vựng được chưng cất từ các bộ mã hóa ngôn ngữ để giải quyết việc phát hiện đối tượng mở ngôn từ. Mặc dù các khuôn khổ này hoạt động tốt hơn so với các mô hình phát hiện đối tượng truyền thống trong việc phát hiện đối tượng mở ngôn từ, chúng vẫn có khả năng áp dụng hạn chế do sự khan hiếm của dữ liệu đào tạo với sự đa dạng từ vựng hạn chế.
Khuôn khổ YOLO-World nhằm đạt được việc phát hiện đối tượng mở ngôn từ hiệu quả cao, và khám phá khả năng của các phương pháp đào tạo trước quy mô lớn để tăng cường hiệu suất của các bộ phát hiện đối tượng truyền thống cho việc phát hiện đối tượng mở ngôn từ.
Mô hình YOLO-World bao gồm một bộ mã hóa văn bản, một bộ phát hiện đối tượng YOLO, và một thành phần mạng lưới聚 hợp đường dẫn ngôn ngữ-hình ảnh có thể tái tham số hóa (RepVL-PAN), như được minh họa trong hình ảnh sau.

Đối với một văn bản đầu vào, bộ mã hóa văn bản mã hóa văn bản thành các bản mã hóa văn bản, tiếp theo là việc trích xuất các tính năng đa quy mô từ hình ảnh đầu vào bởi các bộ phát hiện đối tượng trong thành phần YOLO.
Bộ Phát Hiện Đối Tượng YOLO
Mô hình YOLO-World được xây dựng trên khuôn khổ YOLOv8 hiện có, bao gồm một thành phần lõi Darknet, một đầu ra cho mã hóa đối tượng và hồi quy hộp giới hạn, và một mạng lưới đường dẫn tổng hợp (PAN) cho các kim tự tháp tính năng đa quy mô.
Bộ Mã Hóa Văn Bản
Đối với một văn bản cho trước, mô hình YOLO-World trích xuất các bản mã hóa văn bản tương ứng bằng cách sử dụng một bộ mã hóa văn bản CLIP Transformer đã được đào tạo trước với một số danh từ và chiều kích bản mã hóa.
Đầu Tương Phản Văn Bản
Mô hình YOLO-World sử dụng một đầu tương phản văn bản để thu được sự tương tự đối tượng-văn bản bằng cách sử dụng phương pháp chuẩn hóa L2 và bản mã hóa văn bản.
Đào Tạo Từ Vựng Trực Tuyến
Trong quá trình đào tạo, mô hình YOLO-World xây dựng một từ vựng trực tuyến cho mỗi mẫu mosaic bao gồm 4 hình ảnh.
Sử Dụng Từ Vựng Ngoại Tuyến
Trong quá trình suy luận, mô hình YOLO-World trình bày một chiến lược “đề xuất rồi phát hiện” với từ vựng ngoại tuyến để tăng cường hiệu suất của mô hình.
Mạng Lưới Đường Đẫn Ngôn Ngữ-Hình Ảnh Có Thể Tái Tham Số Hóa (RevVL-PAN)
Hình sau minh họa cấu trúc của mạng lưới đường dẫn ngôn ngữ-hình ảnh có thể tái tham số hóa được đề xuất.

Phương Thức Đào Tạo Trước
Mô hình YOLO-World tuân theo hai phương thức đào tạo trước chính: Học từ tổn thất tương phản ngôn ngữ-hình ảnh và Gán nhãn giả với dữ liệu hình ảnh-văn bản.
YOLO-World: Kết Quả
Sau khi mô hình YOLO-World đã được đào tạo trước, nó được đánh giá trực tiếp trên bộ dữ liệu LVIS trong môi trường không có dữ liệu đào tạo.

Tư Duy Cuối Cùng
Trong bài viết này, chúng ta đã thảo luận về YOLO-World, một phương pháp đổi mới nhằm nâng cao khả năng của khuôn khổ YOLO với khả năng phát hiện đối tượng mở ngôn từ.












