Mô hình và nền tảng AI
Các Transformer Tầm nhìn Vượt qua Thử thách với Phương pháp ‘Chú ý Cluster’ Mới
Các công nghệ trí tuệ nhân tạo (AI), đặc biệt là Các Transformer Tầm nhìn (ViTs), đã thể hiện tiềm năng lớn trong khả năng nhận dạng và phân loại đối tượng trong hình ảnh. Tuy nhiên, ứng dụng thực tế của chúng đã bị giới hạn bởi hai thách thức lớn: yêu cầu năng lực tính toán cao và thiếu minh bạch trong quá trình ra quyết định. Hiện tại, một nhóm nghiên cứu đã phát triển một giải pháp đột phá: một phương pháp mới gọi là “Chú ý Cluster” (PaCa). PaCa nhằm mục đích nâng cao khả năng của ViTs trong nhận dạng, phân loại và phân đoạn đối tượng hình ảnh, đồng thời giải quyết các vấn đề lâu dài về yêu cầu tính toán và minh bạch quyết định.
Địa chỉ Thử thách của ViTs: Một cái nhìn về Giải pháp Mới
Các Transformer, nhờ khả năng vượt trội, là một trong những mô hình mạnh mẽ nhất trong thế giới AI. Sức mạnh của những mô hình này đã được mở rộng sang dữ liệu hình ảnh thông qua ViTs, một lớp transformer được đào tạo với dữ liệu hình ảnh. Mặc dù tiềm năng to lớn của ViTs trong việc giải thích và hiểu hình ảnh, chúng đã bị kìm hãm bởi một số vấn đề lớn.
Trước hết, do bản chất của hình ảnh chứa một lượng lớn dữ liệu, ViTs yêu cầu năng lực tính toán và bộ nhớ đáng kể. Sự phức tạp này có thể quá tải cho nhiều hệ thống, đặc biệt khi xử lý hình ảnh độ phân giải cao. Thứ hai, quá trình ra quyết định trong ViTs thường bị che khuất và không rõ ràng. Người dùng gặp khó khăn trong việc hiểu làm thế nào ViTs phân biệt giữa các đối tượng hoặc tính năng khác nhau trong hình ảnh, điều này rất quan trọng cho nhiều ứng dụng.
Tuy nhiên, phương pháp PaCa sáng tạo cung cấp một giải pháp cho cả hai thách thức này. “Chúng tôi giải quyết thách thức liên quan đến yêu cầu tính toán và bộ nhớ bằng cách sử dụng kỹ thuật phân cụm, cho phép kiến trúc transformer tập trung vào các đối tượng trong hình ảnh”, Tianfu Wu, tác giả chính của một bài báo về công việc này và là Giáo sư Phó tại Đại học North Carolina, giải thích.
Sử dụng kỹ thuật phân cụm trong PaCa giảm đáng kể yêu cầu tính toán, biến quá trình từ một quá trình bậc hai thành một quá trình tuyến tính có thể quản lý được. Wu giải thích thêm, “Bằng cách phân cụm, chúng tôi có thể biến quá trình này thành một quá trình tuyến tính, nơi mỗi đơn vị nhỏ chỉ cần so sánh với một số lượng cụm đã xác định trước.”
Phân cụm cũng giúp làm rõ quá trình ra quyết định trong ViTs. Quá trình hình thành cụm cho thấy làm thế nào ViT quyết định những tính năng nào quan trọng trong việc nhóm các phần dữ liệu hình ảnh lại với nhau. Vì AI chỉ tạo ra một số lượng cụm hạn chế, người dùng có thể dễ dàng hiểu và kiểm tra quá trình ra quyết định, cải thiện đáng kể khả năng giải thích của mô hình.
Phương pháp PaCa Vượt trội so với Các ViTs Hiện đại khác
Thông qua thử nghiệm toàn diện, các nhà nghiên cứu đã tìm thấy rằng phương pháp PaCa vượt trội so với các ViT khác trên nhiều mặt. Wu cho biết, “Chúng tôi phát hiện ra rằng PaCa vượt trội so với SWin và PVT ở mọi mặt.” Quá trình thử nghiệm cho thấy PaCa excelled trong việc phân loại và nhận dạng đối tượng trong hình ảnh và phân đoạn, đồng thời xác định ranh giới của các đối tượng trong hình ảnh một cách hiệu quả. Hơn nữa, nó được tìm thấy là tiết kiệm thời gian hơn, thực hiện các nhiệm vụ nhanh hơn so với các ViT khác.
Khuyến khích bởi thành công của PaCa, nhóm nghiên cứu nhằm mục đích phát triển thêm bằng cách đào tạo nó trên các tập dữ liệu cơ bản lớn hơn. Bằng cách làm như vậy, họ hy vọng sẽ mở rộng ranh giới của những gì có thể đạt được với AI dựa trên hình ảnh.
Bài báo nghiên cứu, “PaCa-ViT: Học Chú ý Cluster trong Các Transformer Tầm nhìn“, sẽ được trình bày tại Hội nghị sắp tới về Máy tính và Nhận dạng Mẫu của IEEE/CVF. Đây là một cột mốc quan trọng có thể mở đường cho các hệ thống AI hiệu quả, minh bạch và dễ tiếp cận hơn.












