Mô hình và nền tảng AI
TinySAM : Mô hình Segment Anything Hiệu Quả
Phân đoạn đối tượng là một lĩnh vực cơ bản và quan trọng trong tầm nhìn máy tính hiện đại. Nó đóng vai trò quan trọng trong các ứng dụng yêu cầu thành phần hình ảnh rộng lớn, chẳng hạn như định vị và xác định đối tượng, và đòi hỏi phân đoạn nhanh chóng, chính xác và theo thời gian thực. Sự quan trọng này đã khiến phân đoạn đối tượng trở thành một chủ đề nghiên cứu nóng, với nhiều công việc đáng kể được thực hiện trong các lĩnh vực như phân đoạn thể hiện, phân đoạn ngữ nghĩa và phân đoạn toàn diện.
Với sự tiến hóa của phân đoạn đối tượng, Mô hình Segment Anything (SAM) đã xuất hiện như một công cụ đáng chú ý, thể hiện khả năng phân đoạn vượt trội và nhanh chóng được áp dụng trong các ứng dụng tầm nhìn máy tính khác nhau. Các khuôn khổ sử dụng kiến trúc SAM đã đạt được hiệu suất ấn tượng trong các nhiệm vụ tầm nhìn hạ lưu. Tuy nhiên, mặc dù khả năng và độ chính xác cao trong các nhiệm vụ phân đoạn, kiến trúc phức tạp và nặng của SAM đòi hỏi sức mạnh tính toán đáng kể, cản trở việc triển khai trên các thiết bị có tài nguyên hạn chế.
Để giải quyết thách thức tính toán của SAM, các nhà nghiên cứu đã phát triển Tiny Segment Anything Model (TinySAM), giữ lại hiệu suất không cần đào tạo của khuôn khổ ban đầu trong khi trở nên nhẹ hơn. TinySAM sử dụng phương pháp khuếch tán kiến thức toàn giai đoạn với mẫu nhắc nhở khó trực tuyến để tạo ra một mô hình học sinh hiệu quả hơn. Quantization sau đào tạo được điều chỉnh cho các nhiệm vụ phân đoạn có thể nhắc nhở进一步 giảm nhu cầu tính toán. Ngoài ra, thiết kế của TinySAM nhằm phân đoạn phân cấp mọi thứ, gần như gấp đôi tốc độ suy luận mà không ảnh hưởng đến hiệu suất.
Bài viết này đi sâu vào khuôn khổ TinySAM, khám phá các nguyên tắc cơ bản, kiến trúc và hiệu suất so với các khuôn khổ phân đoạn khác hiện đại. Hãy cùng khám phá các khía cạnh này chi tiết hơn.
TinySAM : Mô hình Segment Anything Hiệu Quả
Mô hình Segment Anything đã giúp tiến bộ nhanh chóng của nhiều ứng dụng tầm nhìn máy tính nhờ khả năng phân đoạn đáng chú ý cùng với một bộ dữ liệu phân đoạn lớn chứa hơn 11 triệu hình ảnh và hơn một tỷ mặt nạ hình ảnh. Nhờ hiệu suất vượt trội trên các nhiệm vụ phân đoạn đối tượng với các thể loại và hình dạng tùy ý, nó phục vụ như nền tảng cho các khuôn khổ thực hiện các nhiệm vụ hạ lưu như điền hình ảnh, theo dõi đối tượng, tầm nhìn 3D và nhiều hơn. Hơn nữa, Mô hình Segment Anything cũng cung cấp hiệu suất phân đoạn không cần đào tạo đáng chú ý đã được lợi ích trong các ngành công nghiệp nhạy cảm làm việc với lượng dữ liệu hạn chế, bao gồm nghiên cứu y tế và hình ảnh y tế.
Mặc dù không thể đặt câu hỏi về khả năng phân đoạn đáng chú ý của Mô hình Segment Anything trên nhiều nhiệm vụ tầm nhìn hạ lưu, nó có nhược điểm về kiến trúc phức tạp, nhu cầu tính toán cao và chi phí hoạt động đáng kể. Đối với một hệ thống chạy trên GPU hiện đại, thời gian suy luận của mô hình SAM có thể lên đến 2 giây cho hình ảnh 1024×1024. Do đó, việc triển khai ứng dụng SAM trên các thiết bị có tài nguyên hạn chế là một nhiệm vụ rất khó khăn. Để vượt qua rào cản này, các công việc gần đây như MobileSAM và FastSAM đã cố gắng phát triển một mô hình SAM có hiệu quả tính toán hơn. Khuôn khổ MobileSAM cố gắng thay thế thành phần nặng trong mã hóa hình ảnh bằng kiến trúc của khuôn khổ TinyViT, trong khi mô hình FastSAM chuyển nhiệm vụ phân đoạn sang nhiệm vụ phân đoạn thể hiện với chỉ một thể loại với mô hình YoloV8. Mặc dù những phương pháp này đã đạt được một số mức độ thành công trong việc giảm nhu cầu tính toán, chúng không thể duy trì hiệu suất, đặc biệt là trên các nhiệm vụ không cần đào tạo hạ lưu.
TinySAM hoặc Tiny Segment Anything Model là một nỗ lực để giảm nhu cầu tính toán của mô hình SAM hiện tại mà không ảnh hưởng đến hiệu suất trên các nhiệm vụ không cần đào tạo hạ lưu. Hơn nữa, khuôn khổ TinySAM đề xuất thực hiện một phương pháp khuếch tán kiến thức toàn giai đoạn trong kiến trúc của nó với mục tiêu cải thiện khả năng của mạng học sinh compact. Khuôn khổ TinySAM khuếch tán mạng học sinh một cách toàn diện dưới sự giám sát của mạng giáo viên từ các giai đoạn khác nhau. Để tăng cường hiệu suất hơn nữa, khuôn khổ cho phép quá trình khuếch tán chú ý hơn đến các ví dụ khó bằng cách thực hiện một chiến lược lấy mẫu nhắc nhở khó trực tuyến bổ sung. Hơn nữa, để giảm thêm chi phí tính toán, khuôn khổ TinySAM暴露 các nhiệm vụ phân đoạn có thể nhắc nhở cho các thành phần quantization sau đào tạo.
Phần lớn nhu cầu tính toán của Mô hình Segment Anything là do mô hình tạo ra các mặt nạ lớn từ các điểm nhắc nhở lưới để phân đoạn mọi thứ trong hình ảnh. Để vượt qua nhu cầu tính toán của chiến lược phân đoạn này, khuôn khổ TinySAM sử dụng một chiến lược phân đoạn phân cấp mọi thứ, gần như gấp đôi tốc độ suy luận mà không ảnh hưởng đến hiệu suất. Với những phương pháp này được triển khai trong kiến trúc của nó, khuôn khổ TinySAM cung cấp sự giảm đáng kể trong nhu cầu tính toán và thiết lập các giới hạn mới cho các nhiệm vụ phân đoạn mọi thứ hiệu quả.
TinySAM : Kiến Trúc và Phương Pháp
Trước khi chúng ta thảo luận về kiến trúc và phương pháp của khuôn khổ TinySAM, điều quan trọng là phải xem xét trước tiên về tiền thân của nó, khuôn khổ SAM. Kể từ khi ra mắt, Mô hình Segment Anything đã thể hiện hiệu suất đáng chú ý, tính linh hoạt và khả năng tổng quát hóa trên nhiều nhiệm vụ tầm nhìn và phân đoạn đối tượng.
Ở cốt lõi, mô hình SAM bao gồm ba mạng con: mạng mã hóa nhắc nhở, mạng mã hóa hình ảnh và mạng giải mã mặt nạ. Mục tiêu chính của mạng mã hóa nhắc nhở là mã hóa các mặt nạ có hình dạng tùy ý, điểm và hộp nhập, và văn bản tự do với thông tin vị trí. Mạng mã hóa hình ảnh là một mạng nặng dựa trên Vision Transformer (ViT) mà trích xuất hình ảnh đầu vào thành các bản nhúng. Mô hình sử dụng các mạng khác nhau để xử lý các nhắc nhở hình học và văn bản. Cuối cùng, mạng giải mã mặt nạ chứa một bộ chuyển đổi hai chiều nhận đầu ra của mạng mã hóa nhắc nhở và mạng mã hóa hình ảnh để tạo ra dự đoán mặt nạ cuối cùng. Với bộ dữ liệu, khuôn khổ SAM thể hiện khả năng phân đoạn chất lượng cao cho các đối tượng bất kể hình dạng và thể loại. Hơn nữa, Mô hình Segment Anything cũng thể hiện hiệu suất đáng chú ý trên các nhiệm vụ tầm nhìn không cần đào tạo hạ lưu, bao gồm đề xuất đối tượng, phát hiện cạnh, dự đoán mặt nạ từ văn bản và phân đoạn thể hiện. Nhờ khả năng phân đoạn chất lượng cao và tính linh hoạt của nhắc nhở, các khuôn khổ SAM hình thành nền tảng cho các ứng dụng tầm nhìn. Tuy nhiên, không thể bỏ qua nhu cầu tính toán cao của kiến trúc SAM truyền thống với số lượng tham số lớn, khiến việc triển khai các ứng dụng dựa trên SAM trên các thiết bị có tài nguyên hạn chế gần như không thể.
Khuếch Tán Kiến Thức
Khuếch tán kiến thức là một phương pháp quan trọng để tăng cường hiệu suất của các mạng compact trong quá trình đào tạo. Phương pháp khuếch tán kiến thức sử dụng đầu ra của mạng giáo viên để giám sát quá trình đào tạo của mạng học sinh nhẹ. Phương pháp khuếch tán kiến thức có thể được chia thành hai phân loại: khuếch tán cho các tính năng trung gian và khuếch tán cho đầu ra mạng, với đa số công việc nghiên cứu về khuếch tán kiến thức tập trung vào các nhiệm vụ phân loại hình ảnh.
Với điều đó được nói, hình sau minh họa kiến trúc chung của khuôn khổ TinySAM cùng với tổng quan về hiệu suất trên các nhiệm vụ phân đoạn thể hiện không cần đào tạo.

Trong giai đoạn đầu, khuôn khổ TinySAM thực hiện khuếch tán kiến thức được thiết kế đặc biệt cho khuôn khổ SAM, và để kích hoạt quá trình khuếch tán hơn nữa, mô hình sử dụng một chiến lược lấy mẫu nhắc nhở khó trực tuyến để khai thác kiến thức khó cho mạng học sinh từ mạng giáo viên. Trong giai đoạn thứ hai, khuôn khổ TinySAM điều chỉnh phương pháp quantization sau đào tạo cho các nhiệm vụ phân đoạn có thể nhắc nhở và thực hiện nó trên mạng học sinh nhẹ. Cuối cùng, mô hình thực hiện chế độ suy luận phân đoạn phân cấp mọi thứ được thiết kế cho các nhiệm vụ phân đoạn, dẫn đến việc tăng gấp đôi tốc độ suy luận mà không mất đi độ chính xác.
Khuếch Tán Kiến Thức Toàn Giai Đoạn
Như đã đề cập trước đó, Mô hình Segment Anything bao gồm ba mạng con tại cốt lõi: mạng mã hóa nhắc nhở, mạng mã hóa hình ảnh và mạng giải mã mặt nạ, với thành phần mã hóa hình ảnh được xây dựng trên Vision Transformer và có nhu cầu tính toán cao. Để giải quyết vấn đề này, khuôn khổ MobileSAM đã thay thế Vision Transformer bằng TinyViT, mặc dù sự thay thế này không hiệu quả do sự suy giảm hiệu suất đáng kể. Để đảm bảo không có sự suy giảm hiệu suất, khuôn khổ TinySAM thực hiện một phương pháp khuếch tán kiến thức toàn giai đoạn hướng dẫn mạng mã hóa hình ảnh nhẹ từ cấp độ học tập đến cấp độ kiến thức đa dạng. Ngoài sự mất mát thông thường giữa các nhãn ground-truth và kết quả dự đoán, khuôn khổ TinySAM giới thiệu nhiều mất mát khuếch tán trong các giai đoạn khác nhau như thể hiện trong hình sau.

Quantization
Quantization mô hình là một phương pháp phổ biến trong các khuôn khổ tầm nhìn máy tính, và được sử dụng để nén mô hình bằng cách quantize trọng số hoặc hoạt động từ băng thông cao hơn sang thấp hơn trong một nỗ lực để giảm phức tạp tính toán và yêu cầu lưu trữ mà không làm suy giảm chất lượng đầu ra đáng kể.
Mục tiêu chính của quantization trong TinySAM là chiếu tensor điểm nổi lên tensor số nguyên bằng cách sử dụng một yếu tố tỷ lệ với metric đo lường khoảng cách giữa nhân ma trận và ma trận quantized đóng vai trò quan trọng trong việc tối ưu hóa yếu tố tỷ lệ.
Phân Đoạn Phân Cấp Mọi Thứ
Mô hình Segment Anything đề xuất sử dụng một máy tạo mặt nạ tự động lấy mẫu điểm như một lưới để phân đoạn mọi thứ trong hình ảnh. Tuy nhiên, nó đã được chỉ ra rằng việc sử dụng lưới điểm dày đặc dẫn đến đầu ra phân đoạn quá mịn và quá trình này đòi hỏi nhu cầu tính toán và chi phí hoạt động cao. Hơn nữa, ở một bên, quá nhiều điểm lấy mẫu cho một đối tượng hoàn chỉnh có thể dẫn đến việc các phần khác nhau của đối tượng được phân đoạn không chính xác như các mặt nạ riêng biệt, trong khi ở bên kia, chi phí thời gian của chế độ suy luận mọi thứ chủ yếu là do việc mạng mã hóa hình ảnh đã bị thu nhỏ đáng kể. Để giảm chi phí hoạt động của chế độ mọi thứ, khuôn khổ TinySAM sử dụng một phương pháp tạo mặt nạ phân cấp, với sự khác biệt trong chiến lược so với khuôn khổ SAM ban đầu được minh họa trong hình sau.

Khác với phương pháp được thực hiện trong khuôn khổ SAM ban đầu, mô hình TinySAM chỉ sử dụng 25% điểm trên mỗi bên, do đó chỉ sử dụng 1/16 số điểm có sẵn trong cài đặt ban đầu. Mô hình sau đó suy luận mạng giải mã mặt nạ và mạng mã hóa nhắc nhở với các nhắc nhở này và nhận được đầu ra. Mô hình sau đó lọc một số mặt nạ với độ tin cậy vượt quá một ngưỡng nhất định và mặt nạ các vị trí tương ứng như các khu vực cho dự đoán cuối cùng. Vì mô hình coi các khu vực này là kết quả phân đoạn của các thể hiện có độ tin cậy cao, nó không cần phải tạo nhắc nhở điểm. Chiến lược này không chỉ giúp ngăn chặn việc phân đoạn quá mịn của đối tượng mà còn giúp giảm đáng kể chi phí hoạt động và nhu cầu tính toán. Khuôn khổ sau đó hợp nhất và xử lý sau các kết quả của hai vòng để nhận được mặt nạ cuối cùng.
TinySAM : Thử Nghiệm và Kết Quả
Để tăng tốc quá trình khuếch tán, khuôn khổ TinySAM tính toán và lưu trữ các bản nhúng hình ảnh từ mạng giáo viên trước, do đó không cần thiết phải tính toán lại mạng mã hóa hình ảnh nặng của mạng giáo viên trong quá trình đào tạo. Đối với quantization sau đào tạo, khuôn khổ TinySAM quantize tất cả các lớp nhân ma trận, lớp convolution, lớp deconvolution và lớp tuyến tính, với mô hình sử dụng các yếu tố tỷ lệ theo kênh cho cả convolution và deconvolution. Đối với các lớp nhân ma trận, mô hình thực hiện các yếu tố tỷ lệ theo đầu, trong khi đối với các lớp tuyến tính, mô hình thực hiện các yếu tố tỷ lệ tuyến tính. Mô hình cũng thực hiện đánh giá trên các nhiệm vụ không cần đào tạo hạ lưu.
Đối với các nhiệm vụ phân đoạn thể hiện trong môi trường không cần đào tạo, khuôn khổ TinySAM tuân theo các cài đặt thử nghiệm của tiền thân của nó, Mô hình Segment Anything, và sử dụng kết quả phát hiện đối tượng của khuôn khổ Vision Transformer Det-H hoặc VitDet-H cho phân đoạn thể hiện. Như được minh họa trong hình sau, khuôn khổ TinySAM vượt trội so với các phương pháp hiện có về độ chính xác phân đoạn thể hiện và điểm FLOPs.

Hơn nữa, hiệu suất định tính của mô hình TinySAM được minh họa trong hình sau cho phân đoạn thể hiện không cần đào tạo, với hộp màu xanh lá cây đại diện cho các nhắc nhở hộp.

Về đánh giá mặt nạ hợp lệ không cần đào tạo, mô hình TinySAM vượt trội so với khuôn khổ MobileSAM đáng kể trên các bộ dữ liệu khác nhau và cung cấp kết quả tốt hơn đáng kể khi số điểm nhắc nhở được sử dụng bởi khuôn khổ ít hơn.

Hơn nữa, bảng sau tóm tắt kết quả của việc tăng tốc và giảm nhu cầu tính toán đạt được nhờ chiến lược mọi thứ phân cấp. Mô hình áp dụng cùng một điểm số ổn định và giá trị ngưỡng cho các chiến lược khác nhau để so sánh công bằng, và kết quả được tóm tắt dưới đây.

Suy Nghĩ Cuối Cùng
Trong bài viết này, chúng ta đã thảo luận về TinySAM, một khuôn khổ được đề xuất nhằm đẩy ranh giới cho các nhiệm vụ phân đoạn mọi thứ, và nhận được một kiến trúc mô hình hiệu quả với ít nhu cầu tính toán và độ chính xác tương đương với khuôn khổ SAM ban đầu. TinySAM hoặc Tiny Segment Anything Model giữ lại hiệu suất không cần đào tạo của khuôn khổ ban đầu. Khuôn khổ TinySAM đầu tiên thực hiện một phương pháp khuếch tán kiến thức toàn giai đoạn sử dụng mẫu nhắc nhở khó trực tuyến để khuếch tán một mô hình học sinh nhẹ. Khuôn khổ TinySAM sau đó điều chỉnh quantization sau đào tạo cho các nhiệm vụ phân đoạn có thể nhắc nhở, giúp giảm thêm nhu cầu tính toán. Hơn nữa, khuôn khổ cũng nhằm phân đoạn phân cấp mọi thứ, gần như gấp đôi tốc độ suy luận mà không ảnh hưởng đến hiệu suất.












