Mô hình và nền tảng AI

Mô hình Segment Anything – Máy tính hình ảnh nhận được sự thúc đẩy lớn

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Máy tính hình ảnh (CV) đã đạt được độ chính xác 99% từ 50% trong 10 năm. Công nghệ này dự kiến sẽ cải thiện thêm nữa lên mức chưa từng có với các thuật toán hiện đại và kỹ thuật phân đoạn hình ảnh. Gần đây, phòng thí nghiệm FAIR của Meta đã phát hành Mô hình Segment Anything (SAM) – một bước ngoặt trong phân đoạn hình ảnh. Mô hình tiên tiến này có thể tạo ra các mặt nạ đối tượng chi tiết từ các lời nhắc đầu vào, đưa máy tính hình ảnh lên tầm cao mới. Nó có thể cách mạng hóa cách chúng ta tương tác với công nghệ kỹ thuật số trong thời đại này.

Hãy khám phá phân đoạn hình ảnh và khám phá ngắn gọn cách SAM ảnh hưởng đến máy tính hình ảnh.

Phân đoạn hình ảnh là gì & Các loại phân đoạn hình ảnh?

Phân đoạn hình ảnh là một quá trình trong máy tính hình ảnh chia một hình ảnh thành nhiều vùng hoặc phân đoạn, mỗi vùng đại diện cho một đối tượng hoặc khu vực khác nhau của hình ảnh. Cách tiếp cận này cho phép các chuyên gia cách ly các phần cụ thể của hình ảnh để thu được thông tin có ý nghĩa.

Các mô hình phân đoạn hình ảnh được đào tạo để cải thiện đầu ra bằng cách nhận ra các chi tiết hình ảnh quan trọng và giảm phức tạp. Các thuật toán này hiệu quả phân biệt giữa các vùng khác nhau của hình ảnh dựa trên các tính năng như màu sắc, kết cấu, độ tương phản, bóng và cạnh.

Bằng cách phân đoạn hình ảnh, chúng ta có thể tập trung phân tích vào các vùng quan tâm để có được thông tin chi tiết. Dưới đây là các kỹ thuật phân đoạn hình ảnh khác nhau.

  • Phân đoạn ngữ nghĩa bao gồm gán nhãn cho các pixel vào các lớp ngữ nghĩa.
  • Phân đoạn thể hiện đi xa hơn bằng cách phát hiện và phân biệt từng đối tượng trong hình ảnh.
  • Phân đoạn toàn diện gán các ID thể hiện duy nhất cho các pixel đối tượng riêng lẻ, dẫn đến việc gán nhãn ngữ nghĩa toàn diện và ngữ cảnh hơn cho tất cả các đối tượng trong hình ảnh.

Phân đoạn được thực hiện bằng cách sử dụng các mô hình học sâu dựa trên hình ảnh. Các mô hình này thu thập tất cả các điểm dữ liệu và tính năng có giá trị từ tập dữ liệu đào tạo. Sau đó, chuyển đổi dữ liệu này thành vectơ và ma trận để hiểu các tính năng phức tạp. Một số mô hình học sâu được sử dụng rộng rãi trong phân đoạn hình ảnh là:

  • Mạng nơ-ron tích chập (CNNs)
  • Mạng nơ-ron kết nối đầy đủ (FCNs)
  • Mạng nơ-ron hồi quy (RNNs)

Phân đoạn hình ảnh hoạt động như thế nào?

Trong máy tính hình ảnh, hầu hết các mô hình phân đoạn hình ảnh bao gồm một mạng mã hóa-giải mã. Bộ mã hóa mã hóa một biểu diễn không gian ẩn của dữ liệu đầu vào mà bộ giải mã giải mã để tạo thành các bản đồ phân đoạn, hoặc nói cách khác, các bản đồ phác thảo vị trí của từng đối tượng trong hình ảnh.

Thông thường, quá trình phân đoạn bao gồm 3 giai đoạn:

  • Một bộ mã hóa hình ảnh chuyển đổi hình ảnh đầu vào thành một mô hình toán học (vectơ và ma trận) để xử lý.
  • Bộ mã hóa tổng hợp các vectơ ở nhiều cấp độ.
  • Một bộ giải mã mặt nạ nhanh lấy các bản nhúng hình ảnh làm đầu vào và tạo ra một mặt nạ phác thảo các đối tượng khác nhau trong hình ảnh một cách riêng biệt.

Tình hình phân đoạn hình ảnh

Bắt đầu từ năm 2014, một làn sóng các thuật toán phân đoạn dựa trên học sâu đã xuất hiện, chẳng hạn như CNN+CRF và FCN, đã đạt được tiến bộ đáng kể trong lĩnh vực này. Năm 2015 đã chứng kiến sự ra đời của U-Net và Mạng giải mã, cải thiện độ chính xác của kết quả phân đoạn.

Sau đó, vào năm 2016, Phân đoạn nhận thức thể hiện, V-Net và RefineNet đã cải thiện thêm độ chính xác và tốc độ phân đoạn. Đến năm 2017, Mark-RCNN và FC-DenseNet đã giới thiệu phát hiện đối tượng và dự đoán dày cho các nhiệm vụ phân đoạn.

Vào năm 2018, Phân đoạn toàn diện, Mask-Lab và Mạng mã hóa ngữ cảnh đã trở thành trung tâm của sân khấu khi các phương pháp này giải quyết nhu cầu về phân đoạn cấp thể hiện. Đến năm 2019, Panoptic FPN, HRNet và Chú ý Criss-Cross đã giới thiệu các phương pháp mới cho phân đoạn cấp thể hiện.

Vào năm 2020, xu hướng này tiếp tục với việc giới thiệu Detecto RS, Panoptic DeepLab, PolarMask, CenterMask, DC-NAS và Efficient Net + NAS-FPN. Cuối cùng, vào năm 2023, chúng ta có SAM, mà chúng ta sẽ thảo luận tiếp theo.

Mô hình Segment Anything (SAM) – Phân đoạn hình ảnh mục đích chung

Mô hình Segment Anything (SAM) là một phương pháp mới có thể thực hiện các nhiệm vụ phân đoạn tương tác và tự động trong một mô hình duy nhất. Trước đây, phân đoạn tương tác cho phép phân đoạn bất kỳ lớp đối tượng nào nhưng yêu cầu một người hướng dẫn phương pháp bằng cách tinh chỉnh dần dần một mặt nạ.

Phân đoạn tự động trong SAM cho phép phân đoạn các thể loại đối tượng cụ thể được định nghĩa trước. Giao diện có thể quảng bá của nó làm cho nó rất linh hoạt. Do đó, SAM có thể giải quyết một loạt các nhiệm vụ phân đoạn bằng cách sử dụng một lời nhắc phù hợp, chẳng hạn như nhấp chuột, hộp, văn bản và nhiều hơn nữa.

SAM được đào tạo trên một tập dữ liệu đa dạng và sâu sắc với hơn 1 tỷ mặt nạ, làm cho nó có thể nhận ra các đối tượng và hình ảnh mới không có trong tập dữ liệu đào tạo. Khung khổ hiện đại này sẽ cách mạng hóa rộng rãi các mô hình CV trong các ứng dụng như xe tự lái, bảo mật và thực tế ảo.

SAM có thể phát hiện và phân đoạn các đối tượng xung quanh xe trong xe tự lái, chẳng hạn như các phương tiện khác, người đi bộ và biển báo giao thông. Trong thực tế ảo, SAM có thể phân đoạn môi trường thế giới thực để đặt các đối tượng ảo vào các vị trí phù hợp, tạo ra một trải nghiệm người dùng thực tế và hấp dẫn hơn.

Thử thách phân đoạn hình ảnh năm 2023

Sự gia tăng nghiên cứu và phát triển trong phân đoạn hình ảnh cũng mang lại những thách thức đáng kể. Một số thách thức phân đoạn hình ảnh hàng đầu năm 2023 bao gồm:

  • Sự phức tạp ngày càng tăng của các tập dữ liệu, đặc biệt là đối với phân đoạn hình ảnh 3D
  • Sự phát triển của các mô hình sâu có thể giải thích
  • Sử dụng các mô hình học không giám sát giảm thiểu can thiệp của con người
  • Cần có các mô hình thời gian thực và hiệu quả về bộ nhớ
  • Loại bỏ các nút thắt của phân đoạn điểm đám mây 3D

Tương lai của Máy tính hình ảnh

Thị trường máy tính hình ảnh toàn cầu máy tính hình ảnh ảnh hưởng đến nhiều ngành công nghiệp và dự kiến sẽ đạt hơn $41 tỷ vào năm 2030. Các kỹ thuật phân đoạn hình ảnh hiện đại như Mô hình Segment Anything kết hợp với các thuật toán học sâu khác sẽ làm tăng cường thêm nữa cấu trúc của máy tính hình ảnh trong phong cảnh kỹ thuật số. Do đó, chúng ta sẽ thấy nhiều mô hình máy tính hình ảnh mạnh mẽ và thông minh hơn và các ứng dụng thông minh trong tương lai.

Để tìm hiểu thêm về AI và ML, hãy khám phá Unite.ai – giải pháp một điểm đến tất cả các câu hỏi về công nghệ và trạng thái hiện đại của nó.

Haziqa là một Nhà khoa học dữ liệu với kinh nghiệm rộng rãi trong việc viết nội dung kỹ thuật cho các công ty AI và SaaS.