Nền tảng AI

Phân loại hình ảnh hoạt động như thế nào?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Phân loại hình ảnh dự đoán một nhãn cho toàn bộ hình ảnh. Nó trả lời các câu hỏi như “Danh mục sản phẩm nào đang hiển thị?” hoặc “Quét này có chứa mục tiêu không?” Nó không tự mình xác định vị trí từng đối tượng hay vẽ đường viền các pixel.

Các hệ thống hiện đại thường sử dụng mạng nơ-ron tích chập (CNN) hoặc bộ biến đổi thị giác (vision transformers), thường được khởi tạo bằng trọng số đã được huấn luyện trước. Hiệu năng đáng tin cậy vẫn phụ thuộc vào nhãn, mẫu, tăng cường dữ liệu, hiệu chỉnh và kiểm thử trong các điều kiện triển khai thực tế.

Những điểm chính

  • Phân loại gán nhãn cho toàn bộ hình ảnh; phát hiện vẽ hộp bao quanh đối tượng và phân đoạn gán các vùng cấp pixel.
  • Huấn luyện trước và học chuyển giao có thể giảm nhu cầu dữ liệu, nhưng sự không khớp miền có thể làm mất lợi ích.
  • Độ chính xác tổng thể có thể che giấu sự mất cân bằng lớp, các đường tắt ngẫu nhiên và hiệu chỉnh kém.
  • Chất lượng hình ảnh, thiết bị chụp, vị trí địa lý và thay đổi quy trình đều có thể tạo ra sự dịch chuyển phân phối.
How Does Image Classification Work? diagram showing image, preprocess, backbone, logits, probabilities, validate
Một bộ phân loại có thể triển khai bao gồm xử lý bất định và kiểm tra sự dịch chuyển miền.

Từ pixel đến điểm số

Hình ảnh được thay đổi kích thước hoặc cắt, chuẩn hoá và chuyển thành tensor. Tăng cường dữ liệu có thể áp dụng các biến đổi giữ nguyên nhãn như lật, cắt hoặc thay đổi màu sắc. Một mô hình nền (backbone) ánh xạ các pixel thành các đặc trưng; đầu ra phân loại tạo ra logits được chuyển thành điểm số tương đối cho các lớp.

Quá trình tiền xử lý được chọn phải phù hợp với môi trường triển khai. Việc cắt trung tâm làm mất đối tượng liên quan hoặc sự không khớp chuẩn hoá có thể làm giảm hiệu năng ngay cả khi trọng số đã được huấn luyện không thay đổi.

CNN và bộ biến đổi thị giác

Mạng nơ-ron tích chập sử dụng các bộ lọc cục bộ và trọng số chia sẻ để xây dựng các đặc trưng không gian. Các kết nối dư thừa (residual) giúp các CNN rất sâu dễ tối ưu hơn. Bộ biến đổi thị giác chia hình ảnh thành các mảnh và dùng cơ chế attention để mô hình hoá mối quan hệ giữa chúng.

So sánh kiến trúc nên kiểm soát các yếu tố như dữ liệu huấn luyện, tăng cường, tính toán và độ phân giải. Mô hình tốt nhất trên một chuẩn công cộng không nhất thiết là lựa chọn phù hợp cho thiết bị biên, tập dữ liệu nhỏ hoặc yêu cầu giải thích.

Học chuyển giao và thiết kế dữ liệu

Học chuyển giao bắt đầu từ các trọng số đã được huấn luyện trên một tập dữ liệu nguồn lớn hơn. Nhóm phát triển có thể đóng băng backbone, tinh chỉnh các lớp sau hoặc cập nhật toàn bộ mô hình. Việc tinh chỉnh thường cần tốc độ học thấp hơn và một tập kiểm định không rò rỉ.

Nhãn nên mô tả những gì có thể suy ra bằng mắt thường. Nếu một chẩn đoán phụ thuộc vào tiền sử bệnh nhân không có trong hình ảnh, bộ phân loại không thể học được quyết định lâm sàng đầy đủ. Các bản sao, khung từ cùng một video và hình ảnh từ cùng một đối tượng phải ở trong cùng một phần chia.

Đánh giá, bất định và các đường tắt

Độ chính xác Top-1 yêu cầu lớp có điểm cao nhất phải đúng; độ chính xác top-k chấp nhận lớp đúng nằm trong k lớp có điểm cao nhất. Độ chính xác, độ thu hồi từng lớp và một ma trận nhầm lẫn cho thấy các lỗi không đồng đều.

Mô hình có thể lợi dụng nền, dấu nước, thiết bị thu thập hoặc khung hình thay vì đối tượng mong muốn. Các kiểm tra phản thực, phân tích nhóm phụ và công cụ saliency có thể giúp phát hiện các đường tắt, nhưng bản đồ nhiệt giải thích không phải là bằng chứng cho lý luận nhân quả.

Giám sát triển khai

Kiểm tra trong môi trường sản xuất nên bao gồm các tệp hỏng, kích thước không mong đợi, mờ, ánh sáng, mẫu máy ảnh và các lớp mới. Độ tin cậy cần được hiệu chỉnh trên dữ liệu mô phỏng triển khai, và các đầu vào ngoài phạm vi nên bị từ chối hoặc xem xét.

Việc giám sát nhãn trễ và thay đổi chi phí lỗi là điều thiết yếu. Một mô hình có vẻ ổn định dựa trên thống kê đầu vào vẫn có thể thất bại nếu mối quan hệ giữa pixel và nhãn thay đổi.

Xây dựng bộ dữ liệu phân loại hình ảnh

Phân loại hình ảnh gán một hoặc nhiều nhãn cho toàn bộ hình ảnh. Nó khác với phát hiện, vốn xác định vị trí các đối tượng, và phân đoạn, vốn gán nhãn cho các pixel. Xác định phạm vi lớp, cấu trúc phân cấp, quy tắc đa nhãn, các danh mục nền hoặc không xác định, và bằng chứng nào phải hiển thị. Thu thập các máy ảnh, địa điểm, ánh sáng, góc nhìn, khoảng cách và đối tượng đại diện cho môi trường triển khai. Chia dữ liệu theo đối tượng, cảnh, phiên hoặc nguồn trước khi tăng cường; các khung video liền kề hoặc hình ảnh sản phẩm trùng lặp qua các phân vùng gây rò rỉ nghiêm trọng.

Hướng dẫn chú thích nên bao gồm che khuất, đối tượng mơ hồ, đa lớp, chất lượng thấp và từ chối gán nhãn. Đo lường sự đồng thuận và xem xét các bất đồng hệ thống. Cân bằng lớp một mình không đảm bảo độ bao phủ: một lớp bệnh có thể chỉ bao gồm một thiết bị hoặc một lớp động vật hoang dã chỉ có một nền. Kiểm tra siêu dữ liệu và các bản sao gần nhau, và giữ một tập kiểm tra được bảo vệ từ việc thu thập độc lập. Dữ liệu tổng hợp và thu thập từ web có thể mở rộng đa dạng nhưng mang lại các vấn đề về giấy phép, nguồn gốc, phong cách và nhãn cần được đo lường trên hình ảnh thực.

Mô hình, huấn luyện và đánh giá

Các phương pháp cổ điển kết hợp các mô tả được thiết kế sẵn với bộ phân loại; các hệ thống hiện đại sử dụng mạng tích chập hoặc bộ biến đổi thị giác, thường thông qua học chuyển giao. Lựa chọn thay đổi kích thước và cắt ảnh quyết định thông tin nào còn lại. Tăng cường dữ liệu nên phản ánh các biến thể hợp lệ và giữ nguyên nhãn. Tối ưu hàm mất mát phù hợp với nhiệm vụ, xử lý mất cân bằng bằng cách cân nhắc trọng số hoặc mẫu, và chọn các checkpoint dựa trên dữ liệu kiểm định. So sánh với một baseline đơn giản và loại bỏ từng yếu tố như tăng cường, độ phân giải và khởi tạo đã huấn luyện trước để hiểu nguồn gốc của cải thiện.

Báo cáo độ chính xác, độ thu hồi, F1, ma trận nhầm lẫn từng lớp, độ chính xác top-k khi thích hợp, hiệu chỉnh và hiệu năng theo điều kiện. Kiểm tra mờ, nén, ánh sáng, cắt, che khuất, thiết bị và các đầu vào không có lớp hỗ trợ. Ngưỡng độ tin cậy có thể chuyển các trường hợp không chắc chắn sang xem xét; xác suất softmax không đảm bảo độ tin cậy, đặc biệt khi có sự dịch chuyển. Các nền phản thực và kiểm tra che khuất tiết lộ việc học các đường tắt. Đối với các ứng dụng liên quan đến an toàn, đánh giá các thất bại trong trường hợp xấu nhất và hậu quả của các dự đoán dương tính và âm tính sai.

Triển khai và giám sát

Đóng gói các bước giải mã, chuyển đổi màu, định hướng, chuẩn hoá, mô hình và bản đồ nhãn lại cùng nhau. Xác thực artefact đã xuất hoặc đã lượng tử trên các thiết bị mục tiêu và đo độ trễ đầu cuối, bộ nhớ, năng lượng và thông lượng. Giám sát chất lượng hình ảnh, phân phối đầu vào và đầu ra, hiệu chỉnh, nhãn đã xác nhận và tình trạng cảm biến. Giảm thiểu và bảo mật việc lưu trữ hình ảnh, đặc biệt là khuôn mặt, vị trí và người qua đường. Cung cấp cơ chế dự phòng cho các đầu vào hỏng hoặc ngoài phạm vi và quay lại các phiên bản mô hình trước. Phân loại trả lời câu hỏi cấp hình ảnh đã định; không nên mở rộng thành các yêu cầu định vị, nhận dạng hay ý định không được hỗ trợ.

Ví dụ thực tế: phân loại vật liệu tái chế

Một cơ sở chụp ảnh các vật phẩm trên băng chuyền và gán nhãn lớp vật liệu, mức độ ô nhiễm và chưa xác định. Hình ảnh được chia theo ngày thu thập và lô vật phẩm, bao gồm các yếu tố ánh sáng, bề mặt ướt, gập nếp, chồng chéo và băng trống. Một CNN nhỏ và mô hình đã được huấn luyện trước được so sánh với các quy tắc màu và hình dạng. Độ thu hồi từng lớp, sắp xếp sai, hiệu chỉnh, thông lượng và kết quả theo camera và điều kiện vật liệu quyết định lựa chọn.

Quy trình sản xuất kiểm tra độ phơi sáng của camera và thời gian băng, sau đó chuyển các vật phẩm không chắc chắn sang luồng chung thay vì ép buộc một lớp. Việc suy luận lượng tử được xác thực trên phần cứng chính xác. Giám sát theo dõi chất lượng đầu vào, tỷ lệ lớp, các trường hợp bị từ chối và kiểm tra mẫu thủ công; bao bì mới kích hoạt cập nhật dữ liệu đã xem xét. Mô hình điều khiển một bộ phân loại có giới hạn với các rào chắn vật lý, và sự cố cảm biến hoặc mô hình sẽ đưa cơ chế về trạng thái an toàn thay vì lẫn lộn vật liệu một cách âm thầm.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường hoạt động, đầu vào, đầu ra, các phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một tập đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị bỏ quên. Đo lường chất lượng nhiệm vụ cùng với hiệu chỉnh hoặc bất định, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì cơ chế dự phòng an toàn, và xác thực giám sát bằng các lỗi được chèn cố ý. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Định nghĩa ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng ngoại tuyến sẽ duy trì. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình khôi phục, học từ sự cố, xóa và lưu trữ tài liệu, và một điểm rõ ràng khi nó nên được vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Bộ phân loại hình ảnh có thể nhận dạng nhiều đối tượng không?

Một bộ phân loại đa nhãn có thể chỉ ra các danh mục có mặt, nhưng không xác định vị trí từng đối tượng. Cần có phát hiện đối tượng để có hộp bao quanh hoặc đếm số lượng.

Tại sao một mô hình có thể thất bại trên những bức ảnh trông bình thường đối với con người?

Nó có thể dựa vào các hiện tượng nhiễu khi chụp, kết cấu hoặc các tương quan đã thay đổi. Những khác biệt nhỏ trong quá trình tiền xử lý và sự dịch chuyển miền cũng có thể ảnh hưởng đến các đặc trưng đã học.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.