Nền tảng AI

Computer Vision là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Computer vision là lĩnh vực xây dựng các hệ thống trích xuất thông tin hữu ích từ hình ảnh và video. Một mô hình thị giác có thể phân loại toàn bộ hình ảnh, xác định vị trí các đối tượng, gán nhãn cho mỗi pixel, đọc văn bản, ước lượng tư thế, theo dõi chuyển động, hoặc kết nối nội dung hình ảnh với ngôn ngữ.

Các hệ thống thị giác hiện đại không chỉ tái hiện quá trình phát hiện biên ban đầu của nhận thức con người. Chúng học các biểu diễn đặc thù cho từng nhiệm vụ từ dữ liệu, thường sử dụng mạng nơ-ron tích chập, transformer thị giác, hoặc các mô hình nền tảng đa mô hình.

Những điểm chính

  • Phân loại, phát hiện, phân đoạn, OCR, theo dõi và tạo ra là các nhiệm vụ thị giác riêng biệt.
  • CNN xây dựng tính cục bộ và chia sẻ trọng số; transformer thị giác sử dụng cơ chế attention trên các miếng ảnh.
  • Nhãn có thể được cung cấp bởi con người, giám sát yếu, dữ liệu tổng hợp, hoặc các mục tiêu tự giám sát.
  • Độ chính xác một mình là không đủ: độ bền, độ trễ, quyền riêng tư, thiên lệch và chi phí thất bại đều quan trọng.
One street scene illustrated as image classification, object detection, semantic segmentation, pose estimation, OCR, and tracking
Cùng một hình ảnh hỗ trợ các đầu ra thị giác máy tính khác nhau tùy thuộc vào nhiệm vụ.

Các nhiệm vụ chính của thị giác máy tính

  • Phân loại hình ảnh gán một hoặc nhiều nhãn cho một hình ảnh. Xem cách hoạt động của phân loại hình ảnh.
  • Phát hiện đối tượng dự đoán các danh mục và hộp bao cho nhiều đối tượng.
  • Phân đoạn ngữ nghĩa gán nhãn cho mỗi pixel theo lớp, trong khi phân đoạn thể hiện tách riêng các đối tượng.
  • Nhận dạng ký tự quang học (OCR) phát hiện và chuyển đổi văn bản.
  • Ước lượng tư thế dự đoán các điểm mốc của cơ thể hoặc đối tượng.
  • Theo dõi liên kết các phát hiện qua các khung video.
  • Tạo và chỉnh sửa hình ảnh tạo ra hoặc biến đổi nội dung hình ảnh, thường sử dụng mô hình khuếch tán.

Cách hình ảnh trở thành đầu vào cho mô hình

Một hình ảnh kỹ thuật số đã là dữ liệu số: một tensor chứa giá trị pixel trên các chiều không gian và kênh. Tiền xử lý có thể thay đổi kích thước, chuẩn hoá, cắt hoặc tăng cường hình ảnh. Video bổ sung chiều thời gian, trong khi hình ảnh y tế và khoa học có thể bổ sung độ sâu, bước sóng hoặc các mô thức khác.

Thị giác máy tính truyền thống sử dụng các đặc trưng biên, góc và kết cấu được thiết kế thủ công. Các mô hình sâu hiện đại thường học các đặc trưng cùng với nhiệm vụ, mặc dù các phương pháp truyền thống vẫn hữu ích khi dữ liệu hạn chế, quy tắc đã được hiểu rõ, hoặc yêu cầu tính toán phải tối thiểu.

CNN và các đặc trưng cục bộ được học

CNN áp dụng các kernel đã học lên các khu vực lân cận cục bộ. Các lớp đầu tiên có thể phản hồi các mẫu cục bộ, trong khi các khối sau này kết hợp chúng thành các biểu diễn liên quan đến nhiệm vụ. Các phép pooling hoặc stride giảm độ phân giải không gian, và các kết nối residual giúp mạng sâu dễ tối ưu hơn.

Một bộ phân loại CNN hiện đại thường sử dụng global pooling thay vì một chuỗi lớn các lớp fully connected. Các bộ phát hiện và mạng phân đoạn thêm các head chuyên biệt hoặc các đường giải mã để bảo tồn thông tin không gian.

Transformer thị giác và các mô hình nền tảng

Transformer thị giác chia một hình ảnh thành các miếng (patch), nhúng chúng và sử dụng attention để mô hình hoá mối quan hệ giữa chúng. Transformer có thể mở rộng hiệu quả với các bộ dữ liệu lớn và pretraining, trong khi CNN thường cung cấp các giả định tích hợp mạnh mẽ hơn và hiệu quả ở quy mô nhỏ.

Các mô hình đa mô thức căn chỉnh hình ảnh với văn bản để người dùng có thể tìm kiếm, tạo chú thích, trả lời câu hỏi, hoặc hướng dẫn phân đoạn bằng ngôn ngữ. Những mô hình này mở rộng khả năng nhưng cũng kế thừa những điểm yếu từ dữ liệu quy mô web rộng, bao gồm các định kiến, tài liệu có bản quyền và sự phủ sóng không đồng đều của các dân cư và môi trường.

Nhãn, tự giám sát và dữ liệu tổng hợp

Việc tạo các hộp bao, mặt nạ, điểm mốc và chú thích có thể tốn kém. Học tự giám sát suy ra các mục tiêu từ chính hình ảnh, trong khi giám sát yếu sử dụng các nhãn nhiễu hoặc gián tiếp. Dữ liệu tổng hợp có thể bổ sung các kịch bản hiếm, nhưng khoảng cách mô phỏng có thể ngăn hiệu suất tổng hợp chuyển sang thế giới thực.

Chất lượng chú thích phải được đo lường. Các nhãn mơ hồ, ranh giới không nhất quán và thiếu đối tượng đặt ra một giới hạn cho hiệu suất và có thể che giấu các thất bại trong các nhóm phụ.

Cách đánh giá các hệ thống thị giác

Phân loại sử dụng các chỉ số như độ chính xác, độ chính xác (precision), độ thu hồi (recall), F1 và hiệu chuẩn. Phát hiện thường dùng Intersection over Union và Mean Average Precision. Phân đoạn sử dụng Intersection over Union hoặc các thước đo kiểu Dice. Theo dõi bổ sung các chỉ số nhận dạng và quỹ đạo.

Chỉ số phải phù hợp với môi trường triển khai. Một mô hình có thể đạt điểm cao trên bộ chuẩn được chọn lọc nhưng vẫn thất bại trong mưa, ánh sáng yếu, góc camera bất thường, thiết bị mới, hoặc dân cư không quen thuộc. Đánh giá nên bao gồm sự dịch chuyển phân phối, các điều kiện đối kháng và độ trễ vận hành.

Quyền riêng tư, thiên lệch và triển khai

Khuôn mặt, biển số xe, nhà ở, ảnh y tế và video tại nơi làm việc có thể tiết lộ thông tin nhạy cảm. Việc thu thập và lưu trữ nên tuân theo cơ sở pháp lý và đạo đức đã định, với kiểm soát truy cập và tối thiểu hoá dữ liệu. Phân tích khuôn mặt và nhận dạng sinh trắc học đòi hỏi sự thẩm định đặc biệt vì lỗi và giám sát có thể gây hại không đồng đều.

Triển khai ở biên (edge) có thể giảm độ trễ và chuyển dữ liệu. Edge AI, lượng tử hoá, tỉa nhánh và các bộ tăng tốc chuyên dụng có thể làm cho hệ thống thị giác khả dụng trên camera, xe, robot và thiết bị di động, nhưng việc nén cần được đánh giá lại về độ chính xác và thiên lệch.

Từ pixel đến các nhiệm vụ thị giác

Computer vision chuyển đổi hình ảnh hoặc video thành các đầu ra nhiệm vụ như phân loại, phát hiện, phân đoạn, theo dõi, tư thế, độ sâu, luồng quang học, hoặc nhận dạng văn bản. Định nghĩa nhiệm vụ quyết định cách chú thích: một nhãn hình ảnh không thể huấn luyện vị trí chính xác, và một hộp bao không thể mô tả đầy đủ mặt nạ phân đoạn. Hình học camera, ống kính, phơi sáng, ánh sáng, chuyển động, nén và góc nhìn định hình phân phối dữ liệu. Xác định môi trường hoạt động và hậu quả lỗi trước khi chọn mô hình, vì bộ sưu tập ảnh chuẩn có thể không đại diện cho cảm biến hoặc cảnh thực tế.

Một pipeline giải mã và định hướng phương tiện, thay đổi kích thước hoặc chia thành các ô, chuẩn hoá giá trị, áp dụng tăng cường không làm thay đổi nhãn, chạy mô hình, và xử lý hậu kỳ các logits, hộp, mặt nạ hoặc đường theo dõi. Bộ phát hiện đối tượng sử dụng ngưỡng độ tin cậy và loại bỏ trùng lặp; bộ theo dõi liên kết các phát hiện theo thời gian; phân đoạn có thể yêu cầu làm sạch hình thái. Bảo tồn các phép biến đổi tọa độ để đầu ra khớp với hình ảnh gốc. Chia dữ liệu theo người, camera, vị trí hoặc phiên ghi để tránh các khung gần như giống nhau xuất hiện trong cả tập huấn luyện và kiểm tra.

Đánh giá, thiên lệch, quyền riêng tư và vận hành

Các chỉ số phải phù hợp với nhiệm vụ và cách sử dụng. Phân loại cần độ chính xác và độ thu hồi riêng cho từng lớp; phát hiện sử dụng Intersection-over-Union và average precision qua các ngưỡng; phân đoạn sử dụng IoU hoặc Dice; theo dõi bổ sung các chuyển đổi nhận dạng; độ trễ và thời gian mất sự kiện quan trọng đối với video. Báo cáo kết quả theo ánh sáng, khoảng cách, thiết bị, che khuất, tông da, tuổi và các điều kiện liên quan khác. Kiểm tra hiệu chuẩn và các lỗi có độ tin cậy cao. Dữ liệu tổng hợp hoặc tăng cường có thể lấp đầy khoảng trống nhưng cần so sánh với dữ liệu triển khai thực tế và không được rò rỉ các cảnh kiểm tra.

Vision có thể thu thập người qua lại, địa điểm, sinh trắc học và hành vi nhạy cảm. Giảm thiểu việc ghi lại và lưu trữ, bảo mật luồng dữ liệu, hạn chế sử dụng phụ, và cung cấp thông báo hoặc đồng ý khi cần. Kiểm tra các miếng vá đối kháng, phát lại, che khuất, lỗi camera và sự dịch chuyển miền. Giám sát sức khỏe cảm biến, thống kê đầu vào, tốc độ đầu ra và kết quả đã xác nhận; duy trì đánh giá con người cho các quyết định quan trọng. Làm mờ hoặc cắt ảnh có thể giảm phơi bày nhưng cũng có thể xóa bỏ bằng chứng. Điểm số cao trong phòng thí nghiệm không biện minh cho các tuyên bố về danh tính, cảm xúc hoặc ý định vượt ra ngoài nhiệm vụ đã được xác thực.

Ví dụ thực tế: phát hiện người đi bộ tại ngã ba kho

Các camera giám sát một ngã ba xe cấm, và mô hình phát hiện người thay vì nhận dạng họ. Dữ liệu bao phủ ngày và đêm, thời tiết, trang phục, che khuất, người dùng xe lăn, vị trí camera và các cảnh trống, được chia theo phiên ghi. Bộ phát hiện được đánh giá về độ thu hồi sự kiện, báo động sai, vị trí, thời gian cảnh báo trước, và hiệu suất ở khoảng cách. Kỹ thuật an toàn xác định độ trễ tối đa chấp nhận được và các biện pháp kiểm soát vật lý độc lập.

Cảnh báo thị giác có thể làm chậm xe, nhưng dừng khẩn cấp và rào chắn không phụ thuộc vào mô hình đã học. Sự cản trở camera, khung hình đóng băng, mất mạng và thời gian chờ mô hình tạo ra các lỗi rõ ràng. Việc lưu trữ video gốc được giảm thiểu và truy cập được ghi lại. Giám sát theo dõi sức khỏe cảm biến, tần suất cảnh báo, các sự cố đã xem xét và các trường hợp suýt trượt theo điều kiện. Bất kỳ việc di chuyển hoặc thay đổi bố trí camera nào cũng kích hoạt việc xác nhận lại vì sự tương đồng hình ảnh bề ngoài không đảm bảo cùng hình học hoặc rủi ro.

Bằng chứng triển khai và sẵn sàng vận hành

Quyết định triển khai cần hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường hoạt động, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp bình thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, mất phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu dịch vụ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền lực cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát bằng các lỗi được chèn cố ý. Dữ liệu telemetry vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, trạng thái phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu khôi phục, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Computer vision có giống với nhận dạng hình ảnh không?

Không. Nhận dạng hình ảnh thường chỉ đề cập đến phân loại hoặc nhận dạng. Computer vision còn bao gồm định vị, phân đoạn, đo lường, theo dõi, tái tạo, tạo ra và suy luận trên thông tin hình ảnh.

Hệ thống thị giác có nhìn giống con người không?

Không. Một mô hình xử lý các đầu vào số dựa trên kiến trúc và mục tiêu huấn luyện của nó. Nó có thể vượt trội hơn con người trên một bộ chuẩn hẹp nhưng lại thất bại khi gặp những thay đổi nhỏ mà con người có thể xử lý dễ dàng.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.