Nền tảng AI
Máy Tính Nhìn là gì?
Máy Tính Nhìn là gì?
Các thuật toán máy tính nhìn là một trong những hệ thống AI mạnh mẽ và biến đổi nhất trên thế giới hiện nay. Các hệ thống máy tính nhìn được sử dụng trong các phương tiện tự hành, điều hướng robot, hệ thống nhận dạng khuôn mặt và nhiều hơn nữa. Tuy nhiên, máy tính nhìn là gì chính xác? Chúng hoạt động như thế nào? Để trả lời những câu hỏi này, chúng ta sẽ深入 vào lý thuyết về máy tính nhìn, các thuật toán máy tính nhìn và các ứng dụng của các hệ thống máy tính nhìn.
Làm thế nào Các Hệ thống Máy tính nhìn Hoạt động?
Để hiểu rõ cách các hệ thống máy tính nhìn hoạt động, hãy dành một chút thời gian để thảo luận về cách con người nhận biết các vật thể. Giải thích tốt nhất về cách chúng ta nhận biết các vật thể là một mô hình mô tả giai đoạn đầu của nhận dạng vật thể là một quá trình mà các thành phần cơ bản của các vật thể, chẳng hạn như hình dạng, màu sắc và độ sâu, được giải thích bởi não bộ trước. Các tín hiệu từ mắt vào não được phân tích để lấy ra các cạnh của một vật thể trước, và các cạnh này được kết hợp thành một biểu diễn phức tạp hơn để hoàn thành hình dạng của vật thể.
Các hệ thống máy tính nhìn hoạt động rất giống với hệ thống thị giác của con người, bằng cách đầu tiên phân biệt các cạnh của một vật thể và sau đó kết hợp các cạnh này thành hình dạng của vật thể. Sự khác biệt lớn là vì máy tính giải thích hình ảnh dưới dạng số, nên một hệ thống máy tính nhìn cần một số cách để giải thích các pixel riêng lẻ tạo nên hình ảnh. Hệ thống máy tính nhìn sẽ gán giá trị cho các pixel trong hình ảnh và bằng cách kiểm tra sự khác biệt giữa giá trị của một vùng pixel và một vùng pixel khác, máy tính có thể phân biệt các cạnh. Ví dụ, nếu hình ảnh đang được hỏi là hình ảnh thang độ xám, thì giá trị sẽ nằm trong khoảng từ đen (được biểu diễn bằng 0) đến trắng (được biểu diễn bằng 255). Một sự thay đổi đột ngột trong khoảng giá trị của các pixel gần nhau sẽ chỉ ra một cạnh.
Nguyên tắc cơ bản này về việc so sánh giá trị pixel cũng có thể được thực hiện với hình ảnh màu, với máy tính so sánh sự khác biệt giữa các kênh màu RGB khác nhau. Vậy bây giờ chúng ta đã biết cách một hệ thống máy tính nhìn kiểm tra giá trị pixel để giải thích một hình ảnh, hãy xem xét kiến trúc của một hệ thống máy tính nhìn.
Mạng Nơ-ron Lồi (CNNs)
Loại AI chính được sử dụng trong các nhiệm vụ máy tính nhìn là dựa trên mạng nơ-ron lồi. Vậy convolution chính xác là gì?
Convolution là các quá trình toán học mà mạng sử dụng để xác định sự khác biệt giữa giá trị của các pixel. Nếu bạn hình dung một lưới giá trị pixel, hãy tưởng tượng một lưới nhỏ hơn được di chuyển trên lưới chính này. Các giá trị dưới lưới thứ hai đang được mạng phân tích, vì vậy mạng chỉ phân tích một số pixel tại một thời điểm. Điều này thường được gọi là kỹ thuật “cửa sổ trượt”. Các giá trị được phân tích bởi cửa sổ trượt được mạng tóm tắt, giúp giảm độ phức tạp của hình ảnh và làm cho nó dễ dàng hơn cho mạng để trích xuất các mẫu.
Mạng nơ-ron lồi được chia thành hai phần khác nhau, phần lồi và phần kết nối đầy đủ. Các lớp lồi của mạng là các bộ trích xuất tính năng, nhiệm vụ của chúng là phân tích các pixel trong hình ảnh và tạo ra các biểu diễn của chúng mà các lớp kết nối đầy đủ của mạng nơ-ron có thể học các mẫu từ đó. Các lớp lồi bắt đầu bằng việc chỉ kiểm tra các pixel và trích xuất các tính năng thấp cấp của hình ảnh như các cạnh. Các lớp lồi sau đó kết hợp các cạnh này thành các hình dạng phức tạp hơn. Đến cuối cùng, mạng hy vọng sẽ có một biểu diễn về các cạnh và chi tiết của hình ảnh mà nó có thể truyền đến các lớp kết nối đầy đủ.
Chú thích Hình ảnh
Mặc dù mạng nơ-ron lồi có thể trích xuất các mẫu từ hình ảnh một mình, nhưng độ chính xác của hệ thống máy tính nhìn có thể được cải thiện đáng kể bằng cách chú thích hình ảnh. Chú thích hình ảnh là quá trình thêm siêu dữ liệu vào hình ảnh để hỗ trợ bộ phân loại trong việc phát hiện các vật thể quan trọng trong hình ảnh. Việc sử dụng chú thích hình ảnh là quan trọng bất cứ khi nào các hệ thống máy tính nhìn cần phải chính xác cao, chẳng hạn như khi điều khiển một phương tiện tự hành hoặc robot.
Có nhiều cách để chú thích hình ảnh để cải thiện hiệu suất của bộ phân loại máy tính nhìn. Chú thích hình ảnh thường được thực hiện với các hộp giới hạn, một hộp bao quanh các cạnh của vật thể mục tiêu và thông báo cho máy tính tập trung sự chú ý của nó vào trong hộp. Phân đoạn ngữ nghĩa là một loại chú thích hình ảnh khác, hoạt động bằng cách gán một lớp hình ảnh cho mỗi pixel trong hình ảnh. Nói cách khác, mỗi pixel có thể được coi là “cỏ” hoặc “cây” sẽ được dán nhãn thuộc về các lớp đó. Kỹ thuật này cung cấp độ chính xác ở cấp pixel, nhưng việc tạo ra các chú thích phân đoạn ngữ nghĩa phức tạp và tốn thời gian hơn so với việc tạo ra các hộp giới hạn đơn giản. Các phương pháp chú thích khác, như đường và điểm, cũng tồn tại.












