Nền tảng AI
Những gì là CNNs (Mạng Nơ-ron Lồi)?
Có thể bạn đã từng thắc mắc làm thế nào Facebook (META ) hoặc Instagram có thể tự động nhận diện khuôn mặt trong một hình ảnh, hoặc làm thế nào Google (GOOGL ) cho phép bạn tìm kiếm web cho hình ảnh tương tự chỉ bằng cách tải lên một hình ảnh của riêng bạn. Những tính năng này là ví dụ về tầm nhìn máy tính, và chúng được cung cấp bởi mạng nơ-ron lồi (CNNs). Vậy chính xác thì mạng nơ-ron lồi là gì? Hãy cùng tìm hiểu kiến trúc của một CNN và hiểu cách chúng hoạt động.
Những gì là Mạng Nơ-ron?
Trước khi chúng ta bắt đầu nói về mạng nơ-ron lồi, hãy dành một chút thời gian để định nghĩa mạng nơ-ron thông thường. Có một bài viết khác về chủ đề mạng nơ-ron có sẵn, vì vậy chúng ta sẽ không đi quá sâu vào chúng ở đây. Tuy nhiên, để định nghĩa ngắn gọn, chúng là các mô hình tính toán được lấy cảm hứng từ não bộ con người. Một mạng nơ-ron hoạt động bằng cách nhận dữ liệu và điều chỉnh “trọng số”, những giả định về cách các tính năng đầu vào liên quan đến nhau và lớp của đối tượng. Khi mạng được đào tạo, các giá trị của trọng số được điều chỉnh và chúng sẽ hội tụ đến trọng số mà chính xác nắm bắt được mối quan hệ giữa các tính năng.
Đây là cách một mạng nơ-ron tiến hành hoạt động, và CNNs bao gồm hai phần: một mạng nơ-ron tiến hành và một nhóm các lớp lồi.
Những gì là Mạng Nơ-ron Lồi (CNNs)?
Những “lồi” trong mạng nơ-ron lồi là gì? Một lồi là một phép toán toán học tạo ra một tập hợp trọng số, cơ bản tạo ra một biểu diễn của các phần của hình ảnh. Tập hợp trọng số này được gọi là lõi hoặc bộ lọc. Bộ lọc được tạo ra nhỏ hơn hình ảnh đầu vào, chỉ bao phủ một phần của hình ảnh. Các giá trị trong bộ lọc được nhân với các giá trị trong hình ảnh. Bộ lọc sau đó được di chuyển để tạo ra một biểu diễn của một phần mới của hình ảnh, và quá trình này được lặp lại cho đến khi toàn bộ hình ảnh đã được bao phủ.
Một cách khác để nghĩ về điều này là tưởng tượng một bức tường gạch, với gạch代表 các pixel trong hình ảnh đầu vào. Một “cửa sổ” được trượt qua lại dọc theo bức tường, đó là bộ lọc. Những gạch có thể nhìn thấy qua cửa sổ là những pixel có giá trị được nhân với các giá trị trong bộ lọc. Vì lý do này, phương pháp tạo trọng số với một bộ lọc thường được gọi là kỹ thuật “cửa sổ trượt”.
Đầu ra từ các bộ lọc được di chuyển xung quanh toàn bộ hình ảnh đầu vào là một mảng hai chiều đại diện cho toàn bộ hình ảnh. Mảng này được gọi là “bản đồ tính năng”.
Tại sao Lồi là Thiết yếu
Mục đích của việc tạo lồi là gì? Lồi là cần thiết vì một mạng nơ-ron phải có khả năng giải thích các pixel trong hình ảnh dưới dạng giá trị số. Chức năng của các lớp lồi là chuyển đổi hình ảnh thành giá trị số mà mạng nơ-ron có thể giải thích và sau đó trích xuất các mẫu liên quan. Công việc của các bộ lọc trong mạng lồi là tạo ra một mảng hai chiều của các giá trị có thể được truyền vào các lớp sau của mạng nơ-ron, những lớp sẽ học các mẫu trong hình ảnh.
Bộ lọc và Kênh

Ảnh: cecebur qua Wikimedia Commons, CC BY SA 4.0 (https://commons.wikimedia.org/wiki/File:Convolutional_Neural_Network_NeuralNetworkFeatureLayers.gif)
CNNs không sử dụng chỉ một bộ lọc để học mẫu từ hình ảnh đầu vào. Nhiều bộ lọc được sử dụng, vì các mảng khác nhau được tạo ra bởi các bộ lọc khác nhau dẫn đến một biểu diễn phức tạp, phong phú hơn của hình ảnh đầu vào. Các số bộ lọc phổ biến cho CNNs là 32, 64, 128 và 512. Số bộ lọc càng nhiều, cơ hội để CNN xem xét dữ liệu đầu vào và học từ nó càng nhiều.
Một CNN phân tích sự khác biệt về giá trị pixel để xác định ranh giới của các đối tượng. Trong một hình ảnh thang độ xám, CNN chỉ xem xét sự khác biệt giữa đen và trắng, từ sáng đến tối. Khi hình ảnh là hình ảnh màu, không chỉ CNN xem xét sự khác biệt về sáng và tối, mà nó còn phải xem xét ba kênh màu khác nhau – đỏ, xanh lá cây và xanh da trời. Trong trường hợp này, các bộ lọc có 3 kênh, giống như hình ảnh bản thân. Số kênh mà một bộ lọc có được gọi là độ sâu của nó, và số kênh trong bộ lọc phải khớp với số kênh trong hình ảnh.
Kiến trúc Mạng Nơ-ron Lồi (CNN)
Hãy cùng xem kiến trúc hoàn chỉnh của một mạng nơ-ron lồi. Một lớp lồi được tìm thấy ở đầu mỗi mạng lồi, vì nó cần thiết để chuyển đổi dữ liệu hình ảnh thành mảng số. Tuy nhiên, các lớp lồi cũng có thể đến sau các lớp lồi khác, có nghĩa là các lớp này có thể được xếp chồng lên nhau. Việc có nhiều lớp lồi có nghĩa là đầu ra từ một lớp có thể trải qua các lồi thêm và được nhóm lại thành các mẫu liên quan. Về thực tế, điều này có nghĩa là khi dữ liệu hình ảnh đi qua các lớp lồi, mạng bắt đầu “nhận ra” các tính năng phức tạp hơn của hình ảnh.
Các lớp đầu tiên của một ConvNet chịu trách nhiệm trích xuất các tính năng cấp thấp, chẳng hạn như các pixel tạo thành các đường thẳng đơn giản. Các lớp sau của ConvNet sẽ kết hợp các đường thẳng này thành hình dạng. Quá trình này của việc di chuyển từ phân tích bề mặt đến phân tích sâu tiếp tục cho đến khi ConvNet nhận ra các hình dạng phức tạp như động vật, khuôn mặt người và ô tô.
Sau khi dữ liệu đã đi qua tất cả các lớp lồi, nó sẽ đi vào phần kết nối dày đặc của CNN. Các lớp kết nối dày đặc là những gì một mạng nơ-ron tiến hành truyền thống trông như, một loạt các nút được sắp xếp thành các lớp được kết nối với nhau. Dữ liệu đi qua các lớp kết nối dày đặc này, những lớp học các mẫu được trích xuất bởi các lớp lồi, và bằng cách đó, mạng trở nên có khả năng nhận ra các đối tượng.












