Nền tảng AI

Mạng Nơ-ron là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Một mạng nơ-ron nhân tạo là một mô hình toán học có tham số được tạo thành từ các lớp các phép toán kết nối. Trong quá trình huấn luyện, mạng điều chỉnh các tham số sao cho đầu vào được ánh xạ tới các đầu ra hữu ích. Mạng nơ-ron có thể xấp xỉ các quan hệ phi tuyến phức tạp và học các biểu diễn trực tiếp từ văn bản, hình ảnh, âm thanh, chuỗi thời gian và các dữ liệu khác.

Tên gọi này được lấy cảm hứng lịch sử từ các nơ-ron sinh học, nhưng các mạng hiện đại là các hệ thống kỹ thuật hơn là các mô phỏng thực tế của não bộ. Các thuật ngữ như “neuron” và “learning” chỉ là cách viết tắt hữu ích và không nên nhầm lẫn thành bằng chứng cho khả năng nhận thức giống con người.

Những điểm chính

  • Một nơ-ron tính tổng có trọng số, cộng thêm một độ lệch có thể huấn luyện, và áp dụng một hàm kích hoạt.
  • Một lần truyền tiến tạo ra dự đoán; hàm mất mát đo lường lỗi; lan truyền ngược tính gradient; một bộ tối ưu cập nhật các tham số.
  • MLP, CNN, RNN và transformer sắp xếp các kết nối theo cách khác nhau.
  • Thêm lớp hoặc tham số không tự động tạo ra mô hình tốt hơn hoặc đáng tin cậy hơn.
Annotated neural network with inputs, weighted connections, hidden activations, output, loss, and backward gradient arrows
Một mạng nơ-ron được huấn luyện qua một lần truyền tiến, tính toán hàm mất mát, tính gradient và cập nhật tham số.

Từ một nơ-ron nhân tạo đơn lẻ tới một mạng

Với một vector đầu vào x, một đơn vị cơ bản tính toán:

z = Wx + b
output = activation(z)

W chứa các trọng số có thể huấn luyện và b là độ lệch có thể huấn luyện. Hàm kích hoạt tạo ra tính phi tuyến. Các trọng số không “đi qua” hàm kích hoạt một cách riêng biệt; hàm kích hoạt được áp dụng lên tổng có trọng số và độ lệch.

Một multilayer perceptron (MLP) xếp chồng các lớp dày đặc. Lớp đầu vào đại diện cho các đặc trưng, các lớp ẩn biến đổi chúng, và lớp đầu ra được thiết kế cho nhiệm vụ—ví dụ, logits lớp hoặc giá trị hồi quy.

Cách mạng nơ-ron học

  1. Mô hình khởi tạo các tham số có thể huấn luyện.
  2. Một lần truyền tiến xử lý một batch và tạo ra dự đoán.
  3. Hàm mất mát so sánh dự đoán với mục tiêu huấn luyện.
  4. Backpropagation sử dụng quy tắc chuỗi để tính gradient.
  5. Một bộ tối ưu như stochastic gradient descent hoặc AdamW cập nhật trọng số và độ lệch.

Backpropagation trở thành trung tâm của việc huấn luyện mạng nơ-ron thông qua các công trình được phát triển và phổ biến trong nhiều thập kỷ; nó không phải được tạo ra lần đầu tiên trong thời kỳ deep learning gần đây. Các khung hiện đại thực hiện tự động phân biệt ngược (reverse-mode automatic differentiation) để các nhà thực hành không phải tự tay suy ra từng gradient.

Tại sao hàm kích hoạt lại quan trọng

Nếu không có các hàm kích hoạt phi tuyến, nhiều lớp tuyến tính thông thường sẽ hợp nhất thành một phép biến đổi tuyến tính duy nhất. ReLU được sử dụng rộng rãi vì đơn giản và hiệu quả. GELU và SiLU phổ biến trong các kiến trúc hiện đại. Sigmoid và softmax vẫn hữu ích cho một số cách diễn giải đầu ra nhất định, nhưng sigmoid có thể bão hòa trong các lớp ẩn và gây ra hiện tượng gradient biến mất.

Các kiến trúc mạng nơ-ron chính

Mạng nơ-ron tích chập

CNNs áp dụng các bộ lọc đã học trên các vùng lân cận địa phương và chia sẻ tham số qua các vị trí. Những đặc tính này khiến chúng hiệu quả cho hình ảnh và các tín hiệu dạng lưới khác.

Mạng hồi tiếp

RNNs, LSTMs, và GRUs cập nhật trạng thái ẩn qua một chuỗi. Chúng vẫn hữu ích cho các nhiệm vụ streaming và chuỗi thời gian, mặc dù tính hồi tiếp hạn chế xử lý song song và có thể gặp khó khăn với các phụ thuộc dài.

Transformer

Transformers sử dụng cơ chế attention để tạo ra các biểu diễn phụ thuộc ngữ cảnh. Các kết nối dư thừa (residual), chuẩn hoá, thông tin vị trí và các khối feed-forward là các thành phần cốt lõi của kiến trúc. Transformers hiện là nền tảng cho nhiều mô hình ngôn ngữ lớn và đa phương tiện.

Mạng tự mã hoá và mạng sinh tạo

Autoencoders học các biểu diễn thông qua việc tái tạo. GANs, các mô hình khuế tán và mạng tự hồi quy tạo ra các mẫu mới bằng các mục tiêu và quy trình huấn luyện khác nhau.

Các thành phần giúp mạng sâu có thể huấn luyện được

Các hệ thống hiện đại sử dụng nhiều hơn chỉ các lớp và hàm kích hoạt. Các kết nối dư thừa cho phép thông tin và gradient bỏ qua các khối. Chuẩn hoá ổn định các hàm kích hoạt. Regularization, tăng cường dữ liệu, dropout và weight decay có thể giảm overfitting. Các lớp embedding ánh xạ các mục rời rạc như token thành vector. Attention cho phép một biểu diễn phụ thuộc động vào các yếu tố khác.

Ưu điểm và hạn chế

Mạng nơ-ron có thể học các đặc trưng từ dữ liệu thô đa chiều và mở rộng cùng dữ liệu và tính toán. Tuy nhiên chúng cũng có thể đòi hỏi tập dữ liệu lớn, phần cứng chuyên dụng và việc điều chỉnh cẩn thận. Các dự đoán của chúng có thể không được hiệu chỉnh tốt, dễ gãy khi phân phối thay đổi, dễ bị tấn công đối kháng, hoặc khó giải thích.

Kiến trúc nên phù hợp với nhiệm vụ và các ràng buộc triển khai. Đối với nhiều vấn đề dạng bảng, một mô hình cây hoặc mô hình tuyến tính có thể nhanh hơn và dễ kiểm chứng hơn. Đối với các ứng dụng có rủi ro cao, hiệu suất mô hình phải được đánh giá theo các nhóm phụ và các chế độ thất bại, không chỉ dựa trên một chuẩn tổng hợp.

Các lớp, hàm kích hoạt và luồng thông tin

Một mạng nơ-ron kết hợp các hàm có tham số. Mỗi đơn vị tạo thành một tổ hợp có trọng số của các đầu vào, cộng thêm độ lệch, và đưa kết quả qua một hàm kích hoạt như ReLU, sigmoid, tanh, hoặc GELU. Xếp chồng các lớp cho phép các đặc trưng phân cấp và các ranh giới quyết định phi tuyến. Độ rộng kiểm soát số đơn vị mỗi lớp; độ sâu kiểm soát các phép biến đổi liên tiếp; kết nối và chia sẻ trọng số mã hoá kiến trúc. Đầu ra của mạng phụ thuộc vào tiền xử lý, tham số, chuẩn hoá và chế độ suy luận cùng nhau. Một nơ-ron là một phép toán toán học, không phải là một nơ-ron sinh học thực tế hay một khái niệm có ý nghĩa độc lập.

Lan truyền tiến tính toán dự đoán; hàm mất mát định lượng lỗi; lan truyền ngược áp dụng quy tắc chuỗi cho gradient; bộ tối ưu cập nhật các tham số. Khởi tạo, tốc độ học, thống kê batch, các đường dẫn dư thừa và chuẩn hoá ảnh hưởng đến việc gradient có biến mất, bùng nổ hay vẫn hữu ích. Regularization bao gồm weight decay, dropout, tăng cường dữ liệu, dừng sớm và các ràng buộc kiến trúc. Vẽ biểu đồ hành vi huấn luyện và kiểm chứng, kiểm tra thống kê gradient và hàm kích hoạt, và so sánh các lần chạy lặp lại. Một mạng lớn có thể ghi nhớ dữ liệu huấn luyện, trong khi một mạng nhỏ có thể thiếu khớp hoặc bỏ qua cấu trúc cần thiết.

Lựa chọn kiến trúc, đánh giá và triển khai

Multilayer perceptron xử lý các vector cố định; mạng tích chập khai thác cấu trúc cục bộ; các mô hình hồi tiếp và state-space xử lý chuỗi; transformer sử dụng attention; mạng đồ thị trao đổi thông tin dọc các cạnh. Các mô hình lai thường gặp. Lựa chọn dựa trên độ thiên vị (inductive bias), dữ liệu, kích thước chuỗi hoặc hình ảnh, độ trễ, bộ nhớ, khả năng giải thích và phần cứng sẵn có. Đánh giá so với một baseline tuyến tính hoặc cây và thực hiện các thí nghiệm ablation để hiểu độ phức tạp nào quan trọng. Số lượng tham số một mình không dự đoán được chất lượng, chi phí suy luận hay yêu cầu dữ liệu.

Triển khai yêu cầu tiền xử lý cố định, một đồ thị đã xuất hoặc biên dịch, xác thực số học và kiểm tra tài nguyên dưới tải thực tế. Quantization và pruning có thể giảm kích thước nhưng có thể thay đổi hành vi của các lớp hiếm. Giám sát đầu vào, đầu ra, hiệu chuẩn, độ trễ và kết quả đã xác nhận; kiểm tra dữ liệu đối kháng và dữ liệu dịch chuyển. Bảo vệ mô hình, phụ thuộc và dữ liệu qua các artefact có chữ ký, kiểm soát truy cập và đánh giá chuỗi cung ứng. Giải thích từ các hàm kích hoạt cá nhân hoặc saliency đòi hỏi xác minh nguyên nhân và hành vi. Mạng nơ-ron là các bộ xấp xỉ hàm linh hoạt, không phải là đảm bảo về hiểu biết, sự thật hay độ bền.

Ví dụ thực tế: dự báo nhu cầu bằng mạng nơ-ron

Một nhà bán lẻ dự đoán nhu cầu hàng tuần của mặt hàng dựa trên doanh số, khuyến mãi, giá, ngày lễ, khả năng cung ứng và thời tiết. Mạng được so sánh với các baseline seasonal-naive, tuyến tính và cây bằng cách sử dụng các phân tách thời gian cuộn. Các khuyến mãi trong tương lai chỉ được đưa vào khi thực sự biết trước thời điểm dự báo, trong khi tình trạng hết hàng được mô hình hoá vì doanh số quan sát có thể làm giảm ước lượng nhu cầu. Đánh giá sử dụng weighted absolute error, bias, độ bao phủ khoảng tin cậy, và kết quả theo tốc độ bán hàng của mặt hàng và cửa hàng.

Quy trình triển khai cung cấp các phiên bản tính năng, mô hình và horizon và từ chối dự báo khi các đầu vào cần thiết đã lỗi thời. Các nhà hoạch định nhìn thấy các khoảng tin cậy và có thể ghi đè với lý do đã ghi lại. Giám sát phát hiện các nguồn dữ liệu thiếu, lỗi thay đổi, bias và các dự báo bất thường; kết quả kinh doanh được tách ra khỏi độ chính xác dự báo vì chính sách đặt hàng cũng ảnh hưởng tới tồn kho. Một bản cập nhật mô hình được chạy song song qua nhiều chu kỳ, và dự báo viên trước đó vẫn khả dụng để quay lại trong trường hợp mùa vụ hoặc nhà cung cấp gián đoạn.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, người sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, các điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền chịu trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, rollback và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát bằng cách cố tình đưa vào các lỗi. Telemetry vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, sức khỏe phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Định nghĩa ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất offline sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu khôi phục, học từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên được vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Mỗi mạng nơ-ron có phải là deep learning không?

Không. Một mạng nhỏ với một lớp ẩn vẫn là một mạng nơ-ron, trong khi deep learning thường chỉ các kiến trúc có nhiều giai đoạn xử lý học được. Ranh giới này là mang tính quy ước hơn là một ngưỡng khoa học nghiêm ngặt.

Mạng nơ-ron có lưu trữ dữ liệu huấn luyện của chúng không?

Chúng lưu trữ các tham số đã học, không phải một bản sao có thể tìm kiếm thông thường của bộ dữ liệu. Tuy nhiên, các mô hình lớn có thể ghi nhớ và tái tạo các ví dụ huấn luyện riêng lẻ, điều này tạo ra rủi ro về quyền riêng tư và bản quyền cần được kiểm tra.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.