Nền tảng AI
Máy Vector Hỗ Trợ là gì?
A support vector machine (SVM) là một phương pháp học có giám sát tìm ranh giới quyết định với khoảng cách biên rộng nhất có thể giữa các lớp. Các mẫu huấn luyện xác định ranh giới đó là các vector hỗ trợ.
SVM có thể thực hiện phân loại tuyến tính hoặc phi tuyến, hồi quy và phát hiện bất thường. Chúng đặc biệt hữu ích cho các bộ dữ liệu nhỏ‑to‑trung bình có các đặc trưng thông tin, bao gồm dữ liệu thưa chiều cao, nhưng chi phí huấn luyện có thể trở nên không thực tế trên các bộ dữ liệu rất lớn.
Những điểm chính
- Một SVM tối đa hoá khoảng biên tối thiểu giữa ranh giới và các điểm huấn luyện gần nhất.
- Các vector hỗ trợ là các điểm dữ liệu, không phải các siêu phẳng bổ sung.
- Tham số C cân bằng độ rộng biên với các hình phạt cho vi phạm.
- Các kernel tính toán độ tương đồng trong không gian đặc trưng ngầm mà không cần hiện thực hoá từng đặc trưng đã chuyển đổi.

Ý tưởng biên tối đa
Đối với bộ phân loại nhị phân tuyến tính, ranh giới quyết định là một siêu phẳng:
w · x + b = 0
Vector w xác định hướng và b xác định độ dịch. Nhiều siêu phẳng có thể tách các lớp huấn luyện. SVM chọn siêu phẳng tối đa hoá khoảng cách tới các ví dụ gần nhất ở mỗi phía. Các ví dụ gần nhất đó là các vector hỗ trợ và có ảnh hưởng lớn nhất tới ranh giới đã khớp.
Mục tiêu không phải là tối đa hoá khoảng cách từ ranh giới tới mỗi điểm một cách độc lập. Nó tối đa hoá biên tối thiểu đồng thời đáp ứng hoặc phạt các ràng buộc lớp.
Biên cứng và biên mềm
SVM biên cứng yêu cầu tách tuyến tính hoàn hảo và nhạy cảm với các ngoại lệ. Các bộ dữ liệu thực tế thường cần một biên mềm, cho phép các biến lỏng cho các quan sát nằm trong biên hoặc ở phía sai của ranh giới.
Siêu tham số C kiểm soát mức phạt cho các vi phạm này:
- C lớn hơn sẽ phạt các vi phạm mạnh hơn và thường tạo ra biên hẹp hơn, theo sát các mẫu huấn luyện hơn.
- C nhỏ hơn cho phép nhiều vi phạm hơn để đổi lấy biên rộng hơn, được chuẩn hoá tốt hơn.
Số lượng vector hỗ trợ là kết quả của dữ liệu và giải pháp; tăng C không đảm bảo số lượng vector hỗ trợ cụ thể.
Kỹ thuật kernel
Một số lớp không thể tách bằng một siêu phẳng thẳng trong không gian đặc trưng gốc. Kernel đánh giá tích trong tương ứng với một không gian đặc trưng khác. Điều này cho phép SVM khớp một ranh giới phi tuyến mà không cần tính toán từng tọa độ đã chuyển đổi.
Các kernel phổ biến bao gồm:
- Linear: hiệu quả cho các đặc trưng thưa chiều cao như văn bản.
- Polynomial: mô hình hoá các tương tác lên tới bậc đã chọn.
- Radial basis function (RBF): tạo ra các biên địa phương linh hoạt dựa trên khoảng cách.
- Sigmoid: giống một hàm kích hoạt thần kinh nhưng ít được dùng làm lựa chọn mặc định.
Đối với RBF SVM, gamma kiểm soát mức độ địa phương mà mỗi mẫu huấn luyện ảnh hưởng tới ranh giới. Gamma lớn có thể tạo ra các vùng chi tiết cao và overfit; gamma nhỏ tạo ra ảnh hưởng mượt mà hơn.
Phân loại đa lớp
Mục tiêu cổ điển của SVM là nhị phân. Các thư viện mở rộng nó bằng các chiến lược như one‑vs‑rest, đào tạo một bộ phân loại cho mỗi lớp, hoặc one‑vs‑one, đào tạo các bộ phân loại cho từng cặp lớp và kết hợp quyết định của chúng. SVM đa lớp không chỉ vẽ một đường ít hơn số lớp.
Hồi quy vector hỗ trợ và SVM một lớp
Hồi quy vector hỗ trợ (SVR) khớp một hàm trong khi bỏ qua các lỗi nằm trong ống rộng epsilon và phạt các độ lệch lớn hơn. Một SVM một lớp ước tính một ranh giới quanh dữ liệu tiêu chuẩn và có thể hỗ trợ phát hiện bất thường. Một điểm bất thường không tự động là gian lận hay lỗi; nó chỉ là bất thường theo biểu diễn đã khớp.
Yêu cầu thực tiễn
SVM phụ thuộc vào khoảng cách và tích trong, vì vậy các đặc trưng số thường cần được chuẩn hoá. C, kernel, gamma và trọng số lớp nên được chọn thông qua xác thực. Các ước lượng xác suất không thuộc về biên và thường cần hiệu chỉnh, điều này tăng chi phí và cần được đánh giá riêng.
Việc huấn luyện Kernel SVM có thể tăng theo thời gian từ bậc hai đến bậc ba theo số mẫu, tùy thuộc vào dữ liệu và triển khai. Các biến thể SVM tuyến tính hoặc mô hình tuyến tính ngẫu nhiên phù hợp hơn cho các bộ dữ liệu rất lớn. Đối với hình ảnh thô, âm thanh hoặc ngôn ngữ, các biểu diễn đã học từ deep learning có thể hiệu quả hơn, trong khi SVM vẫn có thể phân loại một embedding cố định.
Ưu điểm và hạn chế của SVM
SVM có thể hoạt động tốt với nhiều đặc trưng, cung cấp mục tiêu chuẩn hoá rõ ràng và chủ yếu dựa vào các vector hỗ trợ khi dự đoán. Các hạn chế bao gồm nhạy cảm với việc chuẩn hoá và siêu tham số, chi phí huấn luyện có thể cao, khả năng giải thích giảm khi dùng kernel phi tuyến, và yêu cầu hiệu chỉnh xác suất.
Biên, kernel và mục tiêu tối ưu hoá
Máy vector hỗ trợ tìm một siêu phẳng tách với biên rộng lớn giữa các lớp. Chỉ các vector hỗ trợ nằm trên hoặc bên trong biên mới quyết định ranh giới. SVM biên mềm giới thiệu độ lỏng cho các điểm chồng lấp và nhãn sai; tham số C đổi biên rộng hơn để đổi lại các vi phạm trong quá trình huấn luyện. Các đầu vào thường cần được chuẩn hoá vì khoảng cách và tích vô hướng chi phối giải pháp. Trọng số lớp hoặc lấy mẫu lại giúp khi chi phí lỗi và tần suất không đồng đều, nhưng ngưỡng và xác suất vẫn cần xác thực độc lập.
Kỹ thuật kernel đánh giá độ tương đồng như thể các đầu vào được ánh xạ tới không gian đặc trưng có chiều cao hơn. Các kernel tuyến tính, đa thức, radial-basis và chuyên biệt mã hoá các giả định khác nhau. Đối với kernel RBF, gamma kiểm soát mức độ địa phương mà mỗi điểm ảnh hưởng tới ranh giới: gamma cao có thể tạo ra các vùng phức tạp và gây overfit, trong khi gamma thấp có thể gây underfit. Ma trận kernel tăng theo bậc hai với số mẫu, khiến SVM phi tuyến trở nên tốn kém trên các bộ dữ liệu lớn. Các bộ giải tuyến tính hoặc bản đồ đặc trưng xấp xỉ thường được ưu tiên khi quy mô lớn.
Sử dụng đa lớp, hiệu chỉnh và giới hạn vận hành
SVM nhị phân mở rộng thành đa lớp qua one‑vs‑rest, one‑vs‑one hoặc các công thức cấu trúc. Các siêu tham số phải được điều chỉnh trong cross‑validation, với các phân tách nhóm hoặc thời gian khi cần. Đánh giá độ chính xác và độ thu hồi riêng cho từng lớp, phân bố biên, hiệu chỉnh và hiệu năng khi có sự dịch chuyển. Các điểm quyết định thô không phải là xác suất; Platt scaling hoặc hiệu chỉnh isotonic sử dụng dữ liệu riêng và có thể giảm hiệu suất nếu tần suất thay đổi. So sánh với logistic regression, cây quyết định và các phương pháp dựa trên biểu diễn hiện đại với cùng mức tiền xử lý và nỗ lực điều chỉnh.
Triển khai yêu cầu sử dụng đúng bộ chuẩn hoá, thứ tự đặc trưng, tham số kernel, các vector hỗ trợ và ánh xạ lớp. Chi phí dự đoán cho một kernel SVM tăng theo số lượng vector hỗ trợ, vì vậy cần đo độ trễ và bộ nhớ trên các batch thực tế. Các đầu vào cách xa các vector hỗ trợ trong quá trình huấn luyện vẫn có thể nhận nhãn tự tin; nên thêm kiểm tra ngoại lệ hoặc chính sách từ chối khi phù hợp. Kiểm tra lỗi để phát hiện các proxy nhạy cảm và các artefact của bộ dữ liệu. SVM vẫn mạnh mẽ cho các vấn đề trung bình kích thước, chiều cao, nhưng biên hình học tối đa không chứng minh cấu trúc nhân quả hay an toàn.
Ví dụ thực tế: SVM cho việc định tuyến tài liệu hiếm
Một đội vận hành pháp lý phân loại các hồ sơ ngắn thành các danh mục định tuyến bằng các đặc trưng TF–IDF và một SVM tuyến tính. Nhóm này chia dữ liệu theo vụ việc và thời gian để ngăn chặn rò rỉ mẫu, chuẩn hoá trọng số lớp dựa trên chi phí lỗi đã xem xét, và điều chỉnh C trong xác thực lồng nhau. Mô hình tuyến tính được so sánh với logistic regression và một transformer. Độ chính xác, độ thu hồi, hiệu chỉnh và khối lượng công việc của người xem cho từng lớp quan trọng hơn độ chính xác tổng thể.
Các điểm quyết định được hiệu chỉnh trên dữ liệu riêng, và các tài liệu có biên thấp hoặc ngôn ngữ không được hỗ trợ được chuyển sang tiếp nhận thủ công. Đối tượng triển khai bao gồm bộ tokenizer, từ vựng, trọng số, mô hình, hiệu chỉnh và bản đồ nhãn. Giám sát theo dõi các thuật ngữ mới, tần suất danh mục, biên và các tuyến đã sửa. Tài liệu và các vector hỗ trợ được bảo vệ vì các đặc trưng văn bản có thể lộ thông tin mật. Kernel phi tuyến bị loại bỏ khi lợi ích chất lượng nhỏ không thể biện minh cho độ trễ, bộ nhớ và chi phí giải thích.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định triển khai thực tế cần hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường hoạt động, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi điều chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với hiệu chỉnh hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn và xác minh giám sát bằng các lỗi được chèn cố ý. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, trạng thái phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu khôi phục, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên được tắt hoặc thay thế.
Câu hỏi thường gặp
SVM chỉ thực hiện phân loại phải không?
Không. Hồi quy vector hỗ trợ dự đoán các mục tiêu liên tục, trong khi SVM một lớp có thể ước tính một ranh giới bất thường. Mỗi biến thể có mục tiêu và tập siêu tham số khác nhau.
Khi nào SVM tuyến tính là lựa chọn mạnh mẽ?
SVM tuyến tính thường hiệu quả cho các đặc trưng thưa chiều cao, bao gồm các biểu diễn văn bản truyền thống, trong khi một kernel linh hoạt sẽ tăng chi phí mà không có lợi ích rõ ràng.












