Nền tảng AI
Cây quyết định là gì?
Một cây quyết định là mô hình học có giám sát thực hiện dự đoán bằng cách áp dụng một chuỗi các quy tắc nếu-thì. Mỗi nút nội bộ kiểm tra một đặc trưng, mỗi nhánh đại diện cho một kết quả của phép kiểm tra đó, và mỗi lá tạo ra một dự đoán lớp, xác suất, hoặc giá trị số.
Cây quyết định được sử dụng cho phân loại và hồi quy. Ưu điểm của chúng là thực tiễn: chúng có thể biểu diễn các tương tác phi tuyến, yêu cầu ít tiền xử lý và tạo ra một đường đi mà người dùng có thể kiểm tra. Nhược điểm của chúng là độ không ổn định — những thay đổi nhỏ trong dữ liệu huấn luyện có thể tạo ra một cây khác.
Những điểm chính
- Cây phân chia không gian đặc trưng một cách đệ quy; nó không cần phải tách riêng từng quan sát trong dữ liệu huấn luyện.
- Các phân tách trong phân loại thường sử dụng độ hỗn loạn Gini hoặc entropy, trong khi các phân tách trong hồi quy giảm lỗi dự đoán hoặc phương sai.
- Độ sâu, kích thước lá tối thiểu và việc tỉa cây kiểm soát độ phức tạp và overfitting.
- Rừng ngẫu nhiên và cây tăng cường gradient cải thiện khả năng dự đoán bằng cách kết hợp nhiều cây.

Cách một cây quyết định thực hiện dự đoán
Giả sử một mô hình dự đoán liệu một máy có khả năng hỏng hay không. Nút gốc có thể hỏi liệu độ rung có vượt quá ngưỡng đã học không. Một nhánh sau đó có thể kiểm tra nhiệt độ hoạt động. Quan sát sẽ tới một lá chứa xác suất hỏng ước tính dựa trên các ví dụ huấn luyện đã đi theo cùng một đường đi.
Đối với hồi quy, lá có thể trả về giá trị mục tiêu trung bình của các quan sát trong khu vực đó. Đối với phân loại, nó có thể trả về lớp chiếm đa số hoặc một phân phối tần suất các lớp. Một lá có thể chứa nhiều quan sát; việc tách hoàn toàn dữ liệu huấn luyện thường không mong muốn vì nó có thể tạo ra một cây overfit.
Cách một cây chọn điểm tách
Quá trình huấn luyện xem xét các đặc trưng và ngưỡng ứng cử, sau đó chọn điểm tách cải thiện nhất mục tiêu đã định. Cải thiện này phải được cân nhắc theo số lượng quan sát đi tới mỗi nút con.
Độ hỗn loạn Gini
Đối với phân loại, độ hỗn loạn Gini đo lường mức độ pha trộn của các lớp trong một nút:
Gini = 1 - Σ p(k)²
Một nút chỉ chứa một lớp có độ hỗn loạn bằng không. Một điểm tách ứng cử hữu ích khi độ hỗn loạn có trọng số của các nút con thấp hơn độ hỗn loạn của nút cha.
Entropy và lợi nhuận thông tin
Entropy là một thước đo khác về độ không chắc chắn của lớp:
Entropy = -Σ p(k) log₂ p(k)
Lợi nhuận thông tin là entropy của nút cha trừ đi entropy có trọng số của các nút con. Độ hỗn loạn Gini và entropy thường tạo ra các cây tương tự, mặc dù không phải lúc nào cũng hoàn toàn giống nhau.
Mất mát hồi quy
Các cây hồi quy thường chọn các điểm tách giảm sai số bình phương, sai số tuyệt đối, hoặc tiêu chí hồi quy khác. Mỗi lá sau đó dự đoán một giá trị dựa trên các mục tiêu huấn luyện trong khu vực đó.
CART và các thuật toán cây khác
CART, hay Cây Phân loại và Hồi quy, sử dụng các điểm tách nhị phân và là nền tảng cho các triển khai phổ biến như cây quyết định của scikit-learn. Các thuật toán khác bao gồm ID3, C4.5 và C5.0. Các triển khai khác nhau về loại điểm tách hỗ trợ, cách xử lý giá trị thiếu, việc tỉa cây và mục tiêu.
Các biến danh mục có thể yêu cầu mã hoá, tách trực tiếp các tập con, hoặc cách xử lý đặc thù của triển khai. Giá trị thiếu có thể được ước lượng hoặc xử lý thông qua các hướng mặc định được học hoặc các điểm tách thay thế. Điều quan trọng là hiểu hành vi của thư viện cụ thể thay vì giả định mọi triển khai cây đều hoạt động giống nhau.
Kiểm soát độ phức tạp của cây
Một cây sâu có thể ghi nhớ nhiễu. Các kiểm soát thường gặp bao gồm:
- Maximum depth: giới hạn độ dài của đường dự đoán.
- Minimum samples per split or leaf: ngăn ngừa các vùng quá nhỏ.
- Minimum impurity decrease: yêu cầu một điểm tách phải mang lại đủ lợi ích.
- Maximum number of leaves: giới hạn tổng độ phức tạp.
- Cost-complexity pruning: loại bỏ các nhánh mà cải thiện không đủ để biện minh cho độ phức tạp tăng thêm.
Tỉa cây là một quá trình tối ưu có cấu trúc, không phải là việc xóa ngẫu nhiên. Các siêu tham số nên được chọn dựa trên dữ liệu xác thực hoặc cross‑validation, trong khi tập kiểm tra cuối cùng không được chạm tới.
Ưu điểm và hạn chế
Cây quyết định có thể mô hình hoá các tương tác và hiệu ứng ngưỡng mà không cần chuẩn hoá đặc trưng. Chúng chấp nhận đầu vào số và, tùy thuộc vào triển khai, đầu vào danh mục. Dự đoán nhanh, và một cây nhỏ dễ dàng trực quan hoá.
Tuy nhiên, một cây duy nhất có thể có độ phương sai cao, tạo ra những thay đổi dự đoán đột ngột gần điểm tách, và ưu tiên các đặc trưng có nhiều điểm tách khả dụng. Cây cũng dự đoán kém trong hồi quy: ngoài các vùng đã quan sát, một lá vẫn trả về giá trị được học từ các mẫu huấn luyện. Một cây lớn có thể không dễ hiểu hơn so với một mô hình phức tạp khác.
Từ một cây đến các tập hợp
Ensemble learning kết hợp nhiều mô hình. Rừng ngẫu nhiên huấn luyện nhiều cây trên các quan sát được lấy mẫu lại và các tập con của đặc trưng, sau đó trung bình các dự đoán của chúng. Gradient boosting xây dựng cây theo thứ tự sao cho mỗi cây mới giải quyết phần lỗi còn lại. Các phương pháp này thường vượt trội hơn so với một cây đơn, nhưng chúng đánh đổi một phần khả năng giải thích và tăng chi phí tính toán.
Tầm quan trọng của đặc trưng từ một cây hoặc tập hợp cần được giải thích cẩn thận. Tầm quan trọng dựa trên độ hỗn loạn có thể bị thiên lệch, và mức độ quan trọng của một đặc trưng không chứng minh tính nhân quả. Tầm quan trọng hoán vị, công cụ phụ thuộc một phần, và đánh giá chuyên ngành cung cấp ngữ cảnh bổ sung.
Cách một cây học các điểm tách và dự đoán
Một cây quyết định phân chia không gian đặc trưng một cách đệ quy. Tại mỗi nút, thuật toán huấn luyện đánh giá các ngưỡng đặc trưng hoặc phân hoạch danh mục ứng cử và chọn một điểm tách giảm độ hỗn loạn nhất, chẳng hạn độ hỗn loạn Gini hoặc entropy cho phân loại và sai số bình phương cho hồi quy. Các lá lưu trữ một phân phối lớp hoặc dự đoán số dựa trên các quan sát huấn luyện tới chúng. Việc tách tham lam là thực tiễn về mặt tính toán nhưng không đảm bảo cây tối ưu toàn cục, và các mẫu khác nhau hoặc cách giải quyết tie có thể tạo ra các cấu trúc khác nhau.
Các đặc trưng liên tục, thứ tự, danh mục và thiếu cần được xử lý một cách rõ ràng. Mã hoá one‑hot có thể tạo ra nhiều điểm tách ứng cử; các phương pháp danh mục gốc có thể sử dụng thống kê có thứ tự nhưng cần triển khai an toàn tránh rò rỉ. Cây không yêu cầu chuẩn hoá, tuy nhiên chúng có thể ưu tiên các biến có độ đa dạng cao và tách các nhóm nhỏ. Độ sâu, kích thước lá tối thiểu, mức giảm độ hỗn loạn tối thiểu, và tỉa cây dựa trên chi phí‑độ phức tạp kiểm soát phương sai. Hãy chọn chúng dựa trên dữ liệu xác thực và đánh giá hiệu chuẩn, vì xác suất của một lá dựa trên ít trường hợp có thể quá mức và không ổn định.
Giải thích, các chế độ thất bại và việc sử dụng trong sản xuất
Một đường đi từ nút gốc tới lá là một quy tắc chính xác cho một dự đoán của mô hình, nhưng nó không tự động là một giải thích nhân quả. Các biến có tương quan có thể thay thế lẫn nhau, những thay đổi nhỏ trong dữ liệu có thể làm thay đổi các điểm tách ở cấp trên, và một đường đi trông đơn giản có thể phụ thuộc vào nhãn lệch. Tầm quan trọng toàn cục của đặc trưng dựa trên độ hỗn loạn có thể gây hiểu lầm; tầm quan trọng hoán vị, phụ thuộc một phần, và kiểm tra ngược lại cung cấp ngữ cảnh nhưng cũng có giả định. Báo cáo độ không chắc chắn và kiểm tra xem quy tắc được cho có giữ vững trên dữ liệu độc lập và các nhóm phụ liên quan hay không.
Các cây đơn hữu ích khi tính minh bạch, độ trễ thấp và cấu trúc phi tuyến vừa phải là quan trọng, nhưng các tập hợp thường cung cấp hiệu năng dự đoán mạnh hơn. Xác thực hành vi biên, các danh mục hiếm, giá trị thiếu, và đầu vào ngoài phạm vi huấn luyện. Các quy tắc xuất ra phải tái tạo chính xác tiền xử lý và so sánh số học của quá trình huấn luyện. Giám sát mức độ chiếm dụng lá, phân phối đầu ra, lỗi và các danh mục mới xuất hiện. Một cây định hướng nhiều trường hợp mới vào một vùng rất nhỏ hoặc trước đây trống sẽ kích hoạt việc xem xét ngay cả khi độ trôi dạt tổng thể vẫn nhỏ. Giữ một phương án dự phòng cho các sơ đồ không hợp lệ và ghi chép mọi quyết định tỉa hoặc ngưỡng.
Ví dụ thực tế: cây triage khoản vay có khả năng giải thích
Một nhà cho vay sử dụng cây chỉ để ưu tiên các hồ sơ chưa hoàn thiện cho việc xem xét thủ công, không phải để phê duyệt hoặc từ chối tín dụng. Mục tiêu là kết quả hoàn thiện được ghi lại, và các đặc trưng có sẵn tại thời điểm tiếp nhận không bao gồm các quyết định sau này. Kiểm định thời gian nhóm so sánh một cây tỉa nông với các quy tắc và hồi quy logistic. Kích thước lá tối thiểu ngăn các quy tắc dựa trên một vài người nộp đơn, trong khi hiệu chuẩn và lỗi riêng lớp được báo cáo qua các kênh và các nhóm được bảo vệ liên quan.
Các nhà xét duyệt nhìn thấy đường đi chính xác và các giá trị nguồn nhưng có thể sửa dữ liệu sai và ghi đè định tuyến. Tổ chức kiểm tra các đại diện có tương quan và các thay đổi ngược lại, giám sát mức độ chiếm dụng lá và giá trị thiếu, và coi lưu lượng đột ngột vào một lá nhỏ như một sự cố chất lượng dữ liệu. Các thay đổi chính sách tạo ra phiên bản mô hình và kiểm định mới, không phải là một chỉnh sửa điểm tách không được ghi chép. Vì việc sử dụng ảnh hưởng đến quyền truy cập và gánh nặng, người nộp đơn nhận được kênh con người và cây không bao giờ được trình bày như một giải thích nhân quả về khả năng tín dụng.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường hoạt động, đầu vào, đầu ra, các phụ thuộc, người sở hữu, và hậu quả của mỗi lỗi quan trọng. Thiết lập một chuẩn cơ sở có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, sự cố phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu phục vụ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn, và xác minh giám sát bằng các lỗi được đưa vào cố ý. Dữ liệu đo lường hoạt động nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, sức khỏe phụ thuộc, ghi đè của con người, và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng ngoại tuyến sẽ tiếp tục. Đánh giá lại bất cứ khi nào nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng, hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu phục hồi, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng mà tại đó nó nên bị vô hiệu hoá hoặc thay thế.












