Nền tảng AI

Ensemble Learning là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Ensemble learning kết hợp các dự đoán từ nhiều mô hình. Ý tưởng cốt lõi là các mô hình có lỗi khác nhau có thể tạo ra kết quả chính xác hơn hoặc ổn định hơn khi đầu ra của chúng được trung bình, bỏ phiếu hoặc truyền cho một meta‑learner.

Chỉ thêm mô hình là không đủ. Nếu mọi thành viên đều học cùng một cách tắt, lỗi của chúng sẽ tương quan và tập hợp có thể chỉ trở nên tự tin hơn vào cùng một sai lầm.

Những điểm chính

  • Tập hợp hoạt động tốt nhất khi các mô hình thành viên có ích riêng biệt và gây ra các lỗi khác nhau một cách đáng kể.
  • Bagging huấn luyện các thành viên song song trên dữ liệu được lấy mẫu lại; Boosting huấn luyện các bộ học viên tuần tự để sửa lỗi.
  • Stacking huấn luyện một meta‑model dựa trên các dự đoán out‑of‑fold, không phải trên các dự đoán trong mẫu.
  • Các cải thiện độ chính xác cần được cân nhắc với độ trễ, hiệu chuẩn, khả năng giải thích và chi phí bảo trì.
What is Ensemble Learning? diagram showing base model a, base model b, base model c, predictions, aggregate, final output
Đa dạng chỉ hữu ích khi các lỗi của thành viên không hoàn toàn giống nhau.

Bỏ phiếu và trung bình

Bỏ phiếu cứng (hard voting) chọn lớp có số phiếu nhiều nhất. Bỏ phiếu mềm (soft voting) trung bình các xác suất lớp, thường sau khi đã hiệu chuẩn. Các tập hợp hồi quy thường trung bình các dự đoán số. Các phiên bản có trọng số cho phép các thành viên mạnh hơn có ảnh hưởng lớn hơn.

Việc trung bình có thể giảm phương sai khi các lỗi không hoàn toàn tương quan. Nó không thể sửa chữa lỗi dữ liệu chung, lỗi nhãn hoặc thiếu nhóm phụ. Đa dạng nên được đo lường qua mức độ bất đồng và sự chồng chéo lỗi, không phải dựa trên tên mô hình khác nhau.

Bagging và rừng ngẫu nhiên

Bootstrap aggregating (bagging) huấn luyện các mô hình trên các tập dữ liệu được lấy mẫu lại và trung bình chúng. Một cây quyết định có độ biến động cao, khiến nó trở thành ứng cử viên tự nhiên cho bagging.

Rừng ngẫu nhiên (random forests) thêm việc lựa chọn ngẫu nhiên các đặc trưng tại các nút chia, giảm sự tương quan giữa các cây. Các mẫu out‑of‑bag có thể ước lượng hiệu năng, nhưng một tập kiểm tra cuối cùng chưa được chạm tới vẫn rất quan trọng cho việc chọn mô hình và khẳng định khả năng triển khai.

Boosting

Boosting xây dựng một mô hình cộng dồn theo các giai đoạn. Các bộ học viên sau này tập trung vào các ví dụ hoặc các mẫu dư thừa mà tập hợp hiện tại xử lý kém. AdaBoost thay đổi trọng số của các ví dụ; gradient boosting điều chỉnh các bộ học viên theo gradient âm của hàm mất lựa chọn.

Cây được boost có thể mô hình hoá các quan hệ bảng dữ liệu phức tạp, nhưng cây sâu, vòng lặp quá nhiều và rò rỉ thông tin vẫn có thể overfit. Tốc độ học, độ sâu cây, tỷ lệ lấy mẫu phụ và dừng sớm là các điều khiển quan trọng.

Stacking và blending

Stacking tạo ra một mô hình cấp hai học cách kết hợp các dự đoán cơ sở. Để tránh rò rỉ, mỗi hàng dữ liệu huấn luyện cho meta‑model phải xuất phát từ một mô hình cơ sở chưa được huấn luyện trên hàng đó. Cross‑validation tạo ra các dự đoán out‑of‑fold này.

Blending sử dụng một tập dữ liệu holdout riêng cho meta‑model, cách này đơn giản hơn nhưng giảm lượng dữ liệu có sẵn cho việc huấn luyện. Cả hai phương pháp đều yêu cầu cùng một quy trình tiền xử lý và quản lý phiên bản khi suy luận.

Chi phí vận hành

Một tập hợp có thể làm tăng đáng kể bộ nhớ, tính toán và các chế độ lỗi. Nó có thể khó giải thích, hiệu chuẩn và cập nhật một cách nhất quán hơn. Distillation có thể nén một tập hợp thành một mô hình nhỏ hơn, nhưng mô hình “học sinh” phải được đánh giá độc lập.

Việc lựa chọn thực tiễn so sánh hiệu năng, độ trễ cuối, hiệu chuẩn, tiêu thụ tài nguyên và chi phí lỗi. Đôi khi một mô hình được điều chỉnh tốt sẽ ưu việt hơn so với việc tăng độ chính xác nhẹ nhàng từ một stack dễ gãy.

Tại sao tập hợp lại hiệu quả

Ensemble learning kết hợp nhiều mô hình để các lỗi của chúng phần nào triệt tiêu lẫn nhau hoặc các điểm mạnh của chúng phủ sóng các khu vực khác nhau. Bagging huấn luyện các mô hình trên dữ liệu lấy mẫu lại và trung bình các dự đoán, giảm phương sai; rừng ngẫu nhiên thêm việc chọn ngẫu nhiên các đặc trưng để giảm tương quan giữa các cây. Boosting huấn luyện các bộ học viên tuần tự để tập trung vào lỗi dư, thường giảm độ chệch nhưng tăng độ nhạy với nhiễu và việc điều chỉnh. Stacking huấn luyện một meta‑model dựa trên các dự đoán của mô hình cơ sở. Đa dạng phải có ích: trung bình các mô hình giống hệt chỉ tăng chi phí mà không giảm lỗi đáng kể.

Sự tương quan giữa các lỗi quyết định lợi ích. Đa dạng có thể đến từ các mẫu dữ liệu, đặc trưng, thuật toán, siêu tham số, khởi tạo ngẫu nhiên hoặc cửa sổ thời gian. Bỏ phiếu cứng bỏ qua độ tin cậy; bỏ phiếu mềm trung bình các xác suất nhưng đòi hỏi hiệu chuẩn tương thích. Hồi quy có thể trung bình hoặc dùng phép tổng hợp mạnh mẽ. Trong stacking, các dự đoán out‑of‑fold là thiết yếu—huấn luyện meta‑model trên các dự đoán cơ sở từ cùng một dữ liệu đã huấn luyện gây rò rỉ. Giữ một baseline trung bình đơn giản trước khi áp dụng bộ kết hợp phức tạp.

Đánh giá, hiệu chuẩn và độ không chắc

So sánh từng thành viên và tập hợp trên một tập dữ liệu hold‑out với cùng một quy trình tiền xử lý. Báo cáo các chỉ số nhiệm vụ, hiệu chuẩn, lỗi theo nhóm phụ, phương sai qua các fold hoặc seed, và chi phí tài nguyên. Một tập hợp có thể nâng cao chất lượng trung bình trong khi che giấu một “blind spot” chung do dữ liệu hoặc nhãn chung gây ra. Kiểm tra mức độ bất đồng: nó có thể chỉ ra độ không chắc, nhưng các mô hình sai một cách tự tin và tương quan vẫn có thể đồng ý. Hiệu chuẩn tập hợp cuối cùng, không chỉ các thành viên, và xác thực ngưỡng từ chối so với khả năng xem xét và hậu quả.

Ước lượng out‑of‑bag hữu ích cho các mô hình bagged nhưng không thay thế một bài kiểm tra cuối cùng đại diện cho triển khai. Đối với dữ liệu thời gian, tránh lấy mẫu lại làm phá vỡ thứ tự. Đối với các trường hợp liên quan đến an toàn, kiểm tra lỗi thành viên, mô hình lạc hậu và đầu vào gây nhiễu. Các tập hợp có trọng số có thể overfit dữ liệu xác thực khi thử nhiều ứng cử viên. Ghi lại việc lựa chọn ứng cử viên và sử dụng xác thực lồng nhau khi việc điều chỉnh mở rộng.

Triển khai và bảo trì

Tập hợp làm tăng bộ nhớ, độ trễ, năng lượng và các phụ thuộc vận hành. Distillation có thể nén hành vi kết hợp thành một mô hình duy nhất, kèm theo yêu cầu xác thực mới. Phiên bản các thành viên, tiền xử lý, trọng số và định tuyến như một tài sản duy nhất; xác định hành vi khi một thành viên hết thời gian hoặc tạo ra kết quả không hợp lệ. Giám sát dự đoán của các thành viên và mức độ bất đồng để phát hiện lỗi im lặng. Loại bỏ các thành viên dư thừa và tái huấn luyện có chủ đích. Tập hợp cải thiện dự đoán khi đa dạng lỗi thực sự tồn tại, nhưng chúng không biến dữ liệu huấn luyện thiên lệch hay mục tiêu không hợp lệ thành bằng chứng đáng tin cậy.

Ví dụ thực tế: một tập hợp cho cảnh báo thời tiết nguy hiểm

Một đội dự báo kết hợp bộ đặc trưng mô hình vật lý, cây gradient‑boosted, mô hình chuỗi thần kinh, và baseline thống kê đã được hiệu chuẩn. Các dự đoán out‑of‑fold huấn luyện một meta‑model đơn giản, và việc đánh giá sử dụng các cơn bão trong tương lai hoàn toàn không có trong dữ liệu huấn luyện của các thành viên. Các chỉ số bao gồm độ thu hồi sự kiện, cảnh báo sai, thời gian dự báo trước, hiệu chuẩn, hiệu năng địa lý, và độ tin cậy trong các điều kiện cực đoan hiếm gặp. Độ tương quan lỗi của các thành viên được xem xét vì dữ liệu đầu vào chung có thể tạo ra các “blind spot” chung.

Trong quá trình triển khai, mỗi dự đoán và kết quả tổng hợp đều được lưu giữ. Nếu một thành viên không khả dụng, hệ thống sẽ sử dụng cấu hình suy giảm đã được xác thực trước thay vì tự động chuẩn lại một cách im lặng. Sự bất đồng kích hoạt việc xem xét bổ sung nhưng không luôn được xem là độ không chắc. Giám sát theo dõi sự trôi dạt của thành viên, độ trễ và kết quả bão, với trọng số chỉ được cập nhật qua quá trình xác thực có kiểm soát. Các cảnh báo công khai vẫn tuân theo quy trình quyết định khí tượng có thẩm quyền; tập hợp cải thiện bằng chứng nhưng không tự động định nghĩa lại chính sách cảnh báo.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định sản xuất cần hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường hoạt động, đầu vào, đầu ra, các phụ thuộc, người sở hữu, và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một tập dữ liệu đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị bỏ quên. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn, và xác thực việc giám sát bằng các lỗi được chèn có chủ đích. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình phục hồi, học hỏi từ sự cố, xóa và lưu trữ tài liệu, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Các câu hỏi thường gặp

Rừng ngẫu nhiên có phải là một tập hợp không?

Có. Nó kết hợp nhiều cây quyết định ngẫu nhiên, thường bằng cách bỏ phiếu hoặc trung bình.

Các mô hình giống hệt có thể tạo thành một tập hợp hữu ích không?

Có thể nếu dữ liệu huấn luyện, khởi tạo hoặc việc lấy mẫu tạo ra các lỗi đủ khác nhau, nhưng việc sao chép đơn thuần không mang lại lợi ích.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.