Nền tảng AI

Giảm chiều dữ liệu là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Giảm chiều dữ liệu đại diện cho dữ liệu với ít biến hơn trong khi vẫn giữ lại thông tin hữu ích cho một nhiệm vụ. Nó có thể giảm lưu trữ và nhiễu, cải thiện việc trực quan hoá, giảm bớt các đặc trưng dư thừa và làm cho các mô hình hạ nguồn dễ đào tạo hơn.

Không có phương pháp nào giữ lại mọi mối quan hệ. Một phép giảm hữu ích bắt đầu bằng việc xác định những gì cần được bảo tồn: phương sai, sự tách lớp, các khu vực lân cận địa phương, hình học toàn cục, chất lượng tái tạo hoặc khả năng giải thích.

Những điểm chính

  • Lựa chọn đặc trưng giữ lại các biến gốc; trích xuất đặc trưng tạo ra các tọa độ mới có chiều thấp hơn.
  • PCA là phương pháp tuyến tính và tập trung vào phương sai; t-SNE và UMAP nhấn mạnh cấu trúc lân cận cho việc trực quan hoá.
  • Các biểu diễn trực quan hoá có thể làm méo khoảng cách, kích thước cụm và sự tách rời toàn cục.
  • Áp dụng phép giảm chỉ trên dữ liệu huấn luyện, sau đó sử dụng phép biến đổi đã học cho dữ liệu kiểm định và kiểm thử.
What is Dimensionality Reduction? diagram showing high-d data, scale, choose method, fit on train, transform, validate
Mỗi phương pháp giữ lại một số mối quan hệ và làm méo các mối quan hệ khác.

Lựa chọn đặc trưng so với chiếu

Lựa chọn đặc trưng loại bỏ các biến dựa trên quy tắc miền, mức độ thiếu hụt, dư thừa, các kiểm tra dự đoán hoặc chuẩn hoá. Nó giữ nguyên ý nghĩa gốc của các biến, điều này có thể hỗ trợ quản trị và giải thích.

Các phương pháp chiếu kết hợp các biến thành các tọa độ mới. Chúng có thể nắm bắt cấu trúc phân tán nhưng có thể làm cho mỗi tọa độ khó giải thích hơn. Một autoencoder học một phép chiếu phi tuyến qua quá trình tái tạo.

PCA và SVD

Phân tích thành phần chính (PCA) xác định các hướng trực giao có phương sai giảm dần sau khi trung bình hoá dữ liệu. Phân rã giá trị riêng (SVD) cung cấp một con đường số học chung. Việc chuẩn hoá quan trọng: một đơn vị đo có phương sai cao có thể chi phối các thành phần.

PCA là quyết định ngoại trừ dấu và các giá trị riêng lặp lại, hỗ trợ biến đổi ngoài mẫu và cung cấp tóm tắt phương sai giải thích. Phương sai cao không phải lúc nào cũng liên quan đến nhiệm vụ, và các thành phần tuyến tính không thể mở rộng mọi mặt phẳng cong.

t-SNE và UMAP

t-SNE xây dựng các phân phối xác suất trên các lân cận và tối ưu hoá một bản đồ chiều thấp nhấn mạnh sự tương đồng địa phương. UMAP xây dựng một đồ thị lân cận có trọng số và tối ưu hoá một biểu diễn chiều thấp với các mục tiêu cấu trúc địa phương liên quan.

Cả hai đều là công cụ khám phá mạnh mẽ nhưng nhạy cảm với tiền xử lý, metric khoảng cách và siêu tham số. Không gian trống, diện tích cụm và khoảng cách giữa các cụm trong biểu đồ 2D không nên tự động được diễn giải theo thực tế.

Phương pháp có giám sát và biểu diễn nhận thức nhiệm vụ

Phân tích phân biệt tuyến tính (LDA) sử dụng nhãn lớp để tìm sự tách rời, khiến nó khác với PCA không giám sát. Học biểu diễn thần kinh có thể tối ưu hoá mục tiêu dự đoán hoặc tương phản thay vì tái tạo.

Nếu nhãn hướng dẫn việc giảm, mọi quá trình huấn luyện và điều chỉnh phải nằm trong quy trình huấn luyện. Nếu không, thông tin từ tập kiểm thử có thể rò rỉ vào việc chọn mô hình và tạo ra kết quả lạc quan.

Lựa chọn và xác thực một phương pháp

Bắt đầu với tiền xử lý và một mô hình cơ bản đơn giản. Đối với nén, đo lường độ tái tạo hoặc hiệu suất hạ nguồn qua các chiều. Đối với trực quan hoá, kiểm tra độ ổn định qua các seed và siêu tham số và so sánh việc bảo tồn lân cận với kiến thức miền.

Đối với sản xuất, hỏi liệu phương pháp có thể biến đổi các bản ghi mới, cách nó xử lý giá trị thiếu, có thay đổi khi tái huấn luyện và người dùng có cần giải thích các đặc trưng gốc hay không. Overfitting có thể xảy ra ở bước giảm chiều cũng như trong mô hình cuối cùng.

Phương pháp giảm chiều tuyến tính và phi tuyến

Giảm chiều dữ liệu chuyển đổi dữ liệu đa chiều thành ít tọa độ hơn trong khi vẫn bảo tồn cấu trúc đã chọn. Phân tích thành phần chính tìm các hướng trực giao có phương sai tối đa sau khi trung bình hoá; cần chuẩn hoá khi các đơn vị nên đóng góp tương đương. Phân rã giá trị riêng tính toán cấu trúc hạng thấp liên quan và hỗ trợ ma trận thưa. Phân tích phân biệt tuyến tính sử dụng nhãn để tìm các hướng tách lớp. Các phương pháp này cung cấp các phép biến đổi rõ ràng, nhưng phương sai hoặc sự tách lớp có thể không bảo tồn thông tin cần cho nhiệm vụ hạ nguồn.

Các phương pháp đa tạp như t-SNE và UMAP xây dựng các khu vực lân cận và tối ưu hoá bố cục chiều thấp. Chúng mạnh mẽ cho việc khám phá nhưng làm méo khoảng cách toàn cục, mật độ, kích thước cụm và đôi khi sự tách rời. Kết quả phụ thuộc vào tiền xử lý, metric, số lượng lân cận hoặc perplexity, khởi tạo và seed. Một cụm hấp dẫn trong hai chiều có thể xuất hiện ngay cả khi không có các nhóm rời rạc. Sử dụng nhiều thiết lập, chỉ tô màu theo siêu dữ liệu không được dùng trong huấn luyện, và xác thực cấu trúc dường như trong không gian gốc hoặc với các nhãn độc lập.

Lựa chọn đặc trưng, biểu diễn và đánh giá

Lựa chọn đặc trưng giữ lại các biến gốc thông qua bộ lọc, vòng bao, hoặc tầm quan trọng dựa trên mô hình; học biểu diễn tạo ra các đặc trưng tiềm ẩn mới bằng autoencoder hoặc mô hình có giám sát. Phép chiếu ngẫu nhiên bảo tồn khoảng cách một cách xấp xỉ dưới một số điều kiện và cung cấp các baseline hiệu quả. Chọn phương pháp dựa trên nén, trực quan hoá, giảm nhiễu, tốc độ, lưu trữ, hoặc hiệu suất mô hình. Áp dụng bộ giảm chỉ trên dữ liệu huấn luyện, sau đó biến đổi các tập kiểm định và kiểm thử. Giảm chiều có giám sát phải được lồng trong cross-validation để tránh rò rỉ nhãn.

Đánh giá phương sai giải thích hoặc độ tái tạo cho nén tuyến tính, độ tin cậy và bảo tồn lân cận cho trực quan hoá, và độ chính xác, hiệu chỉnh, độ trễ và độ bền vững hạ nguồn cho dự đoán. Đo lường độ ổn định qua các mẫu và seed. Kiểm tra xem các lớp hiếm hoặc nhóm nhạy cảm có bị gộp lại và liệu có thể thực hiện ánh xạ ngược không. Các tọa độ giảm vẫn có thể chứa thông tin riêng tư; một biểu đồ hai chiều không phải là ẩn danh. Ghi lại phép biến đổi, bộ chuẩn hoá, thứ tự đặc trưng và các hạn chế.

Sử dụng trong sản xuất

Việc triển khai yêu cầu phép biến đổi đã được huấn luyện chính xác và schema đầu vào. Giám sát các đặc trưng thiếu, sự dịch chuyển phạm vi, phân phối điểm số thành phần, lỗi tái tạo và kết quả hạ nguồn. Nếu xuất hiện các danh mục hoặc cảm biến mới, hãy tái huấn luyện và tạo phiên bản cho toàn bộ pipeline thay vì lặng lẽ thêm cột. Giảm chiều có thể cải thiện tính toán và loại bỏ nhiễu cho mô hình, nhưng cũng có thể loại bỏ các tín hiệu yếu quan trọng cho các sự kiện hiếm. Coi đó như một bước đo lường đã học, thông tin giữ lại và mất đi phải được kiểm tra so với quyết định.

Ví dụ thực tế: giảm các đặc trưng hành vi khách hàng

Một nhà phân tích chuẩn hoá 200 chỉ số hành vi và áp dụng PCA chỉ trên khách hàng huấn luyện. Cross-validation chọn số thành phần dựa trên hiệu suất churn hạ nguồn và độ ổn định, không phải dựa trên biểu đồ phân tán hai chiều. Các tải trọng được kiểm tra để phát hiện nguồn chi phối và mức độ thiếu hụt. PCA, lựa chọn đặc trưng, chiếu ngẫu nhiên và một mô hình điều chuẩn chưa giảm được so sánh về hiệu chỉnh, độ trễ và kết quả cho các phân khúc khách hàng hiếm. Các mẫu lặp lại cũng kiểm tra xem các thành phần dẫn đầu và kết luận hạ nguồn có duy trì ổn định hay không.

Pipeline đã triển khai cố định thứ tự đặc trưng, bộ chuẩn hoá và các thành phần và từ chối các phiên bản schema thiếu. Giám sát theo dõi phân phối thành phần, lỗi tái tạo và kết quả hạ nguồn. Một biểu đồ trực quan hoá với các cụm dường như được dùng để tạo câu hỏi, không phải để gán persona cho khách hàng. Vì các thành phần tiềm ẩn vẫn mã hoá hành vi, việc truy cập và giữ lại vẫn được kiểm soát. Nếu định nghĩa nguồn thay đổi, toàn bộ phép biến đổi và mô hình sẽ được xây dựng lại và xác thực thay vì chiếu dữ liệu không tương thích vào các thành phần cũ.

Bằng chứng thực thi và sẵn sàng vận hành

Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường hoạt động, đầu vào, đầu ra, phụ thuộc, người chịu trách nhiệm và hậu quả của mỗi lỗi quan trọng. Thiết lập một baseline có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất dịch vụ phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị bỏ qua. Đo lường chất lượng nhiệm vụ cùng với hiệu chỉnh hoặc độ không chắc chắn, độ trễ, thông lượng, chi phí tài nguyên, khả năng truy cập, quyền riêng tư và bảo mật. Ghi lại mọi phép biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn và xác minh giám sát bằng cách chèn lỗi có chủ đích. Telemetry vận hành nên hiển thị chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có tài liệu khôi phục, học hỏi từ sự cố, quy trình xóa và lưu trữ, và một điểm rõ ràng khi nó nên được vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Giảm chiều dữ liệu luôn cải thiện mô hình không?

Không. Nó có thể loại bỏ thông tin dự đoán hoặc làm phức tạp việc giải thích. So sánh với một baseline không giảm chiều trên dữ liệu giữ lại.

Các cụm t-SNE tách rời chứng minh các lớp thực tồn tại không?

Không. Bản đồ là một biểu đồ trực quan hoá được tối ưu hoá các mối quan hệ lân cận và có thể tạo ra sự tách rời bề ngoài. Xác thực các cụm bằng bằng chứng độc lập.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.