Nền tảng AI

Khoa học dữ liệu là gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Khoa học dữ liệu là thực hành biến dữ liệu thành kiến thức, dự đoán hoặc quyết định có căn cứ. Nó kết hợp chuyên môn miền, thống kê, tính toán, kỹ thuật dữ liệu, trực quan hoá và giao tiếp. Một mô hình có thể là một phần của công việc, nhưng lĩnh vực này bắt đầu trước khi mô hình hoá và tiếp tục sau khi triển khai.

Câu hỏi quan trọng nhất không phải “Thuật toán nào chúng ta nên dùng?” mà là “Quyết định nào chúng ta đang hỗ trợ, bằng bằng chứng nào sẽ trả lời được, và làm sao chúng ta biết kết quả vẫn hữu ích?”

Những điểm chính

  • Khoa học dữ liệu là quy trình chứng cứ từ đầu đến cuối, không phải là đồng nghĩa với học máy.
  • Định nghĩa vấn đề, đo lường và quản trị dữ liệu thường quyết định thành công hơn độ phức tạp của mô hình.
  • Các câu hỏi dự đoán và nguyên nhân đòi hỏi các giả định và thiết kế đánh giá khác nhau.
  • Một phân tích đã triển khai cần được giám sát, tài liệu hoá và giao tiếp phù hợp với người dùng của nó.
What is Data Science? diagram showing question, collect, prepare, analyze / model, decide, monitor
Quản trị, tài liệu và đánh giá miền bao trùm toàn bộ quy trình.

Bắt đầu với quyết định và ước lượng

Một dự án nên xác định người dùng, quyết định, can thiệp và chi phí của lỗi. Đối với câu hỏi mô tả, mục tiêu có thể là tỷ lệ hoặc xu hướng. Đối với dự đoán, nó có thể là nhu cầu hoặc rủi ro trong tương lai. Đối với câu hỏi nguyên nhân, ước lượng mô tả hiệu quả của một can thiệp được định nghĩa dưới các giả định đã nêu.

Mục tiêu mơ hồ như “tìm hiểu sâu” làm cho việc đánh giá trở nên không thể. Một mục tiêu có thể đo lường được tạo ra ranh giới cho việc thu thập dữ liệu và ngăn phân tích lan rộng vào mọi lĩnh vực có sẵn.

Thu thập, quản trị và hiểu dữ liệu

Các nhóm lập danh sách các nguồn, quyền sở hữu, sự đồng ý, thời gian lưu trữ, nguồn gốc và quyền truy cập. Họ phân biệt dữ liệu có cấu trúc và không có cấu trúc, định nghĩa đơn vị và dấu thời gian, và kiểm tra liệu các bản ghi có đại diện cho dân số và khoảng thời gian quan tâm hay không.

Việc làm sạch không chỉ là xóa các hàng thiếu dữ liệu. Nó bao gồm việc giải quyết trùng lặp, giá trị không thể tồn tại, sự mơ hồ nhãn, sự thay đổi schema, kiểm duyệt và các phép nối làm thay đổi đơn vị phân tích. Mọi biến đổi phải có khả năng tái tạo và được ghi chép.

Khám phá trước khi mô hình hoá

Phân tích khám phá nghiên cứu các phân phối, mức độ thiếu, mối quan hệ và các hiện tượng đo lường tiềm năng. Trực quan hoá có thể phơi bày các giá trị ngoại lệ và sự khác biệt giữa các tiểu nhóm mà trung bình tổng hợp che giấu. Việc khám phá nên cung cấp thông tin cho các giả thuyết mà không bị nhầm lẫn thành bằng chứng xác nhận.

Kỹ thuật tạo đặc trưng, giảm chiều và học biểu diễn có thể cải thiện mô hình hoá, nhưng các phép biến đổi phải được huấn luyện chỉ trên dữ liệu huấn luyện để tránh rò rỉ.

Chọn phương pháp cho câu hỏi

Ước lượng thống kê định lượng mức độ không chắc chắn quanh các đại lượng quan tâm. Học máy hữu ích khi mục tiêu chính là hiệu suất dự đoán trên dữ liệu mới. Thí nghiệm và các phương pháp suy luận nguyên nhân cần thiết khi mục tiêu là hiệu quả của một can thiệp.

Một mô hình cơ sở nên đủ đơn giản để hiểu. Các mô hình phức tạp hơn phải chứng minh giá trị bổ sung của chúng bằng hiệu suất tốt hơn trên dữ liệu kiểm tra, độ không chắc chắn được hiệu chỉnh, giá trị vận hành hoặc khả năng cần thiết như xử lý hình ảnh hoặc ngôn ngữ.

Đánh giá, giao tiếp và giám sát

Việc đánh giá nên phù hợp với quyết định. Một bộ phân loại có thể yêu cầu độ chính xác, độ thu hồi, hiệu chỉnh và phân tích tiểu nhóm thay vì chỉ độ chính xác; một hệ thống dự báo cần kiểm thử ngược thời gian. Quá khớp và rò rỉ là lỗi của quy trình, không chỉ là đặc tính của mô hình.

Giao tiếp bao gồm các giả định, mức độ không chắc, giới hạn và hành động đề xuất. Khi một mô hình hoặc bảng điều khiển được sử dụng, các nhóm giám sát chất lượng đầu vào, sự trượt của kết quả, hành vi người dùng và tác động chuỗi cung. Một quy trình quyết định đã ngừng hoạt động cần một kho lưu trữ và quyền sở hữu rõ ràng giống như một quy trình đã triển khai cần người vận hành.

Vòng đời khoa học dữ liệu và các câu hỏi phân tích

Khoa học dữ liệu kết hợp kiến thức miền, thống kê, tính toán và giao tiếp để biến dữ liệu thành bằng chứng cho các quyết định. Bắt đầu bằng việc phân biệt mô tả, chẩn đoán, dự đoán và suy luận nguyên nhân. Một bảng điều khiển báo cáo những gì đã xảy ra, một mô hình dự đoán ai sẽ rời bỏ, và một thí nghiệm ước tính liệu một can thiệp có thay đổi tỷ lệ rời bỏ trả lời các câu hỏi khác nhau. Xác định đơn vị, dân số, khoảng thời gian, kết quả, hành động và chi phí lỗi trước khi trích xuất dữ liệu. Nhiều dự án thất bại giải quyết một chỉ số thay thế có thể đo lường nhưng không hỗ trợ quyết định dự định.

Việc thu thập đòi hỏi nguồn gốc, quyền cho phép, thiết kế mẫu và hợp đồng dữ liệu. Khám phá kiểm tra các phân phối, mức độ thiếu, trùng lặp, ngoại lệ, mối quan hệ, thay đổi đo lường và khả năng rò rỉ. Các lựa chọn làm sạch là các giả định phân tích: xóa các hàng thiếu, ước lượng giá trị, hoặc giới hạn ngoại lệ có thể thay đổi dân số và kết luận. Ghi phiên bản dữ liệu thô một cách bất biến và các biến đổi dưới dạng mã, đồng thời tạo từ điển dữ liệu với đơn vị và ý nghĩa. Chia dữ liệu đánh giá trước khi học các biến đổi hoặc lặp lại việc kiểm tra giả thuyết.

Mô hình hoá, suy luận và tái tạo

Suy luận thống kê định lượng mức độ không chắc chắn dưới các giả định; mô hình dự đoán ước lượng hiệu suất ngoài mẫu; phân tích nguyên nhân yêu cầu xác định qua thiết kế hoặc các giả định có thể bảo vệ. Chọn các phương pháp phù hợp với câu hỏi và quá trình tạo dữ liệu. So sánh với các mô hình cơ sở đơn giản, sử dụng xác thực nhóm hoặc có nhận thức thời gian, và báo cáo mức độ không chắc và độ nhạy. Một hệ số tương quan cao hoặc tầm quan trọng đặc trưng không chứng minh tính nhân quả. Kiểm định đa lần, tự do độ đo của nhà nghiên cứu và báo cáo chọn lọc có thể tạo ra các mẫu thuyết phục, vì vậy đăng ký trước hoặc giai đoạn xác nhận rõ ràng có thể giúp.

Tái tạo bao gồm mã nguồn, môi trường, ảnh chụp dữ liệu, hạt ngẫu nhiên, định nghĩa truy vấn và bản ghi các quyết định thủ công. Kiểm thử tự động nên bao phủ schema, bất biến kinh doanh, biến đổi và các chỉ số. Sổ tay (notebook) có giá trị cho khám phá nhưng công việc sản xuất cần các pipeline mô-đun, có thể xem xét. Đánh giá đồng nghiệp nên thách thức các giả định, rò rỉ, tính hợp lệ của mục tiêu và liệu kết quả có tổng quát hay không. Giao tiếp kích thước hiệu ứng, mức độ không chắc, giới hạn và bằng chứng phản bác thay vì chỉ ý nghĩa thống kê hay điểm số mô hình.

Triển khai và tác động quyết định

Nếu phân tích điều khiển một quy trình lặp lại, chỉ định người chịu trách nhiệm, giám sát độ mới của dữ liệu và chất lượng kết quả, và xác định quy trình quay lại hoặc ngừng hoạt động. Bảo vệ thông tin cá nhân và bí mật bằng cách giảm thiểu, kiểm soát truy cập, lưu trữ và đầu ra an toàn. Đánh giá hiệu quả trên các tiểu nhóm và cách người dùng phản hồi mô hình; vòng phản hồi có thể thay đổi dữ liệu trong tương lai. Đo lường liệu quyết định có cải thiện mục tiêu thực tế, không chỉ là việc triển khai mô hình. Khoa học dữ liệu thành công khi bằng chứng thay đổi hành động một cách đáng tin cậy và minh bạch—không phải khi một tổ chức tích lũy các bảng điều khiển, tính năng hoặc thí nghiệm mà không có người chịu trách nhiệm.

Ví dụ thực tế: đo lường một can thiệp giữ chân

Một nhóm sản phẩm nhận thấy tỷ lệ giữ chân giảm và xác định người dùng hoạt động, nhóm kohort, khoảng thời gian, loại trừ và quyết định. Các nhà phân tích kiểm tra công cụ đo lường, sự kiện thiếu và hỗn hợp thu thập trước khi mô hình hoá. Các kohort mô tả xác định nơi suy giảm xảy ra, một mô hình dự đoán ưu tiên các thành viên nghiên cứu, và một thí nghiệm ngẫu nhiên khi onboarding ước tính liệu thay đổi đề xuất có cải thiện tỷ lệ giữ chân hay không. Đây là ba phân tích riêng biệt với các giả định và kết quả khác nhau.

Sổ tay, truy vấn, ảnh chụp dữ liệu, định nghĩa chỉ số và kế hoạch thí nghiệm được ghi phiên bản và đánh giá đồng nghiệp. Kết quả báo cáo kích thước hiệu ứng và mức độ không chắc với các rào cản bảo vệ nhu cầu hỗ trợ và khả năng tiếp cận. Một bảng điều khiển giám sát thí nghiệm nhưng không thay thế cho phân tích đã được khai báo trước. Nếu can thiệp thành công, việc triển khai sẽ được thực hiện theo giai đoạn và kiểm tra hành vi dài hạn. Công việc chỉ được coi là có giá trị nếu nó hỗ trợ một quyết định có thể tái tạo, không phải vì một mô hình phức tạp hay biểu đồ hấp dẫn đã được tạo ra.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, các phụ thuộc, người sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một nền tảng tái tạo được và một bộ đánh giá đã được phiên bản hoá trước khi tinh chỉnh. Kiểm tra các trường hợp thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng, và các nhóm hoặc môi trường có khả năng bị thiếu hụt. Đo lường chất lượng nhiệm vụ cùng với hiệu chỉnh hoặc mức độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi biến đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng hoạt động. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn, và xác minh giám sát bằng các lỗi được chèn có chủ đích. Dữ liệu đo lường vận hành nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần quy trình phục hồi, học từ sự cố, xóa và lưu trữ được ghi chép, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Câu hỏi thường gặp

Khoa học dữ liệu có giống với phân tích dữ liệu không?

Hai thuật ngữ có phần trùng lặp. Khoa học dữ liệu thường bao gồm việc xây dựng các sản phẩm dữ liệu và hệ thống dự đoán, trong khi phân tích có thể tập trung hơn vào hỗ trợ quyết định mô tả và chẩn đoán. Cách sử dụng trong tổ chức khác nhau.

Mỗi dự án khoa học dữ liệu có cần AI không?

Không. Một truy vấn, biểu đồ, thí nghiệm hoặc ước lượng thống kê được thiết kế tốt có thể hữu ích và đáng tin cậy hơn so với một mô hình phức tạp.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.