Nền tảng AI

Data Science Là Gì?

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Lĩnh vực khoa học dữ liệu dường như ngày càng lớn và phổ biến hơn mỗi ngày. Theo LinkedIn, khoa học dữ liệu là một trong những lĩnh vực việc làm phát triển nhanh nhất vào năm 2017 và vào năm 2020, Glassdoor đã xếp hạng công việc của nhà khoa học dữ liệu là một trong ba công việc tốt nhất tại Hoa Kỳ. Với sự phổ biến ngày càng tăng của khoa học dữ liệu, không có gì ngạc nhiên khi nhiều người đang quan tâm đến lĩnh vực này. Tuy nhiên, khoa học dữ liệu chính xác là gì?

Hãy làm quen với khoa học dữ liệu, dành một chút thời gian để định nghĩa khoa học dữ liệu, khám phá cách dữ liệu lớn và trí tuệ nhân tạo đang thay đổi lĩnh vực này, tìm hiểu về một số công cụ khoa học dữ liệu phổ biến và xem xét một số ví dụ về khoa học dữ liệu.

Khoa Học Dữ Liệu Là Gì?

Trước khi chúng ta có thể khám phá bất kỳ công cụ hoặc ví dụ nào về khoa học dữ liệu, chúng ta sẽ muốn có một định nghĩa chính xác về khoa học dữ liệu.

Định nghĩa “khoa học dữ liệu” thực sự là một chút khó khăn, vì thuật ngữ này được áp dụng cho nhiều nhiệm vụ và phương pháp nghiên cứu và phân tích khác nhau. Chúng ta có thể bắt đầu bằng cách nhắc lại bản thân về ý nghĩa của thuật ngữ “khoa học”. Khoa học là nghiên cứu có hệ thống về thế giới vật lý và tự nhiên thông qua quan sát và thí nghiệm, nhằm mục đích nâng cao hiểu biết của con người về các quá trình tự nhiên. Những từ quan trọng trong định nghĩa này là “quan sát” và “hiểu biết”.

Nếu khoa học dữ liệu là quá trình hiểu thế giới từ các mẫu trong dữ liệu, thì trách nhiệm của một nhà khoa học dữ liệu là chuyển đổi dữ liệu, phân tích dữ liệu và trích xuất mẫu từ dữ liệu. Nói cách khác, một nhà khoa học dữ liệu được cung cấp dữ liệu và họ sử dụng một số công cụ và kỹ thuật khác nhau để tiền xử lý dữ liệu (chuẩn bị dữ liệu cho phân tích) và sau đó phân tích dữ liệu để tìm ra các mẫu có ý nghĩa.

Vai trò của một nhà khoa học dữ liệu tương tự như vai trò của một nhà khoa học truyền thống. Cả hai đều quan tâm đến việc phân tích dữ liệu để hỗ trợ hoặc bác bỏ các giả thuyết về cách thế giới hoạt động, cố gắng hiểu các mẫu trong dữ liệu để cải thiện hiểu biết của chúng ta về thế giới. Các nhà khoa học dữ liệu sử dụng các phương pháp khoa học giống như những phương pháp mà một nhà khoa học truyền thống sử dụng. Một nhà khoa học dữ liệu bắt đầu bằng cách thu thập các quan sát về một số hiện tượng mà họ muốn nghiên cứu. Sau đó, họ xây dựng một giả thuyết về hiện tượng đang được nghiên cứu và cố gắng tìm dữ liệu để bác bỏ giả thuyết của họ theo một cách nào đó.

Nếu giả thuyết không bị bác bỏ bởi dữ liệu, họ có thể xây dựng một lý thuyết hoặc mô hình về cách hiện tượng hoạt động, mà họ có thể tiếp tục kiểm tra lại và lại bằng cách xem liệu nó có đúng với các tập dữ liệu khác tương tự hay không. Nếu một mô hình đủ mạnh, nếu nó giải thích các mẫu tốt và không bị bác bỏ trong các thử nghiệm khác, nó thậm chí có thể được sử dụng để dự đoán các sự kiện tương lai.

Thông thường, một nhà khoa học dữ liệu sẽ không thu thập dữ liệu của riêng họ thông qua một thí nghiệm. Họ thường sẽ không thiết kế các thí nghiệm với các yếu tố kiểm soát và thử nghiệm mù đôi để khám phá các biến số gây nhiễu có thể can thiệp vào một giả thuyết. Hầu hết dữ liệu được phân tích bởi một nhà khoa học dữ liệu sẽ là dữ liệu thu được thông qua các nghiên cứu quan sát và hệ thống, điều này là một cách mà công việc của một nhà khoa học dữ liệu có thể khác với công việc của một nhà khoa học truyền thống, người có xu hướng thực hiện nhiều thí nghiệm hơn.

Được nói, một nhà khoa học dữ liệu có thể được yêu cầu thực hiện một dạng thí nghiệm gọi là thử nghiệm A/B nơi các điều chỉnh được thực hiện đối với một hệ thống thu thập dữ liệu để xem cách các mẫu dữ liệu thay đổi.

Dù sử dụng các kỹ thuật và công cụ nào, khoa học dữ liệu cuối cùng nhằm mục đích cải thiện hiểu biết của chúng ta về thế giới bằng cách đưa ra ý nghĩa từ dữ liệu, và dữ liệu được thu thập thông qua quan sát và thí nghiệm. Khoa học dữ liệu là quá trình sử dụng các thuật toán, nguyên tắc thống kê và các công cụ và máy móc khác nhau để rút ra thông tin từ dữ liệu, thông tin giúp chúng ta hiểu các mẫu trong thế giới xung quanh.

Các Nhà Khoa Học Dữ Liệu Làm Gì?

Bạn có thể thấy rằng bất kỳ hoạt động nào liên quan đến việc phân tích dữ liệu theo cách khoa học có thể được gọi là khoa học dữ liệu, điều này là một phần của lý do tại sao định nghĩa khoa học dữ liệu lại khó khăn. Để làm cho nó rõ ràng hơn, hãy khám phá một số hoạt động mà một nhà khoa học dữ liệu có thể thực hiện hàng ngày.

Khoa học dữ liệu kết hợp nhiều kỷ luật và chuyên môn khác nhau. Ảnh: Calvin Andrus qua Wikimeedia Commons, CC BY SA 3.0 (https://commons.wikimedia.org/wiki/File:DataScienceDisciplines.png)

Vào bất kỳ ngày nào, một nhà khoa học dữ liệu có thể được yêu cầu: tạo sơ đồ lưu trữ và truy xuất dữ liệu, tạo đường ống ETL (trích xuất, chuyển đổi, tải) và làm sạch dữ liệu, sử dụng các phương pháp thống kê, tạo ra các hình ảnh và bảng điều khiển dữ liệu, triển khai các thuật toán trí tuệ nhân tạo và học máy, đưa ra các khuyến nghị dựa trên dữ liệu.

Hãy chia nhỏ các nhiệm vụ trên một chút.

Một nhà khoa học dữ liệu có thể được yêu cầu xử lý việc cài đặt các công nghệ cần thiết để lưu trữ và truy xuất dữ liệu, chú ý đến cả phần cứng và phần mềm. Người phụ trách vị trí này cũng có thể được gọi là “Kỹ sư dữ liệu“. Tuy nhiên, một số công ty bao gồm các trách nhiệm này trong vai trò của các nhà khoa học dữ liệu. Một nhà khoa học dữ liệu cũng có thể cần tạo hoặc hỗ trợ tạo đường ống ETL. Dữ liệu rất hiếm khi đến dưới dạng đã được định dạng như một nhà khoa học dữ liệu cần. Thay vào đó, dữ liệu sẽ cần được nhận dưới dạng thô từ nguồn dữ liệu, chuyển đổi thành định dạng có thể sử dụng và tiền xử lý (như chuẩn hóa dữ liệu, loại bỏ dư thừa và loại bỏ dữ liệu bị hỏng).

Các Phương Pháp Thống Kê Của Khoa Học Dữ Liệu

Việc áp dụng thống kê là cần thiết để biến việc xem xét dữ liệu và giải thích nó thành một khoa học thực sự. Các phương pháp thống kê được sử dụng để trích xuất các mẫu liên quan từ các tập dữ liệu, và một nhà khoa học dữ liệu cần phải thành thạo trong các khái niệm thống kê. Họ cần phải có khả năng phân biệt các mối tương quan có ý nghĩa với các mối tương quan giả, bằng cách kiểm soát các biến số gây nhiễu. Họ cũng cần biết công cụ nào để sử dụng để xác định các tính năng trong tập dữ liệu là quan trọng đối với mô hình của họ / có sức mạnh dự đoán. Một nhà khoa học dữ liệu cần biết khi nào sử dụng phương pháp hồi quy so với phương pháp phân loại, và khi nào quan tâm đến trung bình của một mẫu so với trung vị của một mẫu. Một nhà khoa học dữ liệu đơn giản là không thể là một nhà khoa học nếu không có những kỹ năng quan trọng này.

Trực Quan Hóa Dữ Liệu

Một phần quan trọng trong công việc của một nhà khoa học dữ liệu là truyền đạt các phát hiện của họ cho người khác. Nếu một nhà khoa học dữ liệu không thể truyền đạt hiệu quả các phát hiện của họ cho người khác, thì ý nghĩa của các phát hiện của họ không quan trọng. Một nhà khoa học dữ liệu cũng nên là một người kể chuyện hiệu quả. Điều này có nghĩa là tạo ra các hình ảnh trực quan hóa dữ liệu mà truyền đạt các điểm liên quan về tập dữ liệu và các mẫu được phát hiện trong đó. Có một số lượng lớn các công cụ trực quan hóa dữ liệu khác nhau mà một nhà khoa học dữ liệu có thể sử dụng, và họ có thể trực quan hóa dữ liệu cho mục đích khám phá ban đầu (phân tích dữ liệu khám phá) hoặc trực quan hóa kết quả mà một mô hình tạo ra.

Khuyến Nghị và Ứng Dụng Kinh Doanh

Một nhà khoa học dữ liệu cần phải có một số trực giác về các yêu cầu và mục tiêu của tổ chức hoặc doanh nghiệp của họ. Một nhà khoa học dữ liệu cần phải hiểu những điều này vì họ cần biết loại biến số và tính năng nào họ nên phân tích, khám phá các mẫu sẽ giúp tổ chức của họ đạt được mục tiêu của mình. Các nhà khoa học dữ liệu cần phải nhận thức được các ràng buộc mà họ đang hoạt động và các giả định mà lãnh đạo tổ chức của họ đang thực hiện.

Học Máy và Trí Tuệ Nhân Tạo

Học máy và các thuật toán và mô hình trí tuệ nhân tạo khác là các công cụ được sử dụng bởi các nhà khoa học dữ liệu để phân tích dữ liệu, xác định các mẫu trong dữ liệu, phân biệt mối quan hệ giữa các biến số và đưa ra dự đoán về các sự kiện trong tương lai.

Khoa Học Dữ Liệu Truyền Thống so với Khoa Học Dữ Liệu Lớn

Khi các phương pháp thu thập dữ liệu trở nên tinh vi hơn và các cơ sở dữ liệu lớn hơn, một sự khác biệt đã xuất hiện giữa khoa học dữ liệu truyền thống và “dữ liệu lớn” khoa học.

Phân tích dữ liệu truyền thống và khoa học dữ liệu được thực hiện với phân tích mô tả và khám phá, nhằm tìm ra các mẫu và phân tích kết quả hiệu suất của các dự án. Các phương pháp phân tích dữ liệu truyền thống thường tập trung vào dữ liệu trong quá khứ và hiện tại. Các nhà phân tích dữ liệu thường xử lý dữ liệu đã được làm sạch và tiêu chuẩn hóa, trong khi các nhà khoa học dữ liệu thường xử lý dữ liệu phức tạp và bẩn. Các kỹ thuật phân tích dữ liệu tiên tiến hơn có thể được sử dụng để dự đoán hành vi trong tương lai, mặc dù điều này thường được thực hiện với dữ liệu lớn, vì các mô hình dự đoán thường cần một lượng lớn dữ liệu để được xây dựng đáng tin cậy.

“Dữ liệu lớn” đề cập đến dữ liệu quá lớn và phức tạp để được xử lý bằng các kỹ thuật và công cụ phân tích dữ liệu truyền thống. Dữ liệu lớn thường được thu thập thông qua các nền tảng trực tuyến và các công cụ chuyển đổi dữ liệu tiên tiến được sử dụng để làm cho lượng dữ liệu lớn sẵn sàng cho việc kiểm tra bởi khoa học dữ liệu. Khi nhiều dữ liệu được thu thập mọi lúc, nhiều hơn công việc của một nhà khoa học dữ liệu liên quan đến việc phân tích dữ liệu lớn.

Các Công Cụ Khoa Học Dữ Liệu

Các công cụ khoa học dữ liệu phổ biến bao gồm các công cụ để lưu trữ dữ liệu, thực hiện phân tích dữ liệu khám phá, mô hình hóa dữ liệu, thực hiện ETL và trực quan hóa dữ liệu. Các nền tảng như Amazon Web Services, Microsoft Azure và Google Cloud đều cung cấp các công cụ để giúp các nhà khoa học dữ liệu lưu trữ, chuyển đổi, phân tích và mô hình hóa dữ liệu. Ngoài ra, còn có các công cụ khoa học dữ liệu độc lập như Airflow (hạ tầng dữ liệu) và Tableau (trực quan hóa và phân tích dữ liệu).

Về các thuật toán học máy và trí tuệ nhân tạo được sử dụng để mô hình hóa dữ liệu, chúng thường được cung cấp thông qua các mô块 và nền tảng khoa học dữ liệu như TensorFlow, PyTorch và Azure Machine-learning studio. Các nền tảng này cho phép các nhà khoa học dữ liệu chỉnh sửa các tập dữ liệu của họ, tạo kiến trúc học máy và đào tạo các mô hình học máy.

Các công cụ và thư viện khoa học dữ liệu phổ biến khác bao gồm SAS (đối với mô hình hóa thống kê), Apache Spark (đối với phân tích dữ liệu luồng), D3.js (đối với trực quan hóa tương tác trong trình duyệt) và Jupyter (đối với mã khối tương tác và trực quan hóa có thể chia sẻ).

Ảnh: Seonjae Jo qua Flickr, CC BY SA 2.0 (https://www.flickr.com/photos/130860834@N02/19786840570)

Ví Dụ Về Khoa Học Dữ Liệu

Các ví dụ về khoa học dữ liệu và ứng dụng của nó có ở khắp mọi nơi. Khoa học dữ liệu có ứng dụng trong mọi thứ, từ giao hàng thực phẩm, thể thao, giao thông và sức khỏe. Dữ liệu ở khắp mọi nơi và vì vậy khoa học dữ liệu có thể được áp dụng cho mọi thứ.

Về mặt thực phẩm, Uber đang đầu tư vào một sự mở rộng của hệ thống chia sẻ chuyến đi tập trung vào việc giao thực phẩm, Uber Eats. Uber Eats cần phải đưa thực phẩm đến tay người dùng một cách kịp thời, trong khi thực phẩm vẫn còn nóng và tươi. Để điều này xảy ra, các nhà khoa học dữ liệu của công ty cần sử dụng mô hình hóa thống kê xem xét các khía cạnh như khoảng cách từ nhà hàng đến điểm giao hàng, đợt cao điểm trong ngày lễ, thời gian nấu và thậm chí cả điều kiện thời tiết, tất cả đều được xem xét với mục tiêu tối ưu hóa thời gian giao hàng.

Thống kê thể thao được sử dụng bởi các nhà quản lý đội để xác định những cầu thủ tốt nhất và tạo thành các đội mạnh và đáng tin cậy sẽ giành chiến thắng trong các trận đấu. Một ví dụ đáng chú ý là khoa học dữ liệu được ghi lại bởi Michael Lewis trong cuốn sách Moneyball, nơi tổng giám đốc của đội Oakland Athletics đã phân tích nhiều thống kê để xác định các cầu thủ chất lượng có thể được ký hợp đồng với đội với chi phí tương đối thấp.

Phân tích mẫu giao thông là rất quan trọng cho việc tạo ra các phương tiện tự lái. Các phương tiện tự lái phải có khả năng dự đoán hoạt động xung quanh chúng và phản ứng với các thay đổi trong điều kiện đường xá, như khoảng cách dừng yêu cầu khi trời mưa, cũng như sự hiện diện của nhiều xe hơn trên đường trong giờ cao điểm. Ngoài các phương tiện tự lái, các ứng dụng như Google Maps phân tích mẫu giao thông để thông báo cho người đi đường về thời gian họ cần để đến đích của mình bằng các tuyến đường và phương tiện khác nhau.

Về mặt dữ liệu sức khỏe, tầm nhìn máy tính thường được kết hợp với học máy và các kỹ thuật trí tuệ nhân tạo khác để tạo ra các phân loại hình ảnh có khả năng kiểm tra các thứ như X-quang, FMRIs và siêu âm để xem liệu có bất kỳ vấn đề y tế nào có thể xuất hiện trong quá trình quét hay không. Các thuật toán này có thể được sử dụng để giúp các bác sĩ chẩn đoán bệnh.

Cuối cùng, khoa học dữ liệu bao gồm nhiều hoạt động và kết hợp các khía cạnh của các kỷ luật khác nhau. Tuy nhiên, khoa học dữ liệu luôn quan tâm đến việc kể những câu chuyện hấp dẫn, thú vị từ dữ liệu, và sử dụng dữ liệu để hiểu tốt hơn về thế giới.

Blogger và lập trình viên với chuyên môn về Machine Learning Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.