Lãnh đạo tư tưởng

Tầm quan trọng của Chất lượng Dữ liệu trong Thực hiện Trí tuệ Nhân tạo

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Công nghệ Trí tuệ Nhân tạo và Máy học có thể mang lại lợi ích đáng kể cho các ngành công nghiệp của mọi quy mô. Theo một báo cáo của McKinsey, các doanh nghiệp sử dụng công nghệ trí tuệ nhân tạo sẽ tăng gấp đôi dòng tiền của họ vào năm 2030. Ngược lại, các công ty không triển khai AI sẽ chứng kiến sự giảm 20% dòng tiền của họ. Tuy nhiên, những lợi ích này đi beyond tài chính. AI có thể giúp các công ty đối phó với tình trạng thiếu hụt lao động. AI cũng cải thiện đáng kể trải nghiệm khách hàng và kết quả kinh doanh, làm cho các doanh nghiệp trở nên đáng tin cậy hơn.

Vì AI có nhiều lợi ích, tại sao không phải mọi người đều áp dụng AI? Vào năm 2019, một khảo sát của PwC cho thấy 76% công ty dự định sử dụng AI để cải thiện giá trị kinh doanh của họ. Tuy nhiên, chỉ 15% trong số họ có quyền truy cập vào dữ liệu chất lượng cao để đạt được mục tiêu kinh doanh của mình. Một nghiên cứu khác của Refinitiv cho thấy 66% người được hỏi cho biết dữ liệu chất lượng kém cản trở khả năng triển khai và áp dụng AI hiệu quả của họ.

Khảo sát cho thấy ba thách thức hàng đầu khi làm việc với công nghệ máy học và AI xoay quanh – “thông tin chính xác về phạm vi, lịch sử và dân số của dữ liệu”, “xác định các bản ghi không đầy đủ hoặc bị hỏng” và “làm sạch và chuẩn hóa dữ liệu”. Điều này cho thấy rằng dữ liệu chất lượng kém là rào cản chính cho các doanh nghiệp trong việc có được phân tích AI chất lượng cao.

Tại sao Dữ liệu lại quan trọng?

Có nhiều lý do tại sao chất lượng dữ liệu lại quan trọng trong việc thực hiện AI. Dưới đây là một số lý do quan trọng nhất:

1. Dữ liệu đầu vào và đầu ra

Đầu ra phụ thuộc rất nhiều vào đầu vào. Trong trường hợp này, nếu tập dữ liệu đầy lỗi hoặc bị偏, kết quả cũng sẽ bị sai. Hầu hết các vấn đề liên quan đến dữ liệu không phải là về số lượng dữ liệu mà là chất lượng dữ liệu bạn đưa vào mô hình AI. Nếu bạn có dữ liệu chất lượng thấp, mô hình AI của bạn sẽ không hoạt động đúng dù nó có tốt đến đâu.

2. Không phải tất cả Hệ thống AI đều như nhau

Khi chúng ta nghĩ về tập dữ liệu, chúng ta thường nghĩ về dữ liệu định lượng. Nhưng cũng có dữ liệu định tính dưới dạng video, phỏng vấn cá nhân, ý kiến, hình ảnh, v.v. Trong các hệ thống AI, dữ liệu định lượng được cấu trúc và dữ liệu định tính không được cấu trúc. Không phải tất cả mô hình AI đều có thể xử lý cả hai loại dữ liệu. Vì vậy, việc chọn loại dữ liệu phù hợp cho mô hình phù hợp là rất quan trọng để có được kết quả mong muốn.

3. Chất lượng so với Số lượng

Người ta thường cho rằng hệ thống AI cần phải tiêu thụ một lượng lớn dữ liệu để học từ nó. Trong một cuộc tranh luận về chất lượng so với số lượng, sau này thường được các công ty ưa chuộng. Tuy nhiên, nếu tập dữ liệu có chất lượng cao nhưng ngắn, nó sẽ mang lại cho bạn sự đảm bảo rằng kết quả là相关 và mạnh mẽ.

4. Đặc điểm của một Tập dữ liệu tốt

Đặc điểm của một tập dữ liệu tốt có thể là chủ quan và phụ thuộc vào ứng dụng mà AI đang phục vụ. Tuy nhiên, có một số tính năng chung mà bạn nên tìm kiếm khi phân tích tập dữ liệu.

  • Hoàn chỉnh: Tập dữ liệu phải hoàn chỉnh, không có ô trống hoặc khoảng trống trong dữ liệu. Mỗi ô phải có một phần dữ liệu trong đó.
  • Toàn diện: Tập dữ liệu nên toàn diện nhất có thể. Ví dụ, nếu bạn đang tìm kiếm một vector đe dọa mạng, thì bạn phải có tất cả các hồ sơ chữ ký và tất cả thông tin cần thiết.
  • Đồng nhất: Tập dữ liệu phải phù hợp với các biến mà chúng đã được gán. Ví dụ, nếu bạn đang xây dựng mô hình hộp gói, các biến đã chọn (nhựa, giấy, bìa cứng, v.v.) phải có dữ liệu giá phù hợp để thuộc vào các danh mục đó.
  • Độ chính xác: Độ chính xác là chìa khóa cho một tập dữ liệu tốt. Tất cả thông tin bạn đưa vào mô hình AI phải đáng tin cậy và hoàn toàn chính xác. Nếu một phần lớn tập dữ liệu của bạn không chính xác, kết quả sẽ không chính xác.
  • Độc nhất: Điểm này tương tự như tính nhất quán. Mỗi điểm dữ liệu phải độc nhất đối với biến mà nó đang phục vụ. Ví dụ, bạn không muốn giá của một bao bì nhựa rơi vào bất kỳ danh mục nào khác.

Đảm bảo Chất lượng Dữ liệu

Có nhiều cách để đảm bảo chất lượng dữ liệu cao, như đảm bảo nguồn dữ liệu đáng tin cậy. Dưới đây là một số kỹ thuật tốt nhất để đảm bảo bạn có được dữ liệu chất lượng cao nhất cho mô hình AI của mình:

1. Profiling Dữ liệu

Profiling dữ liệu là rất quan trọng để hiểu dữ liệu trước khi sử dụng. Profiling dữ liệu cung cấp thông tin về phân phối giá trị, giá trị tối đa, tối thiểu, trung bình và các giá trị ngoại lệ. Ngoài ra, nó giúp định dạng các bất thường trong dữ liệu. Profiling dữ liệu giúp hiểu liệu tập dữ liệu có thể sử dụng được hay không.

2. Đánh giá Chất lượng Dữ liệu

Sử dụng một thư viện trung tâm của các quy tắc chất lượng dữ liệu được xây dựng sẵn, bạn có thể xác thực bất kỳ tập dữ liệu nào với thư viện trung tâm. Nếu bạn có một danh mục dữ liệu với các công cụ dữ liệu tích hợp, bạn có thể tái sử dụng các quy tắc đó để xác thực tên khách hàng, email và mã sản phẩm. Ngoài ra, bạn cũng có thể làm giàu và tiêu chuẩn hóa một số dữ liệu.

3. Giám sát và Đánh giá Chất lượng Dữ liệu

Các nhà khoa học đã tính toán chất lượng dữ liệu trước cho hầu hết các tập dữ liệu họ muốn sử dụng. Họ có thể thu hẹp nó lại để xem vấn đề cụ thể mà một thuộc tính có và sau đó quyết định liệu có sử dụng thuộc tính đó hay không.

4. Chuẩn bị Dữ liệu

Các nhà nghiên cứu và nhà khoa học thường phải điều chỉnh dữ liệu một chút để chuẩn bị nó cho mô hình AI. Những nhà nghiên cứu này cần các công cụ dễ sử dụng để phân tích thuộc tính, chuyển đổi cột và tính toán giá trị từ dữ liệu.

Thế giới của trí tuệ nhân tạo đang liên tục thay đổi. Mặc dù mỗi công ty sử dụng dữ liệu theo cách khác nhau, chất lượng dữ liệu vẫn là điều quan trọng nhất trong bất kỳ dự án thực hiện AI nào. Nếu bạn có dữ liệu đáng tin cậy và chất lượng cao, bạn sẽ loại bỏ nhu cầu về tập dữ liệu lớn và tăng cơ hội thành công. Giống như tất cả các tổ chức khác, nếu tổ chức của bạn đang chuyển sang thực hiện AI, hãy kiểm tra xem bạn có dữ liệu chất lượng tốt hay không. Đảm bảo nguồn của bạn đáng tin cậy và thực hiện thẩm định để kiểm tra xem chúng có phù hợp với yêu cầu dữ liệu của bạn hay không.

Amy Groden-Morrison đã phục vụ hơn 15 năm trong các vai trò lãnh đạo truyền thông tiếp thị tại các công ty như TIBCO Software, RSA Security và Ziff-Davis. Những thành tựu trong quá khứ của cô bao gồm thiết lập chương trình công nghệ đồng thương hiệu đầu tiên với CNN, ra mắt một công ty sự kiện trên NYSE, tái thương hiệu một công ty được niêm yết trên NASDAQ trong thời kỳ khủng hoảng và định vị và tiếp thị một công ty khởi nghiệp ở khu vực Boston để mua lại thành công. Hiện tại, cô là VP của Tiếp thị và Hoạt động Bán hàng cho Alpha Software.