Lãnh đạo tư tưởng
Tại Sao Chất Lượng Dữ Liệu Quyết Định Sự Thành Công Hay Thất Bại Của Trí Tuệ Nhân Tạo Doanh Nghiệp

Kể từ khi OpenAI ra mắt ChatGPT vào cuối năm 2022, mọi công ty đều đang cố gắng đẩy nhanh tốc độ với trí tuệ nhân tạo. Các nhà sản xuất phần cứng lớn như Nvidia đang bán nhiều card đồ họa hơn bao giờ hết, trong khi các nhà xây dựng mô hình lớn như OpenAI và Anthropic tiếp tục xây dựng các mô hình lớn hơn và lớn hơn.
Tuy nhiên, ngay cả với các mô hình tiên tiến nhất và ngân sách lớn nhất, nhiều dự án trí tuệ nhân tạo vẫn không đạt được kết quả mong muốn. Chúng tôi đã thấy điều này xảy ra trên nhiều ngành công nghiệp, từ chăm sóc sức khỏe đến vận tải, tài chính và nhiều hơn nữa. Lý do không phải là điều khó hiểu: Trí tuệ nhân tạo chỉ tốt như dữ liệu nó được đào tạo và dữ liệu nó nhận được trong thời gian thực. Khi dữ liệu đó được gắn nhãn kém, lỗi thời hoặc không đầy đủ, không có mô hình nào có thể đưa ra kết quả nhất quán hoặc đáng tin cậy.
Và đó là vấn đề lớn mà nhiều công ty đang phải đối mặt ngày nay. Họ đầu tư mạnh mẽ vào các công cụ trí tuệ nhân tạo, trong khi hệ thống dữ liệu của họ vẫn còn phân mảnh và không đáng tin cậy. Kết quả là một ảo tưởng về tiến bộ. Trong khi các mô hình đưa ra câu trả lời ấn tượng, những thông tin đó thường dựa trên nền tảng yếu. Rào cản thực sự đối với sự thành công của trí tuệ nhân tạo không phải là hiệu suất của mô hình. Đó là chất lượng dữ liệu.
Dữ Liệu Tốt Thực Sự Có Nghĩa Là Gì
Dữ liệu chất lượng cao không chỉ là về độ chính xác. Nó có nghĩa là thông tin hiện tại, đầy đủ và liên quan đến vấn đề đang được giải quyết. Hãy tưởng tượng một khách hàng cố gắng hủy đơn hàng trên một trang web thương mại điện tử. Hệ thống cần kiểm tra chi tiết đơn hàng, trạng thái giao hàng và hồ sơ thanh toán. Nếu bất kỳ điểm dữ liệu nào trong số đó sống trong các hệ thống khác nhau không nói chuyện với nhau, trợ lý trí tuệ nhân tạo sẽ không thể đưa ra câu trả lời hữu ích.
Dữ liệu tốt kết nối những điểm đó ngay lập tức. Nó cho phép trí tuệ nhân tạo nhìn thấy một bức tranh toàn diện chứ không phải chỉ là những mảnh ghép của nó. Dữ liệu kém, mặt khác, buộc mô hình phải đoán. Và khi trí tuệ nhân tạo bắt đầu đoán, nó sẽ mắc lỗi tốn tiền và làm hỏng niềm tin. Các ví dụ gần đây cho thấy sự nguy hiểm của những giả định như vậy.
Trợ lý chatbot kinh doanh của Thành phố New York đã đưa ra lời khuyên bất hợp pháp vì nó lấy từ thông tin pháp lý lỗi thời hoặc không đầy đủ. Trợ lý khách hàng của Air Canada đã đưa ra yêu cầu hoàn tiền sai vì nó thiếu ngữ cảnh từ chính sách công ty. Thậm chí các hệ thống tuyển dụng lớn đã lọc sai ứng viên do dữ liệu bị thiên vị hoặc gắn nhãn sai, như được thấy trong thỏa thuận trí tuệ nhân tạo đầu tiên của EEOC. Những thất bại này không chỉ là kỹ thuật. Chúng là uy tín và tài chính, và chúng bắt nguồn từ các hệ thống trí tuệ nhân tạo được đào tạo trên dữ liệu không đáng tin cậy.
Các nghiên cứu trong ngành xác nhận quy mô của vấn đề này. Gartner báo cáo rằng 80 phần trăm dự án trí tuệ nhân tạo không thể mở rộng quy mô do chất lượng dữ liệu và quản lý kém. Tương tự, một cuộc khảo sát của MIT Sloan Management Review cho thấy rằng các vấn đề dữ liệu, không phải thuật toán, là lý do hàng đầu khiến các dự án trí tuệ nhân tạo doanh nghiệp sụp đổ.
Văn Hóa Quan Trọng Như Là Mã
Cải thiện chất lượng dữ liệu không phải là điều bạn có thể sửa chữa bằng một công cụ hoặc lệnh duy nhất. Nó đòi hỏi một sự thay đổi văn hóa. Đó là lý do tại sao các nhà lãnh đạo doanh nghiệp phải coi dữ liệu như một hệ thống sống cần được chăm sóc và chịu trách nhiệm. Điều này không chỉ là tuyên bố rằng bạn muốn “làm cho dữ liệu tốt hơn” – điều đó không đủ. Mỗi phần của tổ chức phải hiểu cách thông tin di chuyển, ai sở hữu nó, và điều gì xảy ra khi nó thay đổi.
Chúng tôi đã thấy điều này diễn ra trong các hệ thống thế giới thực. Nhiều ứng dụng trí tuệ nhân tạo phụ thuộc vào cập nhật dữ liệu hàng đêm. Nếu cơ sở dữ liệu của bạn được làm mới một lần một ngày, kiến thức của mô hình sẽ luôn chậm lại so với thực tế. Trong môi trường nhanh chóng, sự chậm trễ đó có thể có nghĩa là thông tin lỗi thời và quyết định kém. Các công ty cần phải suy nghĩ lại toàn bộ luồng dữ liệu của họ, từ cách thông tin được thu thập đến cách nó được cung cấp cho mô hình.
Làm điều này tốt có thể tiết kiệm rất nhiều thời gian và chi phí. Khi các đường ống dữ liệu được thiết kế với sự rõ ràng và mục đích, các hệ thống trí tuệ nhân tạo có thể học hỏi và hành động trên thông tin mới nhất và liên quan nhất. Khi chúng không, các đội sẽ dành nhiều thời gian hơn để làm sạch dữ liệu hơn là sử dụng nó.
Các chuyên gia trong quản lý dữ liệu thường chỉ ra rằng chìa khóa để có chất lượng dữ liệu mạnh mẽ là một vòng phản hồi giữa con người, quy trình và nền tảng. Không có vòng phản hồi đó, thông tin sẽ trở nên cũ và mô hình sẽ mất liên lạc với điều kiện thực tế – một vấn đề đôi khi được gọi là trôi dữ liệu.
Đánh Bằng Tốc Độ Với Tính Toàn Vẹn
Đôi khi có sự căng thẳng giữa việc di chuyển nhanh và giữ chính xác. Nhiều tổ chức muốn có kết quả tức thì từ đầu tư trí tuệ nhân tạo của họ, nhưng việc vội vàng có thể dẫn đến những vấn đề lớn hơn sau này. Mục tiêu nên là sự linh hoạt của dữ liệu với tính toàn vẹn. Nói cách khác, xây dựng các hệ thống có thể di chuyển nhanh mà không mất đi độ chính xác.
Để làm được điều này, mỗi công ty nên xác định rõ ràng con đường cho dữ liệu di chuyển từ nguồn đến mô hình trong thời gian thực. Nó cũng giúp xác định loại thông tin nào được phép vào và loại nào phải ở ngoài. Dữ liệu nhạy cảm hoặc riêng tư không bao giờ nên đến được mô hình, ngay cả khi người dùng có quyền truy cập vào nó. Việc bảo vệ ranh giới đó xây dựng niềm tin và giữ cho các hệ thống trí tuệ nhân tạo không bị rò rỉ hoặc lạm dụng thông tin.
Khi trí tuệ nhân tạo trở nên tự chủ hơn, sự giám sát của con người sẽ vẫn rất quan trọng. Mô hình không nên có quyền kiểm soát hoàn toàn các hành động kinh doanh. Nó chắc chắn không nên đưa ra quyết định. Thay vào đó, nó nên đưa ra yêu cầu. Quan trọng hơn, con người phải luôn xem xét và phê duyệt các hành động của nó để đảm bảo chúng phù hợp với chính sách công ty và quy định.
Xây Dựng Chất Lượng Từ Đất
Giữ chất lượng dữ liệu ở quy mô lớn không chỉ là việc làm sạch các lỗi. Nó bắt đầu từ kiến trúc. Bạn cần xác định nơi dữ liệu đáng tin cậy nhất của bạn sống, sau đó thiết kế một hệ thống đưa nó lại với nhau trong một vị trí đáng tin cậy. Từ đó, bạn có thể theo dõi dữ liệu mà mô hình sử dụng và nơi nó đến.
Cách tiếp cận này ngăn chặn sự nhầm lẫn và giữ cho hệ thống minh bạch. Nó cũng giúp các đội giải quyết vấn đề nhanh hơn khi có điều gì đó đi sai. Khi bạn biết chính xác dữ liệu nào đã cho mô hình câu trả lời, bạn có thể xác minh và sửa lỗi trước khi chúng lan rộng.
Tương lai của trí tuệ nhân tạo doanh nghiệp sẽ thuộc về các công ty nhúng chất lượng vào cơ sở hạ tầng của họ theo mặc định. Chúng tôi dự đoán sẽ thấy nhiều hệ thống trí tuệ nhân tạo có thể cắm và chạy, xử lý cả lý luận và tích hợp dữ liệu trong một gói. Những “thiết bị trí tuệ nhân tạo” này có thể giúp các tổ chức triển khai hệ thống thông minh mà không mất quyền kiểm soát dữ liệu của họ.
Các nhà phân tích dự đoán rằng các tổ chức có khả năng thống nhất và quản lý dữ liệu của họ một cách hiệu quả sẽ thấy việc áp dụng và ROI từ các dự án trí tuệ nhân tạo nhanh hơn. Một báo cáo gần đây về sự sẵn sàng dữ liệu giải thích rằng khả năng này phân biệt các công ty liên tục đổi mới với những công ty bị đình trệ sau các thử nghiệm ban đầu. Sự khác biệt thường nằm ở việc liệu các hệ thống trí tuệ nhân tạo của họ có được xây dựng trên thông tin nhất quán và cấu trúc tốt hay không.
Kết Luận
Chất lượng dữ liệu có thể không nghe hấp dẫn so với những đột phá trong thiết kế mô hình, nhưng nó là lực lượng im lặng quyết định liệu trí tuệ nhân tạo có thành công hay thất bại. Không có dữ liệu sạch, hiện tại và nhất quán, các hệ thống thông minh nhất sẽ vấp ngã. Với nó, ngay cả những dự án trí tuệ nhân tạo khiêm tốn cũng có thể tạo ra giá trị lâu dài.
Mỗi nhà lãnh đạo đầu tư vào trí tuệ nhân tạo nên đặt ra một câu hỏi đơn giản: Chúng ta có tin tưởng dữ liệu mà chúng ta dựa vào để đưa ra quyết định không? Từ những gì chúng tôi đã thấy, các công ty có thể trả lời “có” một cách tự tin là những công ty đang dẫn đầu trong cuộc đua trí tuệ nhân tạo.












