Lãnh đạo tư tưởng
Làm Sạch Dữ Liệu Rối Ràng Của Chúng Ta: Làm Thế Nào Trí Tuệ Nhân Tạo Đang Thay Đổi Trò Chơi

Chúng ta đang bị ngập trong dữ liệu. Mỗi nền tảng, đồng hồ thông minh và điện thoại thông minh chia nhỏ cuộc sống của chúng ta thành những mảnh nhỏ có thể đo lường được, nhưng hầu hết trong số đó vẫn còn không hợp lý và không thể sử dụng được.
Các công ty biết điều này, đó là lý do tại sao gã khổng lồ công nghệ Meta đã đầu tư 14 tỷ USD vào mùa hè năm ngoái để mua lại 49% cổ phần của công ty khởi nghiệp gắn nhãn dữ liệu Scale AI, tạo ra một bước đi tính toán và chiến lược để đảm bảo dữ liệu đào tạo chất lượng cao cho các mô hình trí tuệ nhân tạo của mình.
Tính tin cậy của các mô hình ngôn ngữ lớn phụ thuộc hoàn toàn vào chất lượng dữ liệu mà chúng được cung cấp – ngắn gọn, “rác vào, rác ra.” Tuy nhiên, ngày nay, thách thức thực sự mà các công ty phải đối mặt là biến một lượng lớn thông tin thô thành dữ liệu có thể hành động.
Giải pháp có thể đang ẩn náu ngay trước mắt chúng ta: chính trí tuệ nhân tạo có thể giúp tạo ra các chiến lược để vượt qua nhiệm vụ nhàm chán của việc gắn nhãn cho các tập dữ liệu lớn hoặc tìm kiếm trong các bảng tính không ngừng, biến hỗn loạn thành trí tuệ con người có thể sử dụng.
Khi dữ liệu trở nên rối ràng: Chi phí ẩn cho các công ty
Theo nghiên cứu của Gartner từ năm 2020, chất lượng dữ liệu kém khiến các tổ chức mất ít nhất 12,9 triệu USD mỗi năm, ảnh hưởng đến năng suất và dẫn đến việc ra quyết định không chính xác và báo cáo không chính xác.
Hậu quả của dữ liệu rối ràng càng rõ ràng hơn trong các lĩnh vực như chăm sóc sức khỏe. Hồ sơ sức khỏe không đầy đủ, chi tiết hóa đơn và dữ liệu không khớp trên các hệ thống có thể dẫn đến chẩn đoán sai, sai sót trong điều trị và phân bổ nguồn lực không hiệu quả. Về lâu dài, điều này làm tăng chi phí và làm xói mòn niềm tin vào các hệ thống này.
Trong khi đó, trong lĩnh vực hậu cần, dữ liệu không khớp giữa các nhà cung cấp và nhà phân phối có thể dẫn đến chậm trễ hoặc thiếu hụt hàng tồn kho. Một địa chỉ giao hàng không chính xác hoặc một hồ sơ hàng tồn kho đã lỗi thời có thể tạo ra hiệu ứng domino trên toàn bộ chuỗi cung ứng, dẫn đến việc bỏ lỡ thời hạn và làm khách hàng không hài lòng.
“Bằng cách có thể dự đoán hoặc hiểu những gì có thể xảy ra [dọc theo tuyến đường] – dựa trên dữ liệu kết hợp từ quá khứ – bạn thực sự có thể cắt giảm những bất hiệu quả này,” Asparuh Koev, CEO của công ty trí tuệ nhân tạo hậu cần Transmetrics, cho biết trong một cuộc trò chuyện với Unite AI.
Trong thực tế, dữ liệu rối ràng rất tốn kém. Quy tắc 1-10-100 minh họa điều này: chi phí để kiểm tra dữ liệu khi nó được nhập là 1 USD, để làm sạch nó sau đó là 10 USD, và nếu không làm gì cả, chi phí sẽ là 100 USD.
Trí tuệ nhân tạo mang lại gì cho bảng
Khi các doanh nghiệp vật lộn với lượng dữ liệu “bẩn” ngày càng tăng, họ đang chuyển sang trí tuệ nhân tạo để tìm giải pháp. Các nền tảng trí tuệ nhân tạo mới nổi hiện tự động hóa quá trình làm sạch dữ liệu, đảm bảo hiệu quả về chi phí và cải thiện độ chính xác.
Robert Giardina, người sáng lập Claritype, một nền tảng như vậy, giải thích quá trình của trí tuệ nhân tạo:
“Nó hội tụ dữ liệu vào một định dạng chung: một phần của quá trình là chuyển đổi mỗi dữ liệu thành một định dạng tiêu chuẩn phù hợp với doanh nghiệp.”
Trí tuệ nhân tạo của Claritype vượt ra ngoài việc tiêu chuẩn hóa đơn giản. Nền tảng sửa chữa được giám sát cho phép các tổ chức vượt qua ranh giới hệ thống để tìm kiếm câu trả lời cho các câu hỏi cấp bách nhất của họ, phá vỡ các silo.
“Các hệ thống trước đây được giữ riêng biệt, mỗi hệ thống đều nắm giữ một phần của câu trả lời cho các câu hỏi bao quát toàn bộ doanh nghiệp,” Giardina nói với Unite AI.
Nếu một nhà cung cấp chính bị ảnh hưởng bởi chậm trễ giao hàng, ví dụ, chỉ bằng cách kết nối nhà cung cấp với đơn đặt hàng và lịch sử khách hàng, một công ty mới có thể xác định được khách hàng hàng đầu nào nên được thông báo đầu tiên về việc chậm trễ.
“Mục tiêu cuối cùng của chúng tôi là mở rộng cách suy nghĩ liên kết này để thống nhất mọi mảnh dữ liệu trong doanh nghiệp, vì vậy chúng tôi có thể làm cho mọi câu hỏi trở nên dễ dàng và ngay lập tức có thể trả lời,” Giardina nói.
Loại suy nghĩ liên kết này đại diện cho sự thay đổi trong tư duy đang diễn ra trong các công ty ngày nay, khi họ chuyển từ việc làm sạch dữ liệu ad hoc sang quản lý dữ liệu có hệ thống. Thay vì coi chất lượng dữ liệu là một giải pháp một lần, các tổ chức đang phát triển các quy trình có cấu trúc để đảm bảo tính nhất quán và độ tin cậy trên tất cả các hệ thống của họ.
Quản lý dữ liệu hiện được coi là một quy trình kinh doanh có giá trị, không chỉ là một nhiệm vụ của bộ phận CNTT. Bằng cách tích hợp quản lý dữ liệu vào các chiến lược tổng thể của họ, các công ty có thể đưa ra quyết định tốt hơn và thu được những thông tin sâu sắc hơn từ dữ liệu của họ.
Làm thế nào trí tuệ nhân tạo làm sạch dữ liệu và thách thức nó phải đối mặt
Phụ thuộc quá nhiều vào trí tuệ nhân tạo có thể nguy hiểm. Đối với Giardina, “các chuyển đổi dữ liệu tự động đáng lo ngại là những chuyển đổi vượt ra ngoài tiêu chuẩn hóa vào việc đoán mò.”
Ví dụ, một số từ viết tắt có thể dễ dàng bị hiểu lầm. “International Business Machines, Inc.” hoặc “I.B.M.” thường được chuyển đổi thành “IBM”, nhưng nếu việc chuyển đổi được tự động hóa và “I.B.” bị chuyển đổi thành “IBM” một cách không chính xác, nó có thể gây ra vấn đề lớn cho cả hai công ty.
Dữ liệu thiếu và không chính xác là hai vấn đề phổ biến nhất, và việc chỉ dựa vào trí tuệ nhân tạo để lấp đầy khoảng trống theo ngữ cảnh có thể dễ dàng phản tác dụng. Như Giardina chỉ ra, “khi tác động là đáng kể, chúng tôi cần một người để phê duyệt mỗi lần đoán.”
Cân bằng tự động hóa với sự hiểu biết của con người
Dữ liệu rối ràng làm nổi bật những khiếm khuyết sâu sắc trong cách các tổ chức xử lý thông tin. Để tiến về phía trước và cải thiện việc ra quyết định, các doanh nghiệp phải ngừng xem dữ liệu như một vấn đề thuần túy kỹ thuật và chuyển sang các mô hình quản lý kết hợp chuyên môn của con người, nhận thức về đạo đức và tầm nhìn chiến lược dài hạn.
Dữ liệu sạch hơn tạo ra trí tuệ nhân tạo hiệu quả hơn, điều này反过来 giúp cải thiện chất lượng dữ liệu; chu kỳ tương hỗ này rất hứa hẹn, nhưng cũng là một lời nhắc nhở rằng tự động hóa đơn thuần sẽ không giải quyết được vấn đề dữ liệu rối ràng của chúng ta. Tiềm năng này chỉ có thể được hiện thực hóa bằng cách kết hợp độ chính xác của thuật toán với sự phán đoán của con người và nhận thức về các偏见 mà nó có thể giới thiệu, đảm bảo tính minh bạch và niềm tin hơn vào các hệ thống chúng ta xây dựng.
Alex Sandoval, CEO của công ty trí tuệ nhân tạo thông minh sản xuất Allie AI, cũng nhấn mạnh rằng các đồng pilot trí tuệ nhân tạo tạo ra không chạy trên thuật toán đơn thuần, mà phụ thuộc vào sự thông thạo của con người trong logic của nhà máy.
“Ngày nay, các triển khai thành công nhất không chỉ là về việc cho ăn các mô hình với dữ liệu của các bộ điều khiển logic lập trình (PLC) khổng lồ, ghi chú của người vận hành và giao thức tuân thủ. Chúng phụ thuộc vào một loại công nhân tuyến đầu mới: những người có thể dịch giữa hành vi của máy và trực giác kỹ thuật số,” ông kết luận.












