Nền tảng AI

Dữ liệu có cấu trúc vs Dữ liệu không có cấu trúc

mm
Thêm Unite.AI vào các nguồn ưu tiên của bạn trên Google

Dữ liệu có cấu trúc tuân theo một lược đồ đã định nghĩa, trong khi dữ liệu không có cấu trúc không khớp gọn vào một bảng trường cố định. Giữa chúng là dữ liệu bán cấu trúc, chứa các thẻ, khóa hoặc các tổ chức khác mà không yêu cầu mỗi bản ghi phải chia sẻ cùng các cột cứng nhắc.

Sự khác biệt mô tả cách thông tin được biểu diễn và quản lý — không phải liệu nó có giá trị, là số, định tính, hay dễ hiểu. Một tài liệu có thể không có cấu trúc ở lớp lưu trữ nhưng vẫn chứa tên, ngày tháng, bảng và các mối quan hệ mà hệ thống AI có thể trích xuất.

Những điểm chính

  • Các hàng trong bảng quan hệ là có cấu trúc; các sự kiện JSON và nhiều bản ghi nhật ký là bán cấu trúc; văn bản, hình ảnh, âm thanh và video thường được coi là không có cấu trúc.
  • Cơ sở dữ liệu NoSQL có thể lưu trữ các bản ghi có cấu trúc hoặc bán cấu trúc; chúng không đồng nghĩa với dữ liệu không có cấu trúc.
  • Các hồ dữ liệu, kho dữ liệu, lakehouse và cơ sở dữ liệu vector giải quyết các phần khác nhau của vấn đề lưu trữ và phân tích.
  • Siêu dữ liệu, nguồn gốc, kiểm soát truy cập và kiểm tra chất lượng đều quan trọng trong cả ba loại.
Three-column comparison of structured tables, semi-structured JSON records, and unstructured documents and media, with typical storage and AI processing methods
Dữ liệu có cấu trúc, bán cấu trúc và không có cấu trúc khác nhau chủ yếu ở mức độ biểu thị lược đồ một cách rõ ràng.

Dữ liệu có cấu trúc là gì?

Dữ liệu có cấu trúc sử dụng một mô hình đã định nghĩa trước, gán kiểu và ý nghĩa cho mỗi trường. Trong cơ sở dữ liệu quan hệ, các hàng đại diện cho bản ghi và các cột đại diện cho thuộc tính. Các ràng buộc có thể yêu cầu một định danh duy nhất, ngày hợp lệ, hoặc mối quan hệ với một bảng khác.

Các ví dụ bao gồm bản ghi giao dịch, số lượng tồn kho, đo lường cảm biến, số dư tài khoản và các bảng huấn luyện có nhãn. Các tệp CSV và bảng tính có thể chứa dữ liệu có cấu trúc, mặc dù chúng thường áp đặt ít ràng buộc hơn so với cơ sở dữ liệu.

Dữ liệu có cấu trúc thuận tiện cho việc lọc, tổng hợp, nối và các pipeline machine-learning truyền thống. Tuy nhiên, nó không tự động sạch sẽ hoặc đáng tin cậy: các thực thể trùng lặp, định nghĩa thay đổi, giá trị thiếu và rò rỉ vẫn có thể làm mất tính hợp lệ của phân tích.

Dữ liệu bán cấu trúc là gì?

Các định dạng bán cấu trúc mang các dấu hiệu tổ chức nhưng cho phép các bản ghi khác nhau. JSON, XML, tiêu đề email, sự kiện ứng dụng và nhiều nhật ký web hoặc mạng là các ví dụ phổ biến. Một bản ghi JSON có thể thêm một trường mà không cần viết lại mọi bản ghi lịch sử.

Tính linh hoạt này hỗ trợ các ứng dụng đang phát triển, nhưng nó chuyển công việc sang việc phân tích, xác thực, phiên bản và khám phá lược đồ. Các hệ thống sản xuất thường áp đặt một hợp đồng ngay cả khi định dạng nền tảng linh hoạt.

Dữ liệu không có cấu trúc là gì?

Dữ liệu không có cấu trúc thiếu một mô hình bảng đã định nghĩa trước cho nội dung chính của nó. Các ví dụ bao gồm báo cáo, cuộc trò chuyện hỗ trợ, tệp mã nguồn, ảnh chụp, hình ảnh y tế, bản ghi và video. “Không có cấu trúc” không có nghĩa là ngẫu nhiên: một bức ảnh có cấu trúc không gian, ngôn ngữ có ngữ pháp và âm thanh có các mẫu thời gian.

Dữ liệu không có cấu trúc thường được lưu trữ dưới dạng tệp hoặc đối tượng, trong khi siêu dữ liệu như chủ sở hữu, dấu thời gian, quyền truy cập và loại nội dung được lưu trong một danh mục có cấu trúc. Các hệ thống sau đó có thể sử dụng tìm kiếm, text classification, computer vision, chuyển đổi giọng nói thành văn bản, hoặc trích xuất thông tin để làm cho nội dung có thể sử dụng được.

Schema-on-write và schema-on-read

Schema-on-write xác thực và chuyển đổi dữ liệu trước khi lưu trữ để phân tích. Nó hỗ trợ báo cáo nhất quán nhưng đòi hỏi mô hình hoá trước nhiều hơn. Schema-on-read lưu dữ liệu thô hoặc đã qua xử lý nhẹ và áp dụng cấu trúc khi một khối tải đọc dữ liệu. Điều này mang lại tính linh hoạt nhưng có thể tạo ra các định nghĩa cạnh tranh nếu không có quản trị mạnh.

Các hệ thống hiện đại thường kết hợp cả hai. Các sự kiện thô có thể được lưu vào lưu trữ đối tượng, các bảng đã xác thực có thể hỗ trợ phân tích, và các đặc trưng hoặc embedding riêng cho nhiệm vụ có thể cung cấp cho các ứng dụng ML.

Kho dữ liệu, hồ dữ liệu, lakehouse và cơ sở dữ liệu vector

  • Kho dữ liệu tổ chức các bảng đã được biên tập cho phân tích, báo cáo và truy cập SQL có quản trị. Xem hướng dẫn về kho dữ liệu của Unite.AI.
  • Hồ dữ liệu lưu trữ khối lượng lớn các tệp thô và đã xử lý, thường trong lưu trữ đối tượng. Một hồ dữ liệu vẫn cần danh mục, kiểm soát truy cập, chính sách vòng đời và quản lý chất lượng.
  • Lakehouse bổ sung khả năng quản lý bảng và quản trị vào lưu trữ hồ dữ liệu để phân tích và ML có thể chia sẻ kiến trúc.
  • Cơ sở dữ liệu và chỉ mục vector lưu trữ các embedding được dùng cho tìm kiếm tương đồng vector. Embedding là một biểu diễn số học được suy ra, không phải là việc chuyển đổi nội dung gốc thành các thực tế có cấu trúc.

Biến nội dung thành dữ liệu có thể sử dụng

Một pipeline tài liệu có thể chạy OCR, phát hiện bố cục, trích xuất thực thể, chia đoạn, tạo embedding và đính kèm siêu dữ liệu nguồn. Một pipeline hình ảnh có thể thêm nhãn, hộp bao quanh hoặc các đặc trưng đã học. Những quy trình này tạo ra các dẫn xuất có cấu trúc trong khi vẫn bảo tồn hiện vật gốc và nguồn gốc.

Autoencoder có thể học một biểu diễn nén, nhưng nó không tự động biến nội dung không có cấu trúc thành các hàng hoặc nhãn đã được xác thực. Việc xem xét của con người, quy tắc miền và đo lường chất lượng vẫn có thể cần thiết.

Quản trị và bảo mật

Mỗi định dạng đều có thể chứa thông tin cá nhân, bí mật, có bản quyền hoặc được quy định. Quản trị nên bao phủ việc phân loại, nguồn gốc, lưu trữ, đồng ý, kiểm soát truy cập, xóa và khả năng truy vết đầu ra của mô hình trở lại nguồn gốc. Các kho không có cấu trúc đặc biệt dễ bị bỏ qua vì thông tin nhạy cảm có thể được nhúng trong các tệp thông thường.

Mô hình lưu trữ, lược đồ và hệ quả phân tích

Dữ liệu có cấu trúc tuân theo một lược đồ rõ ràng: các hàng, cột, kiểu, khóa và ràng buộc làm cho việc xác thực và nối bảng dự đoán được. Dữ liệu không có cấu trúc như văn bản, hình ảnh, âm thanh và video thiếu một mô hình bảng duy nhất, nhưng vẫn có các định dạng, siêu dữ liệu, cấu trúc nội bộ và nguồn gốc. JSON bán cấu trúc, nhật ký, tài liệu và sự kiện mở ra các trường trong khi cho phép biến đổi. Do đó, sự khác biệt liên quan đến mức độ và vị trí của cấu trúc, không phải việc thông tin có tồn tại hay không. Schema-on-write xác thực trước khi lưu trữ; schema-on-read diễn giải khi dữ liệu được sử dụng.

Cơ sở dữ liệu quan hệ phù hợp cho giao dịch và các quan hệ có quản trị; kho dữ liệu cột phù hợp cho quét phân tích; lưu trữ đối tượng giữ các tệp lớn và định dạng bảng mở; chỉ mục tìm kiếm hỗ trợ truy xuất từ vựng; chỉ mục vector hỗ trợ độ tương đồng; cơ sở dữ liệu đồ thị biểu diễn các quan hệ. Một bộ dữ liệu có thể xuất hiện trong nhiều hệ thống cho các mẫu truy cập khác nhau. Xác định các nguồn dữ liệu có thẩm quyền và nguồn gốc để các bản sao không tự động lệch nhau. Siêu dữ liệu nên bao gồm chủ sở hữu, phân loại, dấu thời gian, đơn vị, phiên bản lược đồ, quyền, lưu trữ và liên kết giữa biểu diễn suy ra và nội dung gốc.

Chuẩn bị dữ liệu hỗn hợp cho hệ thống AI

Các đặc trưng có cấu trúc yêu cầu kiểm tra kiểu, chính sách giá trị thiếu, xử lý danh mục và ngăn ngừa rò rỉ. Văn bản cần phân tích, phát hiện ngôn ngữ, phân đoạn và mã hoá; hình ảnh yêu cầu xác thực giải mã, xử lý màu sắc và hướng; âm thanh cần kiểm soát tần số mẫu và kênh. Văn bản đã trích xuất, embedding, nhãn, chú thích và đầu ra mô hình là dữ liệu suy ra với phiên bản và chất lượng riêng. Giữ các chuyển đổi có thể tái tạo và đánh giá lỗi trích xuất riêng biệt, vì mô hình hạ lưu không thể khôi phục thông tin mà bộ phân tích trước đã loại bỏ hoặc làm hỏng.

Kiểm soát bảo mật và quyền riêng tư phải bao phủ cả dạng thô và dạng suy ra. Các tệp không có cấu trúc có thể chứa dữ liệu cá nhân ẩn, macro độc hại, lệnh nhúng hoặc tài liệu có bản quyền; các bảng có cấu trúc có thể cho phép tái nhận dạng thông qua nối bảng. Quét các tệp tải lên, cô lập bộ phân tích, giảm thiểu thu thập, thực thi truy cập dựa trên mục đích và lan truyền việc xóa. Đo lường độ đầy đủ, tính hợp lệ, trùng lặp, độ tươi mới và tính nhất quán ngữ nghĩa bằng các kiểm tra phù hợp với mỗi phương thức. Một hồ dữ liệu thống nhất không tạo ra ý nghĩa thống nhất — các định danh, hợp đồng và quyền sở hữu có quản trị mới làm cho dữ liệu đa dạng có thể sử dụng chung.

Ví dụ thực tế: kết hợp hồ sơ hỗ trợ và âm thanh cuộc gọi

Một đội dịch vụ liên kết các trường vé có cấu trúc với bản ghi âm cuộc gọi và các đặc trưng được phê duyệt từ âm thanh. Các ID tương tác ổn định và dấu thời gian kết nối các bản ghi, trong khi âm thanh thô vẫn nằm trong hệ thống hạn chế với thời gian lưu trữ ngắn hơn. Các bộ phân tích, chuyển đổi thành văn bản và phát hiện ngôn ngữ được phiên bản hoá và đánh giá riêng biệt. Kho dữ liệu lưu trữ các sự kiện vé có quản trị, lưu trữ đối tượng giữ các phương tiện được phép, và một chỉ mục tìm kiếm hỗ trợ truy xuất văn bản; mỗi bản sao có chủ sở hữu và đường xóa.

Các kiểm tra chất lượng bao gồm cuộc gọi thiếu, vé trùng lặp, lỗi bản ghi theo ngôn ngữ, đồng bộ múi giờ và các trường thay đổi ý nghĩa sau khi di chuyển CRM. Truy cập vào embedding suy ra tuân theo độ nhạy ban đầu thay vì được coi là ẩn danh. Các nhà phân tích có thể truy vết kết quả bảng điều khiển tới tương tác nguồn và phiên bản mô hình. Khi người gọi yêu cầu xóa, dữ liệu thô, bản ghi, chỉ mục và khả năng đào tạo hạ lưu được xử lý qua một quy trình tài liệu duy nhất.

Bằng chứng triển khai và sẵn sàng vận hành

Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng mục tiêu, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một nền tảng có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai định dạng hoặc thiếu, sự dịch chuyển phân phối, mất kết nối phụ thuộc, lạm dụng và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.

Trước khi ra mắt, chỉ định quyền cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng sử dụng. Sử dụng triển khai theo giai đoạn, duy trì một phương án dự phòng an toàn và xác minh giám sát bằng các lỗi được chèn có chủ đích. Dữ liệu đo lường vận hành nên hiển thị chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu suất ngoại tuyến sẽ kéo dài. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình khôi phục, học từ sự cố, xóa và lưu trữ được tài liệu hoá, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.

Tài liệu tham khảo chính

Blogger và lập trình viên với chuyên môn về Machine Learning và Deep Learning topics. Daniel hy vọng giúp đỡ người khác sử dụng sức mạnh của AI cho lợi ích xã hội.