Nền tảng AI
Data Fabric là gì?
Data fabric là một mẫu kiến trúc để khám phá, kết nối, quản trị và cung cấp dữ liệu trên các hệ thống phân tán. Nó cung cấp một lớp siêu dữ liệu và điều khiển chung để con người và ứng dụng có thể tìm dữ liệu đáng tin cậy mà không buộc mọi bộ dữ liệu phải nằm trong một kho lưu trữ vật lý duy nhất.
Data fabric không phải là một sản phẩm duy nhất và nó không xóa bỏ sự khác biệt của các hệ thống nguồn. Giá trị của nó phụ thuộc vào siêu dữ liệu chính xác, quyền sở hữu rõ ràng, chính sách có thể thực thi, tích hợp đáng tin cậy và bằng chứng rằng người tiêu dùng nhận được dữ liệu phù hợp với mục đích của họ.
Những điểm chính
- Mặt phẳng điều khiển giàu siêu dữ liệu kết nối các danh mục, dòng dữ liệu, chất lượng, chính sách và quyền truy cập.
- Dữ liệu có thể vẫn được phân tán và được sao chép, truyền luồng, chuyển đổi hoặc ảo hóa tùy theo khối lượng công việc.
- Data fabric tập trung vào công nghệ; data mesh nhấn mạnh quyền sở hữu miền và dữ liệu như một sản phẩm.
- Tự động hoá giúp mở rộng quản trị, nhưng các chủ sở hữu chịu trách nhiệm vẫn xác định ý nghĩa, chất lượng và cách sử dụng cho phép.

Mặt phẳng điều khiển và mặt phẳng dữ liệu
Mặt phẳng dữ liệu chứa các cơ sở dữ liệu, tệp, luồng, API và các pipeline di chuyển hoặc truy vấn chúng. Mặt phẳng điều khiển ghi lại siêu dữ liệu kỹ thuật và kinh doanh: lược đồ, chủ sở hữu, phân loại, chỉ số chất lượng, dòng dữ liệu, chính sách và cách sử dụng.
Một danh mục hoặc đồ thị tri thức có thể kết nối các thông tin này để người tiêu dùng có thể khám phá một bộ dữ liệu và hiểu ngữ cảnh của nó. Data fabric sau đó sử dụng siêu dữ liệu để hướng dẫn quyền truy cập, chuyển đổi, quan sát và thực thi chính sách trên các nền tảng đa dạng.
Tích hợp mà không cần một kho lưu trữ bắt buộc
Một số khối lượng công việc sao chép dữ liệu qua ETL; những công việc khác sử dụng bắt dữ liệu thay đổi, luồng sự kiện, API hoặc ảo hoá truy vấn. Mẫu phù hợp phụ thuộc vào độ tươi mới, hiệu năng, tính nhất quán, chủ quyền, chi phí và giới hạn của hệ thống nguồn.
Truy cập ảo có thể giảm sự trùng lặp nhưng có thể khiến người tiêu dùng gặp độ trễ và tính sẵn sàng của nguồn. Vật lý hoá thực tế cải thiện hiệu năng và khả năng tái tạo nhưng tạo ra trách nhiệm đồng bộ và vòng đời.
Quản trị, ngữ nghĩa và chất lượng
Bảng thuật ngữ doanh nghiệp cung cấp ý nghĩa chung cho các thuật ngữ như khách hàng, đơn hàng hoặc tài khoản hoạt động. Dòng dữ liệu cho thấy trường dữ liệu xuất phát từ đâu và đã thay đổi như thế nào. Phân loại và chính sách quyết định ai có thể truy cập các bản ghi nhạy cảm và với mục đích gì.
Các quy tắc chất lượng nên được gắn vào các trường hợp sử dụng cụ thể. Độ đầy đủ đủ cho một bảng điều khiển có thể không an toàn cho các quyết định tự động. Data fabric nên hiển thị độ tươi mới, lịch sử xác thực và các hạn chế đã biết thay vì chỉ gắn nhãn tài sản là đã được chứng nhận.
Data fabric, mesh và lakehouse
Data mesh là một phương pháp xã hội‑kỹ thuật gán trách nhiệm cho các đội miền về các sản phẩm dữ liệu có thể tương tác. Data fabric nhấn mạnh các dịch vụ kỹ thuật chung và tự động hoá siêu dữ liệu. Các tổ chức có thể kết hợp chúng: quyền sở hữu miền có thể hoạt động thông qua một data fabric chung.
Lakehouse kết hợp tính linh hoạt của data lake với quản lý kiểu kho và các tính năng truy vấn. Nó có thể là một nền tảng tham gia, nhưng không phải toàn bộ data fabric xuyên hệ thống. Tương tự, một kho dữ liệu hoặc danh mục riêng lẻ không cung cấp đầy đủ các chức năng tích hợp và chính sách.
Triển khai và đánh giá
Bắt đầu với một trường hợp sử dụng xuyên hệ thống có giá trị và lập danh sách các nguồn, chủ sở hữu, chính sách và mong đợi mức dịch vụ tối thiểu. Thiết lập danh tính, tiêu chuẩn siêu dữ liệu, hợp đồng, kiểm thử và khả năng quan sát trước khi thêm các đề xuất tự động.
Đo lường thời gian khám phá, thời gian phê duyệt truy cập, tỷ lệ sự cố, độ tươi mới của dữ liệu, khả năng tái sử dụng và mức độ tin cậy của người tiêu dùng. Liên kết data fabric với quản trị dữ liệu có cấu trúc và phi cấu trúc cũng như an ninh mạng; kết nối mà không có kiểm soát có thể tăng nguy cơ phơi bày.
Kiến trúc data-fabric và mặt phẳng siêu dữ liệu
Data fabric là một cách tiếp cận kiến trúc để kết nối dữ liệu phân tán thông qua siêu dữ liệu chung, quản trị, tích hợp và dịch vụ truy cập. Nó không phải là một cơ sở dữ liệu hay sản phẩm duy nhất. Các nguồn có thể vẫn nằm trong kho dữ liệu, hồ, hệ thống vận hành, luồng và nền tảng SaaS trong khi các danh mục mô tả các bộ dữ liệu, dòng dữ liệu theo dõi các chuyển đổi, chính sách kiểm soát truy cập và định nghĩa ngữ nghĩa làm cho các khái niệm có thể tái sử dụng. Ảo hoá, sao chép, API và pipeline là các phương pháp cung cấp bổ trợ được lựa chọn dựa trên độ trễ, quy mô, khả năng của nguồn và nhu cầu nhất quán.
Siêu dữ liệu hoạt động ghi lại lược đồ, quyền sở hữu, cách sử dụng, chất lượng, phân loại, dòng dữ liệu, mẫu truy vấn và các sự kiện vận hành và có thể thúc đẩy tự động hoá. Đồ thị tri thức có thể kết nối các khái niệm kinh doanh với các trường vật lý và chính sách. Tự động hoá có thể đề xuất các phép nối, phát hiện sự lệch, truyền bá phân loại hoặc định tuyến sự cố, nhưng siêu dữ liệu suy luận cần có độ tin cậy và quản lý. Một danh mục không được kết nối với việc cung cấp và kiểm soát sẽ trở thành nợ tài liệu; tích hợp tự động mà không có quyền sở hữu ngữ nghĩa tạo ra sự không nhất quán nhanh hơn.
Tích hợp, quản trị và sản phẩm dữ liệu
ETL theo lô, bắt dữ liệu thay đổi, luồng, liên hợp và reverse ETL có các ngữ nghĩa về độ tươi mới và lỗi khác nhau. Xác định các nguồn có thẩm quyền, định danh, hợp đồng, thời gian sự kiện, dữ liệu trễ, xóa bỏ và đối chiếu. Truy vấn ảo tránh sao chép nhưng phụ thuộc vào hiệu năng và tính sẵn sàng của nguồn; vật lý hoá cải thiện tốc độ nhưng tạo ra nghĩa vụ về độ tươi mới và lưu trữ. Chính sách nhạy cảm phải được áp dụng hoặc đánh giá lại cho dữ liệu suy ra, bộ nhớ đệm, embedding và xuất khẩu.
Xem các bộ dữ liệu có giá trị cao như các sản phẩm với chủ sở hữu, người dùng, tài liệu, mong đợi dịch vụ, kiểm thử và hỗ trợ. Quyền sở hữu liên hợp cho phép các miền quản lý ý nghĩa trong khi các tiêu chuẩn chung bảo tồn khả năng tương tác. Các đội trung tâm cung cấp khả năng nền tảng và quản trị, không phải sở hữu mọi trường dữ liệu. Đo lường thời gian khám phá, tái sử dụng, chất lượng dữ liệu, thời gian chờ truy cập, giải quyết sự cố, việc áp dụng các chỉ số tin cậy và chi phí. Số lượng mục trong danh mục hoặc kết nối không phải là bằng chứng rằng người dùng có thể tìm và sử dụng dữ liệu đáng tin cậy.
Chiến lược triển khai
Bắt đầu với một hành trình xuyên miền mà các độ trễ và rủi ro đã được biết. Lập danh sách các nguồn và hợp đồng, thiết lập danh tính và phân loại, kết nối dòng dữ liệu và chất lượng, sau đó tự động hoá các kiểm soát lặp lại. Tránh nỗ lực nhiều năm để mô hình hoá toàn bộ doanh nghiệp trước khi mang lại giá trị. Kiểm tra mất nguồn, thay đổi lược đồ, thu hồi quyền truy cập, sự kiện trễ và khôi phục sau thảm họa. Data fabric thành công khi dữ liệu phân tán trở nên dễ quản trị và sử dụng hơn mà không xóa bỏ thực tế vận hành và trách nhiệm của các hệ thống nguồn.
Ví dụ thực tế: a customer-data fabric
Một công ty kết nối dữ liệu thương mại, hỗ trợ, tiếp thị và sản phẩm trong khi để các hệ thống vận hành giữ vai trò thẩm quyền. Một danh mục chung liên kết các định nghĩa về khách hàng, tài khoản, đơn hàng, đồng ý và tương tác với các trường vật lý. Bắt dữ liệu thay đổi cung cấp các sản phẩm được quản trị, trong khi ảo hoá phục vụ các truy vấn hiện tại có khối lượng thấp và các bảng vật lý hoá hỗ trợ phân tích. Danh tính, dòng dữ liệu, chất lượng và chính sách được triển khai trước khi lớp cá nhân hoá AI được phép sử dụng dữ liệu.
Việc rút lại đồng ý được lan truyền qua các bảng kho, chỉ mục tìm kiếm, embedding và hệ thống kích hoạt, kèm bằng chứng hoàn thành. Các hợp đồng lược đồ và kiểm tra đối chiếu phát hiện thay đổi nguồn. Các chủ sở hữu công bố kỳ vọng về độ tươi mới và chất lượng, và siêu dữ liệu sử dụng giúp loại bỏ các bản sao không dùng. Dự án thí điểm đo lường thời gian chờ truy cập, việc tái sử dụng các chỉ số tin cậy, giải quyết sự cố và tuân thủ quyền riêng tư. Data fabric được coi là thành công vì một hành trình xuyên miền trở nên đáng tin cậy và có thể quản trị — không phải vì một nhà cung cấp kết nối số lượng nguồn lớn nhất.
Bằng chứng triển khai và sẵn sàng vận hành
Một quyết định sản xuất cần nhiều hơn một buổi trình diễn thành công. Xác định người dùng dự kiến, môi trường vận hành, đầu vào, đầu ra, phụ thuộc, chủ sở hữu và hậu quả của mỗi lỗi quan trọng. Thiết lập một nền tảng có thể tái tạo và một bộ đánh giá có phiên bản trước khi tinh chỉnh. Kiểm tra các trường hợp thông thường, điều kiện biên, đầu vào sai dạng hoặc thiếu, sự dịch chuyển phân phối, mất phụ thuộc, lạm dụng và các nhóm hoặc môi trường có khả năng bị thiếu hỗ trợ. Đo lường chất lượng nhiệm vụ cùng với hiệu chuẩn hoặc độ không chắc, độ trễ, thông lượng, chi phí tài nguyên, khả năng tiếp cận, quyền riêng tư và bảo mật. Ghi lại mọi chuyển đổi và ngưỡng để một người đánh giá độc lập có thể tái tạo kết quả và phân biệt bằng chứng với một nguyên mẫu hấp dẫn.
Trước khi ra mắt, chỉ định quyền trách nhiệm cho việc phát hành, ngoại lệ, thay đổi, quay lại và ngừng hoạt động. Sử dụng triển khai theo giai đoạn, duy trì một dự phòng an toàn và xác minh giám sát bằng các lỗi được chèn cố ý. Dữ liệu đo lường hoạt động nên tiết lộ chất lượng đầu vào, hành vi đầu ra, phiên bản mô hình hoặc quy tắc, tình trạng phụ thuộc, can thiệp của con người và kết quả đã xác nhận mà không thu thập dữ liệu nhạy cảm không cần thiết. Xác định ngưỡng cảnh báo và người chịu trách nhiệm phản hồi, sau đó xem xét bằng chứng thực tế sau khi triển khai thay vì giả định hiệu năng ngoại tuyến sẽ tiếp tục. Đánh giá lại mỗi khi nguồn dữ liệu, người dùng, mô hình, nhà cung cấp, chính sách, phần cứng hoặc mục tiêu thay đổi. Một hệ thống được duy trì cũng cần có quy trình khôi phục được ghi chép, học hỏi từ sự cố, xóa và lưu trữ, và một điểm rõ ràng khi nó nên bị vô hiệu hoá hoặc thay thế.
Câu hỏi thường gặp
Data fabric có di chuyển toàn bộ dữ liệu vào một nơi duy nhất không?
Không. Nó có thể điều phối dữ liệu vẫn phân tán và chọn việc di chuyển vật lý hoặc ảo hoá tùy theo khối lượng công việc.
Data fabric có giống với data mesh không?
Không. Data fabric chủ yếu mô tả kiến trúc hỗ trợ và tự động hoá; data mesh chủ yếu mô tả quyền sở hữu miền phi tập trung và trách nhiệm của sản phẩm dữ liệu. Hai khái niệm có thể cùng tồn tại.












