AI 基础

什么是数据织体?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

数据织体是一种用于在分布式系统中发现、连接、治理和交付数据的架构模式。它提供共享的元数据和控制层,使人员和应用程序能够在不将每个数据集强制存入单一物理存储的情况下找到可信的数据。

数据织体并非单一产品,也不会消除源系统之间的差异。其价值取决于准确的元数据、明确的所有权、可执行的策略、可靠的集成以及能够证明使用者获得符合其目的的数据的证据。

关键要点

  • 丰富元数据的控制平面将目录、血缘、质量、策略和访问连接起来。
  • 数据可以保持分布式,并根据工作负载进行复制、流式传输、转换或虚拟化。
  • 数据织体侧重技术实现;数据网格强调域所有权和数据即产品的理念。
  • 自动化有助于扩展治理,但有责任的所有者仍需定义含义、质量和可允许的使用方式。
What is a Data Fabric? diagram showing sources, metadata, govern, integrate, deliver, observe
织体通过共享元数据、策略和可衡量的服务质量将分布式数据连接起来。

控制平面与数据平面

数据平面包括数据库、文件、流、API 以及移动或查询这些数据的管道。控制平面记录技术和业务元数据:模式、所有者、分类、质量度量、血缘、策略和使用情况。

目录或知识图谱可以将这些信息关联起来,使使用者能够发现数据集并了解其上下文。随后,织体利用元数据在异构平台上引导访问、转换、可观测性和策略执行。

无需统一存储的集成

某些工作负载通过 ETL 复制数据;其他则使用变更数据捕获、事件流、API 或查询虚拟化。选择合适的模式取决于数据新鲜度、性能、一致性、主权、成本以及源系统的限制。

虚拟访问可以减少重复,但可能使使用者面临源端延迟和可用性问题。物理实体化提升性能和可复现性,却会带来同步和生命周期的责任。

治理、语义与质量

业务词汇表为诸如客户、订单或活跃账户等术语提供共享的含义。血缘显示字段的来源及其变化过程。分类和策略决定谁可以在何种目的下访问敏感记录。

质量规则应绑定到具体使用场景。对仪表盘而言足够的完整性在自动决策时可能并不安全。织体应展示数据新鲜度、验证历史和已知限制,而不仅仅给资产贴上已认证的标签。

数据织体、数据网格与湖仓

数据网格是一种社会技术方法,将可互操作的数据产品责任分配给域团队。数据织体强调共享技术服务和元数据自动化。组织可以将二者结合:域所有权可以通过统一的织体来实现。

湖仓将数据湖的灵活性与数据仓库式的管理和查询功能相结合。它可能是参与平台之一,但并非整个跨系统的织体。同样,仅有仓库或目录也无法提供全部的集成和策略功能。

实施与评估

首先选取有价值的跨系统用例,并列出最少的来源、所有者、策略和服务水平期望。在引入自动化建议之前,先建立身份、元数据标准、合同、测试和可观测性。

衡量发现时间、访问批准时间、事件率、数据新鲜度、复用率以及使用者信任度。将织体与结构化和非结构化数据治理以及网络安全关联起来;缺乏控制的连接会增加暴露风险。

数据织体架构与元数据平面

数据织体是一种通过共享元数据、治理、集成和访问服务来连接分布式数据的架构方法。它并非单一数据库或产品。数据源可以保留在仓库、湖、运营系统、流以及 SaaS 平台中,而目录描述数据集,血缘追踪转换,策略控制访问,语义定义使概念可复用。虚拟化、复制、API 和管道是根据延迟、规模、源能力和一致性需求选择的互补交付方式。

主动元数据捕获模式、所有权、使用情况、质量、分类、血缘、查询模式以及运营事件,并可驱动自动化。知识图谱能够将业务概念与物理字段和策略关联。自动化可能推荐连接、检测漂移、传播分类或路由事件,但推断的元数据需要可信度和监管。未与交付和控制相连的目录会成为文档负债;缺乏语义所有权的自动化集成会导致更快的不一致。

集成、治理与数据产品

批量 ETL、变更数据捕获、流、联邦以及逆向 ETL 在新鲜度和故障语义上各不相同。需定义权威来源、标识符、合同、事件时间、延迟数据、删除以及对账。虚拟查询避免复制,但依赖源端性能和可用性;实体化提升速度,却带来新鲜度和保留义务。敏感策略必须对派生数据、缓存、嵌入和导出进行遵循或重新评估。

将高价值数据集视为拥有所有者、使用者、文档、服务期望、测试和支持的产品。联邦所有权让各域管理语义,而共享标准保持互操作性。中心团队提供平台能力和治理,而不是拥有每个字段。衡量发现时间、复用率、数据质量、访问前置时间、事件解决、可信指标采纳以及成本。目录条目或连接器的数量并不证明人们能够找到并使用可靠的数据。

实施策略

从已知延迟和风险的跨域流程开始。列出来源和合同,建立身份和分类,关联血缘和质量,然后自动化重复的控制。避免在交付价值之前进行多年全企业建模的尝试。测试来源中断、模式变更、撤销访问、延迟事件以及灾难恢复。当分布式数据在不抹去其来源系统的运营现实和责任的前提下,更易于治理和使用时,数据织体即被视为成功。

案例示例:客户数据织体

某公司在保持运营系统为权威的前提下,连接了商务、支持、营销和产品数据。共享目录将客户、账户、订单、同意和交互的定义关联到物理字段。变更数据捕获为受治理的产品提供数据,而虚拟化用于低频实时查询,实体化表支持分析。在允许 AI 个性化层使用数据之前,已实现身份、血缘、质量和策略。

一次同意撤回会在仓库表、搜索索引、嵌入和激活系统中传播,并留下完成的证据。模式合同和对账测试能够检测源端变化。所有者公布新鲜度和质量期望,使用元数据帮助淘汰未使用的副本。试点衡量访问前置时间、可信指标复用、事件解决以及隐私合规性。该织体被认为成功是因为一个跨域流程变得可靠且可治理,而非供应商连接了最多的来源。

实施证据与运营准备

生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、所有者以及每项关键故障的后果。在调优前建立可复现的基线和版本化的评估集。测试常规案例、边界条件、畸形或缺失的输入、分布漂移、依赖中断、误用以及最可能被服务不足的群体或环境。将任务质量与校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全一起衡量。记录每一次转换和阈值,以便独立审阅者能够复现结果并将证据与吸引人的原型区分开来。

在上线前,指定发布、例外、变更、回滚和退役的授权。采用分阶段发布,保留安全回退,并通过有意注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康、人为覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而不是假设离线性能会持续。每当数据来源、用户、模型、供应商、策略、硬件或目标发生变化时都需重新评估。维护中的系统还需要有文档化的恢复、事件学习、删除和保留流程,以及明确的停用或替换时点。

常见问题

数据织体会将所有数据迁移到同一个位置吗?

不会。它可以协调仍然分布式的数据,并根据工作负载选择物理迁移或虚拟化。

数据织体与数据网格是同一概念吗?

不是。织体主要描述支撑性架构和自动化;网格主要描述去中心化的域所有权和数据产品职责。二者可以共存。

主要参考文献

Alex 负责 Unite.AI 的 AI 驱动新闻运营,结合新闻报道、研究和自动化,以支持对人工智能的及时且可扩展的报道。他的工作有助于确保新兴的 AI 发展能够高效呈现,同时保持出版物的编辑标准。