AI 基础
结构化数据 vs 非结构化数据
结构化数据遵循预定义的模式,而非结构化数据则不适合整齐地放入固定的字段表中。介于两者之间的是半结构化数据,它包含标签、键或其他组织方式,但不要求每条记录共享相同的严格列。
这一区分描述了信息的表示和管理方式——而非其价值、数值、定性或可理解性。文档在存储层面可能是非结构化的,但仍可能包含姓名、日期、表格和关系,AI 系统可以提取这些信息。
关键要点
- 关系表中的行是结构化的;JSON 事件和许多日志是半结构化的;散文、图像、音频和视频通常被视为非结构化。
- NoSQL 数据库可以存储结构化或半结构化记录;它们并不等同于非结构化数据。
- 数据湖、数据仓库、湖仓和向量数据库解决存储和分析问题的不同方面。
- 元数据、血缘、访问控制和质量检查在所有三类数据中都至关重要。

结构化数据是什么?
结构化数据使用预先定义的模型,为每个字段分配类型和含义。在关系数据库中,行代表记录,列代表属性。约束可以要求唯一标识符、有效日期或与其他表的关系。
示例包括交易记录、库存计数、传感器测量、账户余额以及标记好的训练表。CSV 和电子表格文件也可以包含结构化数据,尽管它们通常比数据库施加的约束更少。
结构化数据便于过滤、聚合、连接以及传统的机器学习流水线。但它并非自动干净或可信:重复实体、定义变化、缺失值以及数据泄漏仍可能使分析失效。
半结构化数据是什么?
半结构化格式带有组织标记,但允许记录之间存在差异。JSON、XML、电子邮件头、应用事件以及众多网络或网络日志都是常见例子。JSON 记录可以在不需要重写所有历史记录的情况下添加字段。
这种灵活性支持不断演进的应用,但会把工作转移到解析、校验、版本管理和模式发现上。生产系统通常会在底层格式灵活的情况下仍然强制执行合约。
非结构化数据是什么?
非结构化数据缺少针对其主要内容的预定义表格模型。示例包括报告、支持对话、源代码文件、照片、医学影像、录音和视频。“非结构化”并不意味着随机:照片有空间结构,语言有语法,音频有时间模式。
非结构化数据通常以文件或对象形式存储,而所有者、时间戳、权限和内容类型等元数据则存放在结构化目录中。系统随后可以使用搜索、文本分类、计算机视觉、转录或信息抽取等技术使内容可用。
Schema-on-write 与 schema-on-read
Schema-on-write 在数据存储用于分析之前进行验证和转换。它支持一致的报告,但需要更多的前期建模。Schema-on-read 则存储原始或轻度处理的数据,并在工作负载读取时应用结构。这提供了灵活性,但除非治理力度足够,否则可能产生竞争性定义。
现代系统常常两者结合。原始事件可能落入对象存储,验证后的表格支持分析,特定任务的特征或嵌入则供机器学习应用使用。
数据仓库、数据湖、湖仓和向量数据库
- 数据仓库组织经过策划的表格,用于分析、报告以及受治理的 SQL 访问。参见 Unite.AI 的数据仓库指南。
- 数据湖存放大量原始和处理后的文件,通常位于对象存储中。湖仍然需要目录、访问控制、生命周期策略和质量管理。
- 湖仓在数据湖存储上添加表管理和治理能力,使分析和机器学习共享架构。
- 向量数据库和索引存储用于向量相似性搜索的嵌入。嵌入是一种派生的数值表示,而不是将原始内容转换为真实的结构化事实。
将内容转化为可用数据
文档流水线可能运行 OCR、检测布局、抽取实体、划分段落、创建嵌入并附加源元数据。图像流水线可能添加标签、边界框或学习特征。这些过程在保留原始资产及其来源的同时,生成结构化的派生数据。
自编码器可以学习压缩表示,但它并不会自动将非结构化内容转换为验证过的行或标签。仍可能需要人工审查、领域规则以及质量测量。
治理与安全
每种格式都可能包含个人、机密、受版权保护或受监管的信息。治理应涵盖分类、血缘、保留、同意、访问控制、删除以及追溯模型输出至其来源的能力。非结构化仓库尤其容易被忽视,因为敏感信息可能隐藏在看似普通的文件内部。
存储模型、模式与分析后果
结构化数据遵循显式模式:行、列、类型、键以及约束使验证和连接可预测。非结构化数据如散文、图像、音频和视频缺乏单一表格模型,但仍拥有格式、元数据、内部结构和血缘。半结构化的 JSON、日志、文档和事件则在暴露字段的同时允许变化。因而区别在于结构的强度与位置,而非信息是否存在。Schema-on-write 在存储前进行验证;schema-on-read 在使用时进行解释。
关系数据库适合事务和受治理的关系;列式仓库适合分析性扫描;对象存储保存大文件和开放表格格式;搜索索引支持词汇检索;向量索引支持相似度检索;图数据库表示关系。单一数据集可能在多个系统中出现,以满足不同访问模式。请定义权威来源和血缘,以防副本悄然分歧。元数据应包括所有者、分类、时间戳、单位、模式版本、权利、保留以及派生表示与原始内容之间的关联。
为 AI 系统准备混合数据
结构化特征需要类型检查、缺失值策略、类别处理以及防泄漏措施。文本需要解析、语言检测、分段和编码;图像需要解码验证、颜色和方向处理;音频需要采样率和通道控制。提取的文本、嵌入、标签、字幕和模型输出都是具有自身版本和质量的派生数据。保持转换可复现,并单独评估抽取错误,因为下游模型无法恢复早期解析器丢失或破坏的信息。
安全与隐私控制必须覆盖原始和派生形式。非结构化文件可能隐藏个人数据、恶意宏、嵌入指令或受版权保护的内容;结构化表格则可能通过连接实现再识别。请扫描上传、隔离解析器、最小化收集、实施基于目的的访问并传播删除。使用适合各模态的检查手段衡量完整性、有效性、重复、时效和语义一致性。统一的数据湖并不自动产生统一意义——受治理的标识符、合约和所有权才是使异构数据共同可用的关键。
实例演示:合并支持工单与通话音频
服务团队将结构化工单字段与通话转录及经批准的音频特征关联。稳定的交互 ID 和时间戳连接记录,而原始音频保存在保留期更短的受限系统中。解析器、转录和语言检测均有版本管理并单独评估。仓库存储受治理的工单事实,对象存储保留获准的媒体,搜索索引支持文本检索;每份副本都有所有者和删除路径。
质量测试覆盖缺失通话、重复工单、语言转录错误、时区对齐以及 CRM 迁移后意义变化的字段。派生嵌入的访问遵循原始敏感度,而非视作匿名。分析师可以将仪表盘结果追溯到源交互和模型版本。当用户请求删除时,原始音频、转录、索引和下游训练资格均通过一套记录的工作流处理。
实施证据与运营准备度
生产决策需要的不仅是成功演示。请定义预期用户、运行环境、输入、输出、依赖、所有者以及每项重要故障的后果。在调优前建立可复现的基线和有版本的评估集。测试常规情况、边界条件、异常或缺失输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。衡量任务质量、校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全。记录每一次转换和阈值,以便独立审查者复现结果并区分证据与诱人原型。
上线前,分配发布、例外、变更、回滚和退役的权限。采用分阶段发布,保留安全回退,并通过人为注入的故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康、人为覆盖以及已确认的结果,而不收集不必要的敏感数据。设定警报阈值并指派响应负责人,然后在部署后审查真实世界证据,而不是假设离线表现会持续。每当数据源、用户、模型、供应商、政策、硬件或目标变化时重新评估。维护中的系统同样需要有文档化的恢复、事故学习、删除与保留流程,以及明确的停用或替换时点。
主要参考文献
- RFC 8259: The JavaScript Object Notation Data Interchange Format
- NIST Big Data Interoperability Framework: Definitions
- Armbrust et al.: Lakehouse—A New Generation of Open Platforms
ipt Object Notation Data Interchange Format NIST Big Data Interoperability Framework: Definitions Armbrust et al.: Lakehouse—A New Generation of Open Platforms












