AI 基础
结构化数据与非结构化数据
非结构化数据 是一种不按照预定义方式组织的数据,或者缺乏特定的数据模型。相比之下,结构化数据 是具有明确、可定义的数据点之间关系的数据,具有包含它的预定义模型。这种区别的简要答案是结构化数据和非结构化数据之间的区别,但让我们更深入地了解这两种数据类型之间的区别。
什么是结构化数据?
在计算机科学中,数据结构指的是存储和组织数据的特定方式。不同的数据结构具有不同的数据点之间的关系,但数据也可以是非结构化的。什么意思是说数据是结构化的?为了使这个定义更加清晰,让我们看一下结构化数据的各种方式。
结构化数据通常存储在表格中,例如 Excel 文件或 SQL 数据库。在这些情况下,数据的行和列持有不同的变量或特征,通常可以通过检查数据行和列的交点来确定数据点之间的关系。结构化数据可以轻松地适应关系数据库,结构化数据集中的不同特征示例可以包括项目,如名称、地址、日期、天气统计、信用卡号等。虽然结构化数据通常是文本数据,但也可以将图像和音频存储为结构化数据。
结构化数据的常见来源包括传感器收集的数据、网络日志、网络数据和零售或电子商务数据。结构化数据也可以由人们填写电子表格或数据库生成,数据来自计算机和其他设备。例如,通过在线表格收集的数据通常会立即输入数据结构中。
结构化数据有着长期存储在关系数据库和 SQL 中的历史。这些存储方法之所以流行,是因为读写这些格式的便捷性,大多数平台和语言都可以解释这些数据格式。
在机器学习的背景下,结构化数据更容易训练机器学习系统,因为数据中的模式更加明显。可以将某些特征输入机器学习分类器,并使用这些选定的特征对其他数据实例进行标记。相比之下,训练机器学习系统处理非结构化数据往往更加困难,原因将变得明显。
什么是非结构化数据?
非结构化数据是指不按照预定义的数据模型或结构组织的数据。非结构化数据通常被称为定性数据,因为它不能使用传统的方法进行分析或处理,正如对结构化数据所做的那样。
由于非结构化数据没有定义的数据点之间的关系,因此无法将其组织到关系数据库中。相比之下,非结构化数据通常存储在 NoSQL 数据库 或非关系数据库中。如果数据库的结构不是主要关注点,可以使用数据湖,即一个大型的非结构化数据池,来代替 NoSQL 数据库存储数据。
非结构化数据很难分析,要理解非结构化数据通常需要检查个别数据以确定潜在的特征,然后查看这些特征是否出现在数据池中的其他数据中。
绝大多数数据都是非结构化格式,据估计,非结构化数据占所有数据的约 80%。可以使用数据挖掘技术来帮助结构化数据。
在机器学习方面,某些技术可以帮助组织非结构化数据并将其转换为结构化数据。将非结构化数据转换为结构化数据的热门工具是称为自动编码器的系统。












