AI 基础

什么是数据科学?

mm
将 Unite.AI 添加到您在 Google 上的首选来源

数据科学是将数据转化为可靠的知识、预测或决策的实践。它融合了领域专长、统计学、计算、数据工程、可视化和沟通。模型可能是工作的一部分,但该学科在建模之前就已开始,并在部署后仍在继续。

最重要的问题不是“我们应该使用哪种算法?”而是“我们在支持什么决策,什么证据可以回答它,以及我们如何判断结果仍然有用?”

关键要点

  • 数据科学是一套端到端的证据工作流,而非机器学习的同义词。
  • 问题定义、度量和数据治理往往比模型复杂度更决定成功。
  • 预测性和因果性问题需要不同的假设和评估设计。
  • 已部署的分析需要针对用户的监控、文档和沟通。
What is Data Science? diagram showing question, collect, prepare, analyze / model, decide, monitor
治理、文档和领域审查贯穿整个工作流。

从决策和估计量开始

项目应明确用户、决策、干预措施以及错误成本。对于描述性问题,目标可能是某个比率或趋势;对于预测,可能是未来需求或风险;对于因果问题,估计量描述在给定假设下特定干预的效果。

像“寻找洞见”这样模糊的目标使评估变得不可能。可衡量的目标为数据收集设定边界,防止分析扩展到所有可用字段。

收集、治理与理解数据

团队列出数据来源、所有权、同意、保留、血缘和访问情况。他们区分结构化和非结构化数据,定义单位和时间戳,并检查记录是否代表感兴趣的人群和时间段。

清洗不仅仅是删除缺失行,还包括解决重复、异常值、标签歧义、模式漂移、审查以及改变分析单元的连接。每一次转换都应可复现并有文档记录。

建模前的探索

探索性分析研究分布、缺失情况、关系以及潜在的测量伪影。可视化能够揭示平均值隐藏的异常值和子群差异。探索应为假设提供依据,但不应被误认为是确认性证据。

特征工程、降维和表示学习可能提升建模效果,但转换必须仅在训练数据上拟合,以防信息泄漏。

为问题选择方法

统计估计用于量化感兴趣量的不确定性。当主要目标是对新数据的预测性能时,机器学习很有用。若目标是干预效果,则需要实验和因果推断方法。

基线模型应足够简单以便理解。更复杂的模型必须通过更好的留出集表现、校准的不确定性、运营价值或诸如图像或语言处理等必要能力来证明其额外成本的合理性。

评估、沟通与监控

评估应与决策相匹配。分类器可能需要精确率、召回率、校准和子群分析,而不仅仅是准确率;预测系统则需要考虑时间因素的回测。过拟合和信息泄漏是流程失误,而非仅仅模型属性。

沟通应包括假设、不确定性、局限性以及推荐的行动。一旦模型或仪表盘被使用,团队需监控输入质量、结果漂移、用户行为和下游影响。已退役的决策流程需要归档和明确的所有权,正如已部署的流程需要运营者一样。

数据科学生命周期与分析问题

数据科学融合领域知识、统计学、计算和沟通,将数据转化为决策依据。首先要区分描述、诊断、预测和因果推断。报告发生了什么的仪表盘、预测谁会流失的模型以及评估干预是否改变流失的实验,分别回答不同的问题。在提取数据之前,需定义单元、总体、时间窗口、结果、行动以及错误成本。许多失败的项目只解决了一个可衡量的代理指标,却无法支撑预期的决策。

获取数据需要考虑来源、权限、抽样设计以及数据合约。探索阶段检查分布、缺失、重复、异常值、关系、测量变化以及潜在泄漏。清洗选择本质上是分析假设: 删除缺失行、填补数值或限制异常值都可能改变总体和结论。对原始数据和转换过程进行不可变版本管理,并创建包含单位和含义的数据字典。在学习转换或反复检验假设之前,先划分评估数据集。

建模、推断与可复现性

统计推断在假设前提下量化不确定性;预测建模估计样本外表现;因果分析则需要通过实验设计或可靠假设实现识别。选择与问题和数据生成过程相匹配的方法。与简单基线进行比较,使用分组或时间感知的验证,并报告不确定性和敏感性。高相关性或特征重要性并不等同于因果关系。多重检验、研究者自由度以及选择性报告可能制造出令人信服的模式,因此预注册或明确分离的确认阶段有助于规避此类风险。

可复现性包括代码、运行环境、数据快照、随机种子、查询定义以及手动决策记录。自动化测试应覆盖模式、业务不变式、转换和指标。笔记本对探索有价值,但生产环境需要模块化、可审查的流水线。同行评审应质疑假设、信息泄漏、目标有效性以及结果的泛化能力。应传达效应大小、不确定性、局限性和反证,而不仅仅是统计显著性或模型分数。

部署与决策影响

如果分析驱动了重复性流程,需要指定负责人、监控数据新鲜度和结果质量,并定义回滚或退役机制。通过最小化、访问控制、保留策略和安全输出保护个人和机密信息。评估子群效应以及用户对模型的响应;反馈回路可能改变未来数据。衡量决策是否提升了真实目标,而不仅仅是模型是否已部署。数据科学的成功在于证据能够可靠、透明地促进行动——而非组织在没有所有权的情况下堆积仪表盘、功能或实验。

案例示例:衡量留存干预

某产品团队观察到留存率下降,并定义了活跃用户、分群、时间窗口、排除条件以及决策。分析师在建模前审计仪表、缺失事件和获取渠道。描述性分群用于定位下降位置,预测模型用于优先筛选研究参与者,随机化的入职实验评估所提变更是否提升留存。这三种分析各自拥有独立的假设和输出。

笔记本、查询、数据快照、指标定义和实验方案均进行版本管理并接受同行评审。结果报告效应大小和不确定性,并设置对支持需求和可访问性的防护。仪表盘监控实验,但不取代预先声明的分析。若干预成功,仍采用分阶段推出并检查长期行为。只有当工作支持可复现的决策时才被视为有价值,而非仅因生成了复杂模型或视觉上吸引的图表。

实施证据与运营准备度

生产决策需要的不仅是成功的演示。需明确预期用户、运行环境、输入、输出、依赖、负责人以及每类关键故障的后果。在调优前建立可复现的基线和版本化的评估集。测试常规案例、边界条件、格式错误或缺失的输入、分布漂移、依赖中断、误用以及最可能被忽视的群体或环境。同步衡量任务质量、校准或不确定性、延迟、吞吐量、资源成本、可访问性、隐私和安全性。记录每一次转换和阈值,以便独立审阅者能够复现结果并将证据与诱人的原型区分开来。

上线前,指定发布、例外、变更、回滚和退役的授权。采用分阶段推出,保留安全回退,并通过人为注入故障验证监控。运营遥测应揭示输入质量、输出行为、模型或规则版本、依赖健康状况、人为覆盖以及已确认的结果,同时避免收集不必要的敏感数据。设定警报阈值和响应负责人,然后在部署后审查真实世界的证据,而非假设离线性能会持续。每当数据源、用户、模型、供应商、政策、硬件或目标发生变化时都需重新评估。维护中的系统还需有文档化的恢复、事故学习、删除与保留流程,以及明确的停用或替换时点。

常见问题

数据科学与数据分析是否相同?

这两个术语有交叉。数据科学通常包括构建数据产品和预测系统,而数据分析可能更侧重于描述性和诊断性的决策支持。不同组织的使用方式各异。

每个数据科学项目都需要人工智能吗?

不需要。精心设计的查询、图表、实验或统计估计往往比复杂模型更有用且更可靠。

主要参考文献

博客作者和程序员,专攻 Machine Learning 和 Deep Learning 领域。Daniel 希望帮助他人利用 AI 的力量为社会做好事。