访谈

Ian Leysen,Datadobi 首席执行官兼联合创始人——访谈系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Ian Leysen,Datadobi 的首席执行官兼联合创始人,是一位拥有三十多年软件工程、质量保证和企业数据管理经验的技术高管。他在 2009 年共同创立 Datadobi,此前在 EMC 担任质量保证高级经理八年,之前曾在 Mediagenix 和 Wave Research 担任领导职务。Leysen 在整个职业生涯中始终专注于打造高质量的软件工程组织,曾从零建立了三支质量保证团队。在 Datadobi,他负责一家帮助大型企业在本地、云端和混合环境中管理、治理、迁移和保护非结构化数据的公司。公司已从最初的大规模数据迁移业务拓展,推出 StorageMAP——一个供应商中立的平台,旨在为组织提供对复杂非结构化数据资产的更高可视性和控制力,包括为 AI 项目准备企业数据。

Datadobi 帮助企业对快速增长的非结构化数据量获得更高的可视性和控制力。其软件能够扫描数十亿文件,识别陈旧数据、重复文件、所有权缺口以及潜在风险,同时应用元数据和分类标签,以支持治理以及归档、删除和保留的自动化策略。随着组织为生成式 AI 准备企业数据,这一点变得愈发重要,因为不明确或过时的信息会产生噪声、合规问题和安全风险。Datadobi 还帮助公司识别可能有价值的数据集,组织它们以供下游使用,并在保持可追溯性和治理的前提下,将选定信息迁移至数据湖或湖仓。平台还提供存储成本和碳足迹的洞察,帮助组织更明智地决定保留哪些数据以及应存放在哪里。

您在 EMC 领导质量保证工作八年后,于 2010 年共同创立 Datadobi。您在大型企业存储和数据环境中看到哪些现象让您确信可以创办一家公司?随着非结构化数据对 AI 越来越重要,最初的愿景又是如何演变的?

在 EMC 工作期间,我多年目睹企业在存储基础设施上投入巨资,却几乎无法了解实际存放了什么数据。我们在帮助客户存储和保护数据方面表现出色,但没有人去问更深入的问题:这些数据是什么,谁拥有它,是否仍然需要,它的价值是多少?基础设施能力与数据认知之间的差距正是机会所在。我们创立 Datadobi,旨在帮助组织智能地迁移和管理非结构化数据,而不仅仅是把数据从一个阵列搬到另一个阵列。

变化在于风险的提升。十五年前,未受管理的文件共享只是成本和合规问题。如今,同样的未受管理文件共享在有人将 AI 模型或代理指向它的瞬间就变成了负债。非结构化数据已从组织存储的对象,转变为决定其 AI 项目成败的关键因素。我们最初的想法——仅凭存储基础设施无法告诉你数据对业务的意义——并未改变,只是变得前所未有的紧迫。

您曾指出,生成式 AI 并未制造企业数据问题,而是揭示并加速了已经存在数十年的问题。AI 现在显现出的组织在历史上管理数据的最大弱点是什么?

多年来,组织一直难以理解其企业数据。AI 并未制造这种困境,只是把原本隐藏的地方暴露出来。当数据静静地存放在文件共享或归档中时,无人需要对其内容负责。一旦将大型语言模型或 RAG 流水线指向这些数据,所有弱点都会变得显而易见且产生影响。

最大挑战在于大多数组织一直在管理存储,而非管理数据。他们知道卷和桶的位置,却不了解内部内容:哪些文件已陈旧,哪些包含敏感或受监管信息,哪些在整个环境中重复了数十次,以及实际谁拥有访问权限。AI 还揭示了所有权的碎片化程度。数据在本地系统、多个云以及 SaaS 仓库中累积,却没有人拥有完整的全景。这些并非新问题,AI 只是让忽视它们的代价变得立刻且可见。

组织常将 AI 投资集中在更强大的模型、GPU 和基础设施上。为何更多的计算或存储无法解决根本的数据就绪问题,企业应将投资转向何处?

更多的计算只能让错误答案更快出现,并不能提升答案的准确性、安全性或合规性。GPU 和存储基础设施执行决策,却不负责做出决策。如果向强大的模型喂入陈旧、重复、权限错误或敏感的数据,模型会在大规模且快速的情况下产生不可靠或有风险的输出。

我们认为市场已到达一个重要的拐点:过去组织侧重于优化存储,如今他们需要优化数据。这意味着要在基础设施层之上进行投入,具备跨整个数据资产全景观察的能力,了解每条数据的实际含义及其责任人,决定哪些应保留、迁移、归档或删除,并始终如一地执行这些决定。没有这种数据治理的基础设施投入,只会让组织更快地做错事。

这正是我们的非结构化数据管理平台所要解决的问题。它为组织提供跨本地、云端和 SaaS 存储的统一视图,利用标签和元数据分析对数据进行分类,使团队能够看清哪些是冗余、过时或真正有价值的,然后通过基于策略的工作流持续执行迁移、归档或删除决策,而非一次性项目。可视化、分类和一致执行的组合,使“我们拥有大量数据”转变为“我们清楚掌握拥有的内容以及该如何处理”。

“AI‑ready 数据”已成为行业常用词汇。您认为究竟是什么让非结构化数据具备 AI‑ready 条件,组织在将数据投入生成式 AI、检索增强生成(RAG)或训练流水线之前应使用哪些标准?

AI‑ready 数据是组织已经验证过的,而不仅仅是拥有的数据。实际上,这意味着组织在数据进入模型或流水线之前,能够自信地回答以下几个问题:这些数据是否准确且最新,还是多年未动?它是否在其他地方重复,可能导致结果偏差或冲突?是否包含不应公开的敏感、受监管或个人信息?谁被授权访问,它是否仍然符合当前的访问需求?这些数据是否真正为业务场景带来价值,还是仅仅是噪声?

如果无法回答这些问题,就把数据喂入生成式 AI 或 RAG 流水线,只是把治理问题下移到一个比文件共享更擅长展示其发现的系统中。AI‑ready 是一种数据智能治理的学科,而非在项目启动前一次性勾选的检查框。

企业可能在本地基础设施、多个云、归档和业务部门中拥有数十亿文件。它们如何判断哪些数据具备实际业务价值,哪些是冗余、过时、琐碎或仅是会削弱 AI 性能的噪声?

在如此规模下,没人能够逐文件回答此问题,人工审查也不可行。组织首先需要企业范围的可视性:跨本地、云端和 SaaS 仓库的统一、准确视图,因为看不见的数据无法做决策。随后,需要运用数据智能对环境中的数据进行分类,将 ROT(冗余、过时、琐碎)数据识别并与真正具备业务价值的数据区分开来。

这就要求治理不仅停留在可视化。看到数据是必要的,但不足以解决问题。组织需要通过以下步骤:理解数据的内容和意义,决定对其进行保留、迁移、归档、删除或用于 AI,然后在数十亿对象上持续一致地执行该决定。直接从可视化跳到 AI 输入正是噪声削弱模型性能、且有价值数据被埋没的根源。

当 AI 系统能够揭示以前员工难以发现的信息时,安全和治理变得尤为重要。组织在将企业数据暴露给 AI 系统之前,应如何评估权限、敏感信息、所有权和监管风险?

这是 AI 最大程度改变风险评估的领域之一。过去,权限过度或陈旧的文件只是一种理论上的风险,因为实际上需要有人知道其存在并主动去查找。而拥有广泛访问权限的 AI 系统可以瞬间将同一文件展示给任何提出相应问题的用户。模糊性从未是真正的控制手段,AI 已经消除了它偶然提供的最后一点保护。

在任何数据被暴露给 AI 系统之前,组织需要清晰了解谁拥有访问权限以及该权限是否仍然合理,数据中包含哪些敏感或受监管信息,谁是所有者并承担责任,以及其所涉及的监管义务——包括数据驻留、保留和隐私要求等。此类评估不能仅在项目启动前进行一次审计。企业数据持续变化,权限、所有权和风险必须持续审查,而不是仅在 AI 项目上线时进行。

Datadobi 主张将讨论焦点从管理存储基础设施转向将数据视为业务资产。实际操作中,这种转变是什么样的?它如何改变 IT 团队、数据团队、安全负责人和业务部门之间的关系?

在实际操作中,这意味着讨论不再围绕容量、分层和正常运行时间,而是聚焦于结果:降低成本、降低风险、合规以及支持 AI。这些以前被视为独立的项目,各自拥有不同的工具和负责人。我们认为这种观念日益过时。它们都依赖于对同一底层企业数据的理解,所需的是一种以数据为中心的新运营模型,将这些职能连接起来,而不是把每个项目当作依赖于独立系统的孤立任务。我们的平台正是将这种运营模型落地的方式。

这自然会改变参与者的构成。IT 不再是唯一的主导者,因为关于保留、迁移或向 AI 暴露哪些数据的决策是业务决策,需基于数据智能,而非单纯的基础设施决策。安全和合规负责人需要对 IT 管理的数据全景拥有可视性。业务部门需要对哪些数据真正影响其成果拥有发言权。数据管理不再是后台 IT 的职能,而是与 IT、安全和业务共同使用同一信息进行决策的共享运营纪律。

企业 AI 面临的一个挑战是数据不断变化。AI‑ready 能否一次性实现,还是需要持续的发现、分类、治理、归档和迁移数据的过程?

这是持续进行的,毫无例外。企业数据不断变化,新文件产生,权限变动,员工进出,法规演进,因此数据管理必须成为持续的运营能力,而非一系列独立项目。把 AI‑ready 当作项目启动前一次性清理,就像在锁匠只来一次后就宣称建筑安全,随后再也不检查门锁一样。

组织需要一种运营纪律,持续在可视化、理解、决策和执行之间循环:发现存在哪些数据,进行分类和理解,决定应如何处理,然后定期付诸行动。能够在企业规模上持续完成此循环的组织将超越同行,而不是把 AI‑ready 当作有结束日期的项目。

随着企业日益部署能够跨系统搜索并执行自主操作的 AI 代理,非结构化数据管理是否变得更加重要?当 AI 代理能够访问遍布组织的散布信息,而不仅仅是响应用户提示时,会出现哪些新风险?

这变得尤为重要,因为代理改变了暴露的性质。聊天机器人仅在单一用户提问和可见范围内作答受限。而能够跨系统搜索并自主行动的代理,可以比任何单个员工遍历更广的环境,并对发现的内容进行移动、共享或使用,而不必每一步都由人工审查。

这带来的风险超出单纯的发现层面。如果代理访问了不该触及的数据(权限错误的文件、陈旧的敏感记录、应在多年以前归档或删除的信息),它会以机器速度和规模对这些数据进行操作,而不仅仅是展示给单个好奇的用户。最成功部署代理的组织,都是把数据治理视为前提,而非事后考虑,因为代理会忠实利用数据智能中存在的任何漏洞。

对于已经积累了数十年非结构化数据并希望扩大 AI 项目的企业,您建议首先采取哪些实际步骤?在开始治理数据资产时,领导者应避免哪些错误?

首先要实现可视化。无法对看不见的数据做出正确决策,因此第一步是获取跨本地、云端和 SaaS 环境的准确、全企业视图,了解存在哪些数据。随后,进入理解和分类阶段,辨别哪些数据有价值、哪些敏感、哪些仅是噪声,然后再决定保留、迁移、归档或删除。

还有一个预算现实不可忽视。大多数 CIO 并没有单独、无限的 AI 预算,他们只能在已有的固定资金池中分配,而 AI 与维持业务运行的其他支出竞争。通过削减现有基础设施投入来为 AI 提供资金的做法是错误的,因为同样的基础设施、存储、数据管道和治理正是 AI 成功的依赖。更可持续的路径是从现有资产中创造余量:通过 StorageMAP 所提供的数据优化提升可视化并减少存储浪费,从而释放真实预算,而不触及 AI 项目实际需要的容量。

我看到的最大错误是组织直接跳到执行阶段,将 AI 指向其数据资产,或启动清理项目,却没有先建立可视化和理解的基础。第二个错误是把这视为一次性举措,而非运营能力;数据持续变化,治理必须是持续的。第三个错误是把它仅当作技术任务。成功的组织把这视为业务决策,IT、安全和业务相关方在数据价值及其处理方式上保持一致,而不是仅把迁移或存储项目交给 IT。

感谢这次精彩的访谈,想了解更多的读者请访问 Datadobi

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。