访谈

Nexla 的 CEO 和联合创始人 Saket Saurabh – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Saket Saurabh,Nexla 的 CEO 和联合创始人,是一位对数据和基础设施有着深厚热情的企业家。他正在领导开发一款下一代自动化数据工程平台,旨在为数据工作者带来规模和速度。

此前,Saurabh 创立了一家成功的移动初创公司,实现了多项重要里程碑,包括收购、IPO 和发展成为一家数百万美元的业务。他还在任职于 Nvidia (NVDA ) 期间为多个创新产品和技术做出了贡献。

Nexla 使数据工程自动化成为可能,这样数据就可以随时使用。他们通过一种独特的方法实现这一点,即 Nexsets – 数据产品,使任何人都可以轻松地集成、转换、交付和监控数据。

是什么启发你联合创立了 Nexla,你在数据工程方面的经验如何塑造了你对公司的愿景?

在联合创立 Nexla 之前,我在 Nvidia 开始了我的数据工程之旅,构建了高可扩展性和高端技术。在那之后,我带领我的前一家公司经历了收购和 IPO 的旅程,在移动广告领域,海量数据和机器学习是我们的核心产品,处理每天约 300 亿条记录的数据。

在 2015 年我的前一家公司上市后,我正在寻找下一个让我兴奋的挑战。来自这两个背景,我很清楚数据和计算挑战正在汇聚,因为行业正在向更先进的应用迈进,这些应用由数据和 AI 驱动。

虽然我们当时不知道 Generative AI (GenAI) 会以如此快的速度发展,但很明显,机器学习和 AI 将成为利用数据的基础。因此,我开始思考需要什么样的基础设施来使人们能够成功地处理数据,以及如何使任何人(不仅仅是工程师)能够在日常工作中利用数据。

这导致了对 Nexla 的愿景 – 简化和自动化数据背后的工程。数据工程在大多数公司中是一个非常定制化的解决方案,尤其是在处理复杂或大规模数据问题时。目标是使数据更容易被更广泛的用户所接受,而不仅仅是数据工程师。我的经验在构建可扩展的数据系统和应用中促进了这一愿景,即通过自动化和简化来实现数据的民主化。

Nexsets 如何体现 Nexla 使数据为每个人准备就绪的使命,为什么这种创新对于现代企业至关重要?

Nexsets 体现了 Nexla 使数据为每个人准备就绪的使命,通过解决数据的核心挑战。数据的 3Vs – 体积、速度和多样性 – 一直是一个持续的问题。行业在解决体积和速度方面的挑战方面取得了一些进展。然而,数据的多样性仍然是一个重大障碍,因为新系统和应用的激增导致了数据结构和格式的多样性不断增加。

Nexla 的方法是自动建模和连接来自多个来源的数据,形成一个一致的、打包的实体,即我们称之为 Nexset 的数据产品。这使用户能够在不需要了解底层数据源和结构复杂性的情况下访问和处理数据。Nexset 作为一个网关,提供了一个简单、直接的数据接口。

这对于现代企业至关重要,因为它使更多的人(不仅仅是数据工程师)能够在日常工作中利用数据。通过抽象掉数据的多样性和复杂性,Nexsets 使业务用户、分析师和其他人能够直接与他们需要的数据交互,而无需广泛的技术专业知识。

我们还致力于使集成对非技术数据消费者更易于使用 – 从用户界面和人们如何协作和治理数据到他们如何构建转换和工作流。抽象掉数据多样性的复杂性是使数据民主化和赋予更广泛的用户从其信息资产中提取价值的关键。

这对于现代企业来说至关重要,因为他们试图变得更加数据驱动,并在整个组织中利用数据驱动的洞察力。

什么使数据“GenAI 就绪”,Nexla 如何有效地解决这些要求?

答案部分取决于您如何使用 GenAI。大多数公司正在实施 GenAI 检索增强生成 (RAG)。这需要首先准备和编码数据以加载到向量数据库中,然后通过搜索检索数据以添加到提示上下文中作为输入到大型语言模型 (LLM) 中,该模型尚未使用此数据进行训练。因此,数据需要以一种适合向量搜索和 LLM 的方式准备。

无论您是否使用 RAG、检索增强微调 (RAFT) 或执行模型训练,都有一些关键要求:

  • 数据格式:GenAI LLM 通常最适合特定格式的数据。数据需要以模型可以轻松摄取和处理的方式结构化。它还应该以有助于 LLM 更好地使用数据的方式“分块”。
  • 连接性:GenAI LLM 需要能够动态访问相关数据源,而不是依赖静态数据集。这需要与各种企业系统和数据存储库的持续连接。
  • 安全性和治理:在使用敏感企业数据时,具有强大的安全性和治理控制至关重要。数据访问和使用需要安全且符合现有的组织政策。您还需要治理由 LLM 使用的数据,以帮助防止数据泄露。
  • 可扩展性:GenAI LLM 可以是数据密集型和计算密集型,因此底层数据基础设施需要能够满足这些模型的需求。

Nexla 通过以下几种方式解决使数据 GenAI 就绪的要求:

  • 动态数据访问:Nexla 的数据集成平台提供了一种连接到数百个源的方法,并使用各种集成样式和数据速度,以及编排,提供 GenAI LLM 需要的最新数据,而不是依赖静态数据集。
  • 数据准备:Nexla 具有提取、转换和以针对每个 GenAI 用例优化的格式准备数据的功能,包括内置数据分块和对多个编码模型的支持。
  • 自助服务和协作:使用 Nexla,数据消费者不仅可以访问数据并构建 Nexsets 和流程,还可以通过市场协作和共享工作,确保数据处于正确的格式并通过重用提高生产力。
  • 自动生成:集成和 GenAI 都很难。Nexla 根据数据消费者的选择自动生成许多所需步骤 – 使用 AI 和其他技术 – 以便用户可以自行完成工作。
  • 治理和安全性:Nexla 在整个过程中融入了强大的安全性和治理控制,包括协作,以确保敏感的企业数据以安全和符合的方式被访问和使用。
  • 可扩展性:Nexla 平台旨在扩展以处理 GenAI 工作负载,提供必要的计算能力和弹性扩展。

融合集成、自助服务、协作、自动生成和数据治理需要共同构建以使数据民主化成为可能。

多样化的数据类型和来源如何为 GenAI 模型的成功做出贡献,Nexla 在简化集成过程中扮演什么角色?

GenAI 模型需要访问所有类型的信息才能提供最佳的洞察力和相关输出。如果您不提供这些信息,您不应该期望良好的结果。这与人们一样。

GenAI 模型需要在广泛的数据上进行训练,从结构化数据库到非结构化文档,以建立对世界的全面理解。不同的数据源,例如新闻文章、财务报告和客户互动,提供了有价值的上下文信息,这些模型可以利用。接触到多样化的数据还允许 GenAI 模型变得更加灵活和适应性,使它们能够处理更广泛的查询和任务。

Nexla 使用 Nexsets 抽象掉所有这些数据的多样性,并使访问几乎任何源变得容易,然后提取、转换、编排和加载数据,以便数据消费者可以专注于数据并使其为 GenAI 准备就绪。

哪些趋势正在塑造 2025 年及以后数据生态系统,特别是随着 GenAI 的兴起?

公司大多专注于使用 GenAI 构建助手或副驾驶,以帮助人们找到答案并做出更好的决定。代理 AI,即在无人干预的情况下自动执行任务的代理,是随着我们进入 2025 年而增长的趋势。代理需要集成以确保数据流动顺畅 – 不仅是单向,还要使 AI 能够对数据采取行动。

2025 年的另一个主要趋势是 AI 系统的日益复杂性。这些系统变得更加复杂,通过组合来自不同来源的组件来创建协调的解决方案。这类似于人类依赖于一天中使用的各种工具来完成任务。赋予 AI 的系统将遵循这种方法,编排多个工具和组件。这种编排带来了重大挑战,但也代表了一个关键的发展领域。

从趋势的角度来看,我们正在看到生成性 AI 超越简单的模式匹配,实现真正的推理。这个领域正在发生大量的技术进步。虽然这些进步可能不会在 2025 年完全转化为商业价值,但它们代表了我们正在迈进的方向。

另一个关键趋势是加速技术在 AI 推理方面的应用,特别是与 Nvidia 等公司。传统上,GPU 已被广泛用于训练 AI 模型,但运行时推理 – 模型被使用的点 – 正在变得同样重要。我们可以期待在优化推理方面取得进展,使其更加高效和有效。

此外,人们意识到可用的训练数据基本上已经被最大化。这意味着模型的进一步改进不会来自添加更多的训练数据,而是来自模型在推理期间的操作方式。在运行时,利用新信息来增强模型结果变得至关重要。

虽然一些令人兴奋的技术开始接近其极限,但新的方法将继续出现,凸显了组织在采用 AI 时的适应性重要性。今天有效的方法可能会在六个月到一年内变得过时,因此保持适应性和开放性对于跟上快速演变的格局至关重要。

组织可以采用哪些策略来打破数据孤岛并改善数据在其系统中的流动?

首先,人们需要接受数据孤岛将始终存在的事实。这一直如此。许多组织试图将所有数据集中在一个地方,认为这将创造一个理想的设置并解锁巨大的价值,但这被证明几乎是不可能的。尤其是对于大型企业,这通常会变成一个漫长而昂贵的多年项目。

那么,问题变成了:我们如何更高效地处理数据孤岛?

一个有用的类比是考虑大公司。没有一家大公司所有员工都在同一个办公室工作。相反,他们分成总部和多个办事处。目标不是抵制这种自然的划分,而是确保这些办事处可以有效地协作。因此,我们投资于生产力工具,如 Zoom 或 Slack,以连接人们并实现跨地点的无缝工作流程。

同样,数据孤岛是将永远存在的分散系统。关键不是消除它们,而是使它们更高效地协作。知道这一点,我们可以专注于促进这些连接的技术。

例如,像 Nexsets 这样的技术提供了一个可以跨多个数据源工作的共同接口或抽象层。通过作为数据孤岛的网关,它简化了与分散在多个孤岛中的数据交互的过程。这在孤岛之间创建了效率,并最小化了孤岛的负面影响。

本质上,策略应该是增强孤岛之间的协作,而不是试图消除它们。许多企业犯了试图将所有内容集中在一个巨大的数据湖中的错误。但说实话,这是一个几乎不可能赢的战斗。

现代数据平台如何处理速度和可扩展性等挑战,Nexla 在解决这些问题方面有什么独特之处?

我认为,现代数据栈中的许多工具最初都是专注于易用性和开发速度的,这些特点来自于使工具更易于使用 – 使营销分析师能够直接将数据从营销平台移动到可视化工具,例如。这些工具的演变通常涉及开发点解决方案或针对特定、狭义问题的工具。

当我们谈论可扩展性时,人们经常想到的是处理更大数据量的能力。但可扩展性的真正挑战来自两个主要因素:需要处理数据的人员数量的增加,以及需要管理的系统和数据类型的多样性。

现代工具由于高度专业化,往往只解决这些挑战的一个小子集。因此,组织最终使用多个工具,每个工具解决一个单独的问题,这最终会带来自己的挑战,例如工具过载和低效率。

Nexla 通过在易用性和灵活性之间取得平衡来解决这个问题。一方面,我们提供简单性,具有模板和用户友好的界面。另一方面,我们提供灵活性和面向开发人员的功能,允许团队不断增强平台。开发人员可以添加新功能,但这些增强功能仍然以简单的按钮和点击的形式提供给非技术用户。这种方法避免了过度专业化工具的陷阱,同时提供了广泛的企业级功能。

真正使 Nexla 与众不同的是其将易用性与组织所需的可扩展性和广泛性相结合的能力。我们的平台无缝地连接了这两个世界,使团队能够高效地工作而不牺牲力量或灵活性。

Nexla 的主要优势之一在于其抽象架构。例如,虽然用户可以可视化设计数据管道,但管道的执行方式是高度适应性的。根据用户的要求,例如源、目标或数据是否需要实时,平台会自动将管道映射到六个不同引擎之一,以确保最佳性能,而无需用户手动管理这些复杂性。

该平台也是松散耦合的,这意味着源系统和目标系统是解耦的。这使用户可以轻松地向现有源添加更多目标,向现有目标添加更多源,并启用系统之间的双向集成。

重要的是,Nexla 抽象了管道的设计,因此用户可以处理批处理数据、流数据和实时数据,而无需更改其工作流程或设计。平台会自动适应这些需求,使用户更容易以任何格式或速度处理数据。这更多地是关于周到的设计,而不是特定的编程语言,确保无缝的体验。

所有这些说明了我们将 Nexla 建立在以数据消费者为中心的理念上。许多传统工具都是为数据生产者或系统管理员设计的,但我们专注于希望以简单、直接的方式访问数据的数据消费者的需求。优先考虑消费者的体验使我们能够设计一个既简化数据访问又保持支持多样化用例所需的灵活性的平台。

Nexla 的无代码和低代码功能如何改变了数据工程,为您的客户带来了什么样的转变?

无代码和低代码功能将数据工程过程转变为真正的协作体验。例如,DoorDash 的账户运营团队,负责管理商家的数据,过去需要向工程团队提供要求。然后,工程师会构建解决方案,导致迭代的反复过程,耗费大量时间。

现在,使用无代码和低代码工具,这种动态已经改变。日常运营团队可以使用低代码界面直接处理任务。同时,工程团队可以快速通过同一个低代码平台添加新功能和功能,使运营团队能够无缝地使用这些功能而无需延迟。

这种转变将过程转变为协作努力,而不是创造性瓶颈,导致显著的时间节省。客户报告称,之前需要两个月到三个月才能完成的任务现在可以在两周内完成 – 速度提高了 5 倍至 10 倍。

数据工程的角色如何演变,特别是随着 AI 的日益采用?

数据工程正在迅速演变,推动因素是自动化和像 GenAI 这样的进步。该领域的许多方面,例如代码生成和连接器创建,变得更快、更高效。例如,使用 GenAI,连接器可以生成、测试和部署的速度已经大大提高。但是,这一进步也带来了新的挑战,包括增加的复杂性、安全问题和对强大的治理的需求。

一个紧迫的问题是企业数据的潜在滥用。企业担心他们的专有数据无意中被用于训练 AI 模型,并失去竞争优势或经历数据泄露,因为数据被泄露给他人。系统和数据量的日益复杂性需要数据工程团队采取更广泛的视角,关注整个系统的问题,例如安全性、治理和确保数据完整性。这些挑战不能仅通过 AI 来解决。

虽然生成性 AI 可以自动化低级任务,但数据工程的角色正在转变为编排更广泛的生态系统。数据工程师现在更像指挥家,管理着众多相互连接的组件和流程,例如设置防止错误或未经授权访问的防护措施,确保遵守治理标准,并监控 AI 生成的输出在业务决策中的使用方式。

这些系统中的错误和问题可能很昂贵。例如,AI 系统可能会提取过时的政策信息,导致错误的响应,例如向客户承诺退款,而实际上不允许这样做。这些类型的问题需要严格的监督和明确的流程来捕获和解决这些错误,以免影响业务。

数据工程团队的另一个关键职责是适应用户人口统计的转变。AI 工具不再仅限于分析师或技术用户,他们可以质疑报告和数据的有效性。这些工具现在被组织边缘的个人使用,例如客户支持代理,他们可能没有挑战不正确输出的专业知识。AI 的这一更广泛的采用增加了数据工程团队的责任,确保数据的准确性和可靠性。

随着数据工程领域的不断发展,Nexla 可以期待哪些新的功能或进步?

我们专注于几项进步,以应对新兴的挑战和机遇,随着数据工程的不断发展。其中之一是使用 AI 驱动的解决方案来解决数据多样性的问题。数据工程的一个主要挑战是管理来自多个来源的数据的多样性,因此我们正在利用 AI 来简化这个过程。例如,当从数百个不同的商家接收数据时,系统可以自动将其映射到标准结构中。今天,这个过程通常需要大量的人工输入,但 Nexla 的 AI 驱动功能旨在最小化手动努力并提高效率。

我们还在推进我们的连接器技术,以支持下一代数据工作流,包括轻松生成新代理的能力。这些代理使用户能够与各种系统建立无缝连接,并在这些系统中执行特定操作。这主要针对日益增长的 GenAI 用户的需求,并使与各种平台的集成和交互更加容易。

第三,我们继续创新改进的监控和质量保证。随着更多用户在各个系统中使用数据,确保数据质量的重要性显著增加。我们的目标是提供强大的系统监控和质量保证工具,以便即使使用量增加,数据也能保持可靠和可行。

最后,Nexla 也正在采取措施开源一些核心功能。我们的想法是通过与更广泛的社区分享我们的技术,我们可以赋予更多的人使用先进的数据工程工具和解决方案的能力,这最终反映了我们致力于在该领域促进创新和协作。

感谢您的精彩回应,希望了解更多的读者可以访问 Nexla

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。