访谈

杰罗尼莫·德莱昂,Backblaze的人工智能高级产品经理 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

杰罗尼莫·德莱昂是一位经验丰富的产品管理领导者,在企业和初创公司环境中拥有超过10年的AI驱动创新经验。目前,他担任Backblaze的人工智能高级产品经理,负责开发AI/ML功能,专注于Backblaze如何增强客户的MLOps架构中的AI数据生命周期,并实施AI工具和代理来优化内部运营。

Backblaze是一家云存储和备份公司,为个人和企业提供无限的、自动的计算机备份,以及针对企业、媒体和应用程序工作负载的可扩展对象存储解决方案。其服务重点是经济实惠、数据安全、易于恢复和与现有系统的无缝兼容性。

您拥有十多年的AI驱动产品管理经验,从Intelas的LLM和Welcome.AI的RAG到Bloomberg的聊天机器人,现在又领导Backblaze的AI工作。这些经历如何塑造您对云存储在扩展AI/ML工作流中的作用的看法?

从我在IBM Watson开始AI项目以来,我看到创新步伐大大加快。过去需要几年才能从研究转移到生产,现在只需要几个月。然而,基础设施挑战仍然相同:数据在哪里,如何存储,如何高效地访问?

过去,计算和模型是限制因素,但现在我们有大量的预训练模型和计算提供者。然而,当我们开始一个项目时,我们通常需要从数据收集和处理项目开始,这仍然是今天的现状。我一直看到组织面临着数据整合的瓶颈。成功的组织是那些早期解决数据可访问性问题的组织,它们创建了一个可以随着AI成熟度而扩展的基础设施。您的存储架构决定了您可以多快地进行模型训练和创新。

您认为云存储在AI生命周期的哪些方面发挥着最关键的作用,从数据摄取和处理到训练、细化、推理和监控?

云存储在AI生命周期的各个阶段都至关重要,包括数据聚合、处理、训练和推理。在开始阶段,系统地整合、编目和保护存档可以加快新项目的速度,并使得测试新兴模型变得容易。干净、经过良好处理的数据往往比拥有更多数据更有价值,这使得存储成为质量和规模的基础。Backblaze的一个最喜欢的说法是,“如果是数据,那么就不是囤积。”您永远不知道它将有多有价值,因此组织应该尽可能多地收集数据。在训练过程中,可扩展的存储可以确保大型数据集的吞吐量,在推理过程中,捕获预测输出和用户反馈可以实现持续迭代。最终,存储是决定您可以多快地进行AI创新基础的因素。

组织在扩展存储以适应AI时面临的最大障碍是什么,这些挑战在小型初创公司和大型企业之间有何不同?

扩展存储以适应AI的最大障碍是成本、数据管理和可访问性。存储大量数据只是挑战的一部分;数据还必须被组织、检索和用正确的控制进行管理。干净、结构良好的数据往往比拥有更多数据更有价值。

对于初创公司,最初的挑战是收集足够的数据来训练和改进他们的模型。一旦他们拥有了数据,成本和架构就成为下一个障碍。

对于大型企业,挑战是复杂性。他们的数据丰富,但分散在不同的数据存储、遗留系统和合规性管理中,使得整合和可访问性变得困难。

成功的组织将存储视为战略性地与AI成熟度一起扩展的成本、性能和可访问性的使能器。

在成本、延迟、安全性和合规性方面,您认为哪一个是当前扩展AI的最紧迫的障碍,组织应该如何优先解决它?

在成本、延迟、安全性和合规性方面,延迟是最紧迫的障碍之一。它直接影响模型训练和推理,尤其是推理,它决定了用户体验。组织尽可能地减少延迟,因为推理延迟会损害采用率。

成本仍然是一个持续的挑战,因为数据量不断增长,合规性变得更加重要,尤其是在受监管的行业中。初创公司通常首先关注成本和延迟,而企业必须平衡延迟与治理和监管要求。优先级应该是构建最小化训练和推理延迟的存储,同时保持成本效益和合规性,以适应AI的采用。

企业通常强调灵活性和数据的易访问性,以推动AI创新。从您的角度来看,数据访问的真正灵活性是什么,它为什么如此重要?

在我最近的一次演讲中,我强调了智能归档的理念。数据访问的真正灵活性始于将信息集中到一个结构化、可搜索的归档中。这意味着统一多种格式,规范和标记以保持一致性,并启用索引以进行未来的查询。这种方法确保数据不仅被存储,还变得可用。

这是必不可少的,因为它为分析和建模奠定了基础。当数据结构化和可搜索时,团队可以更快地移动,更加自由地尝试,并减少训练和推理中的延迟。没有这种灵活性,存储很快就会成为AI创新中的瓶颈,而不是使能器。

您能否分享一些现实世界的案例,例如Decart AI或Wynd Labs,它们展示了正确的云存储方法如何直接使AI创新成为可能?

这些是两个很好的例子,展示了正确的云存储方法如何直接使AI创新成为可能。Decart专注于模型训练,在那里将数据移动到计算中是至关重要的。使用Backblaze B2,他们在90天内扩展到16PB,跨多个GPU集群训练,零出口成本,并实现了与竞争对手10倍的效率。这种可靠性和效率使他们能够更快地创新。

Wynd Labs专注于客户对数据的访问。他们每天摄入数百万字节的数据,每月提供数百万字节的数据。使用Backblaze的高性能和免费出口,他们可以扩展到企业需求,并将资源重新投资于产品开发。这种在规模上提供数据访问的能力为他们的平台解锁了新的机会。

在这两种情况下,正确的存储策略将基础设施从限制转变为使能器,使公司能够专注于AI创新,而不是管理成本和复杂性。

随着AI模型和数据集变得更加复杂,您会给那些试图在存储性能和成本效率之间取得平衡的组织什么建议?

组织需要考虑他们的长期数据使用情况,同时考虑他们的产品。收集、处理、移动和运行数据的推理将是他们的产品和组织的核心。 如果他们现在不考虑这一点,成本和存储挑战只会随着时间的推移而加剧。 由于AI将成为他们的产品和组织的核心部分,存储必须在早期设计为平衡性能和成本效率,以便在他们成长的过程中平滑扩展。

安全性和合规性在受监管的行业中尤其重要。您如何看待云存储的演变,以支持治理需求,同时仍允许团队快速创新?

治理是存储的一个关键部分。通过使用加密、细粒度权限、审计跟踪和数据驻留选项等内置控制来简化访问至关重要。 在AI中,了解数据的来源、如何处理以及如何用于模型对于合规性和信任至关重要。

同时,存储平台正在改进可用性,以便团队可以快速移动。当治理、数据来源和可访问性协同工作时,组织可以满足监管要求,同时继续以AI的速度创新。

对于正在评估或迁移到B2的组织,您会提供什么建议或指导,特别是在数据迁移、与现有MLOps或计算堆栈集成以及优化吞吐量和出口方面?

由于B2与S3兼容,因此它可以直接集成到现有的MLOps和计算堆栈中,而无需重新架构。我们经常与客户合作,进行概念验证,以验证迁移、性能和集成,然后再扩展。从那里开始,重点是优化吞吐量、数据移动和数据编排,以便团队可以跨集群训练、运行推理和快速迭代,而不会被基础设施瓶颈所阻碍。

随着AI工作负载的不断扩展,特别是LLM、艾字节级数据集和混合或多云策略的趋势,Backblaze如何演变其存储产品以满足这些新兴需求?

在Backblaze,我们专注于不仅仅是数据如何被使用,而是如何在未来编排数据。存储不再仅仅是一个存档;它正在成为一个工具,实现数据的快速访问、有效移动和可靠的编排。随着LLM和艾字节级数据集的出现,这种基础的快速访问和高吞吐量将不仅对于训练和推理至关重要,而且对于依赖数据使流程更加自动化的新兴AI代理类至关重要。结果是存储基础设施可以实现当前的创新,并为组织做好准备,以应对未来的发展。

感谢您接受这次精彩的采访,希望阅读更多的读者可以访问Backblaze

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。