访谈

Pinecone 的创始人和首席科学家 Edo Liberty – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Edo Liberty 是 Pinecone 的创始人和首席科学家,他是大规模数据系统和机器学习领域的领先专家。在创立 Pinecone 之前,他曾是亚马逊云计算(AWS)的研究总监和亚马逊 AI 实验室的负责人,他的团队开发了 SageMaker、OpenSearch、Kinesis 等核心技术。他此前曾领导雅虎的纽约研究实验室,推进了机器学习平台和应用的发展,涵盖搜索、广告和安全等领域。他的工作重点是处理大规模数据集的算法和数学基础,包括降维、聚类、流处理和大规模线性代数。

Pinecone 是一个完全托管的向量数据库,旨在为大规模动态数据集提供可扩展和高效的搜索功能。它支持密集和稀疏嵌入、实时索引和基于元数据的过滤,同时与领先的云、模型和框架无缝集成。凭借无服务器自动扩缩、企业级安全和符合 SOC 2、ISO 27001、GDPR 和 HIPAA 等标准,Pinecone 为部署大规模 AI 应用程序提供了可靠的基础。

您在 2019 年创立了 Pinecone,此前您曾在亚马逊 AI 实验室领导研究,并开发了 SageMaker 等系统。是什么激发了您创立 Pinecone 并专注于向量数据库的灵感?

在 AWS,我们的机器学习团队开发了令人惊叹的系统,但当涉及到内存时,没有办法对大量非结构化数据进行语义搜索。这需要非常专业的工程师,他们知道如何构建复杂的向量搜索解决方案。我知道,如果有办法让人们轻松访问向量捕获的语义丰富性并将其与复杂模型相结合,那么任何人都可以加速 AI 的价值。因此,我离开了 AWS,目标是真正改变人们获取非结构化数据的价值的方式,利用 AI 的力量。

Pinecone 已经成长为向量数据库领域的定义性公司。回顾过去,您在建立这一新类别时面临的最大的技术或市场障碍是什么?

最大的挑战?没有人知道什么是向量数据库!我们不得不教育市场关于我们正在构建的内容以及为什么它很重要。我们问我们的客户他们如何称呼它,他们告诉我们这是一个向量数据库。

一旦其他人开始了解,我们就会被问到为什么不能使用开源解决方案?我们不得不解释开源解决方案的局限性和扩展性与性能的权衡,以及需要经验丰富的工程师来构建基础设施。这就是为什么我们一直专注于提供托管服务和用户体验。我们的系统内部非常复杂,因为您需要这种专业的基础设施来支持亿级别的相似性搜索。但我们通过 API 调用使其对任何开发人员都可访问。

您最近从 CEO 转变为首席科学家,并邀请 Ash Ashutosh 领导公司。是什么驱动了这一决定,您如何看待您在 Pinecone 下一阶段的角色演变?

Pinecone 作为一家公司,是一家 AI 公司和研究型公司。我们之所以能够走到今天,是因为我们重新定义了搜索、系统和算法。我们一直在积极地从事学术研究,发表技术报告和论文,进行演讲,并教育市场,甚至撰写有关 AI 和内存的教科书和大学课程。随着公司的成长,我们需要将这些努力正式化为一个独立于业务的研究实验室。可以将其与 DeepMind 和谷歌进行比较。未来,我将专注于领导我们的研究,赋予 AI 知识,并从 Pinecone 构建下一代上下文产品。

在您的博客文章中,您提到了“赋予 AI 知识”的概念。可以解释一下这在实践中意味着什么,以及 Pinecone 的技术如何独特地使其成为可能吗?

没有记忆的 AI 就像一个有健忘症的天才:非常聪明,但没有背景。“赋予 AI 知识”意味着赋予 AI 系统访问、理解和实时推理大量信息的能力。

我们正在使 AI 应用程序能够提供相关的见解,这些见解来自语义理解和组织的数据,并确保 AI 系统不仅仅是在猜测,而是能够检索和合成知识。这样可以为最终用户提供更准确、更有信息和更及时的输出。

您曾在普林斯顿大学教授“AI 中的长期记忆”课程,您如何看待向量数据库和 AI 模型未来的关系?您是否认为记忆和背景是当前大型模型所缺乏的关键成分?

绝对如此。大型语言模型是模式匹配机器——非常出色的机器,但其训练数据截止和上下文窗口的限制是根本性的。由我和 Meta 的 Matthijs Douze 教授的课程关注的是使向量搜索在大量数据上成为可能的算法。未来不是更大的模型,而是更智能的检索和更多数据的实时处理。

许多企业在将 AI 从试点项目转变为大规模部署时遇到了困难。Pinecone 如何弥合这一差距,您从成功的客户那里观察到了什么最佳实践?

差距通常归结为三个方面:性能(和成本)扩展、安全性和复杂性。一个能处理 1000 万条记录的演示可能会在处理 10 亿条记录时崩溃。运行一小时的东西与 24/7 不间断运行的东西不同,我们对此非常重视,因此我们致力于无服务器架构、企业级功能和易用性。

最重要的事情就是开始使用。我们的客户经常对他们可以在不需要与我们交谈的情况下做的事情感到惊讶。我们故意设计成这样,但也总是乐于帮助需要我们帮助的客户。

您在整个职业生涯中在学术界、科技研究(雅虎、AWS)和创业之间转换。这些不同的环境如何塑造您对建设 Pinecone 的方法?

学术界教会了我从第一原则出发思考。如何抽象和设计出色的解决方案。在雅虎和 AWS,我学会了如何构建简单的数据平台,这些平台受到工程师的喜爱。

创业就是你学会的最佳技术只会赢得真正解决问题并且人们能够使用的市场。这种混合对于我们正在构建的东西至关重要。我们不仅仅是在撰写研究论文或为了技术而构建技术。每一次创新都必须让开发人员的生活更容易,让企业的应用程序更强大。

搜索和 AI 的融合似乎是计算领域最大的变化之一。您认为这五年内会如何发展,Pinecone 的工作将如何塑造这一未来?

搜索变得更加对话式和上下文化。在五年内,您不会再“搜索”——您将与理解您的查询、意图、历史和上下文的 AI 系统进行对话。每一次交互都将由实时更新的庞大知识库所告知。

我们正在为此构建基础设施。我们的向量数据库只是开始。我设想一个未来,每个应用程序都有嵌入的上下文,AI 不会产生幻觉,因为它基于数据,搜索和知道的界限消失了。

作为首席科学家,您将更深入地参与数据、模型和原型开发。您目前最感兴趣的研究领域是什么?

哇,哪里开始呢?在短期和中期内,我正在深入研究效率和易用性。我们能否使向量搜索速度提高 10 倍,同时使其成本降低 10 倍?我们能否使我们的 API 比现在更简单?这些都是困难的问题。

从长远来看,我痴迷于检索和推理的交叉点。如何构建不仅能够找到相关事实,还能理解事实之间关系的系统?然后利用这种上下文构建更知情的 AI 和更强大的代理。

最后,个人层面:您最期待 CEO 角色的转变和 Pinecone 下一阶段的突破是什么?

我最开心的时候是在深入代码中,与我们的研究团队一起工作,并在凌晨 2 点经历“哇,这竟然真的有效!”的时刻。

我的梦想?让检索变得如此出色,以至于它变得不可见。开发人员可以在不考虑嵌入、索引或任何其他内容的情况下构建上下文应用程序,它就能正常工作。

我们正处于一个令人难以置信的时刻,AI 和数据正在汇聚。潜力是无限的,我可以花费我的时间使这一未来成为现实。

感谢这次精彩的采访,希望了解更多的读者可以访问 Pinecone

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。