访谈

Pinecone 首席工程师 Ram Sriharsha 博士 – 采访系列

mm
将 Unite.AI 添加到您在 Google 上的首选来源

Pinecone 首席工程师和研发负责人 Ram Sriharsha 博士曾在雅虎、Databricks 和 Splunk 等公司担任过副总裁职位。在雅虎,他曾是首席软件工程师和研究科学家;在 Databricks,他是统一分析平台的产品和工程负责人;在 Splunk,他担任了多个职位,包括高级首席科学家、工程副总裁和杰出工程师。

Pinecone 是一个完全托管的向量数据库,使得将向量搜索添加到生产应用程序变得容易。它结合了向量搜索库、过滤等功能和分布式基础设施,以提供高性能和可靠性。

是什么最初吸引你进入机器学习领域?

高维统计、学习理论和相关主题吸引了我进入机器学习领域。这些领域具有数学上的严谨定义,可以通过推理和提供关于学习的基本见解和设计高效算法的方法。

您之前曾是 Splunk 的工程副总裁,Splunk 是一个帮助将数据转化为可观察、安全和其他领域的行动的数据平台。您从这段经历中得到了什么关键的收获?

我之前没有意识到企业搜索的用例有多样化:人们使用 Splunk 进行日志分析、可观察性和安全分析等。这些用例中有一个共同点,即检测无结构数据中的相似事件或异常事件。这是一个难题,传统的搜索方法并不适合大规模数据。在 Splunk 的时候,我启动了有关使用机器学习和深度学习进行日志挖掘、安全分析等方面的研究。通过这项工作,我意识到向量嵌入和向量搜索将成为这些领域新方法的基本原理。

您能为我们描述一下什么是向量搜索吗?

在传统搜索(也称为关键词搜索)中,你是在查询和文档之间寻找关键词匹配。这需要将查询分解为单个词,检索包含这些词的文档,然后合并和排名以确定最相关的文档。

传统搜索的主要问题是,为了获得相关结果,查询必须与文档有关键词匹配。例如,如果你搜索“pop”,你会匹配“pop music”,但不会匹配“soda”,因为它们之间没有关键词重叠,即使在许多美国地区,“pop”和“soda”是同义词。

在向量搜索中,你首先将查询和文档转换为高维空间中的向量。这通常是通过将文本传递给深度学习模型(如 OpenAI 的 LLMs 或其他语言模型)来完成的。结果是一个浮点数数组,可以被视为高维空间中的向量。

核心思想是,高维空间中相邻的向量在语义上也是相似的。以“soda”和“pop”为例,如果模型在合适的语料库上训练,它可能会认为“pop”和“soda”在语义上是相似的,因此对应的嵌入将在嵌入空间中彼此接近。如果是这样,那么检索给定查询的最近邻文档就变成了在高维空间中搜索查询向量的最近邻的问题。

您能描述一下向量数据库是什么以及如何使其能够构建高性能向量搜索应用程序吗?

向量数据库存储、索引和管理这些向量。向量数据库解决的主要挑战是:

  • 构建向量的高效搜索索引以回答最近邻查询
  • 构建高效的辅助索引和数据结构以支持查询过滤。例如,如果你想只搜索语料库的一个子集,你应该能够利用现有的搜索索引而不需要重新构建它

在 Pinecone 中使用了哪些类型的机器学习算法?

我们通常处理近似最近邻搜索算法,并开发新的算法以高效地更新、查询和处理大量数据,同时尽量降低成本。

我们还致力于开发将密集检索和稀疏检索相结合以提高搜索相关性的算法。

构建可扩展搜索的挑战是什么?

虽然近似最近邻搜索已经被研究了几十年,但我们相信仍有很多待发现的东西。

特别是,当谈到设计大规模最近邻搜索时,具有成本效益、在大规模上进行高效过滤或设计支持高容量更新和保持索引新鲜、一致、耐用等算法时,都是当前的挑战性问题。

向量数据库可以用于哪些类型的用例?

向量数据库的用例范围正在日益扩大。除了在语义搜索中的应用外,我们还看到它被用于图像搜索、图像检索、生成式 AI、安全分析等领域。

您对搜索的未来有什么展望?

我认为搜索的未来将由 AI 驱动,我不认为这会很远。在那个未来,我预计向量数据库将成为一个核心原语。我们喜欢把向量数据库看作是 AI 的长期记忆(或外部知识库)。

感谢这次精彩的采访,希望读者能够通过访问 Pinecone 来了解更多信息。

安托万是一位具有远见的领导者和Unite.AI的联合创始人,他对塑造和推广人工智能和机器人技术的未来充满热情。作为一位连续创业者,他相信人工智能将对社会产生电力的影响一样的颠覆性影响,并经常对颠覆性技术和通用人工智能的潜力大加赞扬。

作为一位未来学家Securities.io的创始人,这是一个专注于投资尖端技术的平台,这些技术正在重新定义未来并重塑整个行业。