Интервью

Доктор Рам Шрихарша, Вице-президент по инженерии в Pinecone – Интервью

mm
Добавьте Unite.AI в избранные источники в Google

Доктор Рам Шрихарша – Вице-президент по инженерии и исследованиям в Pinecone.

До прихода в Pinecone Рам занимал должности Вице-президента в Yahoo, Databricks и Splunk. В Yahoo он был одновременно ведущим программистом и исследователем; в Databricks он возглавлял разработку единой платформы аналитики для геномики; а в Splunk, где он проработал три года, он занимал различные должности, включая старшего главного ученого, Вице-президента по инженерии и заслуженного инженера.

Pinecone – это полностью управляемая векторная база данных, которая упрощает добавление векторного поиска в приложения. Она объединяет библиотеки векторного поиска, возможности, такие как фильтрация, и распределенную инфраструктуру для обеспечения высокой производительности и надежности в любой масштабе.

Что изначально привлекло вас к машинному обучению?

Высоко измеримая статистика, теория обучения и темы подобного рода привлекли меня к машинному обучению. Они математически хорошо определены, могут быть рассуждены и предлагают некоторые фундаментальные идеи о том, что такое обучение и как проектировать алгоритмы, которые могут учиться эффективно.

Ранее вы были Вице-президентом по инженерии в Splunk, платформе данных, которая помогает превратить данные в действие для наблюдаемости, ИТ, безопасности и многого другого. Какие были некоторые из ваших ключевых выводов из этого опыта?

Я не осознал до тех пор, пока не пришел в Splunk, насколько разнообразны случаи использования в корпоративном поиске: люди используют Splunk для аналитики журналов, наблюдаемости и аналитики безопасности среди множества других случаев использования. И то, что общего у многих этих случаев использования, – это идея обнаружения подобных событий или сильно различающихся (или аномальных) событий в неструктурированных данных. Это оказывается трудной задачей, и традиционные средства поиска через такие данные не очень масштабируемы. Во время моего пребывания в Splunk я инициировал исследования в этих областях о том, как мы могли бы использовать машинное обучение (и глубокое обучение) для аналитики журналов, безопасности и т. д. Через эту работу я пришел к выводу, что векторные вложения и векторный поиск окажутся фундаментальной примитивной величиной для новых подходов к этим областям.

Можете ли вы описать, что такое векторный поиск?

В традиционном поиске (также известном как поиск по ключевым словам) вы ищете совпадения ключевых слов между запросом и документами (это может быть твиты, веб-документы, юридические документы и т. д.). Чтобы сделать это, вы разбиваете свой запрос на токены, извлекаете документы, содержащие заданный токен, и объединяете и ранжируете, чтобы определить наиболее релевантные документы для данного запроса.

Основная проблема, конечно, заключается в том, что для получения релевантных результатов ваш запрос должен иметь совпадения ключевых слов в документе. Классическая проблема с традиционным поиском заключается в том, что если вы ищете “поп”, вы найдете “музыку поп”, но не найдете “соду”, и т. д., поскольку нет совпадения ключевых слов между “поп” и документами, содержащими “соду”, хотя мы знаем, что в многих районах США “поп” означает то же, что и “сода”.

В векторном поиске вы начинаете с преобразования как запросов, так и документов в вектор в некотором высокомерном пространстве. Это обычно делается путем передачи текста через глубокую модель обучения, такую как LLM от OpenAI или другие языковые модели. В результате вы получаете массив чисел с плавающей запятой, который можно рассматривать как вектор в некотором высокомерном пространстве.

Основная идея заключается в том, что ближайшие векторы в этом высокомерном пространстве также семантически подобны. Вернувшись к нашему примеру с “содой” и “попом”, если модель обучена на правильном корпусе, она, вероятно, будет считать “поп” и “соду” семантически подобными, и, следовательно, соответствующие вложения будут близки друг к другу в пространстве вложений. Если это так, то извлечение ближайших документов для данного запроса становится проблемой поиска ближайших соседей соответствующего вектора запроса в этом высокомерном пространстве.

Можете ли вы описать, что такое векторная база данных и как она позволяет строить высокопроизводительные приложения векторного поиска?

Векторная база данных хранит, индексирует и управляет этими вложениями (или векторами). Основные проблемы, которые решает векторная база данных, заключаются в следующем:

  • Создание эффективного поискового индекса по векторам для ответа на запросы ближайших соседей
  • Создание эффективных вспомогательных индексов и структур данных для поддержки фильтрации запросов. Например, если вы хотите искать только подмножество корпуса, вы должны иметь возможность использовать существующий поисковый индекс без необходимости его перестраивать

Поддержка эффективных обновлений и сохранение как данных, так и поискового индекса в актуальном, согласованном, надежном и т. д. состоянии.

Какие типы алгоритмов машинного обучения используются в Pinecone?

Мы в основном работаем над алгоритмами приблизительного поиска ближайших соседей и разрабатываем новые алгоритмы для эффективного обновления, запроса и других операций с большими объемами данных в наиболее экономически эффективной форме.

Мы также работаем над алгоритмами, которые объединяют плотную и разреженную выборку для улучшения релевантности поиска.

Какие некоторые из проблем, связанных со строительством масштабируемого поиска?

Хотя приблизительный поиск ближайших соседей исследовался десятилетиями, мы считаем, что еще многое предстоит открыть.

В частности, когда речь идет о проектировании крупномасштабного поиска ближайших соседей, который является экономически эффективным, или о проектировании алгоритмов, которые поддерживают эффективную фильтрацию в крупном масштабе, или о проектировании алгоритмов, которые поддерживают высокообъемные обновления и в целом свежие индексы, все это являются сложными проблемами сегодня.

Какие некоторые из различных типов случаев использования, для которых может быть использована эта технология?

Спектр случаев использования векторных баз данных растет с каждым днем. Помимо их использования в семантическом поиске, мы также видим их использование в поиске изображений, извлечении изображений, генеративном ИИ, аналитике безопасности и т. д.

Каково ваше видение будущего поиска?

Я думаю, что будущее поиска будет определяться ИИ, и я не думаю, что это очень далеко. В этом будущем я ожидаю, что векторные базы данных будут фундаментальной примитивной величиной. Мы любим думать о векторных базах данных как о долгосрочной памяти (или внешней базе знаний) ИИ.

Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Pinecone.

Антуан - видный лидер и сооснователь Unite.AI, движимый непоколебимой страстью к формированию и продвижению будущего ИИ и робототехники. Как серийный предприниматель, он считает, что ИИ будет столь же разрушительным для общества, как и электричество, и часто увлекается потенциалом разрушительных технологий и ИИ.

Как футуролог, он посвящен исследованию того, как эти инновации будут формировать наш мир. Кроме того, он является основателем Securities.io, платформы, ориентированной на инвестиции в передовые технологии, которые переопределяют будущее и меняют целые сектора.