Интервью
Эдо Либерти, основатель и главный ученый в Pinecone – Интервью

Эдо Либерти, основатель и главный ученый в Pinecone, является ведущим экспертом в области крупномасштабных систем данных и машинного обучения. До запуска Pinecone – векторной базы данных, построенной для производительности и масштабируемости, он был директором исследований в AWS и руководителем лаборатории Amazon (AMZN ) AI, где его команда разработала основные технологии для SageMaker, OpenSearch, Kinesis и других. Ранее он возглавлял исследовательскую лабораторию Yahoo в Нью-Йорке, продвигая платформы и приложения машинного обучения в поиске, рекламе и безопасности. Его работа сосредоточена на алгоритмах и математических основах для обработки огромных наборов данных, включая уменьшение размерности, кластеризацию, потоковую обработку и крупномасштабную линейную алгебру.
Pinecone – это полностью управляемая векторная база данных, построенная для обеспечения масштабируемого и эффективного поиска в больших динамических наборах данных. Она поддерживает как плотные, так и разреженные вложения, индексирование в реальном времени и фильтрацию на основе метаданных, а также интегрируется без проблем с ведущими облачными платформами, моделями и фреймворками. С помощью серверной автомасштабируемости, функций безопасности класса предприятия и стандартов соответствия, таких как SOC 2, ISO 27001, GDPR и HIPAA, Pinecone обеспечивает надежную основу для развертывания крупномасштабных приложений ИИ.
Вы основали Pinecone в 2019 году после руководства исследовательской работой в Amazon AI Labs и разработки систем, таких как SageMaker. Что вдохновило вас на запуск Pinecone и сосредоточиться конкретно на векторных базах данных?
В AWS наша команда по машинному обучению построила удивительные системы, но когда дело доходило до памяти, не было способа семантически искать через огромные объемы неструктурированных данных. Это требовало чрезвычайно специализированных инженеров, которые знали, как строить сложные решения на основе векторного поиска. Я знал, что если есть способ для людей легко получить доступ к семантическому богатству, которое векторы захватывают, и объединить его с сложными моделями, то любой может ускорить ценность ИИ для себя. Итак, я ушел из AWS с целью真正 трансформировать, как можно сделать максимально простым получение максимальной ценности из собственных неструктурированных данных с помощью силы ИИ.
Pinecone выросла в определяющую компанию в области векторных баз данных. Оглядываясь назад, какие были самыми большими техническими или рыночными препятствиями, которые вам пришлось преодолеть, чтобы установить эту новую категорию?
Самый большой вызов? Никто не знал, что такое векторная база данных! Нам пришлось обучить рынок тому, что мы строили и почему это важно. Мы спросили наших клиентов, как они называют это сами, и они сказали нам – векторная база данных.
Как только другие начали понимать, люди спрашивали, почему они не могут просто использовать открытый исходный код? И нам приходилось объяснять все ограничения открытого исходного кода и компромиссы между масштабируемостью и производительностью, которые вы получите – и после всего этого вам все равно понадобятся опытные инженеры, чтобы построить вашу инфраструктуру. Вот почему мы всегда были управляемой службой и фокусируемся на пользовательском опыте. Наша система чрезвычайно сложна под капотом, потому что вам нужна эта специализированная инфраструктура для поиска подобия в миллиардном масштабе. Но мы делаем ее доступной с помощью вызова API, который может использовать любой разработчик.
Это означало абстрагирование всей сложности приблизимого поиска ближайшего соседа, управления индексами и распределенных систем. Разработчикам не хочется думать о параметрах HNSW, им просто хочется, чтобы все работало.
Вы недавно перешли с должности генерального директора на должность главного ученого, привлекая Эша Ашутоша для руководства компанией. Что мотивировало это решение, и как вы видите эволюцию своей роли в следующей главе Pinecone?
Pinecone, как компания, – это компания ИИ и исследований. Мы дошли до того, где мы есть сегодня, потому что мы переопределили поиск, системы и алгоритмы. И мы были очень активны в академии, публикуя технические отчеты и статьи, давая доклады и обучая рынок, даже пишем учебники и проводим университетские курсы по ИИ и памяти. Когда компания растет, нам нужно формализовать эти усилия в исследовательской лаборатории, отделенной от остального бизнеса. Подумайте о DeepMind и Google (GOOGL ) как об примере. В будущем я буду сосредотачиваться свою энергию на руководстве нашими исследованиями, делая ИИ знающим, и строить следующий набор контекстных продуктов от Pinecone.
В то же время Эш будет фантастическим генеральным директором и лидером для Pinecone. Он основал и масштабировал несколько инфраструктурных компаний и знает, как эффективно управлять компанией, такой как Pinecone. Он глубоко знает и креативно относится к нашей технологии и нашему рынку. И он интенсивно сосредоточен на клиентах. Эш и я будем глубоко сотрудничать в росте компании и нашего бизнеса.
В вашем блоге вы написали о сосредоточении на “сделать ИИ знающим”. Можете ли вы раскрыть, что это значит на практике, и как технология Pinecone уникально позиционирована для того, чтобы сделать это возможным?
ИИ без памяти – это как блестящий человек с амнезией: много интеллекта, но нет контекста. “Сделать ИИ знающим” означает дать системам ИИ возможность получить доступ, понять и рассуждать над огромными объемами информации в реальном времени.
Мы делаем возможным для приложений, работающих на ИИ, предоставлять релевантные идеи в реальном времени, полученные из семантически понятых и организованных данных, и гарантируем, что системы ИИ не просто угадывают, но могут извлекать и синтезировать знания по требованию. Это приводит к более точным, информированным и актуальным выводам для конечных пользователей.
Мы делаем это, предоставляя все компоненты и возможности для высококачественного, точного поиска от начала до конца в одном месте, вместе с отраслевым лидерством в производительности для крупномасштабного поиска.
Вы преподавали “Долгосрочная память в ИИ” в Принстоне. Как вы видите связь между векторными базами данных и будущим моделей ИИ? Верите ли вы, что память и контекст – это отсутствующие ингредиенты для современных крупных моделей?
Абсолютно. Большие языковые модели – это машины для распознавания образов – блестящие, но все же фундаментально ограниченные своей обучающей выборкой и контекстными окнами. Курс, который я преподавал с Маттией Дузе из Meta, был сосредоточен на алгоритмах, которые делают векторный поиск возможным над огромными объемами данных. Будущее не в более крупных моделях, а в более умном поиске над большими данными в реальном времени.
Многие предприятия сталкиваются с трудностями при переходе от пилотных проектов ИИ к развертыванию в производстве. Как Pinecone помогает преодолеть этот разрыв, и какие лучшие практики вы наблюдаете у успешных клиентов?
Разрыв обычно заключается в трех вещах: производительности (и стоимости) в масштабе, безопасности и сложности. Демонстрация, которая работает с 10 миллионами документов, разваливается на 10 миллиардах. Запуск чего-то на час отличается от запуска его 24/7 без терпимости к простоев. Вот почему мы сосредоточились на нашей серверной архитектуре, функциях класса предприятия и простоте использования.
Самое главное – просто начать. Наши клиенты часто удивляются, сколько они могут сделать, даже не разговаривая с нами. Мы спроектировали это намеренно, но всегда готовы помочь нашим клиентам, когда им это нужно.
Вы провели свою карьеру, переходя между академией, исследовательскими работами в крупных технологических компаниях (Yahoo, AWS) и предпринимательством. Как эти разные среды сформировали ваш подход к построению Pinecone?
Академия научила меня думать с первых принципов. Как абстрагировать и проектировать великие решения. В Yahoo и AWS я научился, как строить простые платформы данных, которые инженеры любят строить.
Предпринимательство – это где вы учитесь, что лучшая технология выигрывает только тогда, когда она решает реальные проблемы таким образом, что люди могут фактически использовать.
Эта смесь крайне важна для того, что мы строим. Мы не просто пишем исследовательские статьи или строим технологию ради технологии. Каждовое инновационное решение должно делать жизнь разработчиков проще и приложения предприятий более мощными.
Слияние поиска и ИИ кажется одним из самых больших сдвигов в вычислениях. Куда, по вашему мнению, это движется в течение следующих пяти лет, и как работа Pinecone поможет сформировать это будущее?
Поиск становится разговорным и контекстным. Через пять лет вы не будете “искать” – вы будете иметь диалог с системами ИИ, которые понимают не только ваш запрос, но и вашу цель, контекст, историю. Каждое взаимодействие будет информировано огромными базами знаний, которые обновляются в реальном времени.
Мы строим инфраструктуру для этого. Наша векторная база данных – это только начало. Я вижу будущее, где каждое приложение имеет встроенный контекст, где ИИ не выдумывает, потому что он основан на данных, где граница между поиском и знаниями исчезает.
Как главный ученый, вы будете более直接 вовлечены в данные, модели и прототипирование. Какие области исследований вам наиболее интересны для изучения прямо сейчас?
О, где я даже начну? Для короткого-среднего срока я глубже погружаюсь в эффективность и простоту использования. Можем ли мы сделать векторный поиск в 10 раз быстрее, одновременно делая его в 10 раз дешевле? Можем ли мы сделать наши API еще проще, чем они есть сегодня? Это сложные проблемы.
Для более долгосрочной перспективы я одержим пересечением извлечения и рассуждения. Как строить системы, которые не просто находят релевантные факты, но понимают отношения между ними? И затем использовать этот контекст для создания знающего ИИ и более мощных агентов.
Наконец, на личном уровне: отходя от роли генерального директора, что вас больше всего вдохновляет в этом переходе, и какие прорывы вы надеетесь открыть на следующем этапе Pinecone?
Мне больше всего нравится, когда я глубоко в коде, работаю с нашей исследовательской командой, имею эти “вау, это действительно работает!” моменты в 2 часа ночи.
Моя мечта? Сделать извлечение настолько хорошим, что оно станет невидимым. Где разработчики могут строить контекстные приложения, не думая о вложениях или индексах или чем-то подобном, и все просто работает.
Мы находимся в этом невероятном моменте, когда ИИ и данные сходятся. Потенциал безграничен, и я провожу свои дни, делая это будущее реальным сейчас.
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Pinecone.












