Интервью
Чарльз Сие, основатель и генеральный директор Zilliz – Интервью

Чарльз Сие является основателем и генеральным директором Zilliz, который фокусируется на создании следующего поколения баз данных и технологий поиска для приложений ИИ и моделей обработки языка. В Zilliz он также изобрел Milvus, самый популярный в мире открытый векторный база данных для производственных приложений ИИ. В настоящее время он является членом совета директоров LF AI & Data Foundation и занимал пост председателя совета в 2020 и 2021 годах. Чарльз ранее работал в Oracle (ORCL ) в качестве основателя инженерного проекта облачной базы данных Oracle 12c. Чарльз имеет степень магистра в области компьютерных наук Университета Висконсин-Мэдисон.
Zilliz – это команда, стоящая за LF AI Milvus®, широко используемой открытой векторной базой данных. Компания фокусируется на упрощении управления инфраструктурой данных, стремясь сделать ИИ более доступным для корпораций, организаций и отдельных лиц.
Можете ли вы рассказать историю о создании Zilliz и о том, что вдохновило вас разработать Milvus и сосредоточиться на векторных базах данных?
Мой путь в области баз данных охватывает более 15 лет, включая шесть лет в качестве программного инженера в Oracle, где я был одним из основателей команды базы данных Oracle 12c Multitenant. Во время этого времени я заметил ключевое ограничение: хотя структурированные данные были хорошо управляемы, неструктурированные данные, представляющие 90% всех данных, оставались в значительной степени неиспользованными, и только 1% был проанализирован осмысленно.
В 2017 году растущая способность ИИ обрабатывать неструктурированные данные стала поворотным моментом. Достижения в области обработки естественного языка показали, как неструктурированные данные можно преобразовать в векторные представления, открывая их семантическое значение. Это вдохновило меня создать Zilliz с целью управлять “миллиардами данных”. Векторные представления стали краеугольным камнем для моста между неструктурированными данными и действенными идеями. Мы разработали Milvus как базу данных, специально предназначенную для этой цели.
За последние два года отрасль подтвердила этот подход, признав векторные базы данных фундаментальными для управления неструктурированными данными. Для нас это не только технология, но и возможность расширить возможности человечества для использования потенциала неструктурированных данных в эпоху ИИ.
Как изменился путь Zilliz с момента его создания шесть лет назад, и какие ключевые проблемы вы столкнулись, разрабатывая векторные базы данных?
Путь был трансформационным. Когда мы начали Zilliz семь лет назад, реальной проблемой не было привлечение средств или набор персонала – это было создание продукта в совершенно неисследованной территории. Без существующих карт, лучших практик или установленных ожиданий пользователей нам пришлось проложить свой собственный путь.
Наш прорыв произошел с открытием Milvus. Снижая барьеры для принятия и способствуя вовлечению сообщества, мы получили бесценную обратную связь от пользователей, чтобы улучшить и усовершенствовать продукт. Когда Milvus был запущен в 2019 году, у нас было около 30 пользователей к концу года. Это число выросло до более 200 в 2020 году и почти до 1000 вскоре после этого.
Сегодня векторные базы данных сместились от новой концепции к необходимой инфраструктуре в эпоху ИИ, подтверждая видение, с которого мы начали.
Как компания, специализирующаяся на векторных базах данных, какие уникальные технические возможности предлагает Zilliz для поддержки многомодальной векторной поиска в современных приложениях ИИ?
Zilliz разработал передовые технические возможности для поддержки многомодальной векторной поиска:
- Гибридный поиск: Мы обеспечиваем одновременный поиск по разным модальностям, таким как объединение визуальных функций изображения с его текстовым описанием.
- Оптимизированные алгоритмы: Наши проприетарные методы квантования балансируют точность воспоминания и эффективность памяти для межмодальных поисков.
- Поиск в реальном времени и офлайн-обработка: Наша двухпутевая система поддерживает низкозадержную обработку в реальном времени и высокопроизводительную офлайн-импорт, гарантируя свежесть данных.
- Энергоэффективность: Наши экземпляры расширенной емкости используют интеллектуальное многоуровневое хранилище для значительного снижения затрат на хранение, сохраняя при этом высокую производительность.
- Встроенные модели ИИ: Интегрируя многомодальные модели встраивания и ранжирования, мы снизили барьер для реализации сложных приложений поиска.
Эти возможности позволяют разработчикам эффективно обрабатывать разнообразные типы данных, делая современные приложения ИИ более прочными и универсальными.
Как вы видите развитие многомодального RAG в расширении возможностей ИИ по обработке сложных реальных данных, таких как изображения, аудио и видео, наряду с текстом?
Многомодальный RAG (Retrieval-Augmented Generation) представляет собой поворотный момент в развитии ИИ. Хотя текстовый RAG был заметным, большинство корпоративных данных охватывает изображения, видео и аудио. Способность интегрировать эти разнообразные форматы в рабочие процессы ИИ имеет решающее значение.
Этот сдвиг своевремен, поскольку сообщество ИИ обсуждает ограничения доступных интернет-данных для обучения. Хотя текстовые данные являются конечными, многомодальные данные остаются в значительной степени неиспользованными – от корпоративных видео до фильмов и аудиозаписей.
Многомодальный RAG открывает этот неиспользованный резервуар, позволяя системам ИИ обрабатывать и использовать эти богатые типы данных. Это не только о решении проблемы дефицита данных, но и о расширении возможностей ИИ для лучшего понимания и взаимодействия с реальным миром.
Как Zilliz отличается от конкурентов на быстро растущем рынке векторных баз данных?
Zilliz выделяется несколькими уникальными аспектами:
- Двойная идентичность: Мы являемся как компанией ИИ, так и компанией баз данных, расширяя границы управления данными и интеграции ИИ.
- Облачная архитектура: Milvus 2.0 был первой распределенной векторной базой данных, принявшей архитектуру разделенного хранилища и вычислений, обеспечивая масштабируемость и экономическую эффективность для более чем 100 миллиардов векторов.
- Проприетарные улучшения: Наш двигатель Cardinal обеспечивает производительность в 3 раза выше, чем открытый Milvus, и в 10 раз выше, чем у конкурентов. Мы также предлагаем индексирование на диске и интеллектуальное многоуровневое хранилище для экономически эффективного масштабирования.
- Непрерывное инновирование: От гибридных возможностей поиска до инструментов миграции, таких как VTS, мы постоянно продвигаем технологию векторных баз данных.
Наша приверженность открытому исходному коду обеспечивает гибкость, а наш управляемый сервис, Zilliz Cloud, предоставляет производительность класса предприятия с минимальной операционной сложностью.
Можете ли вы подробнее рассказать о значении Zilliz Cloud и его роли в демократизации ИИ и предоставлении услуг векторного поиска доступными для небольших разработчиков и предприятий?
Векторный поиск использовался технологическими гигантами с 2015 года, но проприетарные реализации ограничили его более широкое внедрение. В Zilliz мы демократизируем эту технологию двумя взаимодополняющими подходами:
- Открытый исходный код: Milvus позволяет разработчикам создавать и владеть своей инфраструктурой векторного поиска, снижая технические барьеры.
- Управляемый сервис: Zilliz Cloud исключает операционные затраты, предлагая простое и экономически эффективное решение для бизнеса, чтобы принять векторный поиск без необходимости специализированных инженеров.
Этот двойной подход делает векторный поиск доступным как для разработчиков, так и для предприятий, позволяя им сосредоточиться на создании инновационных приложений ИИ.
С учетом достижений в области моделей LLM и фундаментальных моделей, что, по вашему мнению, станет следующим значительным сдвигом в инфраструктуре данных ИИ?
Следующий значительный сдвиг будет полной трансформацией инфраструктуры данных ИИ для обработки неструктурированных данных, составляющих 90% всех данных. Существующие системы, предназначенные для структурированных данных, не приспособлены для этого сдвига.
Эта трансформация затронет каждый уровень стека данных, от фундаментальных баз данных до протоколов безопасности и систем наблюдения. Это не об инкрементальных обновлениях – это о создании новых парадигм, адаптированных к сложностям неструктурированных данных.
Эта трансформация затронет каждый аспект стека данных:
- Фундаментальные системы баз данных
- Процессы конвейера данных и ETL
- Механизмы очистки и преобразования данных
- Протоколы безопасности и шифрования
- Фреймворки соответствия и управления
- Системы наблюдения за данными
Мы не говорим только об обновлении существующих систем – мы говорим о создании совершенно новых парадигм. Это как переход от мира, оптимизированного для организации книг в библиотеке, к миру, который должен управлять, понимать и обрабатывать весь интернет. Этот сдвиг представляет собой совершенно новый мир, где каждый компонент инфраструктуры данных может потребовать быть переосмысленным с нуля.
Эта революция переопределит, как мы храним, управляем и обрабатываем данные, открывая огромные возможности для инноваций в области ИИ.
Как интеграция NVIDIA GPU повлияла на производительность и масштабируемость вашего векторного поиска?
Интеграция NVIDIA GPU значительно повысила производительность нашего векторного поиска в двух ключевых областях.
Во-первых, при построении индекса, которое является одной из наиболее вычислительно интенсивных операций в векторных базах данных. По сравнению с традиционным индексированием баз данных, построение векторного индекса требует на несколько порядков больше вычислительной мощности. Используя ускорение GPU, мы значительно сократили время построения индекса, обеспечивая более быструю ингестию данных и лучшую видимость.
Во-вторых, GPU были крайне важны для высокопроизводительных запросов. В приложениях, таких как электронная коммерция, где системы должны обрабатывать тысячи или даже десятки тысяч запросов в секунду (QPS), параллельные возможности обработки GPU оказались бесценными. Используя ускорение GPU, мы можем эффективно обрабатывать эти высокообъемные векторные поиски подобия, сохраняя при этом низкую задержку.
С 2021 года мы сотрудничаем с NVIDIA (NVDA ), чтобы оптимизировать наши алгоритмы для архитектуры GPU, а также разрабатываем нашу систему для поддержки гетерогенного вычисления на разных процессорных архитектурах. Это дает нашим клиентам гибкость в выборе наиболее подходящей аппаратной инфраструктуры для их конкретных потребностей.
Поскольку векторные базы данных играют решающую роль в ИИ, вы видите их применение за пределами традиционных случаев использования, таких как системы рекомендаций и поиска, в отраслях, таких как здравоохранение?
Векторные базы данных быстро расширяют свое применение за пределами традиционных приложений, таких как системы рекомендаций и поиска, проникая в отрасли, которые мы ранее не рассматривали. Давайте поделимся некоторыми примерами.
В здравоохранении и фармацевтических исследованиях векторные базы данных революционизируют открытие лекарств. Молекулы можно векторизовать на основе их функциональных свойств, и используя такие продвинутые функции, как поиск диапазона, исследователи могут обнаружить все потенциальные кандидаты на лекарства, которые могут лечить определенные заболевания или симптомы. В отличие от традиционных топ-k поисков, поиск диапазона выявляет все молекулы в определенном диапазоне от целевого, обеспечивая всесторонний обзор потенциальных кандидатов.
В автономном вождении векторные базы данных улучшают безопасность и производительность транспортных средств. Одним из интересных применений является обработка краевых случаев – когда система встречает необычные ситуации, она может быстро искать в огромных базах данных подобных ситуаций, чтобы найти соответствующие данные для обучения для тонкой настройки моделей автономного вождения.
Мы также видим инновационные применения в финансовых услугах для обнаружения мошенничества, кибербезопасности для обнаружения угроз и целевой рекламы для улучшения вовлеченности клиентов. Например, в банковском деле транзакции можно векторизовать и сравнить с историческими шаблонами, чтобы выявить потенциальную мошенническую деятельность.
Сила векторных баз данных заключается в их способности понимать и обрабатывать подобие в любой области – будь то молекулярные структуры, сценарии вождения, финансовые закономерности или угрозы безопасности. По мере продолжения развития ИИ мы только начинаем исследовать, что возможно. Способность эффективно обрабатывать и находить закономерности в огромных объемах неструктурированных данных открывает возможности, которые мы только начинаем исследовать.
Как разработчики и предприятия могут лучше всего взаимодействовать с Zilliz и Milvus, чтобы использовать технологию векторных баз данных в своих проектах ИИ?
Существует два основных пути для использования технологии векторных баз данных с Zilliz и Milvus, каждый из которых подходит для разных потребностей и приоритетов. Если вы цените гибкость и настройку, Milvus, наш открытый решение, является вашим лучшим выбором. С Milvus вы можете:
- Экспериментировать свободно и учиться технологии в своем собственном темпе
- Настроить решение в соответствии с вашими конкретными требованиями
- Внести вклад в разработку и изменить кодовую базу
- Сохранить полный контроль над своей инфраструктурой
Однако, если вы хотите сосредоточиться на создании своего приложения без управления инфраструктурой, Zilliz Cloud является оптимальным выбором. Он предлагает:
- Готовое решение с однократной установкой
- Безопасность и соответствие класса предприятия
- Высокая доступность и стабильность
- Оптимизированная производительность без операционных затрат
Подумайте об этом так: если вы любите “шарить” и хотите максимальную гибкость, выберите Milvus. Если вы хотите минимизировать операционную сложность и сразу приступить к созданию своего приложения, выберите Zilliz Cloud.
Оба пути приведут вас к вашему пункту назначения – это просто вопрос, сколько пути вы хотите контролировать, а сколько вам нужно прибыть
Спасибо за отличное интервью, читатели, которые хотят узнать больше, должны посетить Zilliz или Milvus.












