Інтерв’ю

Чарльз Сє, засновник та генеральний директор Zilliz – Серія інтерв’ю

mm
Додайте Unite.AI до бажаних джерел у Google

Чарльз Сє є засновником і генеральним директором Zilliz, який зосереджується на створенні наступного покоління баз даних і технологій пошуку для застосунків штучного інтелекту та великих мовних моделей. В Zilliz він також винайшов Milvus, найпопулярнішу відкриту базу даних векторів для застосунків штучного інтелекту. Наразі він є членом ради директорів фундації LF AI & Data та обіймав посаду голови ради у 2020 та 2021 роках. Чарльз раніше працював в Oracle (ORCL ) як один із засновників проекту бази даних Oracle 12c. Чарльз має ступінь магістра комп’ютерних наук Університету Вісконсин-Медісон.

Zilliz є командою, яка стоїть за LF AI Milvus®, широко використовуваною відкритою базою даних векторів. Компанія зосереджується на спрощенні управління інфраструктурою даних, маючи на меті зробити штучний інтелект більш доступним для корпорацій, організацій та окремих осіб.

Чи можете Ви поділитися історією заснування Zilliz та чим Вас надихнуло розробити Milvus та зосередитися на базах даних векторів?

Мій шлях у сфері баз даних триває понад 15 років, включаючи шість років як інженер-програміст в Oracle, де я був одним із засновників команди бази даних Oracle 12c. Під час цього часу я помітив ключове обмеження: хоча структуровані дані були добре керованими, неструктуровані дані, які становлять 90% усіх даних, залишалися в основному невикористаними, з лише 1% проаналізованими суттєво.

У 2017 році зростаюча здатність штучного інтелекту обробляти неструктуровані дані стала поворотним моментом. Досягнення в галузі обробки природної мови показали, як неструктуровані дані можна перетворити на векторні вкладення, відкриваючи їх семантичний сенс. Це надихнуло мене заснувати Zilliz з баченням керування “зіллями даних”. Векторні вкладення стали крає stone для мосту між неструктурованими даними та дієвими знаннями. Ми розробили Milvus як спеціально створену базу даних векторів, щоб втіліти це бачення в життя.

За останні два роки галузь підтвердила цей підхід, визнавши бази даних векторів фундаментальними для керування неструктурованими даними. Для нас це не тільки технологія – це про те, щоб надати людині можливість використати потенціал неструктурованих даних у добі штучного інтелекту.

Як змінився шлях Zilliz з моменту його заснування шість років тому, та які ключові виклики Ви зустріли під час піонерства в сфері баз даних векторів?

Шлях був трансформаційний. Коли ми почали Zilliz сім років тому, справжнім викликом не було фінансування чи набір персоналу – це було створення продукту в абсолютно невідомій території. Без існуючих карт, найкращих практик чи усталених очікувань користувачів нам довелося прокладати свій власний шлях.

Наш прорив стався з відкриттям Milvus. Знижуючи бар’єри для прийняття та сприяючи взаємодії спільноти, ми отримали безцінний зворотній зв’язок користувачів, щоб ітерувати та покращувати продукт. Коли Milvus вийшов у 2019 році, у нас було близько 30 користувачів до кінця року. Це виросло до понад 200 у 2020 році та майже 1 000 незабаром після цього.

Сьогодні бази даних векторів перейшли від нової концепції до необхідної інфраструктури в добі штучного інтелекту, підтверджуючи бачення, з яким ми почали.

Як компанія баз даних векторів, які унікальні технічні можливості пропонує Zilliz для підтримки багатомодальної векторної пошуку в сучасних застосунках штучного інтелекту?

Zilliz розробила передові технічні можливості для підтримки багатомодальної векторної пошуку:

  1. Гібридний пошук: Ми дозволяємо одночасний пошук по різних модальностях, таких як поєднання візуальних особливостей зображення з його текстовим описом.
  2. Оптимізовані алгоритми: Пропрієтарні техніки квантування балансують точність виклику та ефективність пам’яті для міжмодальних пошуків.
  3. Реальний час та офлайн-обробка: Наша двоколійна система підтримує низьколатентний реальний час запису та високопродуктивну офлайн-імпорт, забезпечуючи свіжість даних.
  4. Ефективність витрат: Наші розширені екземпляри використовують інтелектуальне шароване сховище для значного зниження витрат на сховище, зберігаючи при цьому високу продуктивність.
  5. Вбудовані моделі штучного інтелекту: Інтегруючи багатомодальні вкладення та моделі ранжування, ми знизили бар’єр для реалізації складних застосунків пошуку.

Ці можливості дозволяють розробникам ефективно обробляти різноманітні типи даних, роблячи сучасні застосунки штучного інтелекту більш надійними та універсальними.

Як Ви бачите розвиток багатомодальної технології RAG для покращення можливостей штучного інтелекту щодо обробки складних реальних даних, таких як зображення, аудіо та відео поряд з текстом?

Багатомодальна технологія RAG (Пошук-з посиленням-генерація) представляє собою ключеву еволюцію штучного інтелекту. Хоча текстова RAG була видатною, більшість підприємств даних охоплює зображення, відео та аудіо. Можливість інтегрувати ці різні формати в робочі процеси штучного інтелекту є критичною.

Цей зсув своєчасний, оскільки спільнота штучного інтелекту обговорює межі доступних інтернет-текстових даних для навчання. Хоча текстові дані є кінцевими, багатомодальні дані залишаються в основному невикористаними – від корпоративних відео до голлівудських фільмів та аудіозаписів.

Багатомодальна технологія RAG розблоковує цей невикористаний резервуар, дозволяючи системам штучного інтелекту обробляти та використовувати ці багаті типи даних. Це не тільки питання подолання нестачі даних – це про розширення меж можливостей штучного інтелекту для кращого розуміння та взаємодії з реальним світом.

Як Zilliz відрізняється від конкурентів на швидко зростаючому ринку баз даних векторів?

Zilliz виділяється через кілька унікальних аспектів:

  1. Двоїстість: Ми є як компанією штучного інтелекту, так і компанією баз даних, спонукаючи межі керування даними та інтеграції штучного інтелекту.
  2. Хмарна конструкція: Milvus 2.0 був першою розподіленою базою даних векторів, яка прийняла архітектуру роз’єднаного сховища та обчислення, забезпечуючи масштабованість та ефективність витрат для понад 100 мільярдів векторів.
  3. Пропрієтарні вдосконалення: Наш двигун Cardinal досягає у 3 рази кращої продуктивності відкритої бази даних Milvus і у 10 разів кращої, ніж у конкурентів. Ми також пропонуємо індексування на диску та інтелектуальне шароване сховище для ефективного масштабування.
  4. Постійне інновування: Від гібридних можливостей пошуку до інструментів міграції, таких як VTS, ми постійно просунуємо технологію баз даних векторів.

Наша прив’язаність до відкритого джерела забезпечує гнучкість, тоді як наш керований сервіс, Zilliz Cloud, пропонує підприємницьку продуктивність з мінімальною операційною складністю.

Чи можете Ви розповісти про значення Zilliz Cloud та його роль у демократизації штучного інтелекту та наданні послуг пошуку векторів малим розробникам та підприємствам?

Пошук векторів використовувався технологічними гігантами з 2015 року, але власні реалізації обмежували його ширше прийняття. В Zilliz ми демократизуємо цю технологію через два взаємодоповнювані підходи:

  1. Відкрите джерело: Milvus дозволяє розробникам будувати та володіти自己的 інфраструктурою пошуку векторів, знижуючи технічні бар’єри.
  2. Керований сервіс: Zilliz Cloud усуває операційний перевитрат, пропонуючи просте та ефективне рішення для підприємств, щоб прийняти пошук векторів без потреби у спеціалізованих інженерів.

Цей подвійний підхід робить пошук векторів доступним як для розробників, так і для підприємств, дозволяючи їм зосередитися на створенні інноваційних застосунків штучного інтелекту.

З прогресом у великих мовних моделях та фундаментальних моделях, що Ви вважаєте наступним великим зрушенням у інфраструктурі даних штучного інтелекту?

Наступним великим зрушенням буде повна трансформація інфраструктури даних штучного інтелекту для обробки неструктурованих даних, які становлять 90% усіх даних. Існуючі системи, розроблені для структурованих даних, не підходять для цього зрушення.

Ця трансформація торкнеться кожного рівня стека даних, від фундаментальних баз даних до протоколів безпеки та систем спостереження. Це не про інкрементальні оновлення – це про створення нових парадигм, адаптованих до складностей неструктурованих даних.

Ця трансформація торкнеться кожного аспекту стека даних:

  • Фундаментальні системи баз даних
  • Пipelines даних та процеси ETL
  • Механізми очищення даних та перетворення
  • Протоколи безпеки та шифрування
  • Фреймворки відповідності та управління
  • Системи спостереження даних

Ми не тільки говоримо про оновлення існуючих систем – ми говоримо про створення цілком нових парадигм. Це як переходити від світу, оптимізованого для організації книг у бібліотеці, до світу, який потребує керування, розуміння та обробки всього інтернету. Це представляє собою цілком новий світ, у якому кожна складова інфраструктури даних може потребувати переосмислення з нуля.

Ця революція переозначить, як ми зберігаємо, керуємо та обробляємо дані, відкриваючи величезні можливості для інновацій штучного інтелекту.

Як інтеграція графічних процесорів NVIDIA (NVDA ) вплинула на продуктивність та масштабованість вашого пошуку векторів?

Інтеграція графічних процесорів NVIDIA суттєво підвищила продуктивність нашого пошуку векторів у двох ключових областях.

По-перше, у будівництві індексу, яке є однією з найбільш обчислювально напружених операцій у базах даних векторів. На відміну від традиційного індексування баз даних, побудова індексу векторів вимагає декілька порядків більше обчислювальної потужності. Використовуючи прискорення графічного процесора, ми суттєво зменшили час побудови індексу, забезпечуючи швидшу інгестію даних та покращену видимість даних.

По-друге, графічні процесори були критичними для високопродуктивних запитів. У застосуваннях, таких як електронна комерція, де системи повинні обробляти тисячі або навіть десятки тисяч запитів на секунду (QPS), паралельні можливості обробки графічного процесора довели свою цінність. Використовуючи прискорення графічного процесора, ми можемо ефективно обробляти ці високовитратні пошуки векторної схожості, зберігаючи при цьому низьку затримку.

Від 2021 року ми співпрацюємо з NVIDIA, щоб оптимізувати наші алгоритми для архітектури графічного процесора, а також розробляти нашу систему для підтримки гетерогенної обчислювальної архітектури. Це надає нашим клієнтам гнучкість у виборі найбільш підходящої апаратної інфраструктури для їхніх конкретних потреб.

Оскільки бази даних векторів відіграють критичну роль у штучному інтелекті, чи бачите Ви їхнє застосування за межами традиційних випадків використання, таких як системи рекомендацій та пошук, у галузях, таких як охорона здоров’я?

Бази даних векторів швидко розширюються за межі традиційних застосунків, таких як системи рекомендацій та пошук, проникаючи в галузі, яких ми раніше не уявляли. Дозвольте мені поділитися деякими прикладами.

У сфері охорони здоров’я та фармацевтичних досліджень бази даних векторів революціонізують відкриття ліків. Молекули можна векторизувати на основі їхніх функціональних властивостей, а за допомогою таких функцій, як пошук діапазону, дослідники можуть виявити всі потенційні кандидати на ліки, які можуть лікувати конкретні захворювання або симптоми. На відміну від традиційних пошуків топ-k, пошук діапазону ідентифікує всі молекули в межах певної відстані від цілі, забезпечуючи повний огляд потенційних кандидатів.

У сфері автономного руху бази даних векторів підвищують безпеку та продуктивність транспортних засобів. Одним із цікавих застосунків є обробка крайових випадків – коли виникають незвичайні ситуації, система може швидко шукати через величезні бази даних подібних ситуацій, щоб знайти відповідні дані для навчання моделей автономного руху.

Ми також бачимо інноваційні застосування в фінансових послугах для виявлення шахрайства, кібербезпеці для виявлення загроз та націленої реклами для покращення взаємодії з клієнтами. Наприклад, у банківських операціях транзакції можна векторизувати та порівняти з історичними моделями, щоб виявити потенційну шахрайську діяльність.

Сила баз даних векторів полягає в їхній здатності зрозуміти та обробити схожість у будь-якій області – чи то молекулярні структури, сценарії руху, фінансові моделі чи загрози безпеки. По мірі розвитку штучного інтелекту ми тільки починаємо розуміти, чого можна досягти. Можливість ефективно обробляти та знаходити закономірності у величезних масивах неструктурованих даних відкриває можливості, яких ми тільки починаємо досліджувати.

Як розробники та підприємства можуть найкраще взаємодіяти з Zilliz та Milvus, щоб використати технологію баз даних векторів у своїх проектах штучного інтелекту?

Є два основні шляхи для використання технології баз даних векторів з Zilliz та Milvus, кожен з яких підходить для різних потреб та пріоритетів. Якщо Ви цінуєте гнучкість та налаштування, Milvus, наш відкритий рішення, є Вашим найкращим вибором. З Milvus Ви можете:

  • Експериментувати вільно та вивчати технологію в своєму темпі
  • Налаштувати рішення згідно з Вашими конкретними вимогами
  • Внесок у розвиток та модифікацію кодової бази
  • Зберігати повний контроль над Вашою інфраструктурою

Однак, якщо Ви хочете зосередитися на побудові свого застосунку без керування інфраструктурою, Zilliz Cloud є оптимальним вибором. Він пропонує:

  • Готове рішення з однією кліком розгортання
  • Підприємницька безпека та відповідність вимогам
  • Висока доступність та стабільність
  • Оптимізована продуктивність без операційної складності

Подумайте про це так: якщо Ви любите “шукати” та хочете максимальної гнучкості, виберіть Milvus. Якщо Ви хочете мінімізувати операційну складність та приступити до побудови свого застосунку, виберіть Zilliz Cloud.

Обидва шляхи приведуть Вас до Вашої мети – це тільки питання того, скільки контролю Ви хочете над процесом проти того, як швидко Ви хочете досягти мети

Дякуємо за велике інтерв’ю, читачам, які бажають дізнатися більше, слід відвідати Zilliz або Milvus.

Антуан є видним лідером і засновником Unite.AI, який рухається незмінною пристрастю до формування та просування майбутнього штучного інтелекту та робототехніки. Як серійний підприємець, він вважає, що штучний інтелект буде таким же революційним для суспільства, як і електрика, і часто захоплюється потенціалом революційних технологій і штучного інтелекту загального призначення.

Як футуролог, він присвячений вивченню того, як ці інновації будуть формувати наш світ. Крім того, він є засновником Securities.io, платформи, орієнтованої на інвестиції в передові технології, які переінакшують майбутнє і змінюють цілі сектори.