Интервью
Франк Лю, Директор по операциям в Zilliz – Интервью

Франк Лю является Директором по операциям в Zilliz, ведущим поставщиком векторных баз данных и технологий ИИ. Они также являются инженерами и учеными, создавшими LF AI Milvus®, самую популярную открытую векторную базу данных в мире.
Что изначально привлекло вас к машинному обучению?
Мое первое знакомство с мощью МО/ИИ было во время учебы в Стэнфордском университете, несмотря на то, что это было немного в стороне от моей специальности (электротехника). Меня изначально привлекла электротехника как область, потому что возможность свести сложные электрические и физические системы к математическим приближениям казалась мне очень мощной, и статистика и машинное обучение казались мне похожими. В итоге я прошел больше курсов по компьютерному зрению и машинному обучению во время аспирантуры, и я написал свою магистерскую диссертацию на тему использования МО для оценки эстетической красоты изображений. Все это привело меня к моей первой работе в команде компьютерного зрения и машинного обучения в Yahoo, где я был в гибридной исследовательской и разработческой роли. Мы были еще в предтрансформерные дни AlexNet и VGG, и наблюдение за тем, как вся область и отрасль движутся так быстро, от подготовки данных до массового параллельного обучения моделей и производственной реализации моделей, было удивительным. Во многих отношениях, кажется немного нелепым использовать фразу “в те дни”, чтобы сослаться на что-то, что произошло менее 10 лет назад, но такой является прогресс, достигнутый в этой области.
После Yahoo я служил в качестве технического директора стартапа, который я основал, где мы использовали МО для индор-локализации. Там мы должны были оптимизировать последовательные модели для очень маленьких микроконтроллеров – очень другая, но не менее связанная инженерная задача с сегодняшними массивными ЛМО и диффузионными моделями. Мы также построили аппаратуру, панели для визуализации и простые облачные приложения, но ИИ/МО всегда служили основным компонентом работы, которую мы выполняли.
Несмотря на то, что я уже около 7 или 8 лет работаю в области МО или смежных с ней, я все еще сохраняю большую любовь к проектированию схем и цифровой логике. Имея背景 в электротехнике, я могу сказать, что это очень полезно для многих работ, которыми я занимаюсь сегодня. Многие важные концепции цифрового дизайна, такие как виртуальная память, предсказание ветвлений и параллельное выполнение в HDL, помогают мне иметь полноценный взгляд на многие системы МО и распределенные системы сегодня. Хотя я понимаю привлекательность компьютерных наук, я надеюсь увидеть возрождение более традиционных инженерных областей – электротехники, механики, химии и т. д. – в течение следующих пары лет.
Для читателей, которые не знакомы с термином, что такое неструктурированные данные?
Неструктурированные данные относятся к “сложным” данным, которые по сути являются данными, которые не могут быть хранены в предопределенной форме или вписаны в существующую модель данных. Для сравнения, структурированные данные относятся к любому типу данных, имеющего предопределенную структуру – числовые данные, строки, таблицы, объекты и хранилища ключ/значение являются всеми примерами структурированных данных.
Чтобы по-настоящему понять, что такое неструктурированные данные и почему они традиционно были трудными для вычислительной обработки, помогает сравнить их с структурированными данными. В самых простых терминах традиционные структурированные данные могут быть хранены через реляционную модель. Возьмем, к примеру, реляционную базу данных с таблицей для хранения информации о книгах: каждая строка в таблице могла представлять конкретную книгу, проиндексированную по номеру ISBN, а столбцы бы обозначали соответствующую категорию информации, такую как название, автор, дата публикации и т. д. Сегодня существуют гораздо более гибкие модели данных – ширококолонные хранилища, объектные базы данных, графовые базы данных и т. д. Но общая идея остается той же: эти базы данных предназначены для хранения данных, которые соответствуют определенной форме данных или модели данных.
Неструктурированные данные, с другой стороны, можно рассматривать как по сути псевдослучайный бинарный данные. Они могут представлять все, быть произвольно большими или маленькими и могут быть преобразованы и прочитаны одним из бесчисленных способов. Это делает их невозможными для вписывания в любую модель данных, не говоря уже о таблице в реляционной базе данных.
Какие примеры этого типа данных?
Данные, созданные человеком – изображения, видео, аудио, естественный язык и т. д. – являются отличными примерами неструктурированных данных. Но есть много менее обыденных примеров неструктурированных данных. Профили пользователей, структуры белков, геномные последовательности и даже человекочитаемый код являются отличными примерами неструктурированных данных. Основная причина, по которой неструктурированные данные традиционно были так трудны в управлении, заключается в том, что неструктурированные данные могут иметь любую форму и могут требовать сильно различающихся runtime для обработки.
Используя изображения в качестве примера, два фотографии одной и той же сцены могли иметь сильно различающиеся значения пикселей, но обе имеют одинаковый общий контент. Естественный язык является еще одним примером неструктурированных данных, который я люблю называть. Фразы “Электротехника” и “Компьютерные науки” чрезвычайно тесно связаны – настолько, что здания ЭЭ и КН в Стэнфордском университете расположены рядом друг с другом – но без способа закодировать семантический смысл за этими двумя фразами, компьютер может наивно подумать, что “Компьютерные науки” и “Социальные науки” более связаны.
Что такое векторная база данных?
Чтобы понять векторную базу данных, сначала нужно понять, что такое вложение. Я расскажу об этом чуть позже, но коротко говоря, вложение – это высокоразмерный вектор, который может представлять семантику неструктурированных данных. В целом, два вложения, которые близки друг к другу в терминах расстояния, очень вероятно соответствуют семантически подобным входным данным. С помощью современного МО мы имеем возможность закодировать и преобразовать различные типы неструктурированных данных – изображения и текст, например – в семантически мощные векторы вложений.
С точки зрения организации неструктурированные данные становятся невероятно трудными в управлении, как только их количество превышает определенный предел. Вот где появляется векторная база данных, такая как Zilliz Cloud. Векторная база данных предназначена для хранения, индексации и поиска по огромным количествам неструктурированных данных, используя вложения в качестве основного представления. Поиск по векторной базе данных обычно выполняется с помощью запросных векторов, и результатом запроса являются топ-N наиболее подобных результатов на основе расстояния.
Лучшие векторные базы данных имеют многие из функций удобства традиционных реляционных баз данных: горизонтальное масштабирование, кэширование, репликация, отработка отказов и выполнение запросов – лишь некоторые из многих функций, которые должна реализовать настоящая векторная база данных. Как определитель категории, мы были активны в академических кругах, опубликовав статьи в SIGMOD 2021 и VLDB 2022, двух лучших конференций по базам данных, которые существуют сегодня.
Можете ли вы рассказать, что такое вложение?
В целом, вложение – это высокоразмерный вектор, который возникает из активаций промежуточного слоя в многослойной нейронной сети. Многие нейронные сети обучены выводить вложения сами по себе, и некоторые приложения используют конкатенированные векторы из нескольких промежуточных слоев в качестве вложения, но я не буду слишком глубоко вдаваться в это сейчас. Другой, менее распространенный, но не менее важный способ генерации вложений – через手工rafted особенности. Вместо того, чтобы иметь модель МО, которая автоматически учит правильные представления для входных данных, хороший старый инжиниринг особенностей может работать для многих приложений. Независимо от основного метода, вложения для семантически подобных объектов близки друг к другу в терминах расстояния, и это свойство является тем, что дает силу векторным базам данных.
Какие наиболее популярные случаи использования этой технологии?
Векторные базы данных отлично подходят для любого приложения, которое требует некоторой формы семантического поиска – рекомендации продуктов, анализ видео, поиск документов, обнаружение угроз и мошенничества и ИИ-чаты – некоторые из наиболее популярных случаев использования векторных баз данных сегодня. Чтобы проиллюстрировать это, Milvus, открытая векторная база данных, созданная Zilliz и лежащая в основе Zilliz Cloud, была использована более чем тысячей корпоративных пользователей по различным случаям использования.
Мне всегда приятно говорить об этих приложениях и помогать людям понять, как они работают, но я также очень люблю обсуждать некоторые менее известные случаи использования векторных баз данных. Открытие новых лекарств является одним из моих любимых “нишевых” случаев использования векторных баз данных. Задача для этого конкретного приложения заключается в поиске потенциальных кандидатов на лекарства для лечения определенного заболевания или симптома среди базы данных из 800 миллионов соединений. Фармацевтическая компания, с которой мы общались, смогла значительно улучшить процесс открытия лекарств, а также сократить аппаратные ресурсы, объединив Milvus с хеминформатической библиотекой RDKit.
Интерактивный инструмент Cleveland Museum of Art (CMA) AI ArtLens является еще одним примером, который я люблю приводить. AI ArtLens – это интерактивный инструмент, который принимает запросное изображение в качестве входных данных и извлекает визуально подобные изображения из базы данных музея. Это обычно называется обратным поиском изображений и является довольно распространенным случаем использования векторных баз данных, но уникальная ценность, которую Milvus предоставил CMA, заключалась в том, чтобы получить приложение в работу в течение недели с очень маленькой командой.
Можете ли вы рассказать, что такое открытая платформа Towhee?
Когда мы общались с людьми из сообщества Milvus, мы обнаружили, что многие из них хотели иметь унифицированный способ генерации вложений для Milvus. Это было верно для почти всех различных организаций, с которыми мы говорили, но особенно для компаний, которые не имели многих инженеров-машинного обучения. С помощью Towhee мы стремимся решить этот пробел через то, что мы называем “векторной данным ETL”. Хотя традиционные конвейеры ETL фокусируются на объединении и преобразовании структурированных данных из нескольких источников в пригодный для использования формат, Towhee предназначен для работы с неструктурированными данными и явно включает МО в результирующий конвейер ETL. Towhee достигает этого, предоставляя сотни моделей, алгоритмов и преобразований, которые можно использовать в качестве строительных блоков в конвейере векторных данных ETL. Кроме того, Towhee также предоставляет простой в использовании Python API, который позволяет разработчикам строить и тестировать эти конвейеры ETL в одной строке кода.
Хотя Towhee является самостоятельным проектом, он также является частью более широкой экосистемы векторных баз данных, центром которой является Milvus, создаваемой Zilliz. Мы представляем себе Milvus и Towhee как два высококомплементарных проекта, которые, когда используются вместе, могут по-настоящему демократизировать обработку неструктурированных данных.
Zilliz недавно подняла $60M в раунде серии B. Как это ускорит миссию Zilliz?
Сначала я хотел бы поблагодарить Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital и других за то, что они поверили в миссию Zilliz и поддержали нас с этим расширением серии B. Мы теперь подняли в общей сложности $113M, и этот последний раунд финансирования будет поддерживать наши усилия по масштабированию инженерных и маркетинговых команд. В частности, мы будем улучшать нашу управляемую облачную пропозицию, которая в настоящее время находится в раннем доступе, но запланирована на открытие для всех позже в этом году. Мы также продолжим инвестировать в передовые исследования баз данных и ИИ, как мы делали в течение последних 4 лет.
Есть ли что-то еще, что вы хотели бы поделиться о Zilliz?
Как компания, мы растем быстро, но то, что действительно отличает нашу текущую команду от других в области баз данных и МО, – это наша единственная страсть к тому, что мы строим. Мы на миссии по демократизации обработки неструктурированных данных, и это абсолютно удивительно видеть так много талантливых людей в Zilliz, работающих над единой целью. Если что-то из того, что мы делаем, кажется вам интересным, не стесняйтесь связаться с нами. Мы бы с радостью приняли вас на борт.
Если вы хотите узнать немного больше, я также лично открыт для общения о Zilliz, векторных базах данных или связанных с ними достижениях в области ИИ/МО. Моя (фигуративная) дверь всегда открыта, поэтому не стесняйтесь связаться со мной напрямую в Twitter/LinkedIn.
Наконец, спасибо за чтение!
Спасибо за отличное интервью, читателям, которые хотят узнать больше, следует посетить Zilliz.












