Wywiady
Frank Liu, Dyrektor Operacji w Zilliz – Seria Wywiadów

Frank Liu jest Dyrektorem Operacji w Zilliz, wiodącym dostawcą technologii bazy danych wektorowych i sztucznej inteligencji. Są również inżynierami i naukowcami, którzy stworzyli LF AI Milvus®, najpopularniejszą na świecie otwartoźródłową bazę danych wektorowych.
Czym było Twoje pierwsze zetknięcie z machine learningiem?
Moją pierwszą styczność z potęgą ML/AI miałem jako student pierwszego roku na Uniwersytecie Stanforda, pomimo że było to nieco poza moim kierunkiem studiów (inżynieria elektryczna). Początkowo zainteresowałem się inżynierią elektryczną, ponieważ zdolność do redukowania złożonych systemów elektrycznych i fizycznych do matematycznych przybliżeń wydawała mi się bardzo potężna, a statystyka i machine learning wydawały mi się podobne. W trakcie studiów podyplomowych uczestniczyłem w więcej zajęciach związanych z computer vision i machine learningiem, a moja praca magisterska dotyczyła wykorzystania ML do oceny estetycznej piękna obrazów. To wszystko doprowadziło mnie do mojej pierwszej pracy w zespole Computer Vision & Machine Learning w Yahoo, gdzie pełniłem rolę hybrydową, łącząc badania i rozwój oprogramowania. W tym czasie byliśmy jeszcze w erze pre-transformerów AlexNet i VGG, a obserwowanie, jak cała branża i przemysł rozwijają się tak szybko, od przygotowania danych po masowo równoległe szkolenie modeli i wdrożenie modeli, jest naprawdę niesamowite. W wielu ways, wydaje się trochę absurdalne używać frazy “w tamtym czasie”, aby odnosić się do czegoś, co miało miejsce mniej niż 10 lat temu, ale taki jest postęp, jaki został dokonany w tej dziedzinie.
Po pracy w Yahoo, pełniłem funkcję CTO w startupie, który założyłem, gdzie wykorzystywaliśmy ML do lokalizacji wewnątrz pomieszczeń. Tam musieliśmy optymalizować sekwencyjne modele dla bardzo małych mikrokontrolerów – zupełnie inny, ale równie istotny wyzwania inżynieryjne w porównaniu z dzisiejszymi ogromnymi LLM i modelami dyfuzyjnymi. Budowaliśmy również sprzęt, pulpity do wizualizacji i proste aplikacje chmurowe, ale AI/ML zawsze stanowiły podstawowy komponent naszej pracy.
Pomimo że jestem już w branży ML przez około 7 lub 8 lat, nadal darzę ogromną miłością do projektowania obwodów i logiki cyfrowej. Posiadanie wykształcenia w dziedzinie inżynierii elektrycznej jest, w wielu ways, niezwykle pomocne w wielu zadań, które wykonuję obecnie jako Dyrektor Operacji. Wiele ważnych pojęć w projektowaniu cyfrowym, takich jak pamięć wirtualna, predykcja gałęzi i wykonywanie współbieżne w HDL, dostarcza pełnego widoku wielu systemów ML i rozproszonych systemów dzisiaj. Chociaż rozumiem atrakcyjność CS, mam nadzieję, że zobaczę odrodzenie się bardziej tradycyjnych dziedzin inżynierskich – inżynierii elektrycznej, mechanicznej, chemicznej itp. – w ciągu najbliższych kilku lat.
Dla czytelników, którzy nie są zaznajomieni z tym terminem, co to jest nieustrukturyzowane dane?
Nieustrukturyzowane dane odnoszą się do “złożonych” danych, które nie mogą być przechowywane w predefiniowanym formacie ani pasować do istniejącego modelu danych. Dla porównania, dane ustrukturyzowane odnoszą się do dowolnego typu danych, które mają predefiniowaną strukturę – dane numeryczne, ciągi, tabele, obiekty i pary klucz-wartość są wszystkie przykładami danych ustrukturyzowanych.
Aby naprawdę zrozumieć, co to jest nieustrukturyzowane dane i dlaczego tradycyjnie były trudne do przetwarzania komputacyjnego, pomaga porównać je z danymi ustrukturyzowanymi. W najprostszych słowach, tradycyjne dane ustrukturyzowane mogą być przechowywane za pomocą modelu relacyjnego. Weźmy na przykład relacyjną bazę danych z tabelą do przechowywania informacji o książkach: każdy wiersz w tabeli mógłby reprezentować konkretną książkę oznaczoną numerem ISBN, a kolumny oznaczałyby odpowiednią kategorię informacji, taką jak tytuł, autor, data publikacji itd. Dzisiaj istnieją znacznie bardziej elastyczne modele danych – magazyny szerokokolumnowe, bazy danych obiektowych, bazy danych grafowych itd. Ale ogólna idea pozostaje taka sama: te bazy danych są przeznaczone do przechowywania danych, które pasują do określonego wzorca danych lub modelu danych.
Nieustrukturyzowane dane, z drugiej strony, mogą być postrzegane jako praktycznie losowy blob danych binarnych. Mogą reprezentować cokolwiek, być dowolnie dużymi lub małymi i mogą być transformowane i odczytywane na jeden z licznych różnych sposobów. To sprawia, że jest to niemożliwe, aby zmieścić je w jakimkolwiek modelu danych, a tym bardziej w tabeli w relacyjnej bazie danych.
Jakie są przykłady tego typu danych?
Dane generowane przez ludzi – obrazy, wideo, audio, język naturalny itd. – są doskonałymi przykładami nieustrukturyzowanych danych. Ale istnieją również mniej przyziemne przykłady nieustrukturyzowanych danych. Profile użytkowników, struktury białek, sekwencje genomowe i nawet ludzkie kodowanie są również doskonałymi przykładami nieustrukturyzowanych danych. Głównym powodem, dla którego nieustrukturyzowane dane tradycyjnie były tak trudne do zarządzania, jest to, że nieustrukturyzowane dane mogą mieć dowolną postać i mogą wymagać znacznie różnych czasów wykonywania, aby je przetworzyć.
Używając obrazów jako przykładu, dwa zdjęcia tego samego sceny mogłyby mieć znacznie różne wartości pikseli, ale oba mają podobną ogólną treść. Język naturalny jest kolejnym przykładem nieustrukturyzowanych danych, których używam. Frazy “inżynieria elektryczna” i “nauka komputerowa” są niezwykle ściśle powiązane – tak bardzo, że budynki EE i CS na Uniwersytecie Stanforda są sąsiadami – ale bez sposobu na zakodowanie semantycznego znaczenia za tymi dwiema frazami, komputer może naiwnie myśleć, że “nauka komputerowa” i “nauka społeczna” są bardziej powiązane.
Co to jest baza danych wektorowa?
Aby zrozumieć bazę danych wektorową, najpierw trzeba zrozumieć, co to jest embedding. Wrócę do tego za chwilę, ale krótko mówiąc, embedding to jest wektor o wysokiej wymiarowości, który może reprezentować semantykę nieustrukturyzowanych danych. Ogólnie, dwa embeddingi, które są blisko siebie pod względem odległości, są bardzo prawdopodobnie semantycznie podobne. Zmodernizowanym ML, mamy możliwość zakodowania i transformacji różnych typów nieustrukturyzowanych danych – obrazów i tekstu, na przykład – w semantycznie potężne wektory embeddingu.
Od strony organizacyjnej, nieustrukturyzowane dane stają się niezwykle trudne do zarządzania, gdy ich ilość przekracza pewną granicę. To jest miejsce, w którym pojawia się baza danych wektorowa, taka jak Zilliz Cloud. Baza danych wektorowa jest zaprojektowana specjalnie do przechowywania, indeksowania i wyszukiwania ogromnych ilości nieustrukturyzowanych danych, wykorzystując embeddingi jako podstawową reprezentację. Wyszukiwanie w bazie danych wektorowej jest zwykle wykonywane za pomocą wektorów zapytań, a wynikiem zapytania są najlepsze N najbardziej podobne wyniki na podstawie odległości.
Najlepsze bazy danych wektorowe mają wiele funkcji użyteczności tradycyjnych relacyjnych baz danych: skalowanie poziome, buforowanie, replikacja, failover i wykonywanie zapytań są tylko niektórymi z wielu funkcji, które prawdziwa baza danych wektorowa powinna implementować. Jako definiująca kategorię, byliśmy aktywni w kręgach akademickich, publikując prace na SIGMOD 2021 i VLDB 2022, dwóch najważniejszych konferencjach baz danych, które odbywają się dzisiaj.
Czy mógłbyś omówić, co to jest embedding?
Ogólnie rzecz biorąc, embedding to jest wektor o wysokiej wymiarowości, który pochodzi z aktywacji warstwy pośredniej w wielowarstwowej sieci neuronowej. Wiele sieci neuronowych jest szkolonych do wytwarzania samych embeddingów i niektóre aplikacje wykorzystują połączone wektory z wielu warstw pośrednich jako embedding, ale nie będę się tym zajmował teraz. Inny, mniej powszechny, ale równie ważny sposób generowania embeddingów to ręcznie wykonane funkcje. Zamiast pozwalania modelowi ML nauczyć się odpowiednich reprezentacji dla danych wejściowych, dobre stare inżynierowanie funkcji może działać dla wielu aplikacji. Niezależnie od podstawowej metody, embeddingi dla semantycznie podobnych obiektów są blisko siebie pod względem odległości, a ta właściwość napędza bazy danych wektorowe.
Jakie są najpopularniejsze przypadki użycia tej technologii?
Bazy danych wektorowe są idealne dla każdej aplikacji, która wymaga pewnej formy wyszukiwania semantycznego – rekomendacja produktów, analiza wideo, wyszukiwanie dokumentów, wykrywanie zagrożeń i oszustw oraz chatboty AI to niektóre z najpopularniejszych przypadków użycia baz danych wektorowych dzisiaj. Aby zilustrować to, Milvus, otwarta baza danych wektorowa stworzona przez Zilliz i podstawowy rdzeń Zilliz Cloud, została wykorzystana przez ponad tysiąc użytkowników przedsiębiorstw w różnych przypadkach użycia.
Lubię rozmawiać o tych aplikacjach i pomagać ludziom zrozumieć, jak one działają, ale naprawdę lubię omawiać mniej znane przypadki użycia baz danych wektorowych. Odkrywanie nowych leków jest jednym z moich ulubionych “nich” przypadków użycia baz danych wektorowych. Wyzwaniem dla tej aplikacji jest wyszukiwanie potencjalnych kandydatów na leki w celu leczenia określonej choroby lub objawu wśród bazy 800 milionów związków. Firma farmaceutyczna, z którą komunikowaliśmy się, była w stanie znacznie poprawić proces odkrywania leków, a także obniżyć zużycie zasobów sprzętowych, łącząc Milvus z biblioteką chemioinformatyczną o nazwie RDKit.
Cleveland Museum of Art’s (CMA) AI ArtLens to kolejny przykład, który lubię przytaczać. AI ArtLens to interaktywne narzędzie, które pobiera obraz zapytania jako dane wejściowe i pobiera wizualnie podobne obrazy z bazy danych muzeum. To jest zwykle określane jako odwrotne wyszukiwanie obrazu i jest dość powszechnym przypadkiem użycia baz danych wektorowych, ale unikalną wartością, którą Milvus zapewnił CMA, była możliwość uruchomienia aplikacji w ciągu tygodnia z bardzo małym zespołem.
Czy mógłbyś omówić, co to jest platforma open-source Towhee?
Prowadząc rozmowy z ludźmi z społeczności Milvus, stwierdziliśmy, że wielu z nich chciałoby mieć ujednolicony sposób generowania embeddingów dla Milvus. To było prawdą dla niemal wszystkich organizacji, z którymi rozmawialiśmy, szczególnie dla firm, które nie miały wielu inżynierów ML. Z Towhee, staramy się rozwiązać tę lukę za pomocą tego, co nazywamy “vector data ETL”. Podczas gdy tradycyjne potoki ETL koncentrują się na łączeniu i transformowaniu danych ustrukturyzowanych z wielu źródeł w użyteczny format, Towhee jest przeznaczony do pracy z nieustrukturyzowanymi danymi i wyraźnie obejmuje ML w wynikowym potoku ETL. Towhee osiąga to, zapewniając setki modeli, algorytmów i transformacji, które mogą być używane jako bloki budulcowe w potoku ETL danych wektorowych. Dodatkowo, Towhee zapewnia łatwy w użyciu interfejs API w Pythonie, który pozwala deweloperom budować i testować te potoki ETL w jednej linii kodu.
Pomimo że Towhee jest niezależnym projektem, jest również częścią szerszego ekosystemu baz danych wektorowych skupionego wokół Milvus, który tworzy Zilliz. Wyobrażamy sobie Milvus i Towhee jako dwa projekty, które są wysoko komplementarne i które, gdy są używane razem, mogą naprawdę udemokratyzować przetwarzanie nieustrukturyzowanych danych.
Zilliz niedawno pozyskał 60 milionów dolarów w rundzie Series B. Jak to przyspieszy misję Zilliz?
Chciałbym najpierw podziękować Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital i innym za wiarę w misję Zilliz i wsparcie nas w tej rundzie Series B. Pozyskaliśmy łącznie 113 milionów dolarów, a ta najnowsza runda finansowania wesprze nasze starania, aby skalować zespoły inżynierskie i marketingowe. W szczególności, poprawimy naszą zarządzaną ofertę chmurową, która jest obecnie w wersji beta, ale planowana do otwarcia dla wszystkich jeszcze w tym roku. Będziemy również kontynuować inwestowanie w najnowsze badania nad bazami danych i AI, tak jak robiliśmy to przez ostatnie 4 lata.
Czy jest coś jeszcze, co chciałbyś podzielić o Zilliz?
Jako firma, rozwijamy się bardzo szybko, ale to, co naprawdę wyróżnia nasz obecny zespół od innych w branży baz danych i ML, to nasza wyjątkowa pasja do tego, co budujemy. Jesteśmy na misji, aby udemokratyzować przetwarzanie nieustrukturyzowanych danych, a jest to absolutnie niesamowite, widząc tak wielu utalentowanych ludzi w Zilliz, pracujących nad jednym celem. Jeśli cokolwiek z tego, co robimy, wydaje się interesujące, nie wahaj się skontaktować się z nami. Chcielibyśmy, abyś do nas dołączył.
Jeśli chcesz dowiedzieć się więcej, jestem również osobiste osiągalny do rozmowy o Zilliz, bazach danych wektorowych lub postępach w AI/ML. Moje (figuratywne) drzwi są zawsze otwarte, więc nie wahaj się, skontaktuj się ze mną bezpośrednio na Twitterze/LinkedIn.
Na koniec, dziękuję za czytanie!
Dziękujemy za wspaniały wywiad, czytelnicy, którzy chcą dowiedzieć się więcej, powinni odwiedzić Zilliz.












