Rozhovory
Frank Liu, ředitel operací ve společnosti Zilliz – rozhovor

Frank Liu je ředitel operací ve společnosti Zilliz, která je předním poskytovatelem vektorových databází a technologií umělé inteligence. Jsou také inženýři a vědci, kteří vytvořili LF AI Milvus®, nejpopulárnější open-source vektorovou databázi.
Co vás původně přitáhlo k strojovému učení?
Moje první zkušenost se silou ML/AI byla jako student bakalářského studia na Stanfordu, přestože to bylo trochu mimo můj obor (elektrotechnika). Původně mě přitahovala elektrotechnika jako obor, protože schopnost zjednodušit komplexní elektrické a fyzikální systémy na matematické aproximace mi připadala velmi silná, a statistika a strojové učení mi připadaly podobné. Nakonec jsem během postgraduálního studia absolvoval více kurzů počítačového vidění a strojového učení a napsal svou diplomovou práci o použití ML pro hodnocení estetické krásy obrázků. To vše mě vedlo k mé první práci v týmu počítačového vidění a strojového učení v Yahoo, kde jsem měl hybridní roli výzkumu a softwarového vývoje. Byli jsme ještě v době před transforméry AlexNet a VGG, a vidět, jak se celý obor a průmysl tak rychle mění, od přípravy dat po masivně paralelní trénování modelů a produkci modelů, je úžasné. Mnohými způsoby to feels a bit absurdní používat frázi “předtím” pro něco, co se stalo méně než před 10 lety, ale takový je pokrok, který byl v tomto oboru učiněn.
Po Yahoo jsem působil jako technický ředitel startupu, který jsem spoluzakládal, kde jsme využívali ML pro indoor lokalizaci. Tam jsme museli optimalizovat sekvenční modely pro velmi malé mikrokontroléry – velmi odlišný, ale stejně tak související inženýrský problém jako dnešní velké LLM a difuzní modely. Také jsme vyvinuli hardware, dashboardy pro vizualizaci a jednoduché cloud-native aplikace, ale AI/ML vždy tvořily jádro naší práce.
Přestože jsem již 7 nebo 8 let v oboru ML nebo v jeho blízkosti, stále mám rád obor elektrotechniky a digitální logiky. Mít zázemí v elektrotechnice je mnoha způsoby nesmírně užitečné pro mnoho práce, které dělám dnes. Mnohé důležité koncepty v digitálním designu, jako je virtuální paměť, predikce větvení a současná exekuce v HDL, poskytují úplný přehled o mnoha ML a distribuovaných systémech dnes. Přestože chápu lákadlo CS, doufám, že uvidíme oživení tradičních inženýrských oborů – elektrotechnika, mechanika, chemie atd. – v příštích pár letech.
Pro čtenáře, kteří nejsou seznámeni s termínem, co je nestrukturovaná data?
Nestrukturovaná data se týkají “komplexních” dat, které nelze uložit v předem definovaném formátu nebo se nehodí do existujícího datového modelu. Pro srovnání, strukturovaná data se týkají libovolného typu dat, který má předem definovanou strukturu – numerická data, řetězce, tabulky, objekty a klíčové hodnoty jsou všechny příklady strukturovaných dat.
Abyste skutečně pochopili, co jsou nestrukturovaná data a proč je tradičně obtížné je zpracovávat, pomáhá je srovnat se strukturovanými daty. V nejzákladnějším smyslu lze tradiční strukturovaná data uložit pomocí relačního modelu. Představte si relační databázi s tabulkou pro uložení informací o knihách: každá řádek v tabulce by mohl reprezentovat konkrétní knihu indexovanou podle čísla ISBN, zatímco sloupce by označovaly odpovídající kategorii informací, jako je název, autor, datum vydání a tak dále. Dnes existují mnohem flexibilnější datové modely – široké sloupcové úložiště, objektové databáze, grafické databáze a tak dále. Ale celková myšlenka zůstává stejná: tyto databáze jsou určeny k uložení dat, která se hodí do určitého datového modelu.
Nestrukturovaná data, na druhé straně, lze považovat za jakýsi pseudo-náhodný binární datový blob. Může reprezentovat cokoliv, může být libovolně velké nebo malé a může být transformováno a přečteno mnoha různými způsoby. To činí nemožným uložit je do jakékoli datové struktury, natož do tabulky v relační databázi.
Jaké jsou některé příklady tohoto typu dat?
Lidská data – obrázky, videa, audio, přirozený jazyk atd. – jsou skvělé příklady nestrukturovaných dat. Ale existují i méně všední příklady nestrukturovaných dat. Uživatelské profily, proteinové struktury, genové sekvence a dokonce i lidsky čitelný kód jsou také skvělé příklady nestrukturovaných dat. Hlavním důvodem, proč byla nestrukturovaná data tradičně tak obtížná na zpracování, je, že nestrukturovaná data mohou mít jakoukoli formu a mohou vyžadovat velmi odlišné časy zpracování.
Používání obrázků jako příkladu, dvě fotografie stejné scény by mohly mít velmi odlišné pixelové hodnoty, ale obě by měly podobný celkový obsah. Přirozený jazyk je dalším příkladem nestrukturovaných dat, o kterých rádi mluvím. Fráze “elektrotechnika” a “počítačová věda” jsou extrémně úzce související – tak úzce, že budovy elektrotechniky a počítačové vědy na Stanfordu jsou vedle sebe – ale bez způsobu, jak zakódovat semantický význam za těmito dvěma frázemi, počítač by mohl naivně myslet, že “počítačová věda” a “sociální věda” jsou více související.
Co je vektorová databáze?
Abyste pochopili vektorovou databázi, musíte nejprve pochopit, co je vkládání. O tom budu mluvit později, ale stručně řečeno, vkládání je vysokodimenzionální vektor, který může reprezentovat semantiku nestrukturovaných dat. Obecně platí, že dvě vkládání, která jsou blízko sebe vzdáleností, jsou velmi pravděpodobně semanticky podobná vstupním datům. Díky modernímu ML máme sílu zakódovat a transformovat různá nestrukturovaná data – obrázky a text, například – do semanticky silných vektorů.
Z pohledu organizace se nestrukturovaná data stávají extrémně obtížnými na zpracování, jakmile jejich množství přesáhne určitou hranici. Zde přichází vektorová databáze, jako je Zilliz Cloud. Vektorová databáze je speciálně navržena pro uložení, indexování a vyhledávání velkých množství nestrukturovaných dat pomocí vkládání jako základního представování. Vyhledávání v vektorové databázi se obvykle provádí pomocí dotazovacích vektorů a výsledkem dotazu jsou top N nejpodobnějších výsledků na základě vzdálenosti.
Nejlepší vektorové databáze mají mnoho funkcí tradičních relačních databází: horizontální škálování, caching, replikace, failover a spouštění dotazů jsou jen některé z mnoha funkcí, které by měla mít skutečná vektorová databáze. Jako kategorie definující jsme byli aktivní v akademických kruzích a publikovali články v SIGMOD 2021 a VLDB 2022, dvou top databázových konferencích.
Můžete diskutovat, co je vkládání?
Obecně řečeno, vkládání je vysokodimenzionální vektor, který pochází z aktivací mezilehlé vrstvy v multilayerovém neuronovém sítí. Mnohé neuronové sítě jsou trénovány na výstup vkládání a některé aplikace používají konkatenoované vektory z více mezilehlých vrstev jako vkládání, ale na to se nyní nebudu pouštět. Další méně častý, ale stejně důležitý způsob generování vkládání je prostřednictvím ručně vytvořených funkcí. Místo toho, aby se ML model automaticky naučil správné reprezentace pro vstupní data, dobrá stará funkce inženýrství může fungovat pro mnoho aplikací. Bez ohledu na základní metodu jsou vkládání pro semanticky podobné objekty blízko sebe vzdáleností, a tato vlastnost je to, co pohání vektorové databáze.
Jaké jsou některé z nejpopulárnějších použití této technologie?
Vektorové databáze jsou skvělé pro libovolnou aplikaci, která vyžaduje some formu semantického vyhledávání – produktové doporučení, video analýza, dokumentové vyhledávání, detekce hrozeb a podvodu a AI poháněné chatboty jsou některé z nejpopulárnějších použití vektorových databází dnes. Pro ilustraci, Milvus, open-source vektorová databáze vytvořená Zilliz a základní jádro Zilliz Cloud, byla použita více než tisícem podnikových uživatelů napříč různými použitími.
Rád bych diskutoval o těchto aplikacích a pomáhal lidem pochopit, jak fungují, ale také jsem rád, když diskutuji o méně známých použití vektorových databází. Nový objev léků je jedním z mých oblíbených “nišových” použití vektorových databází. Výzvou pro tuto konkrétní aplikaci je vyhledávání potenciálních kandidátních léků na léčbu určité nemoci nebo symptomu v databázi 800 milionů sloučenin. Farmaceutická společnost, se kterou jsme komunikovali, byla schopna výrazně zlepšit proces objevu léků a snížit hardwarové zdroje kombinací Milvus s chemickou knihovnou RDKit.
Cleveland Museum of Art’s (CMA) AI ArtLens je dalším příkladem, o kterém rádi mluvím. AI ArtLens je interaktivní nástroj, který bere dotazový obrázek jako vstup a vyhledává vizuálně podobné obrázky z databáze muzea. To se obvykle nazývá reverzní obrazové vyhledávání a je poměrně častým použitím vektorových databází, ale jedinečná hodnota, kterou Milvus poskytl CMA, byla schopnost dostat aplikaci do provozu do týdne s velmi malým týmem.
Můžete diskutovat, co je open-source platforma Towhee?
Když komunikujeme s lidmi z komunity Milvus, zjistili jsme, že mnozí z nich chtěli mít sjednocený způsob generování vkládání pro Milvus. To bylo pravdou pro téměř všechny různé organizace, se kterými jsme mluvili, ale zejména pro společnosti, které neměly mnoho inženýrů strojového učení. S Towhee se snažíme vyřešit tuto mezeru pomocí toho, co nazýváme “vektorová data ETL”. Zatímco tradiční ETL pipeline se zaměřují na kombinování a transformaci strukturovaných dat z více zdrojů do použitelného formátu, Towhee je určen pro práci s nestrukturovanými daty a explicitně zahrnuje ML do výsledného ETL pipeline. Towhee to dělá poskytováním stovek modelů, algoritmů a transformací, které lze použít jako stavební bloky v pipeline vektorových dat ETL. Kromě toho Towhee také poskytuje snadno použitelné Python API, které umožňuje vývojářům vytvářet a testovat tyto ETL pipeline v jediné řádce kódu.
Zatímco Towhee je jeho vlastní nezávislý projekt, je také součástí širšího ekosystému vektorových databází, který Zilliz vytváří. Představujeme si Milvus a Towhee jako dva vysoce komplementární projekty, které, když se používají společně, mohou skutečně demokratizovat zpracování nestrukturovaných dat.
Zilliz nedávno získala 60 milionů dolarů v rámci série B. Jak to urychlí misi Zilliz?
Chtěl bych nejprve poděkovat Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital a dalším za to, že věří v misi Zilliz a podporují nás touto sérií B. Nyní jsme získali celkem 113 milionů dolarů a tato poslední série financování bude podporovat naše úsilí o škálování inženýrských a marketingových týmů. Konkrétně budeme zlepšovat naše spravované cloudové nabídky, které jsou aktuálně v rané fázi, ale které se plánují otevřít všem později v tomto roce. Budeme také pokračovat ve investicích do špičkového výzkumu databází a AI, jak jsme dělali v posledních 4 letech.
Je něco jiného, co byste rádi sdíleli o Zilliz?
Jako společnost rosteme rychle, ale to, co naší současnou tým odlišuje od ostatních v oblasti databází a ML, je naše jedinečná vášeň pro to, co stavíme. Jsme na misi demokratizovat zpracování nestrukturovaných dat, a je absolutně úžasné vidět tolik talentovaných lidí v Zilliz, kteří pracují na jednom cíli. Pokud vás něco z toho, co děláme, zajímá, neváhejte kontaktovat nás. Rádi bychom vás měli na palubě.
Pokud chcete vědět více, jsem také osobně otevřen k diskusi o Zilliz, vektorových databázích nebo pokroku v oblasti AI/ML. Moje (figurativní) dveře jsou vždy otevřené, takže neváhejte kontaktovat mě přímo na Twitteru/LinkedIn.
Nakonec bych chtěl říci díky za čtení!
Děkuji za skvělý rozhovor, čtenáři, kteří chtějí vědět více, by měli navštívit Zilliz.












