Intervjuer

Frank Liu, direktør for operasjoner i Zilliz – Intervju-serie

mm
Legg til Unite.AI blant dine foretrukne kilder på Google

Frank Liu er direktør for operasjoner i Zilliz, en ledende leverandør av vektor database og AI-teknologier. De er også ingeniører og forskere som har skapt LF AI Milvus®, verdens mest populære åpne vektor database.

Hva var det som først tiltalte deg om maskinlæring?

Min første introduksjon til kraften av ML/AI var som student ved Stanford, til tross for at det var litt utenfor mitt hovedfag (Elektroingeniør). Jeg ble først tiltalt til EE som et felt fordi evnen til å destillere komplekse elektriske og fysiske systemer til matematiske approksimasjoner føltes veldig kraftfull for meg, og statistikk og maskinlæring føltes likt. Jeg endte opp med å ta flere klasser i datavisning og maskinlæring under min master, og jeg skrev min masteroppgave om å bruke ML til å score den estetiske skjønnheten til bilder. Alt dette ledet til min første jobb i Computer Vision & Machine Learning-teamet i Yahoo, hvor jeg var i en hybrid forsknings- og programvareutviklingsrolle. Vi var fortsatt i pre-transformator-dagene med AlexNet og VGG, og å se et helt felt og industri bevege seg så raskt, fra dataforberedelse til massivt parallelt modelltrening til modellproduksjon, har vært fantastisk. På mange måter føles det litt latterlig å bruke uttrykket “i gamle dager” for å referere til noe som skjedde mindre enn 10 år siden, men slik er fremgangen som er gjort i dette feltet.

Etter Yahoo, tjenestegjorde jeg som CTO i et startup som jeg var med å grunnlegge, hvor vi utnyttet ML for innendørs lokaliseringsformål. Der måtte vi optimere sekvensielle modeller for veldig små mikrokontrollere – en veldig forskjellig, men likevel beslektet ingeniørutfordring til dagens massive LLM-er og diffusjonsmodeller. Vi bygget også hardware, dashboards for visualisering og enkle skybaserte applikasjoner, men AI/ML tjente alltid som en kjernekomponent i arbeidet vi gjorde.

Til tross for at jeg har vært i eller i nærheten av ML i bedre del av 7 eller 8 år nå, har jeg fortsatt en stor kjærlighet for kretsdesign og digital logikk. Å ha en bakgrunn i Elektroingeniør er, på mange måter, veldig hjelpsomt for mye av arbeidet jeg er involvert i disse dagene. Mange viktige konsepter i digital design, som virtuell minne, grenprediksjon og samtidig eksekvering i HDL, gir en fullstendig oversikt over mye av ML og distribuerte systemer i dag. Mens jeg forstår tiltrekningen av CS, håper jeg å se en fornyelse i mer tradisjonelle ingeniørfag – EE, MechE, ChemE osv. – innen de neste par årene.

Hva er ustrukturert data for noen som ikke kjenner til begrepet?

Ustrukturert data refererer til “kompleks” data, som i realiteten er data som ikke kan lagres i en forhåndsdefinert format eller passe inn i en eksisterende datamodell. For sammenligning, strukturert data refererer til enhver type data som har en forhåndsdefinert struktur – numerisk data, strenger, tabeller, objekter og nøkkel/verdi-lagre er alle eksempler på strukturert data.

For å virkelig forstå hva ustrukturert data er og hvorfor det tradisjonelt har vært vanskelig å prosessere dette type data komputasjonelt, hjelper det å sammenligne det med strukturert data. I de enkleste termer kan tradisjonelt strukturert data lagres via en relasjonsmodell. Ta for eksempel en relasjonsdatabase med en tabel for å lagre informasjon om bøker: hver rad i tabellen kunne representere en bestemt bok indexert etter ISBN-nummer, mens kolonnene ville angi den tilsvarende kategorien av informasjon, som tittel, forfatter, utgivelsesdato osv. I dag er det mye mer fleksible datamodeller – wide-column stores, objektbaserte databaser, grafdatamodeller osv. – men den overordnede ideen forblir den samme: disse databaseene er ment å lagre data som passer en bestemt datamodell.

Ustrukturert data, på den andre siden, kan tenkes som en pseudo-tilfeldig blob av binærdata. Det kan representere hva som helst, være arbitrært stort eller lite, og kan transformeres og leses på en av mange måter. Dette gjør det umulig å passe inn i noen datamodell, la alene en tabel i en relasjonsdatabase.

Hva er noen eksempler på denne type data?

Menneskeskapt data – bilder, video, lyd, naturlig språk osv. – er gode eksempler på ustrukturert data. Men det finnes også en rekke mindre hverdagslige eksempler på ustrukturert data. Brukerprofiler, proteinstrukturer, genomsekvenser og selv menneskelesbart kode er også gode eksempler på ustrukturert data. Den primære grunnen til at ustrukturert data tradisjonelt har vært så vanskelig å håndtere er at ustrukturert data kan ta noen form og kan kreve veldig forskjellige kjøretider for å prosessere.

Med bilder som eksempel, kunne to bilder av samme scenen ha veldig forskjellige pikselverdier, men begge har en lignende totalinnhold. Naturlig språk er et annet eksempel på ustrukturert data som jeg liker å referere til. Uttrykkene “Elektroingeniør” og “Datavitenskap” er ekstremt nært beslektet – så mye at EE- og CS-bygningene ved Stanford er like ved siden av hverandre – men uten en måte å kode den semantiske betydningen bak disse to uttrykkene på, kunne en datamaskin naivt tro at “Datavitenskap” og “Sosialvitenskap” er mer beslektet.

Hva er en vektor database?

For å forstå en vektor database, hjelper det først å forstå hva en innkapsling er. Jeg kommer til det om et øyeblikk, men den korte versjonen er at en innkapsling er en høydimensjonal vektor som kan representere semantikken til ustrukturert data. I allminnelighet er to innkapslinger som er nære hverandre i termer av avstand, veldig sannsynlig å korrespondere til semantisk like inputdata. Med moderne ML har vi kraften til å kode og transformere en rekke ulike typer ustrukturert data – bilder og tekst, for eksempel – til semantisk kraftfulle innkapslingsvektorer.

Fra en organisasjonssynspunkt, blir ustrukturert data veldig vanskelig å håndtere en gang mengden vokser forbi en bestemt grense. Dette er der en vektor database som Zilliz Cloud kommer inn. En vektor database er spesialbygget for å lagre, indeksere og søke gjennom massive mengder ustrukturert data ved å utnytte innkapslinger som den underliggende representasjonen. Søking gjennom en vektor database gjøres vanligvis med søkevektorer, og resultatet av søket er de øverste N mest like resultater basert på avstand.

De beste vektor databaseene har mange av de samme brukervennlige funksjonene som tradisjonelle relasjonsdatabaser: horisontal skalerbarhet, caching, replikasjon, feilovergang og søkeutførelse er bare noen av de mange funksjonene som en virkelig vektor database bør implementere. Som en kategori-definerer, har vi vært aktive i akademiske kretser også, og har publisert papirer i SIGMOD 2021 og VLDB 2022, de to beste databasekonferansene der ute i dag.

Kunne du diskutere hva en innkapsling er?

Generelt sett er en innkapsling en høydimensjonal vektor som kommer fra aktiveringen av en mellomliggende lag i et multilagert neuralt nettverk. Mange neurale nettverk er trent for å utgi innkapslinger selv, og noen applikasjoner bruker konkatenerede vektorer fra flere mellomliggende lag som innkapslingen, men jeg kommer ikke til å gå for dypt inn i noen av disse for nå. En annen mindre vanlig, men like viktig måte å generere innkapslinger på, er gjennom håndlagde funksjoner. I stedet for å la en ML-modell automatisk lære de riktige representasjonene for inputdataene, kan god gammeldags funksjonsingeniørkunst fungere for mange applikasjoner også. Uansett den underliggende metoden, er innkapslinger for semantisk like objekter nær hverandre i termer av avstand, og dette er egenskapen som driver vektor databaseene.

Hva er noen av de mest populære bruksområdene for denne teknologien?

Vektor databaseene er ideelle for enhver applikasjon som krever noen form for semantisk søk – produktanbefalinger, videoanalyse, dokument søk, trussel- og svindelfordring og AI-drevne chatboter er noen av de mest populære bruksområdene for vektor databaseene i dag. For å illustrere dette, Milvus, den åpne vektor databaseen som er skapt av Zilliz og den underliggende kernen i Zilliz Cloud, er blitt brukt av over tusen bedrifter over en rekke ulike bruksområder.

Jeg er alltid glad for å diskutere disse applikasjonene og hjelpe folk med å forstå hvordan de fungerer, men jeg liker også å gå over noen av de mindre kjente vektor database bruksområdene. Oppdagelse av nye legemidler er ett av mine favoritt “nisje” vektor database bruksområder. Utfordringen for denne spesifikke applikasjonen er å søke etter potensielle kandidat-legemidler for å behandle en bestemt sykdom eller symptom blant en database på 800 millioner forbindelser. Et farmasøytisk selskap vi kommuniserte med, var i stand til å betydelig forbedre legemiddeloppdagelsesprosessen, samt kutte ned på maskinvareressursene ved å kombinere Milvus med en kjemisk informasjonsbibliotek kalt RDKit.

Cleveland Museum of Arts (CMA) AI ArtLens er et annet eksempel jeg liker å trekke frem. AI ArtLens er et interaktivt verktøy som tar et søkebilde som input og trekker frem visuelt like bilder fra museets database. Dette kalles vanligvis for omvendt bilde søk og er et ganske vanlig bruksområde for vektor databaseene, men den unike verdi som Milvus ga til CMA var evnen til å få applikasjonen i gang innen en uke med et veldig lite team.

Kunne du diskutere hva den åpne plattformen Towhee er?

Når vi kommuniserer med folk fra Milvus-samfunnet, fant vi at mange av dem ønsket å ha en forent måte å generere innkapslinger for Milvus på. Dette var sant for nesten alle ulike organisasjoner vi snakket med, men spesielt for selskaper som ikke hadde mange maskinlæringsingeniører. Med Towhee, søker vi å løse denne gapen via det vi kaller “vektor data ETL”. Mens tradisjonelle ETL-pipelines fokuserer på å kombinere og transformere strukturert data fra flere kilder til en brukenbar format, er Towhee ment å fungere med ustrukturert data og inkluderer eksplisitt ML i den resulterende ETL-pipeline. Towhee oppnår dette ved å gi hundrevis av modeller, algoritmer og transformasjoner som kan brukes som byggestener i en vektor data ETL-pipeline. I tillegg gir Towhee også en enkel å bruke Python-API som lar utviklere bygge og teste disse ETL-pipelineene i en enkelt linje med kode.

Mens Towhee er et eget uavhengig prosjekt, er det også en del av den bredere vektor database økosystemet sentrert rundt Milvus som Zilliz skaper. Vi ser for oss at Milvus og Towhee skal være to høyt komplementære prosjekter som, når de brukes sammen, kan virkelig demokratisere ustrukturert data prosessering.

Zilliz har nylig samlet inn 60 millioner dollar i en serie B-runde. Hvordan vil dette akselerere Zilliz-misjonen?

Jeg ville først og fremst like å takke Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital og andre for å tro på Zilliz-misjonen og støtte oss med denne serie B-utvidelsen. Vi har nå samlet inn totalt 113 millioner dollar, og denne siste runden av finansiering vil støtte våre bestrebelser på å skalerer ut ingeniør- og markedsføringslagene. Spesielt vil vi forbedre vår managed cloud-tilbud, som for tiden er i tidlig tilgang, men planlagt å åpne opp for alle senere i år. Vi vil også fortsette å investere i fremtredende database- og AI-forskning som vi har gjort de siste fire årene.

Er det noe annet du ville like å dele om Zilliz?

Som et selskap, vokser vi raskt, men det som virkelig skiller vårt nåværende team fra andre i database- og ML-rommet er vår eneste lidenskap for hva vi bygger. Vi er på en misjon for å demokratisere ustrukturert data prosessering, og det er absolutt fantastisk å se så mange talende folk på Zilliz som arbeider mot ett felles mål. Hvis noen av det vi gjør høres interessant ut, føl deg fri til å kontakte oss. Vi ville elske å ha deg om bord.

Hvis du ønsker å vite mer, er jeg også personlig åpen for å diskutere Zilliz, vektor database eller innkapslings-relaterte fremgang i AI/ML. Min (figurative) dør er alltid åpen, så føl deg fri til å kontakte meg direkte på Twitter/LinkedIn.

Til slutt, takk for å lese!

Takk for det flotte intervjuet, lesere som ønsker å lære mer kan besøke Zilliz.

Antoine er en visjonær leder og medgrunnlegger av Unite.AI, drevet av en urokkelig lidenskap for å forme og fremme fremtiden for AI og robotikk. En serial entrepreneur, han tror at AI vil være like disruptiv for samfunnet som elektrisitet, og blir ofte fanget i å prise potensialet for disruptive teknologier og AGI.

Som en futurist, er han dedikert til å utforske hvordan disse innovasjonene vil forme vår verden. I tillegg er han grunnlegger av Securities.io, en plattform som fokuserer på å investere i banebrytende teknologier som definerer fremtiden og omformer hele sektorer.