Interviews

Frank Liu, Director of Operations at Zilliz – Interviewreeks

mm
Voeg Unite.AI toe aan je voorkeursbronnen op Google

Frank Liu is de Director of Operations bij Zilliz, een toonaangevende aanbieder van vector databases en AI-technologieën. Zij zijn ook de ingenieurs en wetenschappers die LF AI Milvus® hebben gecreëerd, de meest populaire open-source vector database ter wereld.

Wat trok je aanvankelijk aan naar machine learning?

Mijn eerste kennismaking met de kracht van ML/AI was als undergraduate student aan Stanford, ondanks dat het een beetje buiten mijn hoofdvak (Elektrotechniek) viel. Ik werd aanvankelijk aangetrokken tot EE als vakgebied omdat de mogelijkheid om complexe elektrische en fysieke systemen te reduceren tot wiskundige benaderingen me heel krachtig leek, en statistiek en machine learning voelden hetzelfde. Ik volgde uiteindelijk meer computer vision en machine learning cursussen tijdens mijn master, en ik schreef mijn masterthese over het gebruik van ML om de aesthetische schoonheid van afbeeldingen te beoordelen. Alles dit leidde tot mijn eerste baan in het Computer Vision & Machine Learning team bij Yahoo, waar ik in een hybride onderzoeks- en softwareontwikkelingsrol zat. We waren nog in de pre-transformers AlexNet & VGG dagen, en het zien van een heel veld en industrie dat zo snel bewoog, van data voorbereiding tot massale parallelle model training tot model productisering, is geweldig. Op veel manieren voelt het een beetje belachelijk om de frase “toen” te gebruiken om naar iets te verwijzen dat minder dan 10 jaar geleden gebeurde, maar zo is de vooruitgang die in dit veld is geboekt.

Na Yahoo, was ik de CTO van een startup die ik mede had opgericht, waar we ML gebruikten voor indoor lokaliseren. Daar moesten we sequentiële modellen optimaliseren voor heel kleine microcontrollers – een heel andere maar eveneens gerelateerde technische uitdaging als de grote LLM’s en diffusiemodellen van vandaag. We bouwden ook hardware, dashboards voor visualisatie en eenvoudige cloud-native applicaties, maar AI/ML diende altijd als een kerncomponent van het werk dat we deden.

Hoewel ik al 7 of 8 jaar in of rond ML zit, houd ik nog steeds veel van circuitontwerp en digitale logica ontwerp. Een achtergrond in Elektrotechniek is op veel manieren heel nuttig voor veel van het werk dat ik tegenwoordig doe bij Zilliz. Veel belangrijke concepten in digitale ontwerp zoals virtueel geheugen, branch predictie en gelijktijdige uitvoering in HDL helpen een volledig overzicht te geven van veel ML en gedistribueerde systemen van vandaag. Terwijl ik de aantrekkingskracht van CS begrijp, hoop ik op een opleving van meer traditionele ingenieursvakken – Elektrotechniek, Mechanische Ingenieurswetenschappen, Chemische Ingenieurswetenschappen, enz. – binnen de komende paar jaar.

Wat is ongestructureerde data voor lezers die niet bekend zijn met de term?

Ongestructureerde data verwijst naar “complex” data, wat in wezen data is die niet kan worden opgeslagen in een vooraf gedefinieerd formaat of past in een bestaand datamodel. Voor vergelijking, gestructureerde data verwijst naar elk type data dat een vooraf gedefinieerde structuur heeft – numerieke data, strings, tabellen, objecten en key/value stores zijn allemaal voorbeelden van gestructureerde data.

Om echt te begrijpen wat ongestructureerde data is en waarom het traditioneel moeilijk is om dit type data computationeel te verwerken, helpt het om het te vergelijken met gestructureerde data. In de eenvoudigste termen kan traditionele gestructureerde data worden opgeslagen via een relationeel model. Neem bijvoorbeeld een relationele database met een tabel voor het opslaan van boekinformatie: elke rij in de tabel kan een bepaald boek vertegenwoordigen dat wordt geïndexeerd door ISBN-nummer, terwijl de kolommen de overeenkomstige categorie van informatie aanduiden, zoals titel, auteur, publicatiedatum, enz. Tegenwoordig zijn er veel flexibelere datamodellen – wide-column stores, object databases, graph databases, enz. – maar het algemene idee blijft hetzelfde: deze databases zijn bedoeld om data op te slaan die past in een bepaald datamodel.

Ongestructureerde data, aan de andere kant, kan worden gedacht als een soort pseudo-willekeurige blob van binaire data. Het kan alles vertegenwoordigen, willekeurig groot of klein zijn en kan op een van de vele manieren getransformeerd en gelezen worden. Dit maakt het onmogelijk om het in een datamodel te passen, laat staan in een tabel in een relationele database.

Wat zijn enkele voorbeelden van dit type data?

Menselijke gegenereerde data – afbeeldingen, video, audio, natuurlijke taal, enz. – zijn goede voorbeelden van ongestructureerde data. Maar er zijn ook minder alledaagse voorbeelden van ongestructureerde data. Gebruikersprofielen, proteïne structuren, genoom sequenties en zelfs mensleesbare code zijn allemaal goede voorbeelden van ongestructureerde data. De primaire reden dat ongestructureerde data traditioneel zo moeilijk te beheren is, is dat ongestructureerde data elke vorm kan aannemen en kan vereisen dat er sterk uiteenlopende runtime omgevingen worden gebruikt om het te verwerken.

Met afbeeldingen als voorbeeld, kunnen twee foto’s van dezelfde scène sterk uiteenlopende pixelwaarden hebben, maar beiden hebben een soortgelijke inhoud. Natuurlijke taal is een ander voorbeeld van ongestructureerde data dat ik graag noem. De frases “Elektrotechniek” en “Computerwetenschappen” zijn extreem nauw verwant – zozeer zelfs dat de gebouwen van Elektrotechniek en Computerwetenschappen aan Stanford naast elkaar liggen – maar zonder een manier om de semantische betekenis achter deze twee frases te coderen, kan een computer naïef denken dat “Computerwetenschappen” en “Sociale wetenschappen” meer verwant zijn.

Wat is een vector database?

Om een vector database te begrijpen, helpt het eerst om te begrijpen wat een embedding is. Ik zal daar zo meteen op ingaan, maar de korte versie is dat een embedding een hoogdimensionale vector is die de semantiek van ongestructureerde data kan vertegenwoordigen. In het algemeen zijn twee embeddings die dicht bij elkaar liggen in termen van afstand, waarschijnlijk zeer waarschijnlijk om semantisch soortgelijke invoerdata te vertegenwoordigen. Met moderne ML hebben we de mogelijkheid om een verscheidenheid aan verschillende soorten ongestructureerde data – afbeeldingen en tekst, bijvoorbeeld – om te zetten in semantisch krachtige embedding vectoren.

Vanuit het perspectief van een organisatie wordt ongestructureerde data ontzettend moeilijk te beheren zodra de hoeveelheid een bepaalde limiet overschrijdt. Hier komt een vector database zoals Zilliz Cloud in beeld. Een vector database is specifiek ontworpen om grote hoeveelheden ongestructureerde data op te slaan, te indexeren en te doorzoeken door embeddings als de onderliggende representatie te gebruiken. Doorzoeken in een vector database gebeurt meestal met query vectoren, en het resultaat van de query is de top N meest soortgelijke resultaten op basis van afstand.

De allerbeste vector databases hebben veel van de gebruikersvriendelijke functies van traditionele relationele databases: horizontaal schalen, caching, replicatie, failover en queryuitvoering zijn slechts enkele van de vele functies die een echte vector database zou moeten implementeren. Als een categorie-definieerder zijn we actief geweest in academische kringen, met publicaties in SIGMOD 2021 en VLDB 2022, de twee topdatabaseconferenties van vandaag.

Kunt u discussiëren over wat een embedding is?

Over het algemeen gesproken is een embedding een hoogdimensionale vector die voortkomt uit de activaties van een tussenlaag in een multilaags neuronaal netwerk. Veel neurale netwerken zijn getraind om embeddings zelf uit te voeren en sommige toepassingen gebruiken geconcateneerde vectoren uit meerdere tussenlagen als de embedding, maar ik zal daar niet te diep op ingaan. Een andere minder gebruikelijke maar eveneens belangrijke manier om embeddings te genereren is door middel van handmatig ontworpen functies. In plaats van een ML-model te laten leren om de juiste representaties voor de invoerdata te leren, kan goede oude feature engineering werken voor veel toepassingen. Ongeacht de onderliggende methode zijn embeddings voor semantisch soortgelijke objecten dicht bij elkaar in termen van afstand, en deze eigenschap is wat vector databases aandrijft.

Wat zijn enkele van de meest populaire use cases met deze technologie?

Vector databases zijn geweldig voor elke toepassing die een vorm van semantische zoekopdracht vereist – productaanbeveling, videoanalyse, documentzoekopdracht, bedreigings- en fraude detectie en AI-gebaseerde chatbots zijn enkele van de meest populaire use cases voor vector databases vandaag. Om dit te illustreren, Milvus, de open-source vector database die door Zilliz is gemaakt en de onderliggende core van Zilliz Cloud, is gebruikt door meer dan duizend enterprise-gebruikers over een verscheidenheid aan verschillende use cases.

Ik ben altijd blij om over deze toepassingen te praten en mensen te helpen begrijpen hoe ze werken, maar ik geniet er ook van om enkele van de minder bekende vector database use cases te bespreken. Nieuwe drugontdekking is een van mijn favoriete “niche” vector database use cases. De uitdaging voor deze specifieke toepassing is het zoeken naar potentiële kandidaatdrugs om een bepaalde ziekte of symptoom te behandelen in een database van 800 miljoen verbindingen. Een farmaceutisch bedrijf dat we hebben gesproken, kon het drugontdekkingsproces aanzienlijk verbeteren en tegelijkertijd de hardwarebronnen verminderen door Milvus te combineren met een chemische informatiekundige bibliotheek genaamd RDKit.

Het Cleveland Museum of Art’s (CMA) AI ArtLens is een ander voorbeeld dat ik graag noem. AI ArtLens is een interactief hulpmiddel dat een queryafbeelding als invoer neemt en visueel soortgelijke afbeeldingen uit de database van het museum haalt. Dit wordt meestal omgekeerde afbeeldingszoekopdracht genoemd en is een vrij gebruikelijke use case voor vector databases, maar de unieke waarde die Milvus aan CMA bood, was de mogelijkheid om de toepassing binnen een week operationeel te krijgen met een heel klein team.

Kunt u discussiëren over wat de open-source platform Towhee is?

Toen we met mensen uit de Milvus-gemeenschap communiceerden, vonden we dat veel van hen een uniforme manier wilden hebben om embeddings voor Milvus te genereren. Dit was waar voor bijna alle verschillende organisaties waar we mee spraken, maar vooral voor bedrijven die niet veel machine learning-engineers hadden. Met Towhee proberen we deze kloof op te vullen via wat we “vector data ETL” noemen. Terwijl traditionele ETL-pijpleidingen zich richten op het combineren en transformeren van gestructureerde data uit meerdere bronnen in een bruikbaar formaat, is Towhee bedoeld om met ongestructureerde data te werken en omvat het expliciet ML in de resulterende ETL-pijpleiding. Towhee bereikt dit door honderden modellen, algoritmen en transformaties te bieden die kunnen worden gebruikt als bouwstenen in een vector data ETL-pijpleiding. Bovendien biedt Towhee een eenvoudig te gebruiken Python-API waarmee ontwikkelaars deze ETL-pijpleidingen kunnen bouwen en testen in één regel code.

Terwijl Towhee een onafhankelijk project is, maakt het deel uit van het bredere vector database ecosysteem dat Zilliz creëert en dat rond Milvus is geconcentreerd. We zien Milvus en Towhee als twee zeer complementaire projecten die, wanneer ze samen worden gebruikt, de verwerking van ongestructureerde data echt kunnen democratiseren.

Zilliz heeft onlangs een Series B-rondes van $60M opgehaald. Hoe zal dit de missie van Zilliz versnellen?

Ik wil eerst Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital en anderen bedanken voor het geloven in de missie van Zilliz en ons te ondersteunen met deze Series B-uitbreiding. We hebben nu in totaal $113M opgehaald, en deze laatste ronde van financiering zal onze inspanningen ondersteunen om de engineering- en go-to-marketteams uit te breiden. In het bijzonder zullen we onze beheerde cloudaanbieding verbeteren, die momenteel in vroege toegang is maar later dit jaar voor iedereen geopend zal worden. We zullen ook blijven investeren in baanbrekend database- en AI-onderzoek, zoals we de afgelopen 4 jaar hebben gedaan.

Is er nog iets anders dat je over Zilliz wilt delen?

Als bedrijf groeien we snel, maar wat ons huidige team echt onderscheidt van anderen in de database- en ML-ruimte, is onze enkelvoudige passie voor wat we bouwen. We zijn op een missie om de verwerking van ongestructureerde data te democratiseren, en het is absoluut geweldig om zo veel getalenteerde mensen bij Zilliz te zien werken aan een enkel doel. Als een van de dingen die we doen interessant lijkt, neem dan vooral contact met ons op. We zouden je graag aan boord hebben.

Als je meer wilt weten, ben ik ook persoonlijk open voor een gesprek over Zilliz, vector databases of embedding-gerelateerde vooruitgang in AI/ML. Mijn (figuurlijke) deur staat altijd open, dus voel je vrij om me rechtstreeks te benaderen op Twitter/LinkedIn.

Tot slot, bedankt voor het lezen!

Bedankt voor het geweldige interview, lezers die meer willen leren, moeten Zilliz bezoeken.

Antoine is een visionaire leider en medeoprichter van Unite.AI, gedreven door een onwankelbare passie voor het vormgeven en promoten van de toekomst van AI en robotica. Een serieondernemer, hij gelooft dat AI net zo disruptief voor de samenleving zal zijn als elektriciteit, en wordt vaak betrapt op het prijzen van de potentie van disruptieve technologieën en AGI.

Als een futurist, hij is toegewijd aan het onderzoeken van hoe deze innovaties onze wereld zullen vormgeven. Bovendien is hij de oprichter van Securities.io, een platform dat zich richt op het investeren in cutting-edge technologieën die de toekomst herdefiniëren en hele sectoren herschikken.