Interviews

Frank Liu, Director of Operations at Zilliz – Interview-Serie

mm
Unite.AI zu deinen bevorzugten Quellen auf Google hinzufügen

Frank Liu ist der Director of Operations bei Zilliz, einem führenden Anbieter von Vektordatenbanken und KI-Technologien. Sie sind auch die Ingenieure und Wissenschaftler, die LF AI Milvus® entwickelt haben, die weltweit beliebteste Open-Source-Vektordatenbank.

Was hat Sie ursprünglich zum Maschinellen Lernen hingezogen?

Meine erste Begegnung mit der Macht von ML/AI war als Undergrad-Student an der Stanford University, obwohl es ein bisschen abseits meines Hauptfachs (Elektrotechnik) lag. Ich wurde ursprünglich von der Elektrotechnik als Fach angezogen, weil die Fähigkeit, komplexe elektrische und physikalische Systeme in mathematische Approximationen zu überführen, sehr mächtig erschien, und Statistik und Maschinelles Lernen fühlten sich ähnlich an. Ich belegte schließlich mehr Kurse in Computer-Vision und Maschinellem Lernen während meines Master-Studiums und schrieb meine Masterarbeit über die Verwendung von ML, um die ästhetische Schönheit von Bildern zu bewerten. All dies führte zu meinem ersten Job im Computer-Vision- und Machine-Learning-Team bei Yahoo, wo ich in einer hybrid-research- und Software-Entwicklungsrolle tätig war. Wir befanden uns noch in den pre-Transformator-AlexNet- und VGG-Tagen, und es war erstaunlich, eine ganze Branche und Industrie so schnell wachsen zu sehen, von der Datenvorbereitung bis hin zur massiv parallelen Modellierung und Modellproduktion. Auf viele Weise erscheint es fast lächerlich, den Ausdruck “damals” zu verwenden, um auf etwas zu verweisen, das weniger als 10 Jahre her ist, aber so ist der Fortschritt in diesem Bereich.

Nach Yahoo war ich als CTO eines Start-ups tätig, das ich mitgegründet hatte, wo wir ML für die Indoor-Ortung nutzten. Dort mussten wir sequenzielle Modelle für sehr kleine Mikrocontroller optimieren – eine sehr unterschiedliche, aber dennoch verwandte Ingenieurs-Herausforderung im Vergleich zu den heutigen großen LLMs und Diffusionsmodellen. Wir bauten auch Hardware, Dashboards für die Visualisierung und einfache Cloud-Anwendungen, aber KI/ML diente immer als Kernkomponente der Arbeit, die wir leisteten.

Obwohl ich jetzt seit etwa 7 oder 8 Jahren im Bereich ML tätig bin, habe ich immer noch eine große Liebe für Schaltkreis-Design und digitale Logik-Design. Eine Ausbildung in der Elektrotechnik ist auf viele Arten sehr hilfreich für viel von der Arbeit, die ich heute mache. Viele wichtige Konzepte in der digitalen Gestaltung, wie virtuelles Gedächtnis, Verzweigungsvorhersage und konkurrierende Ausführung in HDL, liefern eine umfassende Sicht auf viele ML- und verteilte Systeme heute. Während ich den Reiz von CS verstehe, hoffe ich, dass es in den nächsten paar Jahren zu einer Rückkehr zu traditionelleren Ingenieur-Fächern wie Elektrotechnik, Maschinenbau, Chemieingenieurwesen usw. kommt.

Für Leser, die mit dem Begriff “unstrukturierte Daten” nicht vertraut sind, was bedeutet er?

Unstrukturierte Daten beziehen sich auf “komplexe” Daten, die im Wesentlichen Daten sind, die nicht in einem vordefinierten Format gespeichert werden können oder in ein bestehendes Datenmodell passen. Zum Vergleich beziehen sich strukturierte Daten auf jede Art von Daten, die eine vordefinierte Struktur haben – numerische Daten, Zeichenfolgen, Tabellen, Objekte und Schlüssel-Wert-Speicher sind alle Beispiele für strukturierte Daten.

Um wirklich zu verstehen, was unstrukturierte Daten sind und warum sie traditionell schwer zu verarbeiten sind, hilft es, sie mit strukturierten Daten zu vergleichen. In den einfachsten Begriffen kann traditionell strukturierte Daten mithilfe eines relationalen Modells gespeichert werden. Nehmen wir beispielsweise eine relationale Datenbank mit einer Tabelle zur Speicherung von Buchinformationen: jede Zeile in der Tabelle könnte ein bestimmtes Buch darstellen, das durch die ISBN-Nummer indexiert wird, während die Spalten die entsprechenden Kategorien von Informationen wie Titel, Autor, Veröffentlichungsdatum usw. bezeichnen. Heute gibt es flexiblere Datenmodelle – Weit-Spalten-Speicher, Objekt-Datenbanken, Graphen-Datenbanken usw. – aber die grundlegende Idee bleibt dieselbe: diese Datenbanken sind dazu gedacht, Daten zu speichern, die einem bestimmten Datenmuster oder Datenmodell entsprechen.

Unstrukturierte Daten hingegen können als eine Art pseudo-zufälliger Binärdaten-Blob betrachtet werden. Sie können alles darstellen, beliebig groß oder klein sein und auf eine der zahllosen verschiedenen Arten transformiert und gelesen werden. Dies macht es unmöglich, sie in ein Datenmodell, geschweige denn in eine Tabelle in einer relationalen Datenbank, zu passen.

Welche Beispiele gibt es für diese Art von Daten?

Menschengenerierte Daten – Bilder, Videos, Audio, natürliche Sprache usw. – sind großartige Beispiele für unstrukturierte Daten. Es gibt jedoch auch eine Vielzahl weniger alltäglicher Beispiele für unstrukturierte Daten. Benutzerprofile, Proteinstrukturen, Genom-Sequenzen und sogar menschliche Code sind auch großartige Beispiele für unstrukturierte Daten. Der Hauptgrund, warum unstrukturierte Daten traditionell so schwer zu verwalten waren, liegt darin, dass unstrukturierte Daten jede Form annehmen und sehr unterschiedliche Laufzeiten zur Verarbeitung erfordern können.

Wenn man Bilder als Beispiel nimmt, könnten zwei Fotos derselben Szene sehr unterschiedliche Pixelwerte haben, aber beide haben einen ähnlichen Gesamthinweis. Natürliche Sprache ist ein weiteres Beispiel für unstrukturierte Daten, auf die ich gerne hinweise. Die Phrasen “Elektrotechnik” und “Informatik” sind extrem eng miteinander verbunden – so sehr, dass die EE- und CS-Gebäude an der Stanford University nebeneinander liegen – aber ohne eine Möglichkeit, die semantische Bedeutung hinter diesen beiden Phrasen zu kodieren, könnte ein Computer naiv denken, dass “Informatik” und “Sozialwissenschaft” enger miteinander verbunden sind.

Was ist eine Vektordatenbank?

Um eine Vektordatenbank zu verstehen, hilft es, zunächst zu verstehen, was eine Einbettung ist. Ich werde darauf später zurückkommen, aber die kurze Version ist, dass eine Einbettung ein hochdimensionaler Vektor ist, der die Semantik von unstrukturierten Daten darstellen kann. Im Allgemeinen sind zwei Einbettungen, die in Bezug auf die Distanz nahe beieinander liegen, sehr wahrscheinlich semantisch ähnlichen Eingabedaten zugeordnet. Mit modernem ML haben wir die Macht, verschiedene Arten von unstrukturierten Daten – Bilder und Text beispielsweise – in semantisch leistungsfähige Einbettungsvektoren zu kodieren und umzuwandeln.

Aus der Sicht einer Organisation werden unstrukturierte Daten unglaublich schwierig zu verwalten, sobald die Menge eine bestimmte Grenze überschreitet. Hier kommt eine Vektordatenbank wie Zilliz Cloud ins Spiel. Eine Vektordatenbank ist speziell dafür entwickelt, massive Mengen an unstrukturierten Daten mithilfe von Einbettungen als zugrunde liegende Darstellung zu speichern, zu indexieren und zu durchsuchen. Die Suche in einer Vektordatenbank erfolgt typischerweise mit Abfragevektoren, und das Ergebnis der Abfrage sind die Top-N-Ähnlichsten Ergebnisse basierend auf der Distanz.

Die besten Vektordatenbanken haben viele der Benutzerfreundlichkeitsmerkmale traditioneller relationaler Datenbanken: horizontales Skalieren, Caching, Replikation, Failover und Abfrageausführung sind nur einige der vielen Merkmale, die eine echte Vektordatenbank implementieren sollte. Als Kategoriedefinierer waren wir auch in akademischen Kreisen aktiv und haben Papers in SIGMOD 2021 und VLDB 2022 veröffentlicht, den beiden wichtigsten Datenbank-Konferenzen, die es heute gibt.

Könnten Sie über Einbettungen sprechen?

Im Allgemeinen ist eine Einbettung ein hochdimensionaler Vektor, der aus den Aktivierungen einer Zwischenlage in einem mehrschichtigen neuronalen Netzwerk stammt. Viele neuronale Netze sind so trainiert, dass sie selbst Einbettungen ausgeben, und einige Anwendungen verwenden konkatinierte Vektoren aus mehreren Zwischenlagen als Einbettung, aber ich werde nicht zu tief darauf eingehen. Eine andere weniger gebräuchliche, aber genauso wichtige Methode, um Einbettungen zu erzeugen, ist durch handgefertigte Merkmale. Anstatt dass ein ML-Modell automatisch die richtigen Darstellungen für die Eingabedaten lernt, kann gute alte Merkmalsextraktion für viele Anwendungen funktionieren. Unabhängig von der zugrunde liegenden Methode sind Einbettungen für semantisch ähnliche Objekte in Bezug auf die Distanz nahe beieinander, und diese Eigenschaft ist es, die Vektordatenbanken antreibt.

Welche sind einige der beliebtesten Anwendungsfälle für diese Technologie?

Vektordatenbanken sind großartig für jede Anwendung, die eine Art semantische Suche erfordert – Produkt-Empfehlung, Video-Analyse, Dokumentensuche, Bedrohungs- und Betrugs-Erkennung und KI-gesteuerte Chatbots sind einige der beliebtesten Anwendungsfälle für Vektordatenbanken heute. Um dies zu veranschaulichen, wurde Milvus, die Open-Source-Vektordatenbank, die von Zilliz entwickelt wurde und die zugrunde liegende Kern-Technologie von Zilliz Cloud ist, von über tausend Unternehmensanwendern in verschiedenen Anwendungsfällen verwendet.

Ich bin immer gerne bereit, über diese Anwendungen zu sprechen und zu helfen, dass die Leute verstehen, wie sie funktionieren, aber ich genieße es auch sehr, über einige der weniger bekannten Anwendungsfälle für Vektordatenbanken zu sprechen. Die Entdeckung neuer Medikamente ist einer meiner Lieblings-“Nischen”-Anwendungsfälle für Vektordatenbanken. Die Herausforderung bei dieser Anwendung besteht darin, potenzielle Kandidaten-Medikamente für die Behandlung einer bestimmten Krankheit oder Symptomt unter einer Datenbank von 800 Millionen Verbindungen zu suchen. Ein Pharma-Unternehmen, mit dem wir kommunizierten, konnte den Medikamenten-Entdeckungsprozess erheblich verbessern und gleichzeitig die Hardware-Ressourcen reduzieren, indem es Milvus mit einer Chemie-Informations-Bibliothek namens RDKit kombinierte.

Das Cleveland Museum of Art’s (CMA) AI ArtLens ist ein weiteres Beispiel, das ich gerne erwähne. AI ArtLens ist ein interaktives Tool, das ein Abfrage-Bild als Eingabe nimmt und visuell ähnliche Bilder aus der Datenbank des Museums abruft. Dies wird normalerweise als umgekehrte Bild-Suche bezeichnet und ist ein ziemlich häufiger Anwendungsfall für Vektordatenbanken, aber der einzigartige Mehrwert, den Milvus dem CMA bot, war die Fähigkeit, die Anwendung innerhalb einer Woche mit einem sehr kleinen Team in Betrieb zu nehmen.

Könnten Sie über die Open-Source-Plattform Towhee sprechen?

Als wir mit Leuten aus der Milvus-Community sprachen, stellten wir fest, dass viele von ihnen eine einheitliche Möglichkeit haben wollten, um Einbettungen für Milvus zu generieren. Dies war besonders bei Unternehmen der Fall, die nicht viele Maschinen-Lern-Experten hatten. Mit Towhee zielen wir darauf ab, diese Lücke durch das, was wir “Vektor-Daten-ETL” nennen, zu schließen. Während traditionelle ETL-Pipelines sich auf die Kombination und Umwandlung von strukturierten Daten aus mehreren Quellen in ein verwendbares Format konzentrieren, ist Towhee darauf ausgelegt, mit unstrukturierten Daten zu arbeiten und explizit ML in die resultierende ETL-Pipeline einzubeziehen. Towhee erreicht dies, indem es Hunderte von Modellen, Algorithmen und Transformationen bereitstellt, die als Bausteine in einer Vektor-Daten-ETL-Pipeline verwendet werden können. Darüber hinaus bietet Towhee auch eine einfache Python-API, die es Entwicklern ermöglicht, diese ETL-Pipelines in einer einzigen Code-Zeile zu erstellen und zu testen.

Obwohl Towhee ein eigenständiges Projekt ist, ist es auch Teil des umfassenderen Vektordatenbank-Ökosystems, das Zilliz um Milvus herum aufbaut. Wir stellen uns vor, dass Milvus und Towhee zwei hochkomplementäre Projekte sind, die, wenn sie zusammen verwendet werden, die Verarbeitung von unstrukturierten Daten wirklich demokratisieren können.

Zilliz hat kürzlich eine 60-Millionen-Dollar-Serie-B-Runde aufgenommen. Wie wird dies die Zilliz-Mission beschleunigen?

Zunächst möchte ich Prosperity7 Ventures, Pavilion Capital, Hillhouse Capital, 5Y Capital, Yunqi Capital und anderen danken, die an die Zilliz-Mission glauben und uns mit dieser Serie-B-Erweiterung unterstützen. Wir haben nun insgesamt 113 Millionen Dollar aufgenommen, und diese neueste Finanzierungsrunde wird unsere Bemühungen unterstützen, die Ingenieur- und Go-to-Market-Teams auszubauen. Insbesondere werden wir unser Managed-Cloud-Angebot verbessern, das derzeit im frühen Zugang ist, aber später in diesem Jahr für jeden zugänglich sein wird. Wir werden auch weiterhin in Spitzen-Datenbank- und KI-Forschung investieren, wie wir es in den letzten 4 Jahren getan haben.

Gibt es noch etwas, das Sie über Zilliz teilen möchten?

Als Unternehmen wachsen wir schnell, aber was unser aktuelles Team von anderen im Datenbank- und ML-Bereich unterscheidet, ist unsere einzigartige Leidenschaft für das, was wir aufbauen. Wir sind auf einer Mission, die Verarbeitung von unstrukturierten Daten zu demokratisieren, und es ist absolut erstaunlich, so viele talentierte Leute bei Zilliz zu sehen, die auf ein gemeinsames Ziel hinarbeiten. Wenn Ihnen das, was wir tun, interessant erscheint, zögern Sie nicht, mit uns in Kontakt zu treten. Wir würden uns freuen, Sie an Bord zu haben.

Wenn Sie mehr erfahren möchten, stehe ich persönlich gerne zur Verfügung, um über Zilliz, Vektordatenbanken oder Einbettungs-verbundene Fortschritte in KI/ML zu sprechen. Meine (figurative) Tür ist immer offen, also zögern Sie nicht, mich direkt auf Twitter/LinkedIn zu kontaktieren.

Zum Schluss vielen Dank für das Lesen!

Vielen Dank für das großartige Interview. Leser, die mehr erfahren möchten, sollten Zilliz besuchen.

Antoine ist ein visionärer Leiter und Gründungspartner von Unite.AI, getrieben von einer unerschütterlichen Leidenschaft für die Gestaltung und Förderung der Zukunft von KI und Robotik. Als Serienunternehmer glaubt er, dass KI für die Gesellschaft so disruptiv sein wird wie Elektrizität, und er wird oft dabei erwischt, wie er über das Potenzial disruptiver Technologien und AGI schwärmt.

Als Futurist ist er darauf bedacht, zu erforschen, wie diese Innovationen unsere Welt prägen werden. Darüber hinaus ist er der Gründer von Securities.io, einer Plattform, die sich auf Investitionen in bahnbrechende Technologien konzentriert, die die Zukunft neu definieren und ganze Branchen umgestalten.