インタビュー
フランク・リウ、Zillizのオペレーション担当ディレクター – インタビュー・シリーズ

フランク・リウは、Zillizのオペレーション担当ディレクターです。Zillizは、ベクトルデータベースとAI技術の先駆的な提供者であり、LF AI Milvus®の開発者でもあります。Milvusは、世界で最も人気のあるオープンソースベクトルデータベースです。
あなたが最初に機械学習に惹かれたのは何ですか?
私はスタンフォード大学の学部生のとき、EE(電気工学)を専攻していましたが、機械学習の力に最初に触れたのは、そのときでした。EEを選んだのは、複雑な電気的および物理的なシステムを数学的な近似に還元する能力が私に強く感じられたからです。統計と機械学習も同様に感じました。私は後にコンピュータビジョンと機械学習のクラスを受講し、修士論文では、MLを使用して画像の美的美しさをスコアリングするというテーマで執筆しました。これが、私の最初の仕事につながりました。私はYahooのコンピュータビジョン&マシーンラーニングチームで、研究とソフトウェア開発の両方を担当していました。当時はAlexNetやVGGの時代で、データの準備から大規模な並列モデルトレーニングまで、業界が急速に進化しているのを見ていると、本当に驚異的です。
その後、私は共同で設立したスタートアップのCTOを務めました。そこでは、MLを室内位置測定に利用していました。そこでは、小さなマイクロコントローラー用のシーケンシャルモデルを最適化するという、今日の巨大なLLMや拡散モデルとは異なるが関連のあるエンジニアリングの課題がありました。私たちはハードウェアやダッシュボード、クラウドネイティブアプリケーションも開発しましたが、AI/MLは私たちの仕事の中心でした。
私は機械学習に関わっているのは7、8年になりますが、回路設計やデジタルロジック設計に対する愛着はまだ強いです。EEの背景があることは、私が現在関わっている仕事にとって非常に役立ちます。デジタル設計における重要な概念である仮想メモリ、ブランチ予測、HDLにおける並列実行は、今日の多くのMLや分散システムに対して、フルスタックの視点を提供します。CSの魅力はわかりますが、EE、MechE、ChemEなどの伝統的なエンジニアリング分野が次のcouple of years内に復活することを願っています。
構造化されていないデータとは何ですか?
構造化されていないデータとは、事前に定義された形式に収めることができない、または既存のデータモデルに適合しない「複雑な」データのことです。構造化データとは、数値データ、文字列、テーブル、オブジェクト、キー/値ストアなど、事前に定義された構造を持つデータのことです。
構造化されていないデータが何であるかを理解するには、構造化データと比較する必要があります。構造化データは、関係モデルで格納できます。例えば、書籍情報を格納するための関係データベースのテーブルでは、各行が特定の書籍を表し、列が対応する情報(タイトル、著者、出版日など)を表します。今日では、より柔軟なデータモデル(ワイドカラムストア、オブジェクトデータベース、グラフデータベースなど)がありますが、基本的な考え方は同じです。構造化されていないデータは、基本的に二進データの疑似ランダムなブロックと考えられます。任意のサイズで、無数の方法で変換および読み取ることができます。これにより、データモデル、あるいは関係データベースのテーブルに収めることは不可能です。
構造化されていないデータの例は何ですか?
人間が生成したデータ(画像、ビデオ、オーディオ、自然言語など)は、構造化されていないデータの良い例です。ただし、ユーザープロファイル、タンパク質構造、ゲノム配列、人間が読めるコードも構造化されていないデータの良い例です。構造化されていないデータが管理されるのが難しい主な理由は、構造化されていないデータは任意の形式をとることができ、処理に必要なランタイムも大きく異なるからです。
画像を例にとると、同じシーンの2つの写真は、異なるピクセル値を持つ可能性がありますが、全体的なコンテンツは似ています。自然言語も構造化されていないデータの良い例です。”Electrical Engineering”と”Computer Science”は非常に近い関係ですが、意味的な意味をエンコードする方法がないと、コンピューターは”Computer Science”と”Social Science”がより近い関係であると考えるかもしれません。
ベクトルデータベースとは何ですか?
ベクトルデータベースを理解するには、まずエンベディング(embedding)について理解する必要があります。エンベディングとは、高次元ベクトルで、構造化されていないデータの意味を表現することができます。一般に、距離が近い2つのエンベディングは、意味的に似た入力データに対応します。現代のMLでは、画像やテキストなどのさまざまな種類の構造化されていないデータを、意味的に強力なエンベディングベクトルにエンコードおよび変換することができます。
組織の観点から見ると、構造化されていないデータは、ある一定の量を超えると、管理するのが非常に難しくなります。これが、Zilliz Cloudのようなベクトルデータベースが必要な理由です。ベクトルデータベースは、エンベディングを基本的な表現として使用して、構造化されていないデータを大量に格納、インデックス、検索するように設計されています。ベクトルデータベースの検索は、通常、クエリベクトルを使用して行われ、結果は距離に基づいて最も類似した上位N個の結果になります。
ベストなベクトルデータベースには、伝統的な関係データベースと同等の使いやすさの特徴があります。水平スケーリング、キャッシング、レプリケーション、フェイルオーバー、クエリ実行など、ベクトルデータベースとして必要な多くの機能があります。私たちは、SIGMOD 2021およびVLDB 2022で論文を発表し、データベース分野のトップ会議で活躍しています。
エンベディングについて説明してください。
一般に、エンベディングとは、マルチレイヤー・ニューラルネットワークの中間層のアクティベーションから得られる高次元ベクトルです。多くのニューラルネットワークは、エンベディングを出力するようにトレーニングされています。エンベディングは、手作業で特徴を設計することによっても生成できます。MLモデルが自動的に適切な表現を学習するのではなく、特徴エンジニアリングによってエンベディングを生成することもできます。どちらの方法でも、意味的に似たオブジェクトのエンベディングは、距離が近くなります。この特性がベクトルデータベースを動かします。
この技術の最も人気のあるユースケースは何ですか?
ベクトルデータベースは、意味的な検索が必要なアプリケーションに適しています。製品のレコメンド、ビデオ分析、ドキュメント検索、脅威および不正検出、AIパワードのチャットボットなどが、今日のベクトルデータベースの最も人気のあるユースケースです。例えば、Milvusは、Zillizによって開発されたオープンソースのベクトルデータベースであり、Zilliz Cloudの基盤となっています。Milvusは、さまざまなユースケースで1000以上のエンタープライズユーザーによって使用されています。
私はこれらのアプリケーションについて話すことを楽しんでいますし、どのように機能するかを理解するのを助けることもできます。ただし、ベクトルデータベースのあまり知られていないユースケースについても話すのが好きです。新薬の発見は、私の好きな「ニッチ」なベクトルデータベースのユースケースの1つです。このアプリケーションの課題は、800万化合物のデータベースの中から特定の疾患または症状に対する潜在的な候補薬を検索することです。私たちが話した製薬会社は、MilvusとcheminformaticsライブラリであるRDKitを組み合わせることで、薬剤発見プロセスを大幅に改善し、ハードウェアリソースを削減することができました。
Cleveland Museum of ArtのAI ArtLensは、別の例です。AI ArtLensは、入力として画像を取り、美術館のデータベースから視覚的に類似した画像を抽出するインタラクティブツールです。これは、ベクトルデータベースの一般的なユースケースである逆画像検索です。MilvusがCMAに提供したユニークな価値提案は、非常に小さなチームで1週間以内にアプリケーションを立ち上げることができたことです。
オープンソースプラットフォームTowheeについて説明してください。
Milvusコミュニティと話すとき、多くの人がMilvus用のエンベディングを生成するための統一された方法を望んでいました。これは、特に機械学習エンジニアが多くない企業で顕著でした。Towheeでは、ベクトルデータETL(抽出、変換、ロード)と呼ばれるものを提供することで、このギャップを解決しようとしています。従来のETLパイプラインは、構造化データを複数のソースから組み合わせて使用可能な形式に変換することに重点を置いていますが、Towheeは構造化されていないデータとMLを使用して、エンベディングを生成することを目的としています。Towheeは、ベクトルデータETLパイプラインの構築ブロックとして使用できる、数百のモデル、アルゴリズム、変換を提供します。さらに、Towheeは、開発者が単一のコード行でこれらのETLパイプラインを構築およびテストできる、使いやすいPython APIを提供します。
Towheeは独立したプロジェクトですが、Zillizが創り出す、Milvusを中心としたベクトルデータベースエコシステムの一部でもあります。私たちは、MilvusとTowheeが、高度に互換性のある2つのプロジェクトであり、組み合わせて使用することで、構造化されていないデータの処理を真に民主化できることを想像しています。
Zillizは最近、6,000万ドルのシリーズBラウンドを調達しました。どうやってZillizの使命を加速させるのでしょうか。
まず、Prosperity7 Ventures、Pavilion Capital、Hillhouse Capital、5Y Capital、Yunqi Capital、その他のZillizの使命を信じてサポートしてくださった皆さんに感謝したいと思います。合計で1億1,300万ドルを調達しました。このシリーズBラウンドの資金は、エンジニアリングとマーケティングチームの拡大を支援するために使用されます。特に、現在は早期アクセスですが、今年の後半に一般公開される予定の、管理されたクラウドオファリングの改善に注力します。さらに、過去4年間と同様に、先端のデータベースおよびAI研究に投資を続けます。
Zillizについてさらに何か共有したいことはありますか?
会社として、私たちは急成長を遂げていますが、私たちをデータベースおよびML分野の他の企業と異にするのは、私たちが構築しているものに対する、強い情熱です。私たちは、構造化されていないデータの処理を民主化する使命に取り組んでいます。Zillizにいる多くの才能ある人々が、ひとつの目標に向かって取り組んでいるのを見て、とても感動しています。如果、私たちが行っていることがあなたに興味がある場合は、私たちに連絡してください。私たちは、あなたをチームの一員として迎え入れることを楽しみにしています。
もし、あなたがもっと知りたいのであれば、私は個人的にZilliz、ベクトルデータベース、またはAI/MLのエンベディング関連の進歩について話すことを楽しみにしています。私の(比喩的な)ドアはいつでも開けていますので、TwitterまたはLinkedInで直接私に連絡してください。
最後に、読んでくださりありがとうございます。
素晴らしいインタビュー、ありがとうございました。詳しく知りたい読者は、Zillizを訪問してください。












