インタビュー

タイルDBのスタブロス・パパドポウロス博士、創設者兼CEO – インタビュー・シリーズ

mm
Unite.AI を Google の優先ソースに追加

TileDBは、すべてのデータモダリティ、コード、コンピューティングを1つの製品に統合するモダンなデータベースです。 TileDBは、2017年5月にMITとIntel Labsからスピンアウトしました。

TileDB、Inc.を2017年2月に創設する前に、スタブロス・パパドポウロス博士は、Intel (INTC ) Parallel Computing Labのシニアリサーチサイエンティストであり、MIT CSAILのIntel Science and Technology Center for Big Dataのメンバーでした。彼はまた、香港科技大学(HKUST)のコンピューターサイエンスおよびエンジニアリング学部で約2年間、訪問アシスタント教授を務めました。スタブロスは、HKUSTでディミトリス・パパディアス教授の指導の下でコンピューターサイエンスの博士号を取得し、中国香港大学でユーフェイ・タオ教授の指導の下でポスドクフェローを務めました。

あなたは以前、Intel Parallel Computing Labのシニアリサーチサイエンティストであり、MIT CSAILのIntel Science and Technology Center (ISTC) for Big Dataのメンバーでした。あの時代のあなたの人生で最も重要な出来事について教えてください。

Intel LabsとMITでの私の経験は、2つの異なる科学分野、つまり高性能コンピューティング(Intel)とデータベース(MIT)で著名な研究者と共同するというユニークな機会を与えました。そこで得た知識と専門知識は、新しいタイプのデータベースシステムを作成するという私のビジョンを形作る上で重要な役割を果たしました。最終的に、このビジョンはISTC内での研究プロジェクトとして実現し、TileDBになりました。

TileDBの背後にあるビジョンと、TileDBが現代のデータベース景観を革命的に変える方法について説明してください。

最近、機械学習とGenerative AIアプリケーションが急速に普及しており、組織がより良い決定を下せるようになっています。組織は毎日、新しいパターンを発見し、この情報を使用して競争上の優位性を獲得しています。これらのパターンは、さまざまなデータモダリティから生じ、分析して活用するために格納および管理する必要があります。従来の表形式データから、ソーシャルポスト、電子メール、画像、ビデオ、センサーデータなどのより複雑なデータソースまで、データの種類が増えると、データから意味を抽出するタスクはますます困難になります。TileDBは、まさにこの問題に対処するために作成されました。

高度な分析と機械学習の機能を開発する前に、組織がデータインフラストラクチャを優先する理由を説明してください。

AIの採用の熱狂の中で、1つの重要な、しかし、しばしば見落とされる真実があります。つまり、AIイニシアチブの成功は、根本的なデータインフラストラクチャの品質とパフォーマンスに密接に関連しているということです。

問題は、表形式で自然に表現できない複雑なデータが「非構造化」と見なされ、通常、カスタムデータ形式のフラットファイルとして保存されるか、目的のデータベースによって管理されるということです。データサイエンティストは、データを統合するために大量の時間をデータの処理に費やします。データサイエンティストの時間の80~90パーセントがデータのクリーンアップと準備に費やされていると推定されています。その結果、AIアルゴリズムのトレーニングと予測能力の実現までの時間が遅れます。さらに、データサイエンティストの時間の10~20パーセントしかインサイトの作成に費やされません。

組織がAIおよびMLアプリケーションに重点を置き、堅牢なデータベースインフラストラクチャを無視する場合に直面する一般的な落とし穴について説明してください。

組織は新しい技術に重点を置きがちです。大規模言語モデル、ベクトルデータベース、ジェネレーティブAIアプリケーションは、データインフラストラクチャよりも魅力的です。ただし、根本的なデータインフラストラクチャを無視すると、データインフラストラクチャを組み立てるのに多くの時間を費やしたり、インサイトを得る機会を逃したりする可能性があります。

「適応性のある」データベースとは何か、それが現代のデータ分析に不可欠な理由について説明してください。

適応性のあるデータベースは、すべてのデータ(どのようなモダリティでも)を統一された方法で格納できるものです。適応性のあるデータベースは、構造化されていないデータに構造を与えます。世界のデータの80パーセント以上が非表形式、つまり構造化されていないと推定されています。大規模言語モデル(LLM)を含むほとんどのAI/MLモデルは、この種のデータでトレーニングされています。

TileDBは多次元配列でデータを構造化します。この形式は、従来のデータベースと比較してパフォーマンスとコスト効率をどのように向上させますか。

多次元配列データベースの基盤となる強みは、実質的にあらゆるデータモダリティとアプリケーションに対応できることです。ベクトルは、単に1次元配列です。構造化されていないこのデータに構造を与えることで、データインフラストラクチャを統合し、コストを大幅に削減し、シロを排除し、生産性を向上させ、セキュリティを強化できます。さらに、コンピューティングインフラストラクチャをデータ管理インフラストラクチャと組み合わせることで、データから即座に価値を抽出できます。

TileDBがデータ管理と分析パフォーマンスを大幅に改善した主なユースケースについて説明してください。

TileDBの最初のユースケースは、巨大なゲノムデータの格納、管理、分析でした。これは、従来の表形式データベースでは非常に困難で高価なものです。私たちは、他のデータベースやカスタムソリューションと比較して、100倍以上のパフォーマンス向上を観察しました。ただし、TileDBの多次元配列モデルは汎用性が高く、他のデータモダリティにも効率的に対応できます。たとえば、TileDBは、バイオメディカルイメージング、衛星イメージング、シングルセルトランスクリプトミクス、LiDARおよびSONARなどのポイントクラウドデータを処理するのに優れています。

TileDBはオープンソースツールを提供しています。オープンソースアプローチは、科学およびデータサイエンスコミュニティにどのように利益をもたらしますか。

私たちは、TileDBではオープンソースを強く推進しています。コアライブラリとデータ形式仕様はオープンソースです。また、コア配列ライブラリ上に構築されたライフサイエンス向けオファリングもオープンソースです。これには、チャン・ツッカー・ベル財団と共同で開発された、シングルセルデータの効率的な管理を可能にするTileDB-SOMAパッケージが含まれます。CELLxGENE Discover Census — 世界最大の完全にキュレーションされたシングルセルデータセット — を強化し、世界中の学術機関や大手製薬会社で使用されています。

データ管理の将来のトレンドについて見解を示してください。

データが豊富になれば、AIアプリケーションはより賢くなります。大規模言語モデルは、複数のデータモダリティを活用し、さまざまなデータセットとの統合により、AIの新しいフロンティアであるマルチモーダルAIが開けられます。

実際的には、マルチモーダルAIは、ユーザーがあらゆる入力とあらゆる出力タイプを使用してモデルをプロンプトできることを意味します。TileDBは、マルチモーダルAIをサポートするための理想的なデータベースであると考えています。将来に登場するあらゆる新しいデータモダリティに対応できるように設計されています。

素晴らしいレビュー、詳しく知りたい方はTileDBを訪問してください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。