インタビュー

アステラ ソフトウェアの Jay Mishra – インタビュー シリーズ

mm
Unite.AI を Google の優先ソースに追加

Jay Mishra は、アステラ ソフトウェアの最高経営責任者 (COO) であり、アステラ ソフトウェアは、企業向けのデータ ソリューションを提供する急成長中の企業です。アステラ ソフトウェアは、ユーザーに、データから洞察までのギャップを埋めるための、ユーザー フレンドリーで高性能なデータ抽出、データ品質、データ統合、データ ウェアハウス、および電子データ交換ソリューションのスイートを提供しています。これらのソリューションは、中規模企業からフォーチュン 500 企業まで、さまざまな業界の企業で使用されています。

コンピューター サイエンスに最初に惹かれたのは何ですか?

私は数学に対する深い情熱を持っています。私のコンピューター サイエンスへの旅は、その自然な延長です。私の学部教育は数学とコンピューター サイエンスでした。特に、アルゴリズムと高度なアルゴリズム プロセスの複雑な動作に惹かれました。私はコンピューター サイエンスの修士課程でアルゴリズムを専攻しました。以来、私のコンピューター サイエンスとのつながりは強く続いています。私は常に最新の開発を追跡しようと努めています。

現在、アステラの COO です。日々の役割について教えてください。

アステラの COO として、私の役割は多面的です。アステラの創設以来、私はさまざまな分野で責任を負ってきました。製品の開発とコーディングに積極的に貢献することから、機能が顧客のニーズと一致するようにすることまで、そして販売とマーケティングで製品を市場に導入するまで、広範な責任を負っています。成長期にあり、私は収益目標の管理と新しい市場への製品ポートフォリオの戦略的拡大を含む追加の責任を負っています。基本的に、私は運用のほぼすべての側面に携わり、優れた製品を構築するだけでなく、それらを市場に導入し、ビジネス目標を達成することを保証しています。

読者がこの用語に不慣れな場合、データ ウェアハウスとは何ですか?

データ ウェアハウスは、エンタープライズのすべてのデータを中央リポジトリに統合するためのアーキテクチャ パターンです。このリポジトリは、ビジネスの現在と将来の状態を表すさまざまな種類の分析、レポート、ダッシュボードを生成する基盤となります。データを特定の方法で統合し、レポートを容易にするために、データ ウェアハウスと呼ばれるアーキテクチャを設計します。

この用語は、実際の倉庫から借用されています。ここでは、製品が整理された棚に保管されます。しかし、データの世界では、さまざまなソースからのデータを統合します。生産、ウェブサイト、顧客、販売、マーケティング、財務、人事部門からのデータを統合します。すべてのデータを 1 か所にまとめ、データ ウェアハウスと呼ばれるものを設計します。タイムラインに基づいたレポートを容易にするために、特定の方法で設計されています。

現在のデータ ウェアハウスの主なトレンドは何ですか?

データ ウェアハウスは、過去 20 ~ 25 年でかなり進化しました。約 10 年前、自動化されたデータ ウェアハウスが登場し、データ モデルとデータ ウェアハウスの構築プロセスを加速するパラダイム シフトが起こりました。最近、自動化が中心舞台に登場しました。データ ウェアハウスの繰り返しの性質に対処し、プロセスを合理化して時間とリソースを節約します。

アステラの製品である Astera Data Warehouse Builder では、データ ウェアハウスの自動化に対する包括的なアプローチを提供しています。ETL パイプラインとデータ モデリングの自動化から、データをスター スキーマまたはデータ ヴォールトなどの構造に自動的に読み込むまで、すべてをカバーしています。さらに、変更データ キャプチャ (CDC) メカニズムを介してこれらの構造を効率的に維持します。この包括的な自動化は、データ ウェアハウス ランドスケープにおける重要なトレンドとなっています。

さらに、最新のトレンドは、データ ウェアハウスと人工知能 (AI) の融合です。特に、生成的な AI は、自動化を新たな高みに引き上げました。タスクを自動化するだけでなく、ユーザーの意思決定を支援します。

データ ウェアハウス コンポーネント、パイプライン、意思決定ポイントの構成は、AI によってガイドされることができます。データ ウェアハウスをこれまでよりも強力で効率的なものにします。基本的に、これはステロイドに乗った自動化であり、データ ウェアハウスの景観を変革しています。AI とデータ ウェアハウスの交差点は、将来に大きな期待を抱くトレンドです。

企業がデータ ウェアハウス開発を考慮すべき 4 つの基本原則は何ですか?

1. 明確な目的の定義

データ ウェアハウスから何を得たいかを理解することから始めます。目的のない大量のデータを収集するという一般的な落とし穴を避けます。代わりに、達成したい具体的な目的を特定します。どのようなレポートと洞察を求めているのか。目標に焦点を当てることで、関連するデータのみを取り込み、不要な大量の情報を蓄積することを避けることができます。ストレージとコンピューティング パワーのコストが減少していることを考えると、これらのリソースを賢く使うことが重要です。

2. 正しいアーキテクチャ パターンの選択

アーキテクチャ パターンは非常に重要です。データ ウェアハウス ソリューションの成功または失敗を決定します。Inmon スタイルのデータ ウェアハウス、Ralph Kimball のスター スキーマ、Data Vault などの新しいパターンなど、さまざまなオプションがあります。すべてのシナリオに適したパターンはありません。

データ ヴォールトの上にスター スキーマを配置する組み合わせが一般的です。しかし、各要件やシナリオごとに異なる答えがあることを認識する必要があります。専門家に相談し、どのアーキテクチャ パターンがあなたのシナリオに適しているかを確認する必要があります。

3. 正しいツールの選択

ツールは非常に重要であり、データ ウェアハウス ソリューションを構築して維持するために必要な時間とリソースに大きな違いをもたらします。ツールの機能に注意を払い、1 つのアンバレラの下で最も多くの要件をカバーできる製品を探します。ETL、データ品質、データ モデリング、データ ローディング、データ パブリッシングなどの特定の領域があります。各領域に複数の製品を使用することは難しいことです。

4. チーム

最後に、データ ウェアハウス ソリューションを構築するために集めたチームは、最も重要な部分です。データ アーキテクチャ パターンに強い背景を持つ人物を配置することをお勧めします。チーム構成については、ビジネス ユーザーとプログラミングの背景を持つ人々、または少なくともデータの専門知識を持つ人々の混合チームが最も効果的です。また、データ管理担当者、ビジネス ユーザーとの密な協力を促進する必要があります。こうした組織のさまざまな側面間の協力を促進することで、データ ウェアハウス ソリューションの構築と維持に責任を持つ一貫性と効果的なチームを作成できます。

データ ウェアハウスの成功は、これら 4 つの原則のバランスをとることにかかっています。これらの原則を慎重に従うことで、我々の経験では成功の秘訣となっています。

企業がモダンなデータ スタックが必要な理由は何ですか?

「モダン」とは、どのように定義するかによって異なりますが、時には年、月、さらには日に変化することがあります。私たちは、変化するデータの景観を念頭に置いて設計されたモダンなツールセットを考慮する必要があります。過去数年間で、データの性質と量に大きな変化がありました。ビッグ データの台頭により、データの景観が変わりました。E コマースサイト、生産データベース、ビジネスのさまざまな部分からのデータが流入しています。このデータは、構造化されたデータだけでなく、非構造化されたデータも含み、生成される速度も増加しています。

これらのデータの変化に効果的に対処するために、ツールセットを継続的に評価し、適応させる必要があります。モダンなデータ スタックは、データの構造と速度の変化に対処するように設計されており、最近の数年間に進化した新しいアーキテクチャ パターンにも対応しています。したがって、データを最大限に活用したい場合は、データ スタックを最新化する必要があります。これが、最新のデータの課題に対処する唯一の方法です。

企業は、現状の解決策に固執することがあります。ただし、データそのものは本質的に動的であることを認識することが重要です。データは常に進化しており、新しい課題と機会をもたらします。現状の解決策は、これらの変化に対応することができない可能性があります。したがって、企業はデータ スタックを最新化する必要があります。これは、機能するものを壊すことではなく、データの進化する性質に対応することです。データ技術の進歩を継続的に評価し、統合することで、企業は競争力を維持し、データ主導の世界で情報に基づいた決定を下すことができます。

現在、業界で見られるデータ管理の課題は何ですか?

1. データ速度と統合

私たちが直面している大きな課題の 1 つは、さまざまなアプリケーションからの大量のデータです。典型的な IT 組織では、新しいアプリが頻繁に登場し、特に中規模企業では年間何十、何百も登場します。

これらのアプリはすべてデータを生成し、このデータには貴重な洞察が含まれています。主な懸念は、これらの新しいデータ ソースを既存のデータ パイプラインに迅速に統合し、統一されたビューにまとめる能力です。組織がこれらの新しいデータ ストリームを統合して適応できるスピードが、最大の課題です。

2. データ形式の多様性

もう 1 つの重要な課題は、データそのものの性質から生じ、特に非構造化データの増加です。非構造化データには、さまざまなアプローチがあります。

組織は、このデータを直接データ レイクに保存するか、構造化された形式に抽出して変換するかを決定する必要があります。非構造化データを処理するための効果的な戦略を策定することが重要です。中規模企業や小規模企業でも、非構造化データの影響を受けることがあります。したがって、非構造化データを処理するための効果的な戦略を策定することが不可欠です。

3. データの公開と共有

データの統合と統合は重要ですが、データを効果的に共有する能力も同等に重要です。組織は、内部部門、第三者ベンダー、パートナー、他の利害関係者にデータを公開して配布するメカニズムが必要です。この課題は、データを利用可能にすることだけに止まらず、データのセキュリティ、プライバシー、規制遵守も確保する必要があります。データの共有はビジネスにとって必要なものとなり、関連するテクノロジーと製品は需要に応じて急速に進化しています。

アステラは、カスタマー ワークフローに AI をどのように統合していますか?

私たちは、データ管理における AI とカスタマー ワークフローの交差点を 2 つの異なる方法で見ています。

1. 生成的な AI による使いやすさの向上

使いやすさへの取り組みは、私たちの製品開発哲学の基盤です。過去 12 ~ 13 年間で、非技術的なユーザーにとってもアクセスしやすい製品を設計するという強い評判を築いてきました。わずかなトレーニングで、ユーザーは製品を使用してデータで意味のあるタスクを実行できます。

生成的な AI を導入することで、アステラは使いやすさを新たな高みに引き上げました。自然言語コマンドを使用して製品とやり取りできるユーザー インターフェイスを作成するために、生成的な AI を活用しました。この AI ドリブンのインターフェイスにより、構成タスクが簡素化され、ユーザーにとってより直感的で効率的なものになりました。

さらに、アステラは、以前は数時間の手動作業が必要だったタスクを処理するために、AI ドリブンの自動化を統合しました。データ管理製品の構成が、データ管理ソリューションを構築するための最大のコスト要因でした。AI を使用してこれに対処しようとしています。このアプローチにより、従来の製品構成に費やされる時間とリソースが大幅に削減されます。

例として、アステラの製品である ReportMiner は、ルールに基づいて抽出テンプレートを作成できるようにユーザーに許可することで、非構造化ドキュメントからのデータ抽出を簡素化します。AI は、以前は典型的なユーザーに 2 ~ 3 時間かかったタスクである初期テンプレートを数秒で生成できます。AI によって生成されたテンプレートの最初のバージョンは完全ではないかもしれませんが、作業の約 90% を処理し、ユーザーは簡単な調整を行って数分でタスクを完了できるようになります。このアプローチは、アステラが製品全体で使いやすさを高めるために AI をどのように活用しているかを示すものです。

私たちはデータ スタック全体で同様のことを行っており、人工知能によって使いやすさが大幅に向上しています。

2. ツールセットとしての AI 機能

Astera は、データ管理のさまざまな側面を網羅する統合データ スタックを提供します。Astera の顧客は、データ サイエンスの分野全体で AI にアクセスできます。ここでは、マシン ラーニング モデルを構築して展開することから、ML オペレーション (Machine Learning Operations) の処理まで、そしてオープン ソース ベースのモデル (包括的な大規模言語モデル (LLM) を含む) のファインチューニングまで、幅広い機能が利用できます。さらに、Astera は、ベクター データベース、類似性検索、埋め込みなど、AI のサポートを拡大することに取り組んでいます。

この広範な AI 機能により、Astera のユーザーは、AI をさまざまなデータ関連タスクに活用できます。マシン ラーニング モデルの展開、ML オペレーションの実装、オープン ソース モデルのファインチューニングなどです。

データ管理で AI および ML モデルを活用するためのベスト プラクティスは何ですか?

1. AI および ML の開発の最前線に立つ

大規模言語モデルの分野は急速に進化しています。競争上の優位性を獲得するには、最新の進歩について情報を収集する必要があります。Astera は、OpenAI や LAMA などのモデルを使用する、生成的な AI の早期採用者でした。新しいテクノロジーを継続的に監視することで、効果的に活用できる準備が整います。

2. 複数のモデルと構成の実験

大規模言語モデルのファインチューニングを使用して、8 ~ 13 億パラメータの小規模モデルをローカルに展開しました。これは私たちにとってうまく機能しています。異なるベース モデルと構成を試して、どれが最適かを確認することをお勧めします。大規模言語モデルにはさまざまなバリエーションがあり、それぞれ独自の機能があります。開発者やデータ サイエンティストがデータ サイエンスの旅で使用するように、幅広いオプションを選択できる構成を作成します。

ユーザーをエンパワーするために、幅広いオプションを提供する構成システムを作成しました。これは、開発者やデータ サイエンティストがオープン ソース ライブラリを使用してデータ ドリブンな取り組みを行うときと同様です。私たちの目標は、これらのオプションをシームレスに製品に統合し、ユーザーにとってダイナミックで適応性の高い体験を提供することです。

3. ローカル展開を API より優先する

データ中心の製品を扱う場合、遅延を減らすことが重要です。AI および ML モデルの API への依存のみでは、特に大量のデータを扱う場合に、許容できない遅延が生じる可能性があります。特定のシナリオに固有のファインチューンされたモデルをローカルに展開することを優先することをお勧めします。これにより、応答時間と全体的なパフォーマンスが大幅に向上します。

アステラは、競合するプラットフォームよりも優れたソリューションである理由は何ですか?

  • アステラのソリューションには、AI によって強化されたコード不要の直感的な視覚インターフェイスがあり、技術的なスキルに関係なく、すべてのユーザーが複雑なデータ プロセスを実行できます。
  • アステラのデータ スタックの自動化機能により、繰り返しの手動タスクが削減され、時間と開発リソースが節約されます。
  • アステラの統合プラットフォームにより、ユーザーはソリューションを切り替えることなく、エンドツーエンドのデータ プロセスを実行できます。これにより、複数のシロ化されたシステムの学習と管理のコストが削減されます。

素晴らしいインタビュー、詳しく知りたい読者は Astera Software を訪問してください。

アントワーヌは、Unite.AIのビジョナリーレーダーであり共同創設者です。彼は、AIとロボティクスの未来を形作り、推進するための不屈の情熱に駆り立てられています。シリアルエントレプレナーである彼は、AIが電気と同様に社会に大きな変革をもたらすと信じており、破壊的な技術とAGIの可能性について語ることがよくあります。

彼はフューチャリストとして、これらのイノベーションが私たちの世界をどのように形作るかを探求することに尽力しています。さらに、彼はSecurities.ioの創設者であり、未来を再定義し、全セクターを再構築する最先端技術への投資に焦点を当てたプラットフォームです。