インタビュー
スティーブン・ヒリオン、AstronomerのデータおよびAI担当シニア・バイス・プレジデント – インタビュー・シリーズ

スティーブン・ヒリオンは、AstronomerのデータおよびAI担当シニア・バイス・プレジデントです。彼は、研究数学における学術的な背景と、シリコンバレーのマシンラーニングプラットフォーム開発における15年以上の経験を活かし、Apache Airflowの機能を特にMLおよびAIチーム向けに開発しています。また、内部のデータサイエンスチームを監督しています。彼のリーダーシップの下、Astronomerは、モダンなデータオーケストレーションプラットフォームを進化させ、マシンラーニングを通じて、多様なデータソースとタスクをサポートするデータパイプラインの機能を大幅に強化しました。
データサイエンスとAIの分野での経歴と、エンジニアリングおよびアナリティクスチームのリーダーシップについて、詳しくお話しください。
私は、バークレーで研究数学を学んだ後、シリコンバレーで成功したスタートアップ企業でエンジニアとして働きました。学問の世界を離れて政治や官僚主義から離れることができてよかったのですが、数年後には数学を恋しさにかられたので、マシンラーニングやアナリティクスのプラットフォームの開発に移りました。以来、これらの分野で活動しています。
純粋数学のトレーニングを受けた結果、データサイエンティストが「パルシモニー」と呼ぶもの、つまり、適切なツールを使用し、不要なものは使わないという考え方を好みます。数学者は複雑な機械よりも優雅な解決策を好む傾向があるので、マシンラーニングをビジネス問題に適用する際には、シンプルさを重視しています。ディープラーニングは一部のアプリケーションには素晴らしいですが、たとえば文書の要約には大規模な言語モデルが適していますが、シンプルな回帰モデルが適切な場合もあります。
データサイエンティストとソフトウェアエンジニアの役割の変化を20年間見てきました。両方の役割を経験したので、マシンラーニングプロジェクトに適用されるソフトウェア開発ライフサイクル(特に自動化とテスト)の重要性を認識しています。
AIおよび大規模言語モデル(LLM)向けの構造化されていないデータを移動、処理、分析する上での最大の課題について、詳しくお話しください。
ジェネレーティブAIの世界では、データが最も貴重な資産です。モデルはますますコモディティ化されていますので、差別化はすべて、獲得した機関的知識にあり、特有のキュレーションデータセットにあります。
正しいデータを正しいタイミングで提供するには、データパイプラインに高い要求がかかります。これは、構造化されたデータと同様に、構造化されていないデータにも当てはまります。多くの場合、多様なソースから多様な形式のデータを取り込みます。データをモデル推論またはモデルトレーニングに使用できるように準備するために、さまざまな方法へのアクセスが必要です。また、データの出自と最終的な行き先を理解する必要があります。
モデルをトレーニングするために時折行う場合は、運用化する必要はありません。しかし、モデルを毎日使用して、オンラインフォーラムからの顧客の感情を理解したり、請求書を要約してルーティングしたりする場合は、運用的なデータパイプラインのように見えます。その場合、信頼性と再現性について考える必要があります。モデルを頻繁に微調整する場合は、精度とコストを監視する必要があります。
幸いなことに、データエンジニアは、マシンラーニングの管理に成功したプラットフォームであるAirflowを開発しました。世界で最も洗練されたMLチームによって、すでにモデル展開と監視の管理に成功しています。したがって、モデルは新しいかもしれませんが、オーケストレーションはそうではありません。
精度の向上のために、より小さいモデルを微調整するための合成データの使用について、詳しくお話しください。より大きなモデルをトレーニングすることと比較して、どのように異なりますか。
これは強力なテクニックです。大規模な言語モデルは、世界について学んだことをある種のカプセル化しており、これを小さいモデルに伝えることができます。LLMは、さまざまなデータセットから学んだ膨大な知識をカプセル化しており、これらのモデルは、学習したパターン、構造、情報を捉えた合成データを生成できます。この合成データは、小さいモデルをトレーニングするために使用でき、知識の一部を大きなモデルから小さいモデルに転送します。これは「知識の蒸留」と呼ばれ、特定のタスクでうまく機能する効率的な小さいモデルを作成するのに役立ちます。また、プライバシー問題を回避し、トレーニングデータが小さいまたは不完全な場合にギャップを埋めることもできます。
これは、よりドメイン固有のジェネレーティブAIモデルをトレーニングするのに役立ち、より大きなモデルをトレーニングするよりも効果的かもしれません。
データサイエンティストは、すでに合成データを生成していますが、データセットが汚れている場合には、補間が長い間使用されてきました。しかし、データの分布についての誤った仮定や偏見を導入しないように非常に注意する必要がありました。データを合成することが非常に簡単で強力になった今、偏見を導入しないようにさらに注意する必要があります。エラーは拡大する可能性があります。
生成されたデータの多様性が欠如すると、「モデル崩壊」につながる可能性があります。モデルはうまく機能しているように見えますが、それは全体像を見ていないからです。一般に、トレーニングデータの多様性が欠如していることは、データチームが常に注意するべき事項です。
合成データまたは有機データを使用する場合、基準レベルで、データの血統と品質が重要です。モデルは、トレーニングに使用されるデータと同じだけしか優れません。合成データは、機密データセットを公開せずに表現したり、表現データセットのギャップを埋めたりするのに役立つツールですが、データの出自を示す文書とその品質レベルを示すことができなければなりません。
Astronomerのチームがデータパイプラインの効率と信頼性を向上させるために実施している革新的なテクニックについて、詳しくお話しください。
多数のテクニックがあります。Astroの完全に管理されたAirflowインフラストラクチャとAstro Hypervisorは、ダイナミックスケーリングと先進的なヘルスメトリクスを介したプロアクティブモニタリングをサポートします。これにより、リソースが効率的に使用され、システムがどのスケールでも信頼性が高いことが保証されます。Astroは、SlackやPagerDutyなどのさまざまなチャンネルにカスタマイズ可能な通知を送信できる、データ中心の強力なアラートを提供します。これにより、問題が拡大する前に適切な介入が可能になります。
データ検証テスト、ユニットテスト、データ品質チェックは、データパイプラインと最終的にビジネスを推進するデータの信頼性、精度、効率を確保する上で重要な役割を果たします。これらのチェックにより、データパイプラインを迅速に構築して締め切りに対応する一方で、エラーをキャッチし、開発時間を改善し、バックグラウンドで予期せぬエラーを削減することができます。Astronomerでは、 Astro CLIなどのツールを構築して、コードの機能をシームレスにチェックしたり、データパイプライン内の統合問題を特定したりするのに役立ちます。
ジェネレーティブAIのガバナンスの進化について、ガバナンスを支援するための措置について、詳しくお話しください。
ガバナンスは、ジェネレーティブAIのアプリケーションが成功するためには不可欠です。透明性と再現性についてです。結果がどのように得られたのか、どこから来たのか、誰によって得られたのかを知ることができるかどうかです。Airflow単独で、個々のデータパイプラインが何をしているかを示す方法を提供します。Astronomerでは、チームや展開全体の可視性を高めることでこれを拡張しました。また、プラットフォームの使用状況、パフォーマンス、コスト帰属についての包括的な洞察を提供するレポートダッシュボードを顧客に提供します。さらに、Astro APIにより、チームはAirflowパイプラインをプログラム的に展開、自動化、管理できるため、手動プロセスに関連するリスクを軽減し、複数のAirflow環境を管理する際のスケーリング時にシームレスな運用を保証します。データの血統機能はプラットフォームに組み込まれています。
これらはすべて、データガバナンスを管理するのに役立つステップです。企業が、AIアプリケーションに信頼性を確保するためにデータガバナンスの重要性を認識していることを認識しています。この認識と認知は、データガバナンスツールの需要を大幅に増大させるでしょう。さらに多くのツールが開発されることを予想しますが、これらは、オーケストレーションのスタックの一部である必要があります。したがって、私たちはこれをプラットフォームを構築する上で基本的なものと見なしています。
Astronomerのソリューションが、クライアントの運用効率と生産性をどのように向上させたか、具体的な例を示してください。
ジェネレーティブAIプロセスには、慎重に最適化および繰り返し実行する必要がある、複雑でリソースを大量に消費するタスクが含まれます。Astronomerの管理されたApache AirflowプラットフォームであるAstroは、ジェネレーティブAIアプリの中心にある、タスクを簡素化し、迅速なイノベーションを可能にするフレームワークを提供します。
ジェネレーティブAIタスクをオーケストレートすることで、ビジネスは、計算リソースが効率的に使用され、ワークフローがリアルタイムで最適化および調整されることを保証できます。これは、特に新しいデータに基づいて頻繁に更新または再トレーニングする必要があるジェネレーティブモデルを使用する環境で重要です。
AirflowのワークフローマネジメントとAstronomerの展開およびスケーリング機能を利用することで、チームはインフラストラクチャの管理に費やす時間を減らし、データ変換とモデル開発に集中できます。これにより、ジェネレーティブAIアプリケーションの展開が加速され、パフォーマンスが向上します。
このように、AstronomerのAstroプラットフォームは、幅広いユースケースでジェネレーティブAIの運用効率を向上させるのに役立ちました。具体的には、電子商取引製品の検出、顧客流失リスク分析、サポートの自動化、法的文書の分類と要約、顧客レビューからの製品の洞察、製品画像生成のためのダイナミッククラスタプロビジョニングなどです。
Astronomerは、AIおよびMLアプリケーションのパフォーマンスとスケーラビリティを向上させる上で、どのような役割を果たしていますか。
2024年、スケーラビリティは、ジェネレーティブAIに取り組むビジネスにとって大きな課題です。プロトタイプから本稼働への移行時に、ユーザーは、ジェネレーティブAIアプリが信頼性が高く、パフォーマンスが優れていることを期待します。さらに、コスト効率が良く、すべての規模のビジネスがその潜在性を活用できる必要があります。Astronomerを使用することで、タスクを水平方向にスケーリングして、大量のデータソースをダイナミックに処理できます。Astroは、展開とホストされているクラスターをエラスティックにスケーリングできます。キューベースのタスク実行と専用マシンタイプを使用すると、信頼性と計算リソースの効率的な使用が向上します。コスト効率のためのパズルのピースとして、Astroはスケールゼロとハイバネーションの機能を提供し、コストを制御し、クラウド支出を削減するのに役立ちます。また、プラットフォームのコストについて完全な透明性を提供します。私のデータチームは、消費に関するレポートを生成し、毎日顧客に提供します。
あなたが興味を持っているAIとデータサイエンスの将来のトレンドについて、詳しくお話しください。また、Astronomerはこれらのトレンドにどのように対応していますか。
説明可能なAIは、非常に重要で魅力的です。非常に大きなモデルの中で何が起こっているかを覗き込むことができるのは、ほとんど不気味です。また、モデルトレーニングの環境への影響についてコミュニティが取り組むのを見てみることも興味があります。Astronomerでは、最新の統合をすべてRegistryに更新し続け、データおよびMLチームが、最良のモデルサービスと最も効率的なコンピューティングプラットフォームに手間をかけずに接続できるようにしています。
次の数年間で、先進的なAIツール(LLMなど)と従来のデータ管理システムの統合がどのように進化するか、ご予測をください。
DatabricksやSnowflakeが、LLMの使用と開発をそれぞれのプラットフォームに組み込む方法について発表しました。他のDBMSやMLプラットフォームも同様の措置を講じるでしょう。データエンジニアが、コマンドラインまたはSQLプロンプトからこれほど強力な方法に簡単にアクセスできることを見るのは素晴らしいことです。
特に、関係データベースがマシンラーニングを組み込む方法に興味があります。ML方法がSQL標準に組み込まれるのを待っていますが、両者の間には相性が良くないようです。もしかしたら今回は違うかもしれません。
LLMがデータエンジニアの仕事を支援する将来についてはとても興味があります。コード生成ではすでに成功を収めていますが、データサイエンティストにAI駆動の提案を提供する初期の試みは、まちまちです。Hexは素晴らしいですが、Snowflakeは今のところはあまり印象的ではありません。しかし、データエンジニアの仕事の性質を変える巨大な潜在性があります。なぜなら、ソフトウェアエンジニアにとって、プロンプトは関数名またはドキュメントですが、データエンジニアにはデータもあるからです。モデルが活用できるコンテキストは膨大です。
データサイエンティストやAIエンジニアを目指す人々に、業界で影響力を与えるために、どのようなアドバイスを贈りますか。
実践を通じて学びます。AIを搭載したアプリケーションを構築することは非常に簡単です。何か面白いものを作成し、それを尊敬する会社で働く友人の友人に送ります。あるいは私に送ってください。私は確実に目を通します。
コツは、情熱を持った何かを見つけて、関連するデータの良いソースを見つけることです。友人は、19世紀から異常な野球シーズンについての分析を行い、映画に値する物語を発見しました。Astronomerのエンジニアの一部は、ある週末にセルフヒーリングデータパイプラインのプラットフォームを構築しました。我が輩が輩出してきた中で、数年前では考えられなかったことです。しかし、数日間の努力で、Cohereのハッカソンに勝利し、私たちのプラットフォームの重要な新機能の基礎を構築しました。
素晴らしいインタビュー、詳しく知りたい読者は、Astronomerを訪問してください。












