AIモデルとプラットフォーム

LightAutoML: オートMLフレームワーク для金融サービス

mm
Unite.AI を Google の優先ソースに追加

オートMLは数年前に人気を博したが、オートMLの初期の研究は90年代初頭に科学者がハイパーパラメータ最適化に関する最初の論文を発表したときに始まった。2014年にICMLが最初のオートMLワークショップを開催したとき、オートMLはML開発者の注目を集めた。オートMLの主要な焦点の1つは、ハイパーパラメータ検索問題であり、モデルは特定の機械学習モデルに対して大きなハイパーパラメータ空間で最適なハイパーパラメータを決定するために、さまざまな最適化方法の配列を実装する。オートMLモデルが一般的に実装するもう1つの方法は、特定のハイパーパラメータが特定の機械学習モデルに対して最適なハイパーパラメータである確率を推定することである。モデルは、従来、歴史的なデータや他のデータセットから得られるベイジアン方法を実装することでこれを達成する。ハイパーパラメータ最適化に加えて、他の方法は、モデルの空間から最適なモデルを選択することを試みる。

この記事では、LightAutoMLという、主に金融部門のヨーロッパ企業とそのエコシステムのために開発されたオートMLシステムについて説明する。LightAutoMLフレームワークは、さまざまなアプリケーションに展開されており、結果は優れたパフォーマンスを示し、データサイエンティストのレベルに相当する、高品質の機械学習モデルを構築することにも成功した。LightAutoMLフレームワークは、以下の貢献を試みている。まず、LightAutoMLフレームワークは、主に大きなヨーロッパの金融および銀行機関のエコシステムのために開発された。フレームワークとアーキテクチャのため、LightAutoMLフレームワークは、複数のオープンベンチマークとエコシステムアプリケーションで、最先端のオートMLフレームワークを上回ることができる。LightAutoMLフレームワークのパフォーマンスは、データサイエンティストによって手動で調整されたモデルと比較され、結果はLightAutoMLフレームワークのパフォーマンスが優れていることを示した。

この記事は、LightAutoMLフレームワークを深く掘り下げ、メカニズム、方法論、フレームワークのアーキテクチャ、そして最先端のフレームワークとの比較を探る。では、始めましょう。

LightAutoML: 金融サービス向けオートMLフレームワーク

研究者がオートMLを初めて研究し始めたのは90年代初頭だったが、オートMLは最近数年で大きな注目を集めた。プロミネントな工業的な解決策の多くは、AmazonのAutoGluon、DarwinAI、H20.ai、IBM Watson AI、Microsoft (MSFT ) AzureMLなど、自動的に機械学習モデルを構築する。多くのこれらのフレームワークは、金融サービス、ヘルスケア、教育など、さまざまなアプリケーションクラス全体で自動的に機械学習モデルを構築するための一般的なオートMLソリューションを実装する。背後にある主な仮定は、自動モデルを開発するプロセスはすべてのアプリケーション全体で同じであるということである。しかし、LightAutoMLフレームワークは、一般的なオートMLソリューションではなく、個々のアプリケーションのニーズに応える垂直的なアプローチを実装する。LightAutoMLフレームワークは、複雑なエコシステムとその特性に焦点を当てた垂直的なオートMLソリューションである。まず、LightAutoMLフレームワークは、高速で近似的に最適なハイパーパラメータ検索を提供する。モデルはこれらのハイパーパラメータを直接最適化しないが、満足のいく結果を達成する。さらに、モデルは、最適なモデルを小さな問題で、そして大きな問題で十分に高速であることを保証するために、スピードとハイパーパラメータ最適化のバランスを動的に保つ。2つ目、LightAutoMLフレームワークは、モデルの実行時間を悪影響なく高速化するために、機械学習モデルの範囲を故意に2つ、線形モデルとGBMまたは勾配ブースティング決定木のみに制限する。機械学習モデルの範囲を制限する主な理由は、与えられた問題とデータの種類に対して、パフォーマンスに悪影響を与えることなく、モデルの実行時間を高速化することである。3つ目、LightAutoMLフレームワークは、モデルの特徴に基づいて、特定の選択ルールとメタ統計を使用して、さまざまな特徴の前処理スキームを選択するための独自の方法を提示する。LightAutoMLフレームワークは、幅広いオープンデータソースとさまざまなアプリケーションで評価される。

LightAutoML: 方法論とアーキテクチャ

LightAutoMLフレームワークは、Presetsというモジュールで構成されており、典型的な機械学習タスクのエンドツーエンドモデル開発に専用である。現在、LightAutoMLフレームワークはPresetsモジュールをサポートする。まず、TabularAutoML Presetは、表形式データセットで定義された古典的な機械学習問題を解決することに焦点を当てている。2つ目、White-Box Presetは、WoEまたはWeight of Evidenceエンコーディングと離散化された特徴ではなく、ロジスティック回帰などのシンプルな解釈可能なアルゴリズムを実装して、表形式データの二項分類タスクを解決する。シンプルな解釈可能なアルゴリズムを実装することは、さまざまな要因によって解釈可能性の制約が課されるため、適用可能性の確率をモデル化するための一般的な慣行である。3つ目、NLP Presetは、事前トレーニングされた深層学習モデルや特定の特徴抽出器を含むNLPツールと組み合わせて表形式データを処理することができる。最後に、CV Presetは、基本的なツールの助けを借りて画像データを処理する。LightAutoMLモデルがすべての4つのPresetsをサポートしていることにもかかわらず、フレームワークはプロダクションレベルのシステムでTabularAutoMLのみを使用することが重要である。

LightAutoMLフレームワークの典型的なパイプラインは、以下の画像に示されている。

各パイプラインには3つのコンポーネントがある。まず、Readerは、タスクの種類と生データを受け取るオブジェクトであり、重要なメタデータ計算を実行し、初期データをクリーンアップし、さまざまなモデルを適合させる前にデータ操作を決定する。次に、LightAutoMLの内部データセットには、CVイテレータとメタデータが含まれており、データセットの検証スキームを実装する。3つ目は、単一の予測を得るためにスタックされまたはブレンドされる複数の機械学習パイプラインである。LightAutoMLフレームワークのアーキテクチャ内の機械学習パイプラインは、単一のデータ検証と前処理スキームを共有する複数の機械学習モデルの1つである。前処理ステップには、最大2つの特徴選択ステップ、特徴エンジニアリングステップ、または前処理が不要な場合は空であることがある。MLパイプラインは、同じデータセットで独立して計算され、平均化(または加重平均化)を使用してまとめることができる。代わりに、スタッキングアンサンブルスキームを使用して、マルチレベルアンサンブルアーキテクチャを構築することができる。

LightAutoML タブラー プリセット

LightAutoMLフレームワーク内では、TabularAutoMLはデフォルトのパイプラインであり、表形式データで3つのタスクの種類を解決するために実装される: 二項分類、回帰、多クラス分類、さまざまなパフォーマンスメトリックと損失関数に対して。表形式データの4つの列、カテゴリ特徴、数値特徴、タイムスタンプ、クラスラベルまたは連続値を持つ単一のターゲット列が、TabularAutoMLコンポーネントに入力として提供される。LightAutoMLフレームワークの設計の背後にある主な目的の1つは、高速な仮説テストのツールを設計することであったため、フレームワークはパイプラインの最適化のためのブルートフォース方法を使用せず、効率性の高い技術と、幅広いデータセットで機能するモデルにのみ焦点を当てている。

オートタイピングとデータ前処理

さまざまな特徴をさまざまな方法で処理するために、モデルは各特徴の種類を知る必要がある。単一のタスクと小さなデータセットの場合、ユーザーは各特徴の種類を手動で指定することができる。しかし、特徴の種類を手動で指定することは、数百のタスクと数千の特徴を持つデータセットを含む状況では実行可能な選択肢ではない。TabularAutoML Presetの場合、LightAutoMLフレームワークは特徴を3つのクラスにマッピングする必要がある: 数値、カテゴリ、日時。1つのシンプルで明らかな解決策は、実際の特徴の種類として列配列データ型を使用することである: 浮動小数点/整数列を数値特徴にマッピングし、タイムスタンプまたはタイムスタンプとして解釈できる文字列を日時にマッピングし、他のものをカテゴリにマッピングする。しかし、このマッピングは、数値データ型がカテゴリ列で頻繁に発生するため、最も適切なものではない。

検証スキーム

検証スキームは、オートMLフレームワークの重要なコンポーネントである。業界のデータは時間の経過とともに変化するため、モデルを開発する際に、独立同分布(IID)仮定は無関係になる。オートMLモデルは、パフォーマンスを推定し、ハイパーパラメータを検索し、フォールド外予測を生成するために検証スキームを使用する。TabularAutoMLパイプラインは、以下の3つの検証スキームを実装する。

  • KFoldクロスバリデーション: KFoldクロスバリデーションは、TabularAutoMLパイプラインのデフォルトの検証スキームであり、行動モデルのためのGroupKFoldと、分類タスクのための層化KFoldを含む。
  • ホールドアウト検証: ホールドアウト検証スキームは、ホールドアウトセットが指定された場合に実装される。
  • カスタム検証スキーム: カスタム検証スキームは、ユーザーが個々の要件に応じて作成することができる。カスタム検証スキームには、クロスバリデーションと時間シリーズ分割スキームが含まれる。

特徴選択

特徴選択は、業界基準のモデルを開発する上で重要な側面であるが、多くのオートMLソリューションはこの問題に焦点を当てていない。対照的に、TabularAutoMLパイプラインは、以下の3つの特徴選択戦略を実装する: 選択なし、重要度カットオフ選択、重要度ベースのフォワード選択。3つの中で、重要度カットオフ選択特徴選択戦略がデフォルトである。さらに、特徴の重要度を推定する主な2つの方法がある: スプリットベースのツリーアイポートランスと、GBMモデルまたは勾配ブースティング決定木のパーミューテーション重要度。重要度カットオフ選択の主な目的は、モデルに役立たない特徴を拒否し、パフォーマンスに悪影響を与えることなく、特徴の数を削減することである。これにより、モデル推論とトレーニングを高速化することができる。

上の画像は、バイナリバンクデータセットでのさまざまな選択戦略を比較する。

ハイパーパラメータチューニング

TabularAutoMLパイプラインは、チューニングされるものに基づいて、ハイパーパラメータをチューニングするためのさまざまなアプローチを実装する。

  • エーリーストッピングハイパーパラメータチューニング: トレーニングフェーズ中にすべてのモデルのイテレーション数を選択する。
  • エキスパートシステムハイパーパラメータチューニング: モデルのハイパーパラメータを満足のいく方法で設定するためのシンプルな方法である。ハードチューニングされたモデルと比較して、最終的なモデルのスコアが大幅に低下するのを防ぐ。
  • ツリーストラクチャードパーゼン推定(TPE): GBMまたは勾配ブースティング決定木モデル。TPEは、LightAutoMLパイプラインのデフォルトのチューニング戦略である混合チューニング戦略である。各GBMフレームワークに対して、LightAutoMLフレームワークは2つのモデルをトレーニングする: 最初のモデルはエキスパートハイパーパラメータを受け取り、2番目のモデルは時間予算に適合するようにファインチューンされる。
  • グリッドサーチハイパーパラメータチューニング: 線形モデルの正則化パラメータをファインチューニングするために、TabularAutoMLパイプラインで実装される。早期停止とウォームスタートとともに。

モデルは、ユーザーによって定義されたもの、またはタスクに既定のものである、メトリック関数を最大化することで、すべてのパラメータをチューニングする。

LightAutoML: 実験とパフォーマンス

パフォーマンスを評価するために、LightAutoMLフレームワーク内のTabularAutoML Presetは、さまざまなタスクで既存のオープンソースソリューションと比較され、LightAutoMLフレームワークの優れたパフォーマンスが実証される。まず、比較は、35のバイナリおよびマルチクラス分類タスクのデータセットで評価されるOpenMLベンチマークで実行される。以下の表は、LightAutoMLフレームワークと既存のオートMLシステムの比較をまとめたものである。

表から見られるように、LightAutoMLフレームワークは、ベンチマーク内の20のデータセットで他のすべてのオートMLシステムを上回っている。以下の表は、データセットのコンテキストで詳細な比較を示しており、LightAutoMLはさまざまなクラスのタスクで異なるパフォーマンスを提供していることを示している。バイナリ分類タスクの場合、LightAutoMLはパフォーマンスで劣るが、大量のデータを持つタスクの場合、LightAutoMLフレームワークは優れたパフォーマンスを提供する。

以下の表は、15のバンクデータセットでLightAutoMLフレームワークとオートMLシステムのパフォーマンスを比較する。表から見られるように、LightAutoMLは15のデータセットのうち12で他のすべてのオートMLソリューションを上回り、勝率は80%である。

最終的な考え

この記事では、LightAutoMLという、主に金融部門のヨーロッパ企業とそのエコシステムのために開発されたオートMLシステムについて説明した。LightAutoMLフレームワークは、さまざまなアプリケーションに展開されており、結果は優れたパフォーマンスを示し、データサイエンティストのレベルに相当する、高品質の機械学習モデルを構築することにも成功した。LightAutoMLフレームワークは、以下の貢献を試みている。まず、LightAutoMLフレームワークは、主に大きなヨーロッパの金融および銀行機関のエコシステムのために開発された。フレームワークとアーキテクチャのため、LightAutoMLフレームワークは、複数のオープンベンチマークとエコシステムアプリケーションで、最先端のオートMLフレームワークを上回ることができる。LightAutoMLフレームワークのパフォーマンスは、データサイエンティストによって手動で調整されたモデルと比較され、結果はLightAutoMLフレームワークのパフォーマンスが優れていることを示した。LightAutoMLフレームワークは、複数のオープンなベンチマークとエコシステムアプリケーションで、最先端のオートMLフレームワークを上回り、データサイエンティストによって手動で調整されたモデルと比較して、より優れたパフォーマンスを示した。

職業はエンジニア、心は作家。クナルは、AIとMLを深く愛し理解しているテクニカルライターで、これらの分野の複雑な概念を魅力的で情報の多いドキュメンテーションを通じて簡素化することに尽力しています。