AIモデルとプラットフォーム

弾力性 > 精度:モデルを本稼働環境で使用するための真のメトリックである「モデル弾力性」の重要性

mm
Unite.AI を Google の優先ソースに追加

著者:Ingo Mierswa、RapidMinerの創設者、社長、チーフデータサイエンティスト。

データサイエンスは最近数年で大きな進歩を遂げてきており、多くの組織が高度な分析または機械学習モデルを使用してプロセスや将来の予想についての深い洞察を得ています。しかし、他の「科学」では、プロジェクトが成功するかどうかは明らかではなく、データサイエンスプロジェクトの87%が本稼働環境に移行しないという報告もあります。100%の成功率は期待できませんが、データサイエンスプロジェクトでは高い成功率を達成するためのパターンが存在し、これらのパターンは特定の業界やユースケースに依存しないようです。つまり、データサイエンスには普遍的な問題が存在し、これを解決する必要があります。

機械学習の成功を測る

データサイエンティストは、機械学習(ML)モデルを作成する際に、モデルがどれほどよく機能するかを測るための明確な数学的基準を使用します。どの基準を使用するかは、モデルの種類によって決まります。例えば、モデルが新しい状況に対してクラスまたはカテゴリを予測する必要があるとします。このような場合、データサイエンティストは、精度(モデルが正しい頻度)または精密度(予測した顧客が実際に解約する頻度)などの測定値を使用します。

データサイエンティストは、これらの客観的な基準を必要としています。なぜなら、彼らの仕事の一部は、これらの評価基準を最適化して、最良のモデルを生成することにあるからです。実際、データをモデル化のために準備すること以外に、データサイエンティストはモデルの構築と調整に最も多くの時間を費やしています。

しかし、このことには欠点もあります。データサイエンティストは、実際にモデルを本稼働環境に移行することにあまり焦点を当てていません。これは、複数の理由で問題です。第一に、成果が上がらないモデルは、モデルを展開する組織に対してビジネスへの影響を生み出すことができません。第二に、これらの組織は、モデルを開発、トレーニング、運用化するのに時間とお金を費やしていますが、モデルは「現実世界」のデータに対して成功的に結果を生み出すことができません。したがって、これらの組織は、機械学習やその他のデータサイエンスツールを自分たちの組織にとって無駄であると判断し、将来的にデータサイエンスのイニシアチブを進めることを辞める可能性が高くなります。

実際、データサイエンティストはモデルを調整することを楽しんでおり、多くの時間を費やしています。しかし、ビジネスへの影響がない場合、この時間は賢く使われているわけではありません。特に、今日の世界ではデータサイエンティストが希少なリソースであることを考えると、これは特に痛ましいことです。

Netflix賞と本稼働環境への移行の失敗

最近、モデル構築への過度の投資とモデル運用への不十分な投資の現象が見られました。 Netflix Prize (NFLX ) は、ユーザーの映画に対する評価を予測するための最良の共同フィルタリングアルゴリズムを競うオープンコンペティションでした。如果あなたが新しい映画に高い評価を与えると、たぶんその映画はあなたが楽しんでいるはずです。したがって、この評価システムを使用して、Netflixはあなたに特定のタイトルを推薦し、あなたが推薦されたコンテンツを楽しむと、Netflixの顧客として長く残る可能性が高くなります。グランプリは、Netflixのアルゴリズムを少なくとも10%改善したチームに贈られる100万ドルの賞金でした。

このチャレンジは2006年に開始され、続く3年間で、世界中の4万を超えるデータサイエンスチームの貢献により、タイトル推薦の成功率が10%以上改善されました。ただし、優勝チームのモデルは 本稼働環境に移行されませんでした。Netflixは「精度の向上が、モデルを本稼働環境に移行するための努力を正当化しなかった」と述べました。

最適なものが常に最適なものではない理由

モデル精度やその他のデータサイエンス基準は、モデルを本稼働環境に移行する前にモデルの成功を測るために長年使用されてきました。多くのモデルは本稼働環境に移行することなく終了します。これは、エネルギーと時間の両方でリソースの浪費です。

しかし、モデル調整への過度の投資にはさらに問題があります。第一に、テストデータへの不注意な過剰適合が発生し、モデルはデータサイエンティストにとっては良好に見えますが、実際には本稼働環境で不十分に機能するか、時には有害な結果をもたらす可能性があります。これは2つの理由で発生します:

  1. テストエラーと本稼働環境でのエラーには既知の不一致があります
  2. ビジネスへの影響とデータサイエンスのパフォーマンス基準は相関していますが、「最適な」モデルは常に最大の影響を与えない

最初の点は「テストセットへの過剰適合」とも呼ばれます。これは、特にKaggleのようなデータサイエンスコンテストの参加者の中ではよく知られた現象です。このようなコンテストでは、パブリックリーダーボードとプライベートリーダーボードの間で既にこの現象の強いバージョンを見ることができます。実際、参加者はKaggleコンテストのパブリックリーダーボードで優勝することなく、データを読むことなく優勝する可能性があります。同様に、プライベートリーダーボードと全体的なコンテストの勝者は、評価されたデータセット以外のデータセットに対してパフォーマンスを維持できないモデルを生成した可能性があります。

精度はビジネスへの影響を意味しない

長い間、この慣行を受け入れてきました。これは、テストデータセットへのモデルの適合度が遅いものになります。結果として、最良のモデルであるように見えるものが、実際には中途半端なものであることがあります:

  • 予測精度のような測定値は、ビジネスへの影響を意味しない
  • 精度を1%改善することは、ビジネス結果を1%改善することを意味しない
  • 低性能モデルがビジネスへの影響で他のモデルを上回る場合があります
  • メンテナンス、スコアリングスピード、または時間の経過に対するロバスト性(「弾力性」)などの他の要因も考慮する必要があります。

この最後の点は特に重要です。最良のモデルは、コンテストで勝つか、データサイエンスラボで良好に見えるかではなく、本稼働環境で維持され、さまざまなテストセットで良好に機能するものです。これらのモデルは、弾力性のあるモデルと呼ばれます。

ドリフトと弾力性の重要性

すべてのモデルは時間の経過とともに劣化します。質問は、どれほど速く劣化するか、そしてどれほどモデルが変化した状況下でまだ良好に機能するかです。モデルが劣化する理由は、世界が静的ではないため、モデルに適用されるデータも時間の経過とともに変化するためです。如果変化がゆっくりと発生する場合、これを「概念ドリフト」と呼びます。如果変化が突然発生する場合、これを「概念シフト」と呼びます。例えば、顧客は時間の経過とともに消費行動をゆっくりと変える可能性があり、トレンドやマーケティングの影響を受ける可能性があります。購入意欲モデルはある時点で機能しなくなる可能性があります。これらの変化は、特定の状況で急速に加速する可能性があります。COVID-19は、トイレットペーパーや消毒剤などの特定の製品の売上が急激に増加することによって、予測モデルを完全に混乱させる可能性があります。

弾力性のあるモデルは、精度や精密度などの測定値では最良のモデルではないかもしれませんが、より広い範囲のデータセットで良好に機能します。したがって、モデルはより長い期間で良好に機能し、持続的なビジネスへの影響をもたらす可能性が高くなります。

線形モデルやその他の単純なモデルは、特定のテストセットや時間に過剰適合しにくいため、より弾力性があります。より強力なモデルは、シンプルなモデルに対する「チャレンジャー」として使用できます。データサイエンティストは、モデルが時間の経過とともに維持できるかどうかを確認できます。しかし、これはモデリングの旅の終わりに行うべきです。
データサイエンスの分野では、正式なKPIとしてモデルを評価する方法はまだ導入されていませんが、データサイエンティストがモデルの弾力性を評価する方法は複数あります:

  • クロスバリデーション実行での標準偏差が小さいと、モデルのパフォーマンスはテストセットの詳細に依存しない
  • データサイエンティストが完全なクロスバリデーションを実行していない場合、テストと検証のために2つの異なるデータセットを使用できます。テストデータセットと検証データセットのエラー率の不一致が少ないと、弾力性が高い
  • モデルが本稼働環境で適切に監視されている場合、エラー率は時間の経過とともに見ることができます。エラー率の時間経過による一貫性は、モデルの弾力性の良い兆候です。
  • モデル監視ソリューションがドリフトを考慮する場合、データサイエンティストは、入力ドリフトによってどれほどモデルが影響を受けるかにも注意する必要があります。

データサイエンスの文化の変化

モデルが本稼働環境に展開された後も、モデルの精度への脅威が存在します。上記のモデル弾力性に関する最後の2点は、モデルの本稼働環境での適切な監視を必要とします。データサイエンスの文化の変化の出発点として、企業はモデル監視に投資し、データサイエンティストがモデルを本稼働環境に移行した後のパフォーマンスの欠如に対して責任を負うようにすることが賢明です。これにより、文化はモデル構築文化から価値創造文化、そしてデータサイエンス分野の持続可能な文化へと変化します。

最近の世界的な出来事は、世界が急速に変化することを示しています。現在、より多くのモデルを構築する必要があります。Kaggleは、データサイエンティストを世界中で集めて、COVID-19に対する戦いで使用できるモデルソリューションを構築するチャレンジを主催しています。私は、このチャレンジによって生成される最も成功したモデルは、最も正確なものではなく、最も弾力性のあるものであると予想しています。なぜなら、COVID-19のデータは1日で急速に変化することができるからです。

データサイエンスは、「最良の」モデルを生成することではなく、真実を見つけることについてであるべきです。弾力性よりも精度を優先するより高い基準を自分たちに課すことで、データサイエンティストは組織に対してより多くのビジネスへの影響をもたらすことができ、将来をより良いものにすることができます。

dly COVID-19データは1日で変化する可能性があります。データサイエンスは「最良の」モデルを生成することではなく、真実を見つけることについてであるべきです。弾力性よりも精度を優先するより高い基準を自分たちに課すことで、データサイエンティストは組織に対してより多くのビジネスへの影響をもたらすことができ、将来をより良いものにすることができます。

インゴ・マイエルスワは、ドイツのドルトムント工科大学(TU Dortmund University)の人工知能部門でRapidMinerの開発を開始して以来、業界のベテランデータサイエンティストです。マイエルスワ、科学者は、予測分析とビッグデータについて数多くの賞を受賞した出版物を著しています。マイエルスワ、起業家は、RapidMinerの創設者です。彼は、戦略的なイノベーションを担当し、RapidMinerの技術に関する全体的な質問に対処しています。彼のリーダーシップの下で、RapidMinerは最初の7年間で年間300%の成長を遂げました。2012年、彼は米国、英国、ハンガリーにオフィスを開設することで、国際化戦略を主導しました。2回の資金調達ラウンド、Radoopの買収、GartnerやForresterなどの主要なアナリストファームによるRapidMinerのポジショニングのサポートの後、インゴは、世界最高のチームをRapidMinerに引きつけることに大きな誇りを感じています。