ソートリーダー
マシンラーニング開発の成功には新しいパラダイムが必要 – Thought Leaders

By Victor Thu、Datatronの社長
マシンラーニングを使用したイニシアチブは、従来のソフトウェアを使用したプロジェクトと同じように扱うことはできません。迅速に進める必要があります。そうすれば、テストを行い、問題を修正し、再テストを行うことができます。つまり、プロセスの中で早く失敗する能力が必要です。後で問題を発見するのを待つと、非常に高価で時間がかかることになります。
AIには新しいアプローチが必要
従来の方法でソフトウェアを開発する場合、決定ロジックを使用します。できるだけ正確にしようとします。ソフトウェアが正常に機能するようにロジックを組み込むからです。アプリケーションのロジックが開発された後は、バグ修正以外の変更は必要ありません。非常に方法的な開発プロセスです。各ステップを正確に進めることで、次のステップに進みます。この戦略は、ソフトウェア開発で一貫してその有効性を証明してきました。
しかし、AI/MLプロジェクトでは同じ戦略を使用することはできません。代わりに、MLプロジェクトで成功するために、迅速に繰り返し行う能力が必要です。MLには初期のトレーニングが必要であり、プロセスであることを認識してアプローチする必要があります。最初にデプロイされたときに正確であるとは限りません。
このプロセスには複数のイテレーションが必要です。現実は、最初のモデルは99%の確率で予期せぬ結果に遭遇します。ラボでモデルを数ヶ月トレーニングしても、現実のデータとトラフィックに出会うと必ず変化します。
即時の完全性を目指さない
したがって、モデルをテストして、どのような変更が必要かを判断するには、迅速にプロダクションに配置する必要があります。次に、調整を行い、再度リリースして、改良します。したがって、プロダクションでテストする前にモデルを完璧にしようとしすぎてはいけません。最初の試みは完璧ではありません。誰もそれを期待するべきではありません。
モデルがラボで開発されている間、92%から95%の精度への追加の改善は、一部のユースケースでは重要ではないかもしれません。なぜでしょうか。AIモデルをトレーニングするために使用されるトレーニングデータはわずかです。精度のわずかな向上を得るために多くの時間と金額を投資することになりますが、その間にモデルが提供するメリットを得ることができません。
MLデプロイの有効なステップ
モデルが失敗したり、誤った予測を行ったりする可能性があるため、ML科学者はモデルをプロダクションに配置することを躊躇することがあります。ある程度、理解できます。リアルタイムでイベントを表示できるシステムが必要です。このアプローチにより、モデルをすぐにプルして更新し、新しいモデルを迅速にリリースできます。分析パラリシスに陥るのではなく、これがマシンラーニングモデルをプロダクションに配置する最も効率的な方法です。
モデルを起動して、現実の経験を積むことを許す方がはるかに優れています。これは、データ科学者が最初からモデルをできるだけ正確に作成する必要性を排除するものではありません。しかし、最初のバージョンが完成した後すぐに、重要なデータの収集を開始する必要があります。
このプロセスの一環として、モデルをA/Bテストモードまたはシャドウモードで実行し、現実のデータに対してテストすることができます。そうすれば、さまざまなモデルのパフォーマンスを比較し、どのモデルをプロモートまたはデモートするかを決定する前に、多くのデータと証拠を取得できます。
グローバルモデルを作成するのではなく、ローカライズされたモデルを作成するというベストプラクティスもあります。ローカルモデルでは、特定のシナリオのデータを使用して、モデルが各シナリオで適切に動作するようにします。これにより、グローバルモデルに比べて時間、データ、労力が節約できます。グローバルモデルでは、多くのリソースを使用して動作させる必要があります。
カスタムスニーカーの需要を決定することが、この点での例となります。ニューヨーク市の人口に基づいてグローバルモデルを作成した場合、北米の他の地域には適用できないかもしれません。ローカライズされたモデル戦略を使用することで、現在失っているより高い利益率を得ることができます。
モデルは定期的に更新する必要があります。従来のソフトウェアと異なり、モデルは一時的に設定して放置するのではなく、環境のデータが常に変化するため、定期的に更新する必要があります。MLモデルは、定期的に更新しないと劣化します。これは、モデルのライフサイクル中に注意深く監視する必要があります。
マシンラーニングの新しいパラダイム
マシンラーニングモデルを従来のソフトウェアと比較することは賢明ではありません。ただし、DevOpsと同様に、MLエキスパートはAI/MLモデルの迅速なデプロイ技術から利益を得ます。MLプロジェクトでは、モデルを迅速に起動できるシステムが必要です。さまざまなモデルを比較し、ライブモデルのパフォーマンスと非ライブモデルのパフォーマンスを対比できる必要があります。上記で説明したベストプラクティスとその他のベストプラクティスは、分析パラリシスを回避し、早く失敗し、早期にスケールすることで、マシンラーニングをスケールするのに役立ちます。












