AIの基礎

オフザシェルフ 対 カスタム マシンラーニング モデル?

mm
Unite.AI を Google の優先ソースに追加

オフザシェルフ ソリューションを購入するよりもビルドする方が良いのはいつですか?

企業は、モデル開発にさまざまなアプローチを取ります。完全に管理された ML サービスから、カスタム モデルまで。ビジネス要件、利用可能な専門知識、計画の制約に応じて、選択をしなければなりません。カスタム ソリューションをスクラッチから開発するべきですか。あるいは、オフザシェルフ サービスを選択するべきですか。

ML ワークロードのすべての段階で、さまざまなパズル ピースがどのようにまとまるかについての決定が必要です。データ収集、準備、視覚化から、特徴エンジニアリング、モデルトレーニング、評価まで、機械学習エンジニアは繰り返し同じ質問をします。カスタム実装ソリューションをスクラッチから開発するべきですか。あるいは、オフザシェルフ サービスを使用するべきですか。

しかし、ビルドする方がオフザシェルフ ソリューションを購入するよりも良いのはいつですか。2 つのアプローチを区別する主な要因は、前処理の努力、開発の速度、必要な専門知識です。

オフザシェルフまたはカスタム マシンラーニング モデルを使用することを決定する際に考慮すべきこと

前処理の努力

ML プロジェクトは、さまざまな課題に直面していますが、最大の課題はトレーニング データの入手可能性です。トレーニング データの不足は、プロジェクトが開始される前にそれを停止させる可能性があります。プロジェクトが開始される前に、データの収集、ラベリング、クリーンアップ、前処理の努力から、重大な前処理コストが発生する可能性があります。これは、多くの ML プロジェクトが失敗することで知られている罠です。前処理は、割り当てられたリソースの 80% を占めることがあり、モデル トレーニングと評価のためにわずかなリソースしか残りません。

オフザシェルフ ソリューションは、前処理の努力の負担を軽減します。最も一般的な操作を実行するように設計されており、わずかな構成のみが必要です。最も良いのは、ML ワークロードのすべての段階でオフザシェルフ ソリューションが利用できるということです。

一方、カスタム実装は通常、より多くの前処理の努力を必要とします。ただし、それらを完全に却下する必要はありません。特定の ML ステージを問題を解決するための特定の要件に合わせて調整する必要があるからです。特に汚れたデータセットには、特殊なクリーンアップ ルールが必要になる場合があります。同様に、特定の特徴セットには、カスタムの特徴エンジニアリングが必要になる場合があります。ニューラル アーキテクチャには、わずかな調整が必要になる場合があります。この場合、スクラッチから構築されたカスタム ソリューションは、すべてのニーズをカバーする可能性が高いでしょう。

開発の速度

オフザシェルフ ソリューションは、実装ではなく構成に焦点を当てています。何を実行するかではなく、さまざまなパズル ピースがどのようにまとまるかについてML チームは集中します。このアプローチにより、企業、研究者、エンジニアは、プロトタイプと概念実証を迅速に実装できます。車の輪を再発明するのではなく、オフザシェルフ ソリューションは、既存の知識を活用できるようにし、開発時間を節約できます。

スクラッチから実装されたカスタム ソリューションは、開発の速度が遅いことで知られています。これは、維持のニーズが増加するためです。エンジニアは、ソリューションの何とどうについて両方を決定する必要があります。同様に、ソリューションの複雑性が増加すると、スケーラビリティと可用性を確保するために、より多くの時間リソースが必要になります。プロダクション環境で実行中です。したがって、カスタム ソリューションと時間の努力は直接比例します。ソリューションの複雑性が増加すると、より多くの時間が必要になります。

しかし、通常、真実は中間にあるということです。既存のコードベースがリファクタリングされ、現在のプロジェクトのニーズに適応されます。モデル トレーニングの転送学習アプローチの場合と同様です。

専門知識

マシンラーニングは、コード不要のインターフェイスからスクラッチからモデルを構築するまで、さまざまなレベルで実行されます。マシンラーニング モデルを開発するための専門知識のレベルも、同様に複数あります。

オフザシェルフ ソリューションは、非常に少ないマシンラーニングの専門知識が必要です。直感的なインターフェイスとドラッグ アンド ドロップ アプローチを使用することで、誰でも (ビジネス アナリストからソフトウェア エンジニアまで) がマシンラーニング モデルを構築してデプロイできます。ただし、このような単純なモデル開発アプローチは、プロダクション システムの要件を満たす可能性は低いです。

プロダクション環境でオフザシェルフ ソリューションを適切に構成、設定、維持するには、専門知識が依然として必要です。ワークアラウンド、コード パッチ、さまざまな API インターフェイスへの接続、デプロイの問題に対処することは、プロダクション環境でのモデルのパフォーマンスを確保するために必要な一般的なタスクです。

カスタム ソリューションは通常、インフラストラクチャ レベルで実装されます。専門知識が必要です。企業のサイズとプロジェクトの目標に応じて、プロダクション システムを維持するために、多分野にわたるチームが必要になる場合があります。データ サイエンティスト、ML エンジニア、ビジネス アナリストが一緒に推論結果を理解し、プロダクション モデルを維持するために協力します。

オフザシェルフまたはカスタム マシンラーニング モデルを使用するべきですか?

ML ソリューションは、さまざまなコンポーネントとサービスで構成され、まとまりのあるソリューションとしてまとめられます。100% カスタムか 100% オフザシェルフのどちらか一方に頼るのではなく、ビジネス上の問題に応じてさまざまなソリューションが必要です。通常、ML ベースのソリューションは、オフザシェルフ サービスを使用して一般的な洞察を抽出し、カスタム モデルを使用して精度とドメイン固有の知識を高めることによって構築されます。

カスタム ソリューションをスクラッチから実装するときと、プロジェクトのどの部分がオフザシェルフ サービスの利点を活用できるかを判断するのがコツです。これは、解決しようとしている問題の種類、ビジネス要件、利用可能なデータ、開発環境の制約などに大きく依存します。

AI やテクノロジー トレンドの詳細については、Josh Miramant、Blue Orange Digital の CEO を参照してください。サプライ チェーン、ヘルスケア ドキュメント オートメーションなど、データ ドリブンのソリューションを提供しています。

あなたもこれらを好きかもしれません:

NLP を使用してソーシャル メディアのコメントを分類する

Google のオープンソース BERT モデルを通じて言語処理がどのように強化されているか (GOOGL )

Josh Miramantは、 Blue Orange DigitalのCEO兼設立者です。Blue Orange Digitalは、ニューヨークシティとワシントンDCにオフィスを置く、トップランクのデータサイエンスと機械学習エージェンシーです。Miramantは人気のあるスピーカー、未来学者であり、企業やスタートアップ企業への戦略的ビジネス&テクノロジーアドバイザーです。彼は、組織がビジネスを最適化して自動化し、データ駆動型の分析技術を実装し、人工知能、ビッグデータ、インターネット・オブ・シングスなどの新技術の影響を理解するのを支援しています。