ソートリーダー

AI実装におけるデータ品質の重要性

mm
Unite.AI を Google の優先ソースに追加

人工知能と機械学習技術は、すべての規模の業界に大きな利益をもたらす可能性があります。マッキンゼーの報告書によると、人工知能技術を採用する企業は、2030年までに現金流量を2倍にすることが予測されています。一方、人工知能を導入しない企業は、現金流量が20%減少することが予測されています。ただし、こうした利益は経済的なものだけではありません。人工知能は、企業が労働力不足に対処するのに役立ちます。人工知能はまた、顧客の体験とビジネス成果を大幅に改善し、企業をより信頼性の高いものにします。

人工知能には多くの利点があるので、 почему 人工知能を採用しないのでしょうか。2019年、PwCの調査によると、76%の企業がビジネス価値を向上させるために人工知能を使用する予定であることがわかりました。ただし、高品質のデータにアクセスできる企業はわずか15%でした。さらに、Refinitivの調査によると、66%の回答者が、低品質のデータが人工知能の採用と有効な使用を妨げていると回答しました。

調査によると、機械学習と人工知能技術を使用する上でのトップ3の課題は、「データのカバレッジ、履歴、人口に関する正確な情報」、「不完全または破損したレコードの特定」、「データのクリーン化と正規化」です。これは、低品質のデータが、企業が高品質のAI分析を取得する上での最大の障害であることを示しています。

データの重要性

人工知能実装におけるデータ品質が重要な理由は多数あります。以下は最も重要な理由です。

1. ガベージインガベージアウト

入力が正確でないと、出力も正確ではありません。データセットにエラーが含まれている場合、結果も不正確になります。大部分のデータ関連の問題は、データの量ではなく、人工知能モデルに与えるデータの品質に起因しています。低品質のデータを使用すると、人工知能モデルは正しく機能しません。

2. 人工知能システムはすべて等しくない

データセットについて考えると、通常、数量データを想像します。しかし、ビデオ、個人的なインタビュー、意見、画像などの質的データもあります。人工知能システムでは、数量データは構造化され、質的データは非構造化されます。すべての人工知能モデルが両方のデータセットを処理できるわけではありません。したがって、適切なモデルに適したデータタイプを選択することが、期待される出力を得る上で重要です。

3. 品質対数量

人工知能システムは、多量のデータを学習する必要があると考えられています。品質と数量の議論では、後者が一般的に企業によって好まれます。ただし、データセットが高品質で短い場合、出力が関連性と信頼性があることを保証できます。

4. 良質なデータセットの特性

良質なデータセットの特性は、人工知能が提供するアプリケーションによって異なります。ただし、データセットを分析する際に検討すべき一般的な特性があります。

  • 完全性:データセットは空のセルやスポットがない完全なものでなければなりません。各セルにはデータが入力されていなければなりません。
  • 包括性:データセットは可能な限り包括的なものでなければなりません。たとえば、サイバー脅威ベクトルを探している場合、すべての署名プロファイルと必要な情報を含める必要があります。
  • 一貫性:データセットは割り当てられた変数に適合する必要があります。たとえば、パッケージボックスをモデル化している場合、選択した変数(プラスチック、ペーパー、カードボードなど)には適切な価格データが必要です。
  • 正確性:正確性は良質なデータセットの重要な要素です。人工知能モデルに与えるすべての情報は信頼性が高く完全に正確でなければなりません。大部分のデータセットが不正確な場合、出力も不正確になります。
  • 一意性:この点は一貫性と似ています。各データポイントは提供する変数に一意的でなければなりません。たとえば、プラスチックラッパーの価格を他のパッケージングカテゴリに含めることはできません。

データ品質の確保

データ品質を高く保つ方法は多数あります。たとえば、データソースが信頼性があることを確認することが挙げられます。以下は、AIモデルに最も高品質のデータを入手するための最良のテクニックです。

1. データプロファイリング

データプロファイリングは、データを使用する前に理解するために不可欠です。データプロファイリングは、値の分布、最大値、最小値、平均値、外れ値に関する洞察を提供します。さらに、データの整形不一致を特定するのに役立ちます。データプロファイリングにより、データセットが使用可能かどうかを判断できます。

2. データ品質の評価

事前に構築されたデータ品質ルールのライブラリを使用して、任意のデータセットを検証できます。データカタログに組み込まれたデータツールがある場合、顧客名、メールアドレス、製品コードを検証するルールを再利用できます。さらに、一部のデータを強化および標準化することもできます。

3. データ品質の監視と評価

科学者は、使用するデータセットのデータ品質を事前に計算しています。特定の属性の問題を特定し、使用するかどうかを判断できます。

4. データ準備

研究者や科学者は、データを人工知能モデルに適合させるために、データを少し調整する必要があります。研究者は、属性を解析し、列を転置し、データから値を計算するための簡単なツールが必要です。

人工知能の世界は不断に変化しています。各企業がデータを異なる方法で使用している場合でも、データ品質は人工知能実装プロジェクトに不可欠です。信頼性の高い高品質のデータを持つと、巨大なデータセットの必要性を排除し、成功の可能性を高めることができます。組織が人工知能の実装に移行している場合、データの品質が良好であることを確認してください。データソースが信頼できることを確認し、データ要件に準拠していることを確認するための尽力を払ってください。

Amy Groden-Morrisonは、TIBCO Software、RSA Security、Ziff-Davisなどの企業で15年以上のマーケティングコミュニケーションリーダーシップの役割を担ってきました。彼女の過去の功績には、CNNとの最初の共同ブランド技術プログラムの設立、NYSEでのイベント会社の立ち上げ、NASDAQ上場企業のブランド変更、ボストンエリアのスタートアップの成功的な買収への立ち位置とマーケティングなどがあります。現在、彼女はAlpha SoftwareのマーケティングおよびセールスオペレーションのVPです。