ソートリーダー

人工知能開発における汚れたデータの高コスト

mm
Unite.AI を Google の優先ソースに追加

人工知能開発における現代のゴールドラッシュが進行中であることは、秘密ではありません。マイクロソフトとLinkedInによる2024 Work Trend Indexによると、40%以上のビジネスリーダーは、人工知能(AI)を使用してビジネスプロセスを根本的に再設計することを予想しています。

(MSFT )

この地殻変動は、単なる技術的アップグレードではありません。ビジネスが運営され、意思決定され、顧客とやり取りされる根本的な変革です。この急速な開発は、データとファーストパーティーデータ管理ツールへの需要を促しています。Forresterによると、92%のテクノロジー担当者は、2024年にデータ管理とAI予算を増やす予定です。

最新のMcKinsey Global Survey on AIによると、65%の回答者は、組織が定期的に生成的なAIテクノロジーを使用していることを示しました。ただし、この採用は、AIシステムを餌にするデータの品質という重大な課題も浮き彫りになります。

悪いデータの高コスト

悪いデータは新しい問題ではありませんが、その影響はAIの時代に増大しています。2017年にマサチューセッツ工科大学(MIT)が行った研究によると、悪いデータは会社に驚くべき15%から25%の収益を費やします。2021年には、Gartnerは、貧弱なデータが組織に年間平均12.9百万ドルのコストを課すと推定しました。

汚れたデータは、不完全な、不正確な、または一貫性のないデータであり、AIシステムに波及効果をもたらす可能性があります。AIモデルが低品質のデータでトレーニングされた場合、結果として得られる洞察と予測は根本的に欠陥があります。これは、AIアプリケーションの有効性を損なうだけでなく、批判的な意思決定にこれらのテクノロジーに依存するビジネスに重大なリスクをもたらします。

これは、データをクリーンアップし、整理するために限られたリソースを増やさなければならない企業のデータサイエンスチームにとって、大きな頭痛の種となっています。最近のDBTによるエンジニアリング報告書によると、57%のデータサイエンス専門家は、仕事でデータ品質の悪さを主な問題として挙げています。

AIモデルへの影響

悪いデータの影響は、3つの主要な方法でAI開発に現れます。

  1. 精度と信頼性の低下:AIモデルは、データから導き出されたパターンと相関関係に依存しています。入力データが汚れている場合、モデルは信頼性のない出力を生成します。これは、間違った戦略、製品の失敗、顧客の信頼の喪失につながる可能性があります。
  2. 偏見の増大:汚れたデータには、偏見が含まれていることが多く、チェックされなければAIアルゴリズムに組み込まれる可能性があります。これは、採用、融資、法執行など、デリケートな分野で差別的な慣行につながる可能性があります。たとえば、AI採用ツールが偏った歴史的な採用データでトレーニングされた場合、特定の人種を他の人種よりも優先する可能性があります。
  3. 運用コストの増加:欠陥のあるAIシステムでは、追加の時間とリソースを費やす必要があります。企業は、エラーを修正するのではなく、革新と改善に注力することに忙しい状態に陥る可能性があります。

来るべきデータポカリプス

「私たちは「転換点」に近づいています。非人間生成コンテンツが人間生成コンテンツを上回る量になっているからです。AI自体の進歩は、新しいツールを提供しています。ただし、ウェブ上のAI生成コンテンツの量は指数関数的に増加しています。

AI生成コンテンツがウェブに流れ込むにつれて、LLMによって生成されたAI生成コンテンツが生成されます。第一パーティと信頼できるデータは、希少で貴重なコモディティになりつつあります。

データ希薄化の課題

AI生成コンテンツの普及は、業界にいくつかの大きな課題をもたらします。

  • 品質管理:人間生成データとAI生成データを区別することが困難になり、AIモデルをトレーニングするために使用されるデータの品質と信頼性を確保することが困難になります。
  • 知的財産に関する懸念:AIモデルがAI生成コンテンツから学習し、スクラップすることによって、データに関連する所有権と権利に関する疑問が生じ、法的複雑さにつながる可能性があります。
  • 倫理的影響:データの起源に関する透明性の欠如は、誤情報の拡散や偏見の強化などの倫理的な問題につながる可能性があります。

データ・アズ・ア・サービスが基本となる

データ・アズ・ア・サービス(DaaS)ソリューションが、トレーニング目的の第一パーティーデータを補完および強化するために求められます。DaaSの真の価値は、データ自体が正規化、クリーンアップ、評価されたさまざまな信憑性と商業アプリケーション使用例に対して標準化されたプロセスです。業界が成熟するにつれて、データ業界全体でこの標準化が見られるようになるでしょう。すでに、小売メディア部門でこの統一性の推進を見ています。

人工知能がさまざまな業界に浸透するにつれて、データ品質の重要性はさらに高まっています。クリーンダータを優先する企業は競争上の優位性を獲得するでしょう。一方、クリーンダータを怠る企業はすぐに後れを取ってしまいます。

人工知能開発における汚れたデータの高コストは、無視できない問題です。データ品質の悪さは、AIシステムの基盤を損なうため、欠陥のある洞察、増加したコスト、潜在的な倫理的落とし穴につながります。包括的なデータ管理戦略を採用し、データの完全性を重視する文化を育むことで、企業はこれらのリスクを軽減できます。

データが新しい石油である時代に、データの純度を確保することは、技術的な必要性のみならず、戦略的な必須条件です。今日、クリーンダータに投資する企業は、明日、イノベーションの最前線を牽引することになるでしょう。

エリ・グッドマンは、Datos のCEO兼共同創設者です。デジタルとデータの分野で25年以上の経験を持つエリは、ComScoreでの9年の在籍を含む、代替データ企業でのリーダーシップを担ってきました。