ソートリーダー
企業のAIが成功するか失敗するかを決めるのはデータの品質である理由

2022年後半にOpenAIがChatGPTを発表して以来、すべての企業はAIでより速く進もうとしています。Nvidiaのような大手ハードウェアメーカーは、以前より多くのGPUを販売しています。一方、OpenAIやAnthropicのような大規模モデルビルダーは、より大きなモデルを構築し続けています。
しかし、最も高度なモデルや最大の予算を持っていても、多くのAIプロジェクトはまだ失敗しています。医療、交通、金融など、さまざまな業界でこれが起こっているのを見てきました。理由は簡単です。AIは、トレーニングに使用するデータとリアルタイムで受け取るデータの質だけが良ければ、どれほど優れたモデルであっても一貫した結果や信頼できる結果を出すことができません。
これが今日、多くの企業が直面している大きな問題です。AIツールに多くを投資していますが、データシステムは散在し、信頼性が低いままです。結果は、進歩の幻想です。モデルは印象的な答えを出しますが、洞察は弱い基盤に基づいています。AIの成功を妨げる真正の障壁は、モデル性能ではありません。データ品質です。
良いデータとは本当に何を意味するのか
高品質のデータとは、単に正確であるということだけではありません。現在、完全で、問題に適切な情報であるということです。例えば、電子商取引サイトで顧客が注文をキャンセルしようとする場合、システムは注文の詳細、出荷状況、支払い記録を確認する必要があります。これらのデータポイントが互いに通信できない別々のシステムに存在する場合、AIアシスタントは役に立たない答えしか出せません。
良いデータは、これらの点を瞬時に接続します。AIが部分的な情報ではなく、全体像を見られるようにします。悪いデータは、モデルに推測を強いるのです。AIが推測を始めると、金銭的損失や信頼の損失につながるミスを犯します。最近の例は、そんな仮定がどれほど危険であるかを示しています。
ニューヨーク市のビジネスチャットボットは、法的情報が古くなったり不完全なりしたために、違法なアドバイスをしました。エアカナダのカスタマーサービスボットは、会社のポリシーからのコンテキストが不足しているために、虚偽の返金請求を行いました。大きい採用システムも、偏ったりラベル付けされたりしたデータのために、候補者を間違ってフィルタリングしました。これは、EEOCの最初のAI関連の和解で見られました。これらの失敗は技術的なものだけではありません。評判や金銭的なものでもあり、信頼性の低いデータでトレーニングされたAIシステムから生じています。
業界の調査も、この問題の規模を裏付けています。Gartnerによると、80パーセントのAIプロジェクトは、データ品質とガバナンスの低さのために拡大に失敗します。同様に、MITスローン管理レビューの調査では、アルゴリズムではなくデータの問題が、企業のAIプロジェクトが崩壊する主な理由であることがわかりました。
文化はコードと同等に重要
データ品質を向上させることは、単一のツールやコマンドで解決できるものではありません。文化的な変化が必要です。そのため、ビジネスリーダーは、データを生きたシステムと見なし、ケアと説明責任をもって扱う必要があります。これは、単に「データを改善したい」と宣言するだけでは不十分です。組織のすべての部分が、情報がどのように移動し、誰が所有し、変更されたときに何が起こるかを理解する必要があります。
現実のシステムでこれがどのように機能するかを見てきました。多くのAIアプリケーションは、夜間のデータ更新に依存しています。データベースが1日に1回更新される場合、モデルの知識は常に現実から遅れます。迅速に変化する環境では、その遅れは古くなった洞察や悪い決定につながる可能性があります。企業は、情報が収集される方法からモデルに提供される方法まで、データフロー全体を見直す必要があります。
これをうまく行うことで、多くの時間とコストを節約できます。データパイプラインが明確で目的を持って設計されている場合、AIシステムは最新で関連性の高い情報を学習し、行動することができます。そうでない場合、チームはデータを使用するよりもクリーンアップに多くの時間を費やします。
データ管理の専門家は、強力なデータ品質の鍵は、人々、プロセス、プラットフォームの間のフィードバックループにあると指摘しています。そのループがなければ、情報は古くなり、モデルは現実世界の状況から切り離されます。これは、時々「データドリフト」と呼ばれる問題です。
スピードと完全性のバランス
迅速性と精度の間には、しばしば緊張が存在します。多くの組織はAI投資から即時の結果を期待していますが、急ぐと後に大きな問題につながる可能性があります。目標は、完全性を保ったまま迅速性を実現することです。言い換えれば、精度を失うことなく迅速に動作するシステムを構築することです。
この点について、すべての企業は、データがソースからモデルにリアルタイムで流れる明確なパスを定義する必要があります。さらに、どのような情報が許可され、どのような情報が除外されるかを定義することも役立ちます。機密性の高い、またはプライベートなデータは、ユーザーが技術的にアクセスできる場合でも、モデルに到達することはできません。境界を保護することで信頼を築き、AIシステムが情報を漏らしたり誤用したりするのを防ぐことができます。
AIがより自律的になるにつれて、人間の監視は重要性を保ちます。モデルはビジネス上の行動を完全に制御するべきではありません。決定も行うべきではありません。代わりに、リクエストを出します。さらに重要なのは、人間が常にモデルの行動を確認し、会社のポリシーや規制と一致することを確認する必要があります。
基盤から品質を構築する
拡大性を持ったデータ品質を維持することは、単にエラーをクリーンアップする問題ではありません。アーキテクチャから始まります。最も信頼できるデータが存在する場所を特定し、それらを1つの信頼できるロケーションにまとめるシステムを設計する必要があります。そこから、モデルが使用するデータとその出所を追跡できます。
このアプローチは、混乱を防ぎ、システムを透明性を持たせます。さらに、チームが何かが間違っている場合に迅速にトラブルシューティングできるようにします。モデルが回答に使用したデータを正確に知ることができれば、問題が広がる前にそれを検証して修正できます。
企業のAIの未来は、デフォルトで品質をインフラストラクチャに組み込んだ企業に属することになります。より多くのプラグアンドプレイのAIシステムが、推論とデータ統合の両方を1つのパッケージで処理するようになることを期待しています。これらの「AIアプライアンス」は、企業がデータの制御を失うことなく、スマートシステムを展開することをより簡単にします。
アナリストは、データを効果的に統一し、統治できる組織は、AIプロジェクトからより迅速に採用し、より高いROIを得ることができると予測しています。最近のデータ準備度に関するレポートは、この能力が、継続的にイノベーションを続ける企業と、初期のパイロットの後で停滞する企業を区別するものであると説明しています。違いは、AIシステムが一貫した、構造化された情報に基づいているかどうかにあります。
結論
データ品質は、モデル設計のブレークスルーに比べれば、魅力的ではありませんが、AIが成功するか失敗するかを決めるのは、データ品質です。クリーンで現在で一貫したデータがなければ、最も賢いシステムでも躓きます。そうでない場合、ささいなAIプロジェクトでも持続可能な価値を生み出すことができます。
AIに投資するすべてのリーダーは、1つの質問を自分に問うべきです。私たちの決定を導くデータを信頼していますか。私たちが見てきたように、自信を持って「はい」と答えることができる企業は、すでにAIレースでリードしています。












