ソートリーダー

バイアスがあなたのAI/ML戦略を殺す理由とそれに対処する方法

mm
Unite.AI を Google の優先ソースに追加

モデル内の「バイアス」とは、モデルが十分な高品質で多様なデータでトレーニングされていないため、入力データやプロンプトに正確に応答できない状況を指します。例えば、Appleの顔認証による携帯電話のロック解除機能は、より暗い肌の色を持つ人に対して、より高い失敗率で機能しました。これは、モデルが暗い肌の色を持つ人々の画像で十分にトレーニングされていないためです。このようなバイアスは、比較的低リスクの例ですが、EUのAI法が市場に出る前にモデル効率とコントロールを証明するための要件を定めた理由です。ビジネス、金融、健康、または個人的な状況に影響を与えるモデル出力は、信頼できるものでなければなりません。そうでない場合、使用されません。

データでバイアスに取り組む

大量の高品質データ

多くの重要なデータ管理の実践の中で、AI/MLモデルのバイアスを克服し、最小限に抑えるための重要な要素は、多様な大量の高品質データを取得することです。これには、データを持つ複数の組織との協力が必要です。従来、データの取得と協力は、プライバシーと知的財産保護の懸念によって妨げられていました。機密データはモデル所有者に送信できず、モデル所有者は自社の知的財産をデータ所有者に漏らすリスクを負うことができません。一般的な回避策は、モックまたは合成データを使用することですが、これには、実際の完全なコンテキストのデータを使用する場合と比較して限界があります。これが、プライバシー強化技術(PETs)が必要な答えを提供する場所です。

合成データ:近いですが、十分ではありません

合成データは、実際のデータを模倣するために人工的に生成されます。これは難しいですが、AIツールの進歩により少し簡単になりました。高品質の合成データは、実際のデータと同じ特徴距離を持っている必要があります。そうでない場合、役に立たないことになります。高品質の合成データは、トレーニングデータの多様性を効果的に高めるために使用できます。小規模な、周縁的な人口や、AI提供者が十分なデータを持っていない人口のギャップを埋めるために使用できます。合成データは、現実世界で十分な量に見つけることが難しいエッジケースに対処するために使用することもできます。また、組織は、データの居住地とプライバシー要件を満たすために、合成データセットを生成できます。これは素晴らしいことのように聞こえます。しかし、合成データは、パズルの一部に過ぎません。解決策ではありません。

合成データの明らかな限界の1つは、現実世界との断絶です。例えば、合成データのみでトレーニングされた自律走行車は、現実の予期せぬ道路状況に苦労することになります。また、合成データは、生成に使用された実際のデータからのバイアスを継承します。これは、バイアスを克服するという私たちの議論の目的をほとんど破壊することになります。結論として、合成データは微調整とエッジケースへの対処に役立つ選択肢ですが、モデル効率の改善とバイアスの最小化には、現実世界のデータへのアクセスが依然として必要です。

PETsを使用したリアルデータへのアクセス:より良い方法

PETsは、データが使用されているときにデータを保護します。AI/MLモデルについては、モデルが実行されているときにモデル自体の知的財産も保護できます。2つの鳥を1つの石で打つことができます。PETsを使用するソリューションは、以前はデータプライバシーとセキュリティの懸念によりアクセスできなかった機密データセットでモデルをトレーニングできるようにします。これは、リアルデータへのフローを解放する最良の選択肢であり、バイアスを減らす最良の方法です。しかし、実際にはどう機能しますか?

現在、主な選択肢は、機密コンピューティング環境から始まります。次に、PETsベースのソフトウェアソリューションとの統合が必要です。このソリューションは、データ管理とセキュリティの要件を考慮して、すぐに使用できるようにします。標準の信頼できる実行環境(TEE)には含まれない要件です。このソリューションでは、モデルとデータは、セキュアなコンピューティング環境に送信される前に暗号化されます。環境はどこにでもホストできます。これは、特定のデータローケーションの要件に応じて重要です。つまり、モデルIPと入力データのセキュリティが計算中も維持されます。信頼できる実行環境の提供者であっても、内部のモデルまたはデータにアクセスできません。暗号化された結果は、確認のために送り返され、ログは確認のために利用可能です。

このフローは、どこにあっても誰が所有しているかに関係なく、最高品質のデータへのアクセスを可能にし、バイアスの最小化と私たちが信頼できる高効率モデルへの道を開きます。このフローは、EUのAI法が規制サンドボックスの要件で説明しているものと同じです。

倫理的および法的コンプライアンスの促進

高品質のリアルデータを取得することは難しいです。データプライバシーとローケーションの要件はすぐに利用可能なデータセットを制限します。イノベーションと成長が発生するためには、データが価値を抽出できる人々にフローする必要があります。

EUのAI法の第54条は、「高リスク」モデルタイプについて、市場に出る前に証明する必要があるものについて規定しています。簡単に言えば、チームは、AI規制サンドボックス内でリアルデータを使用して、十分なモデル効率とコントロールを証明する必要があります。コントロールには、モニタリング、透明性、説明可能性、データセキュリティ、データ保護、データ最小化、モデル保護が含まれます。DevSecOps + Data Opsと考えることができます。

最初の課題は、実際のデータセットを見つけることです。これは、高リスクモデルタイプの場合、機密データであるためです。技術的な保証がない場合、多くの組織はモデルプロバイダーにデータを信頼することを躊躇するか、またはそうすることができないかもしれません。また、法が「AI規制サンドボックス」を定義する方法も課題です。要件の1つは、モデルが実行された後、システムからデータが削除されることを保証することです。また、ガバナンスコントロール、施行、報告も必要です。

多くの組織は、既存のデータクリーンルーム(DCR)と信頼できる実行環境(TEE)を使用しようとしました。しかし、これらのテクノロジーは、データとAI規制の要件を満たすために、重要な専門知識と作業が必要です。DCRは使用しやすいですが、まだよりロバストなAI/MLニーズには役立ちません。TEEはセキュアサーバーですが、すぐに役立つように使用するには、統合コラボレーションプラットフォームが必要です。これは、プライバシー強化テクノロジープラットフォームがTEEと統合する機会を特定し、セットアップと使用を容易にし、AI規制サンドボックスの取得と使用を容易にすることを示しています。

これらのテクノロジーは、プライバシーを保護する方法でより多様で包括的なデータセットを使用できるようにすることで、AIとMLの実践がデータプライバシーに関する倫理基準と法的要件(例:GDPRとEUのAI法)に従っていることを保証します。要件はしばしば聞こえが悪いですが、これらの要件は、信頼できるモデルを構築し、重要なデータ駆動型の意思決定に頼ることができるように導き、モデル開発とカスタマイズに使用されるデータ主体のプライバシーを保護するために導かれています。

アディ・ハーシュタインは、Duality Technologiesの製品担当VPです。アディは、B2Bスタートアップに重点を置いたデータとAIの分野で技術企業のイノベーションを牽引してきた20年以上の経験を持つエグゼクティブ、製品マネージャー、起業家です。Duality Technologiesに参加する前、アディは、Iguazio(MLOps会社)の製品VPを務めていました。IguazioはMcKinseyに買収されました。その前、アディは、EMCの製品ディレクターを務めていました。EMCは、Zettapoint(データベースおよびストレージ会社)を買収しました。Zettapointでは、アディは、製品VPとして、製品の立ち上げから市場への浸透と成長までを牽引しました。