ソートリーダー
AIのデータ・ディレマ:プライバシー、規制、エチカルAIの未来

AI駆動のソリューションは、毎日、さまざまな業界、サービス、製品に急速に採用されています。ただし、その有効性は、トレーニングに使用されるデータの品質に完全に依存するという点で、データセットの作成プロセスでよく誤解されるか、見落とされる側面があります。
データ保護当局がAIテクノロジーがプライバシーとデータ保護規制に準拠しているかどうかを厳しく調査するにつれ、企業は、データを調達して、注釈を付けて、精製するために、準拠性と倫理的な方法で圧力を受けるようになっています。
本当にAIデータセットを構築するための倫理的なアプローチがあるのでしょうか。企業が直面している最大の倫理的な課題とは何ですか。彼らはそれらにどのように対処していますか。発展する法的枠組みは、トレーニングデータの入手可能性と使用にどのような影響を与えるのでしょうか。让我們来探讨这些问题吧。
データプライバシーとAI
AIは、タスクを実行するために大量の個人データを必要とします。これにより、データの収集、保存、使用に関する懸念が生じています。世界中の多くの法律が、個人データの使用を規制し、制限しています。欧州のGDPRや新しく導入されたAI法から、医療業界の患者データへのアクセスを規制する米国のHIPAAまで、様々な法律があります。
世界中のデータ保護法の厳しさに関する参考資料 / DLA Piper
例えば、現在、米国の14の州には包括的なデータプライバシー法があり、6つの州では2025年と2026年初頭に施行される予定です。新しい政権は、連邦レベルのデータプライバシー施行に対するアプローチを変更する信号を送っています。重点は、AI規制であり、イノベーションの促進よりも制限を課すことよりも焦点を当てています。このシフトには、AIに関する以前の行政命令の撤回や、開発と適用を導くための新しい指令の導入が含まれます。
データ保護法は、さまざまな国で進化しています。ヨーロッパでは法律が厳しくなっていますが、アジアやアフリカでは、法律が緩い傾向があります。
ただし、個人を特定できる情報(PII)とは、顔の画像、パスポートなどの公式文書、またはその他の機密個人データのことです。一般的に、多くの国では、個人を特定できる情報の使用が制限されています。国連貿易開発会議によると、個人情報の収集、使用、第三者への共有について、消費者の通知や同意なしに個人情報を収集、使用、共有することは、世界の大多数にとって大きな懸念事項です。194の国中137カ国には、データ保護とプライバシーを確保する規制があります。したがって、ほとんどのグローバル企業は、モデルトレーニングにPIIを使用するのを避けるために、慎重な措置を講じています。規制が厳格なEUのような地域では、PIIの使用は厳しく禁止されています。
時間の経過とともに、データ保護法はより包括的になり、世界的に施行されています。企業は、法的課題を避け、現れる法的および倫理的要件を満たすために、慣行を適応させています。
企業がデータを取得する方法
モデルをトレーニングするためのデータ保護問題を研究する場合、企業がどこでデータを取得するかを理解することが重要です。主なデータソースは3つあります。
- データ収集
この方法により、クラウドソーシングプラットフォーム、メディアストック、オープンソースデータセットからデータを収集できます。
公開ストックメディアは、プラットフォームごとに異なるライセンス契約の対象となることに注意することが重要です。商用利用ライセンスであっても、コンテンツがモデルトレーニングに使用できないことが明示的に記載されている場合があります。これらの期待はプラットフォームごとに異なり、企業は必要な方法でコンテンツを使用できることを確認する必要があります。
AI企業がコンテンツを合法的に取得したとしても、問題に直面する可能性があります。AIモデルトレーニングの急速な進歩は、法的枠組みを上回っています。つまり、AIトレーニングデータを取り巻く規則と規制はまだ発展中です。したがって、企業は法的開発について情報を収集し、ストックコンテンツをAIトレーニングに使用する前にライセンス契約を慎重に確認する必要があります。
- データ作成
最も安全なデータセット準備方法の1つは、スタジオや屋外ロケーションなどの制御された環境でユニークなコンテンツを作成することです。参加者は、データ収集についての同意書に署名し、収集されるデータの種類、使用方法、使用者についての情報を提供します。これにより、法的保護が完全に保証され、企業は違法なデータ使用の主張に直面することはないことが保証されます。
この方法の主な欠点はコストです。特にエッジケースや大規模プロジェクトのデータを作成する場合、コストは高くなります。ただし、大企業や企業は、このアプローチを使用し続けています。理由は2つあります。まず、すべての規格と法的規制に完全に準拠していることを保証します。2つ目は、企業にシナリオとニーズに合わせてカスタマイズされたデータを提供し、モデルトレーニングで最高の精度を保証することです。
- 合成データ生成
ソフトウェアツールを使用して、与えられたシナリオに基づいて画像、テキスト、またはビデオを作成します。ただし、合成データには限界があります。自然な変動性が欠けているため、実際のデータとは異なります。
この欠点は、AIモデルに悪影響を及ぼす可能性があります。常に発生するわけではありませんが、重要な点です。特に、数百万の画像を扱う場合、モデルが崩壊する可能性があります。モデルが崩壊すると、出力の品質が低下し、低品質の出力が生成される可能性があります。
合成データは、基本的なタスク、パターン認識、オブジェクト識別、または基本的な視覚要素の識別に有効です。
ただし、モデルを最初からトレーニングしたり、希少または非常に特定のシナリオを扱ったりする必要がある場合は、最適な選択ではありません。
最も明らかなシナリオは、運転手が子供に気を取られている、運転手が疲れている、または無謀な運転をするような、車内環境でのものです。これらのデータポイントは、公共のデータセットでは一般的に利用できません。実際の個人をプライベートな環境で扱っているため、利用できるべきではありません。AIモデルは、トレーニングデータに基づいて合成出力を生成するため、正確に表現できないシナリオに苦労します。
合成データが失敗した場合、制御された環境で実際の俳優を使用して収集されたデータが解決策となります。
データソリューションプロバイダーであるKeymakrは、車にカメラを設置し、俳優を雇用し、赤ちゃんの世話をしたり、ボトルから飲んだり、疲れを示したりするアクションを記録します。俳優は、AIトレーニングにデータを使用することに明示的に同意する契約に署名します。これにより、プライバシー法に準拠していることが保証されます。
データセット作成プロセスにおける責任
プロセス参加者は、契約書に記載された責任を負います。最初のステップは、関係の性質、機密保持および知的財産に関する条項を含む契約書を確立することです。
最初のオプション、つまりデータを作成する場合を考えてみましょう。知的財産権によれば、プロバイダーが作成するデータは、依頼会社の所有となります。つまり、データは依頼会社のために作成されます。これは、プロバイダーがデータを合法的に取得し、適切に取得したことを保証することも意味します。
データソリューション企業であるKeymakrは、データのコンプライアンスを確保するために、データが作成される管轄区域を最初に確認し、関係するすべての個人から適切な同意を取得し、データがAIトレーニングに法的に使用できることを保証します。
また、データがAIモデルトレーニングに使用された後、特定のデータがモデルにどのように貢献したかを判断することはほぼ不可能であることにも注意することが重要です。AIはすべてのデータをまとめるため、特定の出力は、特に数百万の画像を扱う場合、モデル自身の出力ではありません。
この分野は急速に発展しているため、責任の明確なガイドラインがまだ確立されていません。これは、自動運転車の場合と同様で、運転手、製造元、またはソフトウェア会社のどれが責任を負うかについて、まだ明確な答えはありません。
他の場合、注釈プロバイダーが注釈付けのためにデータセットを受け取った場合、クライアントがデータを合法的に取得したと想定します。データが明らかに違法に取得された場合、プロバイダーはそれを報告する必要があります。ただし、そんな明らかなケースは非常にまれです。
また、評判を重視する大企業、企業、ブランドは、データの出所について非常に慎重です。データが最初から作成されたわけではなく、他の法的出所から取得された場合でもです。
要約すると、データ作業プロセス参加者の責任は、契約書によって異なります。これを、法的および倫理的基準を維持する上で重要な役割を果たす「持続可能性チェーン」の一部と見なすことができます。
AI開発のバックエンドに関する誤解
AI開発に関する大きな誤解は、AIモデルが検索エンジンのように機能し、学習した知識に基づいてユーザーに情報を提示するというものです。ただし、特に言語モデルを含むAIモデルは、確かな理解ではなく、確率に基づいて機能します。パターンを使用して、以前のデータに基づいて単語や用語を予測します。AIは「知識」を持っていません。推測し、確率を調整し、外挿します。
さらに、多くの人は、AIをトレーニングするために大量のデータセットが必要であると考えます。しかし、AIが認識する必要がある多くのもの、例えば犬、猫、または人間は、すでに確立されています。現在の焦点は、精度を向上させ、モデルを改良することです。AI開発の大部分は、精度の最後の小さなギャップを埋めることではなく、認識能力を再発明することではありません。
倫理的な課題とEUのAI法および米国の規制緩和が世界のAI市場に与える影響
データの倫理と合法性について議論する場合、どのような「倫理的」AIであるかを明確に理解することが重要です。
企業が現在直面している最大の倫理的な課題は、AIに何が許容されず、教えられずにすべきかを判断することです。倫理的なAIは人間に害を与えるのではなく、助けるべきであり、欺瞞を避けるべきであるという広範な合意があります。ただし、AIシステムはエラーを生じる可能性があり、または「妄想」する可能性があり、これらのミスのうちどれが誤情報または有害であるかを判断することは課題です。
AI倫理は、UNESCOのような組織が関与する重要な議論です。監査可能性と追跡可能性を取り巻く主要原則があります。
データへのアクセスとAIトレーニングを取り巻く法的枠組みは、AIの倫理的景観を形作る上で重要な役割を果たします。データの使用に制限が少ない国では、トレーニングデータへのアクセスがより容易になります。一方、データ法が厳格な国では、AIトレーニングに使用できるデータの入手可能性が制限されます。
例えば、AI法を採用したヨーロッパと、AI規制を大幅に撤廃した米国は、現在の世界の状況を示す対照的なアプローチを示しています。
EUのAI法は、ヨーロッパで事業を展開する企業に大きな影響を及ぼしています。厳格な規制枠組みが導入され、企業が特定のAIモデルを使用または開発することが難しくなりました。企業は、特定のテクノロジーを使用するために特定のライセンスを取得する必要があり、規制が厳しいため、多くの場合、小規模企業にとって規制に準拠することは困難です。
結果として、一部のスタートアップはヨーロッパを離れたり、そこで事業を展開しないことを選択する可能性があります。規制の影響は、暗号通貨規制の場合と同様です。大企業は、規制に準拠するための必要な投資を行うことができますが、AI法はヨーロッパからAIのイノベーションを他の市場、例えば米国やイスラエルに追いやる可能性があります。そこでは規制が緩いからです。
米国が、より制限の少ないAI開発に大量の資源を投資する決定は、欠点もあるかもしれませんが、市場に多様性をもたらす可能性があります。EUが安全性と規制遵守に焦点を当てている一方で、米国は、よりリスクを負って先端的な実験を行う可能性が高いでしょう。













