AIモデルとプラットフォーム
人工データはAIのホールユーションにどのような影響を与えるのか?
人工データは強力なツールですが、特定の状況下でしかAIのホールユーションを軽減できないことが多いです。ほとんどの場合、ホールユーションを増幅させることになります。なぜそんなことが起こるのか?これは、人工データに投資した人々にとって何を意味するのか?
人工データと実データの違いは何ですか?
人工データは、AIによって生成された情報です。実世界のイベントや観察から収集されたのではなく、人工的に生成されます。しかし、元のデータに十分に似ているため、正確で関連性のある出力が生成されます。そういうはずです。
人工データセットを作成するには、AIエンジニアが生成アルゴリズムを実関係データベースでトレーニングします。プロンプトが与えられると、最初のセットとよく似た第二のセットが生成されますが、そこには本物の情報は含まれていません。一般的な傾向や数学的特性は保持されますが、元の関係を隠すのに十分なノイズが含まれています。
AIによって生成されたデータセットは、デイダクチブ化を超えて、フィールド間の関係の根底にある論理を複製します。フィールドを同等の代替品に置き換えるのではなく、フィールド間の関係の根底にある論理を複製します。同一性情報がないため、企業はこれを使用してプライバシーと著作権規制を回避できます。さらに重要なのは、企業はこれを自由に共有または配布できますが、セキュリティ漏洩を心配する必要はありません。
ただし、偽の情報は補足としてより一般的に使用されます。企業は、AIシステムを効果的にトレーニングするのに十分な大きさに拡張するために、サンプルサイズが小さすぎる場合にこれを使用できます。
人工データはAIのホールユーションを軽減しますか?
時々、アルゴリズムは存在しないイベントを参照したり、論理的に不可能な提案をしたりします。これらのホールユーションは、しばしば無意味、誤解を招いたり、不正確です。たとえば、大規模言語モデルは、ライオンを飼う方法についての記事や、6歳で医者になる方法についての記事を書くかもしれません。しかし、それらはすべてこのような極端なものではありません。つまり、それらを認識することは難しいことがあります。
適切にキュレーションされた場合、人工データはこれらの事象を軽減できます。関連性のある本物のトレーニングデータベースは、どのモデルにも必要な基盤です。つまり、誰かが持っている情報が多いほど、モデル出力の精度が高いということになります。補足データセットを使用すると、ニッチなアプリケーションでもスケーラビリティが向上します。
デバイアシングも、人工データベースがAIのホールユーションを軽減する方法の1つです。MITスローンマネジメントスクールによると、これは、偏見を解消するのに役立ちます。これは、元のサンプルサイズに制限されていないためです。専門家は、現実的で詳細な情報を使用して、サブポップュレーションが不足しているギャップを埋めることができます。
人工データはホールユーションを悪化させる
知的アルゴリズムは情報を理由付けや文脈化できないため、ホールユーションに陥りやすくなります。生成モデル、特に事前トレーニングされた大規模言語モデルは、特に脆弱です。人工的事実は、ある意味で、問題を悪化させます。
バイアスの増幅
人間と同様に、AIは偏見を学習し、再現することができます。人工データベースが特定のグループを過大評価し、他のグループを過小評価している場合(これは、心配するべきことに、偶然に起こりやすいことです) — その意思決定ロジックは歪み、出力の精度に悪影響を与えることになります。
同様の問題が発生する可能性があります。企業が人工データを使用して現実世界の偏見を排除する場合、現実を反映しない可能性があります。たとえば、乳がんは99%以上が女性に発生します。したがって、表現を均衡させるために補足情報を使用すると、診断が歪む可能性があります。
交差的ホールユーション
交差性は、年齢、性別、人種、職業、社会階級などの社会的アイデンティティがどのように交差して、ユニークな差別と特権の組み合わせを生み出すかを分析する社会学的フレームワークです。
生成モデルがトレーニングに使用した情報に基づいて人工的な詳細を生成するように求められると、元の情報に存在しなかった、または論理的に不可能な組み合わせを生成する可能性があります。
リンコーピング大学のジェンダーと社会の教授であるエリカ・ジョンソンは、機械学習の科学者と協力して、この現象を実証しました。彼らは、1990年のアメリカ合衆国国勢調査のデータの合成バージョンを作成するために生成的対抗ネットワークを使用しました。
すぐに、明らかな問題に気づきました。人工バージョンには、「妻と独身」と「未婚の夫」というカテゴリがありました。これらは、交差的ホールユーションでした。
適切なキュレーションがなければ、レプリカデータベースは常にデータセット内の支配的なサブポップュレーションを過大評価し、代表されていないグループを過小評価します。エッジケースやアウトライアは、支配的な傾向のために完全に無視される可能性があります。
モデルの崩壊
人工的なパターンや傾向への過度の依存は、モデルの崩壊につながります。モデルのパフォーマンスが、現実世界の観察やイベントに適応できなくなるため、急激に低下します。
この現象は、特に次世代の生成AIで顕著です。繰り返し、人工バージョンを使用してこれらをトレーニングすると、自己消耗のループが生じます。1つの研究では、各世代に十分な最新の実際の数字がなければ、品質とリコールが進化的に低下することが示されています。
過剰適合
過剰適合は、トレーニングデータへの過度の依存です。アルゴリズムは最初はうまくいきますが、新しいデータポイントが提示されるとホールユーションを起こします。人工情報は、現実を正確に反映していない場合、問題を悪化させる可能性があります。
人工データの継続的な使用の影響
人工データ市場は急成長しています。このニッチ業界の企業は、2022年に約328万ドルを調達しました。2020年の530万ドルから、わずか18ヶ月で518%の増加です。これは、公開されている資金調達額のみなので、実際の額はもっと高い可能性があります。企業がこの解決策に非常に投資していることは間違いありません。
企業が適切なキュレーションやデバイアシングを行わずに人工データベースを使用し続けると、モデルのパフォーマンスが低下し、AIへの投資が損なわれる可能性があります。結果は、アプリケーションによってはより深刻になる可能性があります。たとえば、医療では、ホールユーションの増加により、誤診や不適切な治療計画が生じ、患者の転帰が悪化する可能性があります。
解決策は実データへの復帰にはなりません
AIシステムは、トレーニングに数百万、または数十億の画像、テキスト、ビデオが必要です。これらの多くは、パブリックウェブサイトからスクラップされ、大規模なオープンデータセットにまとめられます。不幸にも、アルゴリズムはこれらの情報を、人間が生成するよりも速く消費します。アルゴリズムがすべてを学習したらどうなるでしょうか?
ビジネスリーダーは、データの壁に当たることを心配しています。データの壁とは、インターネット上のすべてのパブリック情報が尽きてしまうことを指します。これは、予想よりも早く訪れる可能性があります。
平均的なコモンクロールのWebページのプレーンテキストの量と、インターネットユーザーの数は、年間2%から4%の割合で増加しています。しかし、アルゴリズムは、高品質のデータが不足していることを心配しています。トレーニングに使用できるのは、パフォーマンスを損なわないように10%から40%までです。トレンドが続けば、人間が生成するパブリック情報のストックは2026年までに尽きる可能性があります。
おそらく、AIセクターはデータの壁に早く当たる可能性があります。過去数年の生成AIブームにより、情報所有権と著作権侵害に関する緊張が高まっています。ウェブサイトの所有者は、ウェブクローラーをブロックするロボット除外プロトコルを使用したり、サイトがクロールできないことを明示したりしています。
2024年の研究では、MITが主導する研究グループが、コロッサルクリーニングコモンクロール(C4)データセット — 大規模なWebクロールコーパス — に対する制限が増加していることを発見しました。C4の最もアクティブで重要な28%のソースは完全に制限されていました。また、C4の45%はサービス利用規約によってアクセスが制限されていました。
企業がこれらの制限を尊重すれば、現実世界のパブリック事実の新鮮さ、関連性、正確さが低下します。企業は人工データベースに頼らざるを得ないかもしれません。代替案が著作権侵害とみなされる場合、選択の余地がないかもしれません。
人工データとAIホールユーションの将来
著作権法が現代化し、ウェブクローラーからコンテンツを隠すウェブサイト所有者が増えるにつれて、人工データセットの生成はますます人気になります。組織は、ホールユーションの脅威に直面する準備をしなければなりません。












