ソートリーダー

合成データの台頭と、リアルデータを置き換えるのではなく補完すること

mm
Unite.AI を Google の優先ソースに追加

エロン・マスクは最近、AIモデルのトレーニングに使用できる人間のデータが尽きつつあると述べた。彼の警告は、AIの進歩を続けるために新しいデータソースが必要であるというコメントの最新の例である。ヘルスケアや金融などの業界では、厳格なプライバシーの規制がデータの不足をさらに深刻にしている。

合成データ – この不足に対する可能な解決策 – は新しいものではないが、その重要性は続々と高まっており、最近の合成データ分野における合併や投資の増加もその証左である。ただし、合成データの使用には、特にモデル崩壊のリスクなど、いくつかの深刻な不確実性がある。モデル崩壊とは、多モーダル大規模言語モデル(LLM)の出力の品質が、トレーニングに使用するためのリアルなデータがなければ低下する現象である。この問題が解決可能かどうかは、ジェネレーティブAI(Gen AI)の未来に大きな影響を与えるかもしれない。

合成データとは何か、それはどうやって作られるのか

合成データは、実際のイベントから収集されたのではなく、人工的に作成されるデータである。現在、最も広く使用されている合成データは、AIによって生成されたもので、モデルをリアルなデータでトレーニングしてパターンや相関関係を検出させ、次にこれらの統計的特性を模倣する新しいデータを生成するものである。

LLMは、構造化されたデータ(例:表形式のデータ)や非構造化されたデータ(例:自由形式のテキスト、動画、画像)などのさまざまな種類の合成データを生成するために使用されている。生成されるデータの種類によって、さまざまな方法が使用される。

例えば、合成画像データを生成するために一般的に使用される2つの方法は、GANと拡散モデルである。GANでは、2つのニューラルネットワークを使用する。1つは生成器で、実際のデータの人工的なバージョンを作成し、もう1つは判別器で、どれが実際のデータで、どれが生成されたデータかを識別する。判別器と生成器は連続的に協力して、生成器は判別器を「欺く」ことを目指し、人工的なデータのリアリティと多様性を向上させる。拡散モデルは、異なるアプローチをとり、実際のデータを歪ませてからそれを逆転させて「ノイズ除去」することを学ぶ。効果的にトレーニングされれば、高品質の合成オーディオやビジュアルデータを生成できる。

合成データの重要性の増大

合成データに対する関心は長年のものである。しかし、過去5年間で、LLMの急速な発展により、合成データの需要が高まり、さらに大規模に生成する手段も生まれた。その結果、合成データの使用は急激に増加した。

ガートナーの予測によると、LLMのトレーニングに使用されるデータのうち、合成データの割合は2024年までに60%に達する見込みである。2021年にはまだ1%だった。たとえば、MicrosoftのPhi-4モデルは、他のLLMよりも優れておりながらも、サイズはかなり小さく、ほとんどが合成データでトレーニングされた。一方、AmazonのAlexaのエンジニアは、「先生/学生」モデルの使用を検討している。ここで、「先生」モデルが合成データを生成し、それを使用してより小さい「学生」モデルを微調整する。

この広範な採用は、市場での大きな動きと共に進行している。合成データ分野は2021年から2022年にかけて投資ブームを経験した。Gretel AITonic.aiは、それぞれ5,000万ドルと3,500万ドルのシリーズBラウンドを確保した。これに続いて、MOSTLY AIが2,500万ドルのシリーズBラウンドを閉じSynthesis AIが1,700万ドルのシリーズA資金調達を行った。

最近の傾向は、大規模な買収に向かっている。NVIDIAのGretel買収は、テクノロジー大手のこの分野での自社の取り組みを支援する。同様に、AIソリューション会社のSASは、2024年11月に合成データスタートアップのHazyを買収した

分析会社Cognilyticaは、2021年の合成データ生成市場の価値を約1億1,000万ドルと推定しており、2027年までに11億5,000万ドルに達すると予測している。他の予測では、2030年までにこの分野が31%の年間成長率で22億3,300万ドルに達することを予測している。

モデル崩壊

しかし、合成データの魅力的な潜在性は、重大な欠点も伴う。モデル崩壊とは、合成データのみでトレーニングされたLLMが、精度の低いまたは多様性の低い出力を生み出す現象である。

実世界のデータは複雑性が高く、合成データはモデルによって簡素化され、凝縮されることが多い。たとえば、研究者は、がん性のうさぎを写真から検出するようにトレーニングされたモデルの精度が、合成トレーニングデータの量と反比例することがわかった。オックスフォード、ケンブリッジ、インペリアル・カレッジ、トロント大学の学者による最近の研究では、モデル生成データを無批判に使用すると、結果として生じるモデルの「不可逆的な欠陥」につながることがわかった。

さらに悪いことに、ほとんどのLLMは「ブラックボックス」であるため、合成データに対する反応を理解することは難しい。ライス大学とスタンフォード大学の研究者は、最新のリアルなデータがなければ、「将来のジェネレーティブモデルは、品質(精度)または多様性(リコール)が徐々に低下することになる」と結論付けた。

リアルなデータの継続的な必要性

明らかに、合成データの需要の増加にもかかわらず、リアルなデータの需要は依然として残っている。実際、ハイ品質のリアルなデータの需要は増加する可能性さえある。理由は2つある。まず、合成データを生成するAIモデルをトレーニングするには、リアルなデータが必要である。2つ目は、モデル崩壊を避けるために、合成データをリアルなデータと継続的に同期させる必要がある。

合成データ生成AIモデルのトレーニングに使用するためのリアルなデータ

先ほど述べたように、現在の合成データのほとんどは、ジェネレーティブAIによって生成されている。これらのジェネレーティブAIモデルは、リアルなデータでトレーニングされる必要がある。なぜなら、リアルなデータセットのパターンや統計的特性を複製することによってのみ、有用な合成データを生成できるからである。

例えば、最近の保険会社の例では、機密性の高い顧客データを危険にさらすことなく、さまざまなベンダーをテストするために合成データを使用できた。ただし、この合成データセットを生成するために、リアルなデータでトレーニングされたAIモデルが必要だった。

モデル崩壊を軽減するためのリアルなデータ

モデル崩壊のリスクを軽減するための戦略は複数ある。合成データセットを検証し、定期的にレビューすることや、合成データをジェネレーティブモデルで使用する前にその品質を確認することが含まれる。しかし、最も一般的なアプローチは、データを多様化することで、合成データと人間のデータを組み合わせることである。ガートナーの調査では、63%の回答者が部分的に合成データセットを使用することを好み、13%のみが完全に合成データを使用していると回答した。

実際のデータを少しでも追加することで、モデルのパフォーマンスを大幅に改善できる。南カリフォルニア大学の研究者は、企業が実データの最大90%を合成データに置き換えることができずに、パフォーマンスの低下が見られないことを発見した。しかし、その最後の10%の人間のデータを置き換えると、パフォーマンスの低下が顕著になる。

品質も重要である。MicrosoftのPhi-4の成功例が示しているように。Phi-4は、GPT-4oによって生成された主に合成データでトレーニングされた。ただし、事前トレーニングデータセット(モデルを最初の段階でトレーニングするために使用される一般的なデータセット)の多くは、書籍や研究論文など、高品質のリアルなデータで慎重にキュレーションされたものであった。

合成データがもたらす潜在的な利点

合成データを賢く使用し、効果的にリアルなデータと組み合わせることで、AIトレーニングデータに関する6つの特定の問題を解決できる可能性がある。データの不足、データのアクセシビリティ、データの均質性、偏り、プライバシー問題、コストである。

データの不足

AI企業が市場シェアを獲得し、新しい成果を達成するために、データの需要は増加する。合成データは、このギャップを埋める可能性がある。ただし、事前トレーニングデータセットで、またモデル崩壊を避けるために、リアルなデータを使用する必要がある。

データのアクセシビリティ

大手テクノロジー企業は、データのゲートキーパーとして機能し、新規参入障壁を作り出している。合成データは、ジェネレーティブAIを民主化し、大量のトレーニングデータを手頃な価格でアクセス可能にする可能性がある。ただし、これは、大手テクノロジー企業がリアルなデータへのアクセスを改善する責任を取り除くものではない。

データの均質性

特定の用途(例:自動運転のAIトレーニング)では、実世界のデータセットが均質性に欠けることがある。合成データを使用して、データのギャップを埋めることができる。たとえば、道路上のまれな事象に対するトレーニングデータを生成できる。

偏り

実世界のデータセットには、内在的な偏りがあることがある。合成データを生成して、AIモデルがよりバランスの取れた絵を得ることができる。たとえば、金融分野では、英国金融行為監視機構(FCA)は、合成データが人間のデータセットに含まれない特定のグループの潜在的な偏りを相殺する可能性があると主張している。

プライバシー

ヘルスケアや金融などの分野では、プライバシー要件がデータ不足をさらに深刻にしている。合成データを使用すると、企業は顧客のプライバシーを危険にさらすことなく、モデルのトレーニングデータセットを構築できる。ただし、英国王立学会が依頼した報告書は、合成データが「本質的にプライベート」であるという「誤解」があることを指摘している。研究者は、合成データは、元のデータから情報を漏らす可能性があると警告している。

特に、機密性の高いデータでトレーニングされたモデルは、モデル逆転攻撃に脆弱で、ハッカーが元のデータセットの一部を再構築できる。

コスト

一般的に、合成データはリアルなデータよりも低コストで生成される。さらに、ラベル付けが必要なく、時間とコストを節約できる。AIトレーニングプロジェクトでは、データ準備(ラベル付けを含む)が最大80%を占めることがある。これが、データ処理のニーズを満たすために、低コストの労働力を提供する専門会社が登場した理由である。

リアルデータを置き換えるのではなく、補完する

合成データの利点を活用するには、リアルなデータの代替ではなく、補完として使用する必要がある。リアルなデータセットのスケールを増やす方法を提供する役割を担う。

例として、Metaの次のLLM、LLAMA Behemothは、30兆のデータポイントでトレーニングされる予定である。明らかに、この規模のリアルなデータを見つけることは困難、あるいは不可能である。ただし、合成データ生成モデルをトレーニングするため、または精度を確保しモデル崩壊を避けるために、リアルなデータの使用は依然として必要である。LLMが現在稼働しているスケールでは、合成データが使用されるデータの割合が大きくても、リアルなデータの需要は依然として大きく残り、ゲートキーピング、 アクセス、偏り、コスト、時間などの複雑な問題が解決される必要がある。

13年以上にわたり、ゲディミナス・リッケヴィチュスは、世界中の市場を牽引するIT、広告、物流企業で成長の原動力となってきました。彼は、戦略的意思決定にビッグデータを統合することで、伝統的なビジネス開発とセールスのアプローチを変え続けています。Oxylabsのグローバルパートナーシップ担当シニアVPとして、ゲディミナスは、企業を最先端のパブリックウェブデータ収集ソリューションでエンパワーメントするという使命を続けています。