Andersonの視点
「ルージュ」データが汚染するジェネレーティブAIのパフォーマンス

新しい研究によると、AIモデルを訓練するために使用される人気のある画像データセットの多くが、テスト画像または類似の画像で汚染されており、モデルは回答を覚えるのではなく、学習するのではなく、チートすることができるようになっていることがわかりました。 この漏洩は広範囲にわたっており、一般的には検出されていないが、スコアを軽く膨らませ、ウェブスケールのデータで訓練されたモデルに不公平な優位性を与えている。
運転免許のテストを受ける場合、通常、テストで使用される正確なルートは事前に教えられません。如果、あなたが(少し)非正直で、テストのルートを事前に知っている場合、あなたはテストを「最適化」するためにそのルートで繰り返し練習するかもしれません。そうではなく、どのルートでもまあまあ運転できるように、幅広い運転スキルを身につけるのです。
機械学習モデルの訓練では、これは訓練セットデータを訓練モデルに使用するデータ(通常、70%の分割)と、「野外」データ(残りの30%)に分割することの良いアナロジーです。
「野外」データはモデルが見たことがないため、モデルがそのデータでよく機能する場合、効果的で実用的であると想定できます。如果そうでない場合、モデルはバランスの取れたセットに過度にフィットしている可能性があります。あるいは、データに追加のキュレーションと定義が必要です。
どちらにせよ、AI研究と開発における現在の方法の基盤は、モデルをその訓練データで評価しないことです。
同じこと、もう一度
日本からの新しい研究論文によると、コンピュータビジョンとジェネレーティブAIの研究分野は、テストデータが訓練データを汚染しないようにするためのLLM研究者の努力に近づいていません。研究者は、調査したすべてのハイパースケールビジョンデータセット、現在のいくつかの大きなジェネレーティブAIシステムを動かしているものを含む、がそのテストデータをある程度訓練データに混在させていることを発見しました。つまり、モデルがこれらのスプリットで訓練された場合、ベンチマークとパフォーマンスレポートは、試験の結果が正確ではないのと同じくらい正確ではありません。実際の新しいデータでのパフォーマンスを反映しないからです。

研究者によって発見されたデータの交差汚染の例、訓練データとテストデータの両方に重複または類似のデータポイントがある。出典: https://arxiv.org/pdf/2508.17416
上の画像は、新しい論文からで、さまざまなモデルの訓練データとテストデータの両方に存在する重複または類似のデータポイントの例を示しています。モデルのそのデータでのパフォーマンスを無効にし、全体的なスコアを軽く膨らませ、一般化のレベルを達成していないように見せかけることができます。
状況を複雑にするのは、汚染がさまざまなシナリオで発生する可能性があることです。たとえば、「事前訓練」では、古い祖先モデルの重みを使用して新しいモデルを「キックスタート」します。如果、上流の古いモデルが、新しいデータセットと同じデータを持っている場合、交差汚染が発生する可能性があります。70/30または80/20の分割がクリーンであってもです。
累積効果
これは、最新のデータセットでもほぼ確実に発生します。ビジョン/言語データセットの範囲は、過去5年で大幅に拡大し、ウェブ上の最新の画像データのみならず、古い歴史的なデータセットにも再収集されています。
さらに、重複と類似を検出する自動ルーチンは、数十億の画像をフィルタリングするという非常に困難なタスクに直面しています。したがって、キュレーションのコストは、時間とお金の両方で考慮する必要があります。
一方、ウェブをトラウリングする大規模なコレクション(Common Crawlなど)のような画像の複製は、画像を再投稿して再圧縮し、編集(許可なく使用された場合など、検出を避けるために)適用することが一般的であるため、避けられません。
著者は次のように述べています。
「データ漏洩は広範囲にわたる問題であり、ほとんどの視覚データセットで発生しています。漏洩はモデルの汎化能力を隠す可能性があり、特に異なるデータセットで訓練されたモデルの比較を行う場合に問題となります。」
「データセットの設計者は、これらの評価の影響を慎重に検討する必要があります。より公平なモデル評価のために、ハード漏洩とソフト漏洩の両方を考慮する重複検出器を使用することを推奨します。」
「理想的には、漏洩した画像を訓練セットから削除し、可能でない場合は少なくともテストセットから削除する必要があります。」
論文は、研究者がさまざまな大規模で人気のあるデータセットで実施したいくつかのテストについて説明しています。すべてのデータセットで何らかのレベルの汚染が発生していることが示されています。
新しい論文は「視覚データセットのデータ漏洩」と題され、大阪大学の3人の研究者によって書かれています。
方法
論文の著者は、漏洩を3つの次元で定義しています。モダリティ、カバレッジ、度合いです。
モダリティは、画像のみが漏洩しているか、画像とラベルが両方漏洩しているかを区別します。カバレッジは、重複が同じデータセット内で発生するか、異なるデータセット間で発生するかを特定します。度合いは、重複するコンテンツが完全に同じか、またはほぼ同じかを定義します。
漏洩については、2つのシナリオが考慮されています。データセット内で評価画像が訓練スプリットに再現する「データセット内漏洩」、および評価画像が別のデータセットで訓練に使用される「データセット間漏洩」です。
度合いについては、2つのレベルが定義されています。画像が完全に同じ場合の「ハード漏洩」、および画像がわずかに異なる場合の「ソフト漏洩」です。
研究者は、画像の特徴ベクトルとして表現するために画像エンコーダーを使用して、漏洩の検出を扱います。クエリセットは評価データであり、コレクションは訓練セットです。
小規模なデータセットの場合、すべてのクエリベクトルはcosine類似度を使用して直接すべての訓練ベクトルと比較されます。大規模なデータセットの場合、Faissインデックスが構築されています。これにより、KNN検索が可能になり、より迅速な検索が可能になります。
エンコーダーは、微妙な類似性を検出するのに十分な視覚情報を捉える必要がありますが、非常に大規模なデータセットにも対処できる必要があります。したがって、著者は、LAIONコレクションの下にあるStable Diffusionやその後のプロジェクトで事前に計算されたCLIP機能を使用しています。
CLIPを使用することで、プロセスが大幅に高速化され、比較全体で一貫性が向上したことがわかりました。
データとテスト
テストで使用されたCLIP画像エンコーダーは、LAIONをフィルタリングするために使用されたCLIP ViT-B/32のデフォルトでした。
多様な画像が関連しているかどうかを判断するために、KNNはAutoFaissの下で使用されました。
データセットは3つのタイプに分類されました。事前訓練データセット、訓練データセット、ベンチマークデータセットです。
分析では、7つのデータセットをまたぐ20のスプリットがカバーされました。Microsoft COCOは、訓練と評価の両方に使用され、訓練、検証、テスト、ラベル付けされていないスプリットが含まれていました。
Flickr30kはベンチマークとしてのみ使用され、Google Conceptual Captions (GCC)コレクションは事前訓練ソースとして使用され、検証部分は評価に使用されました。
ImageNetは訓練とベンチマークの両方に使用され、LAION-400Mデータセットは事前訓練にのみ使用されました。
OpenImages v4は訓練とベンチマークデータを提供し、TextCapsは評価の両方のスプリットを提供しました。

新しい研究で調査されたGoogleのOpen Imagesデータセットからの画像注釈の例。出典: https://arxiv.org/pdf/1811.00982
画像が微妙に変更された場合(リサイズ、トリミングなど)、漏洩を検出する方法の有効性を評価するために、Flickr30kでテストが実施されました。
各クエリ画像は、エンコードされる前に変換され(リサイズやトリミングなどの非セマンティック変更)、コレクション内の最も類似のアイテムとcosine類似度を使用して照合されました。元の画像がトップ結果として取得された場合のみ、照合がカウントされました。
3つのエンコーダー、ResNet-152、DINOv2 ViT-B/14、およびCLIP ViT-B/32が比較されました。
4つのタイプの非セマンティック画像変換が使用されました。幾何学的(フリップ、回転)、トリミング(各辺から20、50、100ピクセルを削除)、ピクセル化(ガウシアンブラー、ノイズの追加、または128または256ピクセルにダウンサンプリング)、およびカラー(グレースケール、反転、または赤、緑、青のオーバーレイ)です。

補足資料から、データに適用された変換の例 – これらはデータ増強の前処理でも一般的なルーチンです。[/em>
画像検索での漏洩の検出については、

さまざまな非セマンティック変換を適用されたFlickr30kの5,000個のクエリ画像に対する漏洩検出の精度。[/em>
すべてのエンコーダーは、変更されていない画像で完全なパフォーマンスを達成し、CLIPはトリミング、水平フリップ、ノイズ、リサイズに対して安定したままでした。ResNet-152はピクセルレベルと色の変更に対してCLIPに劣りました。
DINOv2は色の変換に対して強い耐性を示しましたが、幾何学的編集やトリミングでは弱かったです。これらは重複したデータセットで一般的なものです。
LAIONにはすでにCLIPエンベッディングが含まれているため、また一貫性と速度の点で安定していたため、CLIPが主要な分析のデフォルトエンコーダーとして選択されました。
ハード漏洍とソフト漏洍
パフォーマンスは、正確な重複と類似の重複(ハード漏洍とソフト漏洍)を区別するために、さまざまなcosine類似度のしきい値で評価されました。
ハード漏洍を定義するために、0.98のしきい値が選択され、偽陽性はなく、完全な重複の検出が行われました。
ソフト漏洍の場合、0.95のしきい値が選択され、類似の重複の取得が可能になりましたが、偽陽性率はほぼゼロのままでした。精度が再現性よりも優先され、結果は慎重に推定されました。

ハード漏洍とソフト漏洍の検出のしきい値の選択を導く受信者操作特性曲線。変換されたおよび変換されていない条件の両方で高いAUCスコアは、わずかな変更があっても類似のアイテムを信頼性高く区別できることを示しています。[/em>
データセット内漏洍
データセット内漏洍は、同じデータセット内の訓練スプリットと評価スプリット間の画像の重複を計算することによって計算されました。データセットは、訓練または事前訓練スプリットとベンチマークスプリットの両方を持つもののみが対象となり、分析はCOCO、GCC、ImageNet、OpenImages、およびTextCapsに絞られました。
COCOの場合、テストセットは訓練セット、評価セット、およびラベル付けされていないサブセットと比較され、検証セットは訓練セットとラベル付けされていないサブセットと比較されました。
ImageNetのテストセットと検証セットでは、ハード漏洍が1.58%、ソフト漏洍が2%未満に達するという、データセット内漏洍の最高レートが観察されました。GCCとCOCOが続き、COCOのval2017ではソフト漏洍が3%、テストスプリットでは1.35%から1.38%の範囲でした。OpenImagesではハード漏洍が0.05%で低く、ソフト漏洍がテストセットと検証セットの両方で1.3%を超えました。TextCapsでは全体的な漏洍が0.69%で最も低く、ハード漏洍は検出されませんでした。

評価スプリットが訓練データと重複する割合を示すデータセット内漏洍の率。[/em>
著者は次のように述べています。
「これらの結果は、すべての分析対象データセットでデータセット内漏洍が発生することを示しています。データセット内漏洍は、モデル評価を損なう可能性があり、データセットはモデル評価のために設計されているため、設計上このリスクは存在しないはずです。」
「しかし、すべてのデータセットで複数のインスタンスを発見しました。」
データセット間漏洍
データセット間漏洍を測定するために、GCCトレーニングセット、ImageNetトレーニングセット、OpenImagesトレーニングセット、およびLAIONが、訓練データのソースとして使用されました。これらは、COCO 2014テストセットと検証スプリット、Flickr30k、TextCapsテストセット、OpenImagesテストセットと検証スプリット、およびImageNetテストセットと検証スプリットから抽出された評価データと照合されました。
LAIONを除くすべてのデータセットについて、CLIP ViT-B/32エンベッディングが抽出されました。LAIONは独自の事前計算されたエンベッディングを提供しますが、公式のCLIP実装で生成されたものとは若干異なります。したがって、クエリ画像はclip-retrievalリポジトリで使用されている方法に従ってリサイズされ、互換性が確保されました。
KNN検索を使用して検索が実行されましたが、LAIONの規模のため、100万画像のブロックに分割して個別にインデックス化する必要がありました。

ベンチマークデータセット(列)と事前訓練データセット(行)間のデータセット間漏洍。左側はハード漏洍(完全に同じ画像)、右側はソフト漏洍(類似の画像)を示しています。[/em>
すべてのベンチマークデータセットで、クロスデータセット漏洍が観察され、程度はさまざまです。LAIONは、特にOpenImagesとTextCapsのテストデータで、ハード漏洍の最も高いレートを示しました。各ベンチマークで3%を超えました。OpenImagesはCOCOに多少のハード漏洍をもたらしました。ImageNetにはすべてのベンチマークでハードの重複がありましたが、1%未満でした。GCCは全体的なハード漏洍が最も低く、1%未満でした。
ソフト漏洍はより広範囲にわたりました。LAIONは最大7.9%のオーバーラップをもたらしました。OpenImagesとTextCapsは、ベンチマーク全体で最も影響を受けたものでした。Flickr30kは漏洍が最も少なかったです。
これらの重複は評価セットの小さな部分を占めるかもしれませんが、存在はモデルを過度に適応させ、テストの妥当性を損なう可能性があります。

漏洩した画像の例。左側はハード漏洍(データセット内またはデータセット間で同じ画像)、右側はソフト漏洍(視覚的に類似の画像)を示しています。[/em>
下流評価への影響
論文では、データ漏洍が下流評価(事前訓練モデルをベンチマークでテストするときのパフォーマンス)に与える影響について検討しています。
3つのタスクが検討されました。ゼロショット分類、教師あり分類、テキスト-画像検索です。
各タスクについて、モデルは漏洩サンプルがすでに事前訓練データ内で特定されたベンチマークデータセットで評価されました。結果は、4つのサブセット全体で比較されました。フルベンチマーク、漏洍サンプルのサブセット、漏洍のないサブセット、および漏洍サンプルと同じサイズのランダムに選択されたサブセット(コントロールとして使用)です。
ゼロショット分類では、LAIONで事前訓練されたモデルは、ImageNet評価セットからの漏洍画像で著しく高い精度を達成しました。これは、訓練中にさらされた画像やその類似画像に対して、モデルが優位性を得ていることを確認しています。

ImageNet検証セットでのゼロショット分類の精度。漏洩サブセットの精度は、最後の列に相対的な精度の向上として示されています。[/em>
教師あり分類では、ImageNetでの漏洍によってパフォーマンスが大幅に低下しました。ただし、漏洩画像が両方のスプリットで同じラベルを持っている場合、モデルはほぼ完全な精度を達成しました。これは、強い過度適応の影響を示しています。

ImageNet検証セットでの教師あり分類の精度。最後の列はフルセットからの相対的な精度の変化を示しています。[/em>
画像からテキストへの検索では、漏洩画像ではパフォーマンスが向上し、ハード漏洍とソフト漏洍の両方がリコールを高め、漏洩サブセットでは結果が一貫性の高いものになりました。

Flickr30kでの画像からテキストへの検索のパフォーマンス。漏洩サブセットは強調表示されています。[/em>
著者は次のように結論付けています。
「全体として、視覚データセットで漏洩が公正なモデル評価に重大な脅威をもたらすことを一貫した証拠を示しています。機械学習の最も基本的な原則の1つである、モデルをその訓練データで評価しないという原則を損なっています。」
結論
この論文の驚くべき側面の1つは、LAIONの大量の画像データのエンベッディングを取得するためにCLIPを使用する必要があるということです。これは、トークン化されたメタデータではなく、より詳細な特性を検査できる程度に扱いやすいデータセットの規模を超えた、ビジョン言語モデルの訓練の範囲を示しています。
これは、ビジョン言語モデルの訓練が人間の監視や、サブサンプルの手動キュレーションを超えた規模に達したことを示しています。
* ある程度混乱を招くものの、論文では重複の問題が「漏洩」として定義されています。
† 著者の強調です。
2025年8月26日火曜日初めて発行されました。












