Anderson의 관점

‘로그’ 데이터가 오염시키는 생성적 AI 성능

mm
Unite.AI를 Google의 선호 소스에 추가
Flux Dev, Firefly.

새로운 연구에 따르면, AI 모델을 훈련하는 데 사용되는 많은 인기 있는 이미지 데이터셋이 테스트 이미지 또는 거의 중복된 이미지로 오염되어 있으므로, 모델이 답변을 기억함으로써 치팅할 수 있습니다. 이 유출은 광범위하지만 일반적으로検출되지 않으며, 조용히 점수를 부풀리고 웹 규모의 데이터로 훈련된 모델에 불공平한 이점을 제공합니다.

 

운전 시험을 볼 때, 일반적으로 시험에 사용될 정확한 도로를 미리 알려주지 않습니다. 만약 알려준다면(그리고 당신이 조금 부정직하다면), 당신은 시험에 합격하기 위해 그 루트만 반복적으로 연습할 수 있습니다. 그 대신에, 당신은 더广い 운전 기술을 개발하여任意의 루트를 합리적으로 잘 다룰 수 있습니다.

기계 학습 모델을 훈련하는 경우, 이것은 훈련 세트 데이터를 모델을 훈련하는 데 사용되는 데이터(일반적으로 70% 분할)와 ‘야생’ 데이터(남은 30%)로 분할하는 것과 유사합니다.

야생 데이터는 모델이 전에 본 적이 없는 데이터이므로, 모델이 그 데이터에서 잘 수행된다면, 효과적이고 성능이 좋다는 것을 가정할 수 있습니다. 그렇지 않으면, 모델은 잘 균형 잡힌 세트에 과적합할 수 있습니다. 또는 데이터에 추가적인 큐레이션과 정의가 필요할 수 있습니다.

어떤 경우든, 모델을 그들의 훈련 데이터에서 평가하지 않는 것이 현재의 AI 연구와 개발 방법의基礎입니다.

같은 일이 다시 발생합니다

일본의 새로운 연구 논문에 따르면, 컴퓨터 비전과 생성적 AI 연구 분야는 LLM 연구자들이 테스트 데이터가 훈련 데이터를 오염시키지 않도록 하는 노력에 비해远く 뒤처져 있습니다. 연구자들은 테스트에서, 그들이 조사한 모든 超大규모 비전 데이터셋, 일부 큰 생성적 AI 시스템을 구동하는 데이터셋을 포함하여, 테스트 데이터가 훈련 데이터로 넘어가는 정도가 어느 정도 있는 것을 발견했습니다. 즉, 이러한 분할에서 훈련된 모델에 대한 벤치마크와 성능 보고서는, 시험 방에서 부정행위를 한 사람의 시험 결과만큼 정확하지 않으며, 실제 새로운 데이터에서 모델의 성능을 반영하지 않습니다.

연구자들이 발견한 데이터 오염의 예시, 훈련 데이터와 테스트 데이터에 중복 또는 거의 중복된 데이터 포인트가 있습니다. 출처: https://arxiv.org/pdf/2508.17416

연구자들이 발견한 데이터 오염의 예시, 훈련 데이터와 테스트 데이터에 중복 또는 거의 중복된 데이터 포인트가 있습니다. 출처: https://arxiv.org/pdf/2508.17416

위의 이미지에서, 새로운 논문에서, 우리는 훈련 데이터와 테스트 데이터에 중복 또는 거의 중복된 데이터 포인트를 발견한 예시를 볼 수 있습니다. 이것은 모델의 성능을 부풀리고, 모델이 실제로 얻지 못한 일반화 수준을 나타낼 수 있습니다.

이 오염은 다양한 시나리오에서 발생할 수 있으며, ‘사전 훈련’을 포함하여, 이전 모델의 가중치를 사용하여 새로운 모델을 시작하는 경우에 발생할 수 있습니다. 만약 업스트림 모델이 새로운 데이터셋과 동일한 데이터를 가지고 있다면, 데이터 오염이 발생할 수 있습니다.

누적 효과

이것은 거의 확실하게 최신 데이터셋에서도 발생할 것입니다. 비전/언어 데이터셋의 범위는 지난 5년 동안 enorm하게 성장했으며, 웹의最新 이미지 데이터뿐만 아니라, 이전 데이터셋에 포함된 많은 데이터를 재수집했습니다.

さらに, 자동화된 루틴은 수십억 개의 이미지를 필터링하고 중복을 찾는 작업에 직면해 있으며, 큐레이션 자체의 비용을 시간과 돈으로 고려해야 합니다.

한편, 이미지 중복은 Common Crawl과 같은 대규모 컬렉션에서 발생하는 일반적인 결과입니다. 이미지 재게시와 재압축, 그리고 편집(예를 들어, 허가없이 사용된 경우)을 위한 크롭 및 플립과 같은 작업은 탐지 회피를 위해 수행될 수 있습니다.

저자들은 다음과 같이 관찰합니다:

‘데이터 오염은 광범위한 문제이며, 대부분의 시각적 데이터셋에서 발생합니다. 오염은 모델의 일반화 능력을 흐리며, 특히 다른 데이터셋에서 훈련된 모델을 비교할 때, 불공平한 비교를 유발합니다.

‘우리는 데이터셋 설계자들에게 이러한 평가의 의미를 신중하게 고려할 것을 촉구합니다. 더 공평한 모델 평가를 위해, 우리는 중복 탐지기를 사용하는 것을 추천합니다. 이는 하드 및 소프트 오염을 모두 고려합니다.

‘이상적으로, 누출된 이미지는 훈련 세트에서 제거되어야 하며, 그렇지 않으면 테스트 세트에서 제거되어야 합니다.’

이 논문은 대규모 및 인기 있는 데이터셋에 대한 여러 테스트에 대해 자세히 설명합니다. 모든 테스트에서 어느 정도의 오염이 발견되었습니다.

새로운 논문은 시각적 데이터셋의 데이터 오염이라고 제목이 붙여져 있으며, 오사카 대학의 세 명의 연구자에 의해 작성되었습니다.

방법

이 논문의 저자들은 데이터 오염을 세 가지 차원으로 정의합니다: 모달리티, 커버리지, 및 .

모달리티는 오염이 이미지만이 아닌 레이블도 포함하는지 여부를 구분합니다. 커버리지는 중복이 동일한 데이터셋 내에서 발생하는지 또는 다른 데이터셋 간에 발생하는지 여부를 식별합니다. 는 중복된 콘텐츠가 정확히 동일한지 또는 근접한지 정의합니다.

오염에 대해 고려된 두 시나리오는 데이터셋 내 오염(同じ 데이터셋의 훈련 분할에서 평가 이미지 재등장)과 데이터셋 간 오염(다른 데이터셋에서 훈련된 평가 이미지)입니다.

도에 대해 정의된 두 수준은 소프트 오염(이미지가 동일하지 않지만 약간의 변형을 가짐)과 하드 오염(이미지가 훈련 및 평가에서 정확히 동일함)입니다.

저자들은 이미지 검색을 사용하여 오염을 탐지하는 것을 다룹니다. 쿼리 세트는 평가 데이터이며, 컬렉션은 훈련 세트입니다.

작은 데이터셋의 경우, 모든 쿼리 벡터는 직접 비교를 위해 코사인 유사성을 사용하여 모든 훈련 벡터와 비교되었습니다. 더 큰 데이터셋의 경우, Faiss 인덱스를 빌드하여 더 빠른 K-최근접 이웃(KNN) 검색을 가능하게 했습니다.

인코더는 충분한 시각적 정보를 캡처하여 미묘한 유사성을 감지해야 하지만, 매우 높은 데이터 볼륨에서도 효율적으로 유지되어야 합니다. 따라서 저자들은 LAION 컬렉션의 경우, 데이터셋 작성자가 제공한 사전 계산된 CLIP 기능을 사용했습니다.

저자들은 CLIP를 사용하여 데이터셋의 이해를 사용하는 것이(실제 파일을 대규모로 폴링하는 대신) 프로세스를 상당히 가속화했으며, 비교에서 일관성을 개선했다고 주목합니다.

데이터 및 테스트

테스트에 사용된 CLIP 이미지 인코더는 기본 CLIP ViT-B/32이었습니다. 다양한 이미지가 관련되어 있는지 여부를 확인하기 위해 KNN을 사용했습니다.

데이터셋은 세 가지 유형으로 분류되었습니다: 사전 훈련 데이터셋 – 대규모 웹 스크래핑 컬렉션으로, 일반 모델을 훈련하는 데 사용됩니다. 훈련 데이터셋 – 작은, 종종 주석이 달린 컬렉션으로, 직접 모델 튜닝을 위한 것입니다. 벤치마크 데이터셋 – 수동으로 주석이 달린 것으로, 평가 전용으로 사용됩니다.

분석에는 7개의 데이터셋에 걸쳐 20개의 분할이 포함되었습니다: Microsoft COCO 는 훈련 및 평가 세트로 사용되었습니다. Flickr30k는 벤치마크로만 사용되었습니다. Google Conceptual Captions (GCC) 컬렉션은 사전 훈련 소스로 사용되었으며, 그들의 검증 부분은 평가를 위해 사용되었습니다.

추가로, ImageNet은 훈련 및 벤치마크에 모두 사용되었습니다. LAION-400M 데이터셋은 사전 훈련 전용으로 사용되었습니다.

OpenImages v4는 훈련 및 벤치마크 데이터를 모두 제공했습니다. TextCaps는 훈련 및 테스트 분할을 모두 평가를 위해 제공했습니다.

새로운 작업에서 조사된 Google의 Open Images 데이터셋의 이미지 주석 예시. 출처: https://arxiv.org/pdf/1811.00982

새로운 작업에서 조사된 Google의 Open Images 데이터셋의 이미지 주석 예시. 출처: https://arxiv.org/pdf/1811.00982

저자들은 또한 이미지에 미묘한 변경(예: 크기 조정, 크롭, 비슷한 비semantic 변환)을 적용하여, 이러한 변경으로 인해 어떻게 오염이 탐지되는지 테스트했습니다.

쿼리 이미지 각각에 대해, 이미지 인코더를 사용하여 특징 벡터를 생성한 다음, 코사인 유사성을 사용하여 가장 유사한 항목을 찾았습니다.

세 가지 인코더(ResNet-152, DINOv2 ViT-B/14, CLIP ViT-B/32)를 비교했으며, CLIP이 다양한 변경에 대해 가장 강력하고 일관적인 성능을 보였습니다.

이미지 변환에는 기하학적(플립, 회전), 크롭, 픽셀화(가우시안 블러, 노이즈 추가, 다운샘플링), 색상(그레이스케일, 반전, 색상 오버레이) 등이 포함되었습니다.

데이터에 적용된 변환의 예시 - 데이터 증강 전처리에서 일반적으로 사용됩니다.

데이터에 적용된 변환의 예시 – 데이터 증강 전처리에서 일반적으로 사용됩니다.

이미지 검색에서 오염을 테스트했습니다.

다양한 비semantic 변환에 대한 오염 탐지 정확도.

다양한 비semantic 변환에 대한 오염 탐지 정확도.

모든 인코더는 변경되지 않은 이미지에서 완벽한 성능을 보였으며, CLIP은 크롭, 수평 플립, 노이즈, 크기 조정에서 강력한 성능을 유지했습니다.

DINOv2는 색상 변환에 강했지만, 기하학적 편집과 크롭에서 약했습니다.

LAION은 이미 CLIP 임베딩을 포함하므로, 일관성과 속도 때문에 CLIP이 기본 인코더로 선택되었습니다.

하드 및 소프트 오염

저자들은 하드 및 소프트 오염을 구분하기 위해 코사인 유사성 임계값을 평가했습니다.

하드 오염을 정의하기 위해 0.98의 임계값을 선택하여, 거짓 양성 없이 정확한 동일 이미지 탐지를 달성했습니다.

소프트 오염의 경우, 0.95의 임계값을 선택하여, 근접한 중복을 포함하면서 거의 제로 거짓 양성률을 유지했습니다. 정밀도는 재현율보다 우선순위가 높았으며, 발견은 보수적으로 추정되었습니다.

하드 및 소프트 오염 탐지 임계값 선택을 위한 수신자 운영 특성(ROC) 곡선.

하드 및 소프트 오염 탐지 임계값 선택을 위한 수신자 운영 특성(ROC) 곡선.

데이터셋 내 오염

데이터셋 내 오염은 동일한 데이터셋 내에서 훈련 및 평가 분할 사이에서 이미지 오버랩을 계산하여 결정되었습니다.

이 분석에는 COCO, GCC, ImageNet, OpenImages, TextCaps가 포함되었습니다.

COCO의 경우, 테스트 세트는 훈련 세트, 평가 세트, 및 레이블이 없는 하위 세트와 비교되었습니다.

ImageNet의 테스트 및 검증 분할에서 가장 높은 오염률이 관찰되었습니다. 하드 오염은 1.58%에 달했고, 소프트 오염은 2% 미만이었습니다.

GCC와 COCO는 뒤를 이었으며, COCO의 val2017은 3%의 소프트 오염을 보였고, 테스트 분할은 1.35%에서 1.38% 사이를 보였습니다. OpenImages는 하드 오염이 0.05%로 낮았지만, 테스트 및 검증 세트에서 1.3% 이상의 소프트 오염을 보였습니다. TextCaps는 전체 오염이 0.69%로 가장 낮았으며, 하드 오염은 감지되지 않았습니다.

데이터셋 내 오염률, 각 평가 분할이 해당 훈련 데이터와 중복되는 비율을 나타냅니다.

데이터셋 내 오염률, 각 평가 분할이 해당 훈련 데이터와 중복되는 비율을 나타냅니다.

저자들은 다음과 같이 말합니다:

‘이 결과는 데이터셋 내 오염이 모든 분석된 데이터셋에서 발생한다는 것을 보여줍니다. 오염은 모델 평가를 손상시키며, 특히 다른 데이터셋에서 훈련된 모델을 비교할 때, 불공평한 비교를 유발합니다.

‘데이터셋은 이 목적으로 설계되었으며, 데이터셋 내 오염은 설계에 의해 존재해서는 안 됩니다.

‘그러나 우리는 모든 데이터셋에서 여러 인스턴스를 발견했습니다.’

데이터셋 간 오염

데이터셋 간 오염(다른 데이터셋에서 훈련된 모델을 평가할 때 발생하는 오염)을 측정하기 위해, 4개의 데이터셋(GCC 훈련, ImageNet 훈련, OpenImages 훈련, LAION)이 훈련 데이터 소스로 사용되었습니다.

이 데이터셋은 COCO 2014 테스트 및 검증 분할, Flickr30K, TextCaps 테스트, OpenImages 테스트 및 검증 분할, ImageNet 테스트 및 검증 분할에서 평가 데이터와 매칭되었습니다.

CLIP ViT-B/32 임베딩은 LAION을 제외한 모든 데이터셋에서 추출되었습니다. LAION은 이미 자신의 임베딩을 제공했지만, 공식 CLIP 구현과 약간 다르므로, 쿼리 이미지를 CLIP-회수 저장소에서 사용하는 방법에 따라 크기 조정을 수행했습니다.

KNN 검색을 사용하여 검색을 수행했으며, LAION의 경우, 1백만 개의 블록으로 분할하여 개별적으로 색인화했습니다.

벤치마크 데이터셋(열)과 사전 훈련 데이터셋(행) 사이의 데이터셋 간 오염. 왼쪽에는 하드 오염(동일 이미지), 오른쪽에는 소프트 오염(근접 중복)이 표시됩니다.

벤치마크 데이터셋(열)과 사전 훈련 데이터셋(행) 사이의 데이터셋 간 오염. 왼쪽에는 하드 오염(동일 이미지), 오른쪽에는 소프트 오염(근접 중복)이 표시됩니다.

모든 벤치마크 데이터셋에서 데이터셋 간 오염이 관찰되었습니다. LAION은 특히 OpenImages 및 TextCaps 테스트 데이터에서 하드 오염이 3% 이상인 것으로 나타났습니다.

ImageNet은 모든 벤치마크에서 하드 중복을 포함했지만, GCC는 1% 미만의 하드 오염을 보였습니다.

소프트 오염은 더广泛했으며, LAION은 7.9%까지의 오버랩을 보였습니다.

이러한 오버랩은 평가 세트의 작은 부분만을 차지할 수 있지만, 모델이 메모라이제이션을 허용하고 테스트의 유효성을 손상시킬 수 있습니다.

오염된 이미지의 예시. 왼쪽에는 하드 오염(데이터셋 내 또는 데이터셋 간의 동일 이미지) 사례가 있으며, 오른쪽에는 소프트 오염(시각적으로 근접한 중복) 사례가 있습니다.

오염된 이미지의 예시. 왼쪽에는 하드 오염(데이터셋 내 또는 데이터셋 간의 동일 이미지) 사례가 있으며, 오른쪽에는 소프트 오염(시각적으로 근접한 중복) 사례가 있습니다.

하위 평가에 대한 영향

이 논문은 데이터 오염이 하위 평가(사전 훈련 모델을 벤치마크에서 평가할 때의 성능)에 미치는 영향을 고려합니다.

세 가지 작업이 고려되었습니다: 제로샷 분류; 감독 분류; 및 이미지-텍스트 검색.

각 작업에 대해, 모델 성능은 벤치마크 데이터셋에서 평가되었으며, 누출된 샘플이 이미 사전 훈련 데이터에 포함되어 있는지 여부에 따라 데이터를 나누었습니다.

결과는 누출된 샘플이 포함된 하위 세트에서 모델 성능이 향상됨을 보여주었습니다.

ImageNet 검증 세트에서 제로샷 분류 정확도, 누출된 샘플을 포함한 하위 세트에서 평가됨.

ImageNet 검증 세트에서 제로샷 분류 정확도, 누출된 샘플을 포함한 하위 세트에서 평가됨.

감독 분류의 경우, ImageNet에서 누출이 Dramatic 성능 저하를 유발했지만, 누출된 이미지와 동일한 레이블이 있는 경우에만 모델이 거의 완벽한 정확도를 달성했습니다.

ImageNet 검증 세트에서 감독 분류 정확도, 누출된 샘플을 포함한 하위 세트에서 평가됨.

ImageNet 검증 세트에서 감독 분류 정확도, 누출된 샘플을 포함한 하위 세트에서 평가됨.

이미지-텍스트 검색의 경우, 누출된 샘플에서 성능이 향상되었습니다.

Flickr30K에서 이미지-텍스트 검색 성능, 누출된 샘플을 포함한 하위 세트에서 평가됨.

Flickr30K에서 이미지-텍스트 검색 성능, 누출된 샘플을 포함한 하위 세트에서 평가됨.

저자들은 다음과 같이 결론을 내립니다:

‘전반적으로, 우리는 시각적 데이터셋에서 누출이 공평한 모델 평가를 위협하는 심각한 위협을 제시하는 일관된 증거를 보여줍니다. 이것은 기계 학습의 가장 기본적인 원칙 중 하나를 위반합니다. 즉, 모델을 그들의 훈련 데이터에서 평가하지 않는 것입니다.’

결론

이 논문의 한 가지 충격적인 측면은, LAION의 거대한 이미지 데이터에 대한 임베딩을 얻기 위해 CLIP를 사용해야 한다는 것입니다. 이것은 비전-언어 모델의 훈련이 인간의 관리나 수동 큐레이션의 범위와 능력을 훨씬 넘어섰으며, 대표적인 하위 샘플을 넘어서는 수준의 수동 큐레이션이 불가능하다는 것을 보여줍니다.

이 논문은 데이터 오염이 시각적 데이터셋에서 광범위한 문제이며, 모델 평가를 손상시키고, 모델이 실제로 얻지 못한 일반화 수준을 나타낼 수 있음을 보여줍니다.

저자들은 데이터셋 설계자들에게 이러한 평가의 의미를 신중하게 고려할 것을 촉구하며, 더 공평한 모델 평가를 위해 중복 탐지기를 사용하는 것을 추천합니다.

이 연구는 데이터 오염의 문제를 강조하며, 모델 평가의 공정성을 보장하기 위해 데이터셋의 질을 높이는 것이 중요함을 보여줍니다.

* 데이터 중복 문제는 논문에서 ‘누출’로 정의됩니다.

† 저자의 강조입니다.

처음 게시된 날짜: 2025년 8월 26일 화요일

기계 학습 분야 작가, 인간 이미지 합성 분야 전문가입니다. Metaphysic.ai의 연구 콘텐츠 책임자였으며, DNEG의 Brahma.ai로의 합병으로 해체될 때까지 그 역할을 수행했습니다.
포트폴리오 사이트: martinanderson.ai
연락처: [email protected]