Anderson의 관점
이미지넷의 역사적 정확성 평가

구글 리서치와 UC 버클리에서 수행한 새로운 연구는 컴퓨터 비전(CV) 연구 분야가 오랫동안 사용해 온 이미지넷(ImageNet) 데이터셋과 그 파생물에 대한 비판을 추가한다. 연구자들은 수작업 평가를 통해 이미지넷의 다중 레이블 하위 집합 평가에서 최고 모델이犯하는 거의 50%의 오류가 실제 오류가 아니라는 결론을 내렸다.
연구에서:
‘우리의 분석은 거의 절반의 오류가 실제 오류가 아니라는 것을 보여주며, 우리는 새로운 유효한 다중 레이블을 발견하여, 이러한 모델의 성능을 과소평가하고 있음을 입증한다.
‘반면에, 우리는 또한 오늘의 최고 모델이 여전히 많은 오류(40%)를犯하고 있음을 발견했다. 이러한 오류는 인간 평가자에게는 명백한 오류이다.’
이미지넷의 역사적인 오류 기록을 평가하기 위해 연구자들은 몇몇 专門 평가자를 고용하여 오류 판정을 다시 검토했다. 그 결과, 많은 오류 판정이 실제 오류가 아니라는 것을 발견했다.
연구자들은 또한 새로운 모델이 기존 레이블을 초과하여 새로운 레이블을 제안할 때, 이러한 모델이 비상형으로 간주될 수 있음을 지적했다. 예를 들어, 이미지가 도우인지 베이글인지 구분하기 어려운 경우, 모델이 베이글로 예측할 수 있다.
이러한 경우, 크라우드소싱 작업자가 이러한 객체를 식별하는 것은 의미론적이고 철학적인 난제이다. 이러한 난제는 다중 레이블링으로 해결할 수 있다.
연구자들은 이미지넷의 주요 오류와 부차적 오류를 분류하고, 새로운 오류 유형을 발견했다. 이러한 오류 유형에는 미세한 오류, 미세한 오류 với 어휘 외부 객체, 가짜 상관관계, 비전형적 오류 등이 있다.
연구자들은 또한 이미지넷의 레이블이 항상 정확하지는 않음을 발견했다. 일부 경우, 원래 레이블이 실제로 틀렸거나 문제가 있는 경우가 있었다.
연구의 결과, 연구자들은 이미지넷의 오류를 재평가하고, 새로운 오류 유형을 발견했다. 이러한 결과는 컴퓨터 비전 연구 분야에 새로운 시각을 제공한다.
기술 부채
이 연구의 결과는 중요하다. 이미지넷의 오류는 16년간 축적된 오류로, 이러한 오류는 모델의 성능을 평가하는 데 중요한 역할을 한다. 그러나 이러한 오류가 실제 오류가 아닌 경우, 모델의 성능을 과소평가할 수 있다.
컴퓨터 비전 연구 분야는 이미지넷을 벤치마크로 사용하고 있다. 그러나 이미지넷의 오류를 재평가할 필요가 있다.
방법
연구자들은 이미지넷의 오류를 재평가하기 위해 표준적인 ViT 모델을 사용했다. 이 모델은 3억개의 매개변수를 가지고 있으며, JFT-3B에서 사전 훈련되고 이미지넷-1K에서 미세 조정되었다.
연구자들은 이미지넷2012 다중 레이블 검증 집합을 사용하여 모델의 초기 다중 레이블 정확도를 96.3%로 기록했다. 이 모델은 676개의 오류를犯했다. 이러한 오류를 평가하기 위해 연구자들은 专門 평가자를 고용하여 오류를 다시 검토했다.
연구의 결과, 연구자들은 이미지넷의 오류를 재평가하고, 새로운 오류 유형을 발견했다. 이러한 결과는 컴퓨터 비전 연구 분야에 새로운 시각을 제공한다.
연구는 다음과 같은 결론을 내린다:
‘이 연구에서, 우리는 이미지넷의 다중 레이블 검증 집합에서 ViT-3B와 Greedy Soups 모델이犯하는 모든 오류를 분석했다.
‘전체적으로, 우리는 다음과 같은 것을 발견했다: 1) 큰 모델이 새로운 예측을 할 때, 거의 절반의 경우에 실제 새로운 다중 레이블이다; 2) 높은 정확도의 모델이 우리의 오류 유형과 심각도에서 명백한 패턴을 보여주지 않는다; 3) 현재의 최고 모델은 인간이 평가한 다중 레이블 하위 집합에서 최고의 전문가와 비슷하거나 더 좋은 성능을 보여준다; 4) 노이즈가 있는 훈련 데이터와 명확하지 않은 클래스가 이미지 분류의 개선 측정을 제한하는 요인일 수 있다.’
이 연구는 2022년 5월 15일에 처음 발표되었다.












